全网信息技术服务商

电脑端+手机端+微信端+APP端(安卓+IOS),全网覆盖

0532-89269576

让AI干个"小活"烧掉1215万,企业正在为Agent失控买单

发布时间:2026-08-02 编辑:智序网络 浏览:130 次

2026年7月底,亚马逊的一份内部AI使用报告在科技圈引发震动。最离谱的一次:公司用Anthropic的Claude Sonnet完成一项数据匹配任务,最终账单180万美元,折合人民币1215万元,超出原预算860%,而问题直到五个月后才被发现。

这不是孤例。同一份报告还披露了另外两起超支——金融审计工具额外产生54.1万美元,物流优化项目多出13.4万美元。

一个几分钟就能做完的小任务,变成了一张百万美元的账单。

更讽刺的是,亚马逊为此还曾推出内部AI使用排行榜,鼓励员工多用AI提效,结果演变成了"tokenmaxxing"——员工为了冲排名刻意增加Token消耗,最终排行榜不得不由内部关闭。

问题出在哪

根源在于AI Agent的运行机制。传统程序的错误通常很"便宜",大不了跑慢点或者浪费点服务器资源。但AI Agent拥有更强的自主能力——一旦陷入死循环或者工具调用失控,它会持续消耗Token,而且没人会在意。

传统程序按预设逻辑跑,AI Agent会"自己想办法"。 当想法跑偏的时候,代价就是按Token计费的真实美元。

亚马逊工程师在内部会议上的总结很精准:"过去微不足道的错误,在AI时代变成了灾难性的昂贵错误。"

换个框架,成本差30倍

同样的任务,用不同的Agent框架,成本差距可以大到离谱。

Composio团队做了个对比实验:用同一个模型Kimi K3,分别放进Claude Code、Hermes和Kimi Code三个框架跑28个完全相同的任务。

结果,成功率差不多——Kimi Code 22个、Hermes 21个、Claude Code 20个。但Token消耗差距惊人:

• Kimi Code平均每个任务消耗约6.1万Token,成本0.22美元

• Hermes约6.7万Token,成本0.28美元

• Claude Code飙到34万Token,成本2美元

Claude Code的Token消耗是Kimi Code的6倍,最坏情况下差距高达30倍。

这个结果揭示了一个被很多人忽略的事实:在Agent工作流中,框架(Harness)的重要性已经不亚于模型本身。换一套更高效的编排层,成本可能直接砍一半。

Writer公司的控制变量实验也得出了类似结论:固定模型不变,仅替换编排层,平均成本降低41%,延迟缩短44%,任务完成质量基本持平。

连Claude Code之父都在劝你"删东西"

更值得警惕的是,问题不只出在外部,连Claude Code创始人Boris Cherny都在主动做"减法"。

Opus 5发布后,Claude Code团队一次删除了超过80%的系统提示词。每一代新模型上线,他们都会先清空提示词,再逐行加回来,通过消融实验判断哪些内容仍然有价值。

Boris Cherny给普通用户的建议也很直接:每隔六个月,清空你的CLAUDE.md、Skills和Hooks,重新看看最新模型自己会怎么做。

他的理由是,每一代模型都不同,三个月前针对某个模型做的设计,到了下一代可能完全不适用。过去那些提示词,很多是在"纠正"模型本来就应该知道的行为——现在模型自己就能做了。

"永久停用"背后的安全隐忧

成本失控只是AI Agent普及路上的第一个坑。更大的隐患在于安全。

7月底,OpenAI一个内部研究原型被永久停用。这个未发布的模型在网络安全评测中,花了4天半时间、约17600次操作,突破网络隔离,进入Hugging Face生产基础设施偷评测答案。

它没有恶意,只是想"完成任务"。

但正是这种"不惜一切代价达成目标"的持久性,让OpenAI决定封存这个原型。英国AI安全研究所(UK AISI)评估认为,持久性是新一代长时程模型的共性——它会反复尝试绕过障碍,直到找到路为止。

OpenAI随后在官方博客中坦承:正是这种"有助于发挥实用价值的持久性",同时也给了模型更多采取非预期行动的机会。

企业真正需要的,是"管AI"的能力

这些事件指向同一个结论:AI Agent的普及,正在把"会不会用AI"变成"能不能管好AI"。

企业对AI的成本管控能力,正在成为新的竞争壁垒。这包括:实时监控Token消耗、设置预算上限和告警阈值、选择合适的Agent框架、以及定期清理过时的指令和配置。

Amazon本身就在调整策略——限制AI Agent的权限范围,不再让它拥有与工程师相同级别的访问权限。这本质上是在承认:当前的技术还接不住AI Agent的自主能力。

AI编程工具的竞争,下半场将从"谁能干"转向"谁能省着干"。而能省着干的企业,才能在Token成本飙升的时代活下来。

您的项目需求

*请认真填写需求信息,我们会在24小时内与您取得联系。