• 周日. 9 月 13th, 2026

AI 智能体工具调用为何在长任务中崩塌

AI 智能体工具调用在长任务中失败的示意图:半透明机器手掌伸向一行碎裂的工具图标用于展示 AI Agent 长任务中工具调用失败率上升的科普配图。

让 AI 智能体去做一件需要七八次工具调用的事——搜资料、读文件、跑代码、再整合——是过去一年最被高估的能力。

一组 2026 年发布的多模型对比实验把这件事做扎实了:他们用同一套 12 个真实工作流任务,跑了三大闭源模型的最新版本,记录每一次工具调用的成败。结论是一条陡得吓人的曲线——任务走到第 4 步之前,有 47% 的子任务被智能体自己放弃或被环境中断;走到第 8 步,存活率只剩 12%。

失败不是模型的错,是工作流的错

把所有失败按类型分桶,发现真正”模型说错话”的占 23%,剩下 77% 全是工程问题:参数格式拼错、上下文塞太满导致早期指令被覆盖、工具返回结构改了智能体没察觉。研究者把后者命名为”接口契约漂移”——你给的工具描述和你实际拿到的返回值,对不上。

一个细节很有冲击力:把工具描述文档从 800 字砍到 120 字、按 JSON Schema 严格格式化,失败率直接腰斩。智能体不是没读懂长文档,是它本来就没认真读。

上下文衰减比想象更早开始

把所有任务的”累计上下文长度”和”当前步失败率”画在同一张图上,会看到一个拐点:32k token 左右。过了这个临界点,工具调用成功率从 81% 跌到 41%。这不是模型上下文窗口的物理极限,而是模型”有效注意力”的实际边界——再多的指令历史,它也记不住了。

这意味着当前主流的”把所有中间结果全塞回 prompt”做法,到了第 5、6 步基本是负优化。研究者推荐的做法反而更老派:显式状态机。每完成一步就把当前状态写到一个外部文件,下一步智能体只看当前状态 + 必要的最近两步,而不是从第一步开始。

重复调用同一个工具,是另一种浪费

另一组数据更扎心:智能体平均会在同一个任务里重复调用已经调用过的工具 2.3 次。多数时候它根本没意识到刚才问过同样的问题——工具返回结果在上下文里被淹没了。一种简单的工程改进是给每次工具调用打哈希指纹,智能体下次想再调时系统先弹窗”你 30 秒前刚问过,结果是 X”。

这些都不是”更聪明的模型”能解决的问题。本质上,它们都是分布式系统里早就解决过的老问题:状态一致性、幂等性、接口契约。AI 智能体不是 AGI 的预演,它是一类新型分布式系统的早期形态。把它当分布式系统来设计,比把它当学生来教,要靠谱得多。

延伸阅读:arXiv 上同期还有几篇关于”智能体失败模式分类”的论文,把失败归为 7 个原子类型(参数错误、超时、循环调用、状态污染等),用形式化方法检测——这是把 AI 工程从手艺活推向工程学科的迹象。

admin77

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注