IBM Research 揭示 Agent 一致性鸿沟:单次成功不等于能重复成功
9 月 15 日,IBM Research 在 Hugging Face 发布技术博客,指出当前 Agent 评估存在一个被隐藏的可靠性鸿沟:一次跑通的任务,未必能在多次运行中稳定复现。
事件内容
IBM 研究人员在 AppWorld 基准上测试了一个基于 GPT-4.1 的 ReAct Agent。结果显示:
- Mean@5 平均成功率:77.4%
- Pass^5(连续 5 次全部成功):53.0%
两者相差 24.4 个百分点,IBM 称之为「一致性鸿沟」(consistency gap)。在最难任务层级上,这一鸿沟扩大到约 30 个百分点。
问题根源在于模型决策点的 token 概率分布。当两个可选动作概率接近时,GPU 浮点舍入、请求批处理等平台级微小扰动,都足以让 Agent 选择不同路径。即使 temperature 设为 0,也无法消除这种方差。
为此,IBM 开源框架 ALTK-Evolve 新增 Consistency Analyzer:它复用一条已记录轨迹,对每个决策点进行 5 次重采样,标记出容易「翻转」的步骤,再自动生成一致性指南并在推理时注入。实验表明,该方法将一致性鸿沟从 24.4 个百分点降到 12.0 个百分点,同时平均准确率从 77.4% 提升到 81.0%。
值得关注的原因
- 重新定义 Agent 生产就绪标准:当前多数榜单只报平均成功率,而真实业务关心的是「同一请求反复执行是否稳定」。IBM 提出用 Pass^k 替代或补充 Mean@k,是推动 Agent 从 demo 走向生产的关键一步。
- 黑盒诊断工具实用性强:Consistency Analyzer 不需要模型 logits 或内部状态,只需一条已有轨迹即可定位不稳定步骤,对使用闭源 API 的团队同样可用。
- 指南可跨任务迁移:IBM 发现,针对一类不稳定模式(如正则计数、搜索结果验证)生成的指南,能在相似任务甚至更小模型上带来提升,说明这解决的是系统性问题而非个案 hack。
来源
- IBM Research 技术博客(Hugging Face)
- AI Insiders:《IBM Research Flags a Hidden Reliability Gap in AI Agents》
- Mango Developer:《IBM Research Finds 24-Point Reliability Gap in LLM Agents, Ships Fix in ALTK-Evolve》

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论