IBM Research 揭示 Agent 一致性鸿沟:单次成功不等于能重复成功

IBM Research 揭示 Agent 一致性鸿沟:单次成功不等于能重复成功

Author: tengdy | Create: 2026-09-16 22:42:56 | Update: 2026-09-16 22:42:56 | 分类:智能体与 Harness

IBM一致性可靠性Agent

IBM Research 揭示 Agent 一致性鸿沟:单次成功不等于能重复成功

9 月 15 日,IBM Research 在 Hugging Face 发布技术博客,指出当前 Agent 评估存在一个被隐藏的可靠性鸿沟:一次跑通的任务,未必能在多次运行中稳定复现。

事件内容

IBM 研究人员在 AppWorld 基准上测试了一个基于 GPT-4.1 的 ReAct Agent。结果显示:

  • Mean@5 平均成功率:77.4%
  • Pass^5(连续 5 次全部成功):53.0%

两者相差 24.4 个百分点,IBM 称之为「一致性鸿沟」(consistency gap)。在最难任务层级上,这一鸿沟扩大到约 30 个百分点。

问题根源在于模型决策点的 token 概率分布。当两个可选动作概率接近时,GPU 浮点舍入、请求批处理等平台级微小扰动,都足以让 Agent 选择不同路径。即使 temperature 设为 0,也无法消除这种方差。

为此,IBM 开源框架 ALTK-Evolve 新增 Consistency Analyzer:它复用一条已记录轨迹,对每个决策点进行 5 次重采样,标记出容易「翻转」的步骤,再自动生成一致性指南并在推理时注入。实验表明,该方法将一致性鸿沟从 24.4 个百分点降到 12.0 个百分点,同时平均准确率从 77.4% 提升到 81.0%。

值得关注的原因

  1. 重新定义 Agent 生产就绪标准:当前多数榜单只报平均成功率,而真实业务关心的是「同一请求反复执行是否稳定」。IBM 提出用 Pass^k 替代或补充 Mean@k,是推动 Agent 从 demo 走向生产的关键一步。
  2. 黑盒诊断工具实用性强:Consistency Analyzer 不需要模型 logits 或内部状态,只需一条已有轨迹即可定位不稳定步骤,对使用闭源 API 的团队同样可用。
  3. 指南可跨任务迁移:IBM 发现,针对一类不稳定模式(如正则计数、搜索结果验证)生成的指南,能在相似任务甚至更小模型上带来提升,说明这解决的是系统性问题而非个案 hack。

来源

  • IBM Research 技术博客(Hugging Face)
  • AI Insiders:《IBM Research Flags a Hidden Reliability Gap in AI Agents》
  • Mango Developer:《IBM Research Finds 24-Point Reliability Gap in LLM Agents, Ships Fix in ALTK-Evolve》

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.