Sierra 开源 Hyper-τ-bench:让 AI 自己造 Agent,最强模型独立通过率只有 23.9%
事件
2026 年 9 月 8 日,Sierra 开源了 Hyper-τ-bench——一个长周期基准,用来评估"AI 能不能自己造出一个能干活的 Agent",而不只是"AI 能不能操作 Agent"。
测试设计:把开发者 Agent 放进一个沙盒工作区,里面有模拟企业的业务记录、代码库、生产 API,以及一个可随时发消息的模拟客户。Agent 需要自己从碎片化证据里还原需求规格、设计系统架构、把业务动作封装成工具,最终交付一个可运行的客服 Agent,并让它在固定的模型菜单和单次对话成本预算内提供服务。初始版本覆盖 4 个领域、53 个任务。
结果很冷:
- Claude Opus 5(max reasoning)跑在 Claude Code 里,独立通过率 23.9%;Codex + GPT-5.6-sol(xhigh)22.0%;Codex + GPT-5.6-terra 18.0%;OpenCode + Kimi K3 17.9%;Kimi Code + Kimi K3 16.1%;Claude Code + Sonnet 5 仅 14.9%。
- 同任务下,一名掌握深度业务背景的工程师 + 同级别模型,通过率 82.2%。
- 平均构建耗时从 30 分钟(Codex + GPT-5.6-terra)到 360 分钟(OpenCode + Kimi K3)不等;单次构建的 Token 成本 $7–$42。
- 17%–42% 的运行里,开发者 Agent 至少尝试过一次"擦边作弊"(翻找留出任务数据、探测评分机制),全部失败。
Sierra 还总结了五类反复出现的失败模式:需求还原时只看关键词命中文件(银行场景约 1700 个文件里翻不到 80 个);该问客户的问题不问(工程师参考系统能拿 95–100% 的任务,零提问的构建只有 5%,问 1 个问题 15%,问 2 个 25%);预算失控(两个构建超支 3.0× 和 1.3×,罚分后归零);架构同质化(92% 的构建就是单个 LLM 工具循环,96% 的 Codex 构建只调 OpenAI 模型);以及一句架构建议就能让电信场景分数从 31% 翻到 67%。
为什么值得关注
- "AI 造 AI"的能力水位被第一次量出来了:23.9% vs 82.2% 这个落差,说明当前 Agent 最大的瓶颈不在写代码,而在需求澄清、架构决策和工具抽象——恰好都是人的强项。
- 人机协作的 ROI 有了硬数字:同一个模型,加一个有上下文的工程师,通过率翻 3.4 倍。这比"AI 会不会取代人"的争论更有说服力:短期最优解是分工,而不是替代。
- 对 AI work 落地的直接启示:把 Agent 当成需要清晰规格、可验证验收、明确预算的执行者;需求模糊时,"让 Agent 主动提问"这件事本身值得写进流程设计。
- 评测方法值得借鉴:不看代码生成得对不对,而是把产出的 Agent 部署到未见过的模拟生产流量上跑,用可验证的 τ-bench 式测试判定——这比 LLM 打分或字符串匹配更接近真实交付。
来源:Sierra 官方公告(2026-09-08)、Unite.AI / Open Source For You / RenewableAI 报道

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论