Sierra 开源 Hyper-τ-bench:让 AI 自己造 Agent,最强模型独立通过率只有 23.9%
Sierra 开源 Hyper-τ-bench:让 AI 自己造 Agent,最强模型独立通过率只有 23.9% 事件 2026 年 9 月 8 日,Sierra 开源了 Hyper-τ-bench——一个长周期基准,用来评估"AI 能不能自己造出一个能干活的 Agent",而不只是"AI 能不能操作 Agent"。…
✎ tengdy
4 分钟
