Anthropic Fable 5.1 上线:缓存价砍 75%,Devin 单任务成本直降 54%
2026 年 9 月 3 日 · 分类:大模型
事件概述
9 月 1 日,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。两款模型共用同一基础模型,区别仅在安全防护级别——Fable 面向所有用户,Mythos 仅向经过审核的机构开放。
最核心的变化不是 benchmark 数字,而是价格:缓存读取(cache read)定价从 1 美元/百万 token 暴降至 0.25 美元/百万 token,降幅 75%。对于典型工作负载,综合成本降低约 25%;对于高度智能体化的任务,最高降幅达 45%。
为什么缓存定价如此重要
输入输出定价维持不变(10 美元/百万输入,50 美元/百万输出),看起来没什么变化。但对于 AI agent 场景,缓存定价才是真正的成本杠杆。
Agent 工作流的典型模式:每次循环都重新读取大量固定上下文——代码库、系统提示、历史对话、API 文档。Cognition 的 AI 工程师 Devin,95% 以上的 token 都是缓存命中的。缓存价降 75% 对这类场景的影响是决定性的。
据 Cognition 公布的数据,Devin 切换到 Fable 5.1 后,单任务成本下降 54%。其多模型编排系统 Fusion 在 FrontierCode 1.1 基准上拿到相同分数,单任务成本仅 1.43 美元——比 Fable 5.1 单独使用还便宜 47%。
性能提升:从"聊天窗口里聪明"到"独立运行过夜"
Fable 5.1 的 benchmark 亮点全部指向长周期任务:
| 指标 | Fable 5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench-Science | 24.7% | 52.6% |
| Terminal-Bench 4.0(agent 编码) | 42% | 最高 60.9% |
| CursorBench | — | 73.4% 居首 |
Anthropic 的产品叙事已经从"聊天窗口里很聪明"转向"值得让你信任它独立运行过夜"。官方旗舰案例:一次 38 小时无人值守运行中,Fable 5.1 成功诊断出一篇已发表论文的结果是标注伪影(label artifact)。
安全护栏的精细化调整
Fable 5.1 的安全防护也有大改——不是收紧,而是精准化:
- 网络安全误报率下降 60%
- 漏洞发现功能解禁(但仍不允许编写利用代码)
- 生物安全无害查询拒答率下降 85%
在所有实验室都在收紧护栏的当下,Anthropic 押注的是:精度而非严格度才是差异化竞争点。
上下文窗口与输出限制
Fable 5.1 保持 100 万 token 上下文窗口和 12.8 万 token 最大输出长度。低/中等推理强度设置下,性能已接近甚至超过 Fable 5 的最高推理强度——意味着同样的任务可以用更低的成本完成。
值得关注的原因
-
缓存定价即 agent 定价:Anthropic 是第一个把缓存定价作为核心武器的大模型厂商。对于 AI coding agent、RAG 系统、知识库问答等高频复用上下文的场景,这直接改写了经济模型。
-
Devin 54% 降本是行业信号:Cognition 的数据证明,模型升级 + 缓存优化的组合效应可以是 50%+ 的成本削减。这对所有 agent 创业公司的盈利模型有直接影响。
-
IPO 前夜的战略卡位:Anthropic 和 OpenAI 均已提交不公开上市申请,Fable 5.1 是上市前抢企业市场份额的关键一步。缓存降价是获客手段,长周期 benchmark 是叙事手段。
-
多模型编排成趋势:Cognition 的 Fusion 证明,用多个模型组合达到相同分数但成本更低 47%。单模型依赖正在被多模型 harness 替代。
本文为每日 AI 动态跟踪,关注 AI work 方向的重要事件与趋势。

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论