过去一周,Agent 基础设施层的三家头部公司同时出了大牌。OpenAI 把 Codex Harness 开源了,Anthropic 把四个 Beta API 转正了,DeepSeek 在涨价 11 倍之后又宣布周末半价。
三件事看似各自为政,拼在一起却指向同一个结论:Agent 竞争的主战场,已经从模型层搬到了运行时和平台层。
一、OpenAI 开源 Codex Harness:Agent = Model + Harness
8 月 19 日,OpenAI 宣布将 Codex 背后的核心执行框架 Harness 全面开源,Apache-2.0 协议,托管在 github.com/openai/codex。截至 8 月 21 日,GitHub 星标已超 10.7 万。
Codex Harness 是什么?是让模型「能干活」的那一层:对话状态管理、工具调用调度、沙箱执行、流式输出、人工审批——所有 Codex App、CLI 和 IDE 插件共用的运行时。
开源包含三层集成接口:
- codex exec——轻量非交互调用,一行命令跑完任务就退出。适合 CI/CD 管道和批处理脚本。
- Codex SDK(TypeScript)——程序化编排,把 Agent 嵌进你自己的应用。支持 low/medium/high/max/ultra 五档推理强度。
- App Server——持久会话,JSON-RPC 协议,支持长对话和状态持久化。VS Code 插件和桌面 App 跑的就是这层。
最有说服力的数字来自 OpenAI 自己:仅靠保留推理状态和上下文压缩两项 Harness 层优化,GPT-5.6 Sol 在 ARC-AGI-3 上的得分从 13.3% 飙到 38.3%,输出 Token 压到原来的六分之一。同一个模型,更好的 Harness,分数翻了近三倍,成本降了六分之五。
二、Anthropic 四大 API 转正:Computer Use 不再是实验
8 月 20 日,Anthropic 把四个 Claude Platform 功能同时从 Beta 推到 GA(General Availability):
- Computer Use(
computer_toolset_20260801):截屏操作桌面软件。最大改进是「多动作回合」——一次模型调用可以执行多个动作,不再一步一步等确认。同时获得了 HIPAA 合规资格。 - Browser Use(
browser_toolset_20260801):新增的浏览器工具。和 Computer Use 的区别在于:Computer Use 靠截屏猜像素位置,Browser Use 直接读页面无障碍树(accessibility tree),定位表单和链接精确得多。像素定位一旦页面改版就崩,结构定位稳得多。 - Skills API:上传版本化的技能包(指令 + 脚本 + 模板),Claude 按需加载,在沙箱里跑。版本可以回滚——这是系统提示词里塞指令做不到的。
- Files API:上传文件拿 file_id,后续请求直接引用。1TB 组织存储,速率限制提升 5 倍,支持自动过期。
四个能力拼在一起,就是一个完整的生产级 Agent 栈:Files 管文档输入,Skills 管流程知识,Browser/Computer Use 管软件操作,Files 管结果输出。全部跑在 Anthropic 的基础设施上,不需要自建。
一个保险理赔客户的数据:最长工作流从 32 分钟降到 13 分钟,单任务成本降 30%,完成率 100%——没改一行 prompt。
三、DeepSeek 周末半价:涨价之后的第一步回调
8 月 17 日,DeepSeek 完成了「地震级」涨价:V4-Pro 高峰输出从 6 元/百万 token 飙到 27 元(涨 350%),缓存命中输入从 0.025 元涨到 0.30 元(涨 1100%,11 倍)。业界一片哗然,「价格屠夫」开始算账了。
不到一周,8 月 23 日凌晨,DeepSeek 再次调整:周末(周六、周日)全天统一按低谷价计费,不再区分峰谷时段。以 V4-Pro 为例,周末全天输出 13.5 元/百万 token,比工作日高峰的 27 元直接腰斩。
官方说法是「让用户周末更灵活安排业务,同时平衡全网算力负载」。翻译一下:工作日白天算力紧张,涨价逼你错峰;周末算力空闲,半价吸引你跑批处理任务。
这不是简单的让利。深层逻辑是峰谷定价的精细化运营——涨价不是目的,引导负载分布才是。同时,V4 Pro 正式版已更新至 API,增强 Agent 能力,支持 Responses API 和 Codex 接入,Terminal Bench 得分 87.9,逼近 Fable 5 的 88.0。
与此同时,大洋彼岸也在降价。OpenAI 把 GPT-5.6 Sol 的输入从 $5 降到 $4、输出从 $30 降到 $20(三个月促销期)。Google 的 Gemini 3.7 Flash 价格约为上一版的一半。模型价格战的火没有灭,只是从「谁更便宜」变成了「谁的单位 intelligence 性价比更高」。
四、三件事拼在一起:竞争换了楼层
把三件事并排看:
| OpenAI | Anthropic | DeepSeek | |
|---|---|---|---|
| 本周动作 | 开源 Codex Harness | 四大 API 转正 | 周末半价 + V4 Pro 更新 |
| 竞争焦点 | 运行时框架 | 平台能力栈 | 推理定价 |
| 开放策略 | Apache-2.0 开源 | 闭源平台 GA | 闭源 + 开源 Harness(dsh) |
| 对开发者意味着什么 | 可以自建 Agent 运行时 | 可以直接用生产级 Agent API | 周末跑批更便宜了 |
OpenAI 开源 Harness,赌的是「运行时成为公共品」——和 DeepSeek 开源 dsh 走的是同一条路。区别在于 OpenAI 的 Codex Harness 已经在生产环境跑了数月(10 万+ 星标、5 个月 100 万行代码、1500 个 PR),而 dsh 还是开发者预览版。但 dsh 的赌注更大:一切皆插件,连 Agent 循环本身都可以替换。
Anthropic 不开源运行时,而是把平台能力做到「开箱即用」——你不需要自建沙箱、文件管理、浏览器自动化,Claude Platform 全包了。这条路对不想碰基础设施的企业团队非常有吸引力。
DeepSeek 的打法最务实:运行时开源(dsh),推理层按量收费,峰谷定价精细到「工作日贵、周末便宜」。模型和框架同天更新——多模态 Agent 是作为整体在推进的。
五、给开发者的三个判断
第一,Harness 层的竞争正式开始。 上周写了 DeepSeek Harness 的拆解,这周 OpenAI 也出了牌。加上 Anthropic 的平台化路线,Agent 运行时这条赛道已经有了三种截然不同的打法:开源拼装(dsh)、开源成品(Codex Harness)、闭源平台(Claude Platform)。选哪条路,取决于你愿意花多少力气在基础设施上。
第二,模型价格战进入「精算」阶段。 单纯比谁更便宜的时代过去了。DeepSeek 的峰谷定价、OpenAI 的促销降价、Google 的版本降价——都是在用不同方式优化「单位 intelligence 的成本」。对跑 Agent 的团队来说,理解每个供应商的定价模型,已经和理解它们的 API 一样重要。
第三,Browser Use 是个信号。 Anthropic 从截屏猜像素转向读页面结构,说明 Agent 操作软件的方式正在从「模拟人类」走向「理解机器」。这条路走通了,RPA 行业的好日子可能到头了。
(MCP 2026 路线图也在同一天发布,五个优先方向直指 Agent 身份和工具规模化的痛点——感兴趣的读者可以看我今天的另一篇文章。)

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论