Agent 运行时三国杀:Codex Harness 开源、Claude 平台转正、DeepSeek 周末半价

Agent 运行时三国杀:Codex Harness 开源、Claude 平台转正、DeepSeek 周末半价

Author: tengdy | Create: 2026-08-23 10:43:16 | Update: 2026-08-24 13:54:59 | 分类:智能体与 Harness

CodexAnthropicClaudeDeepSeekOpenAI

过去一周,Agent 基础设施层的三家头部公司同时出了大牌。OpenAI 把 Codex Harness 开源了,Anthropic 把四个 Beta API 转正了,DeepSeek 在涨价 11 倍之后又宣布周末半价。

三件事看似各自为政,拼在一起却指向同一个结论:Agent 竞争的主战场,已经从模型层搬到了运行时和平台层。

一、OpenAI 开源 Codex Harness:Agent = Model + Harness

8 月 19 日,OpenAI 宣布将 Codex 背后的核心执行框架 Harness 全面开源,Apache-2.0 协议,托管在 github.com/openai/codex。截至 8 月 21 日,GitHub 星标已超 10.7 万。

Codex Harness 是什么?是让模型「能干活」的那一层:对话状态管理、工具调用调度、沙箱执行、流式输出、人工审批——所有 Codex App、CLI 和 IDE 插件共用的运行时。

开源包含三层集成接口:

  1. codex exec——轻量非交互调用,一行命令跑完任务就退出。适合 CI/CD 管道和批处理脚本。
  2. Codex SDK(TypeScript)——程序化编排,把 Agent 嵌进你自己的应用。支持 low/medium/high/max/ultra 五档推理强度。
  3. App Server——持久会话,JSON-RPC 协议,支持长对话和状态持久化。VS Code 插件和桌面 App 跑的就是这层。

最有说服力的数字来自 OpenAI 自己:仅靠保留推理状态和上下文压缩两项 Harness 层优化,GPT-5.6 Sol 在 ARC-AGI-3 上的得分从 13.3% 飙到 38.3%,输出 Token 压到原来的六分之一。同一个模型,更好的 Harness,分数翻了近三倍,成本降了六分之五。

二、Anthropic 四大 API 转正:Computer Use 不再是实验

8 月 20 日,Anthropic 把四个 Claude Platform 功能同时从 Beta 推到 GA(General Availability):

  • Computer Usecomputer_toolset_20260801):截屏操作桌面软件。最大改进是「多动作回合」——一次模型调用可以执行多个动作,不再一步一步等确认。同时获得了 HIPAA 合规资格。
  • Browser Usebrowser_toolset_20260801):新增的浏览器工具。和 Computer Use 的区别在于:Computer Use 靠截屏猜像素位置,Browser Use 直接读页面无障碍树(accessibility tree),定位表单和链接精确得多。像素定位一旦页面改版就崩,结构定位稳得多。
  • Skills API:上传版本化的技能包(指令 + 脚本 + 模板),Claude 按需加载,在沙箱里跑。版本可以回滚——这是系统提示词里塞指令做不到的。
  • Files API:上传文件拿 file_id,后续请求直接引用。1TB 组织存储,速率限制提升 5 倍,支持自动过期。

四个能力拼在一起,就是一个完整的生产级 Agent 栈:Files 管文档输入,Skills 管流程知识,Browser/Computer Use 管软件操作,Files 管结果输出。全部跑在 Anthropic 的基础设施上,不需要自建。

一个保险理赔客户的数据:最长工作流从 32 分钟降到 13 分钟,单任务成本降 30%,完成率 100%——没改一行 prompt。

三、DeepSeek 周末半价:涨价之后的第一步回调

8 月 17 日,DeepSeek 完成了「地震级」涨价:V4-Pro 高峰输出从 6 元/百万 token 飙到 27 元(涨 350%),缓存命中输入从 0.025 元涨到 0.30 元(涨 1100%,11 倍)。业界一片哗然,「价格屠夫」开始算账了。

不到一周,8 月 23 日凌晨,DeepSeek 再次调整:周末(周六、周日)全天统一按低谷价计费,不再区分峰谷时段。以 V4-Pro 为例,周末全天输出 13.5 元/百万 token,比工作日高峰的 27 元直接腰斩。

官方说法是「让用户周末更灵活安排业务,同时平衡全网算力负载」。翻译一下:工作日白天算力紧张,涨价逼你错峰;周末算力空闲,半价吸引你跑批处理任务。

这不是简单的让利。深层逻辑是峰谷定价的精细化运营——涨价不是目的,引导负载分布才是。同时,V4 Pro 正式版已更新至 API,增强 Agent 能力,支持 Responses API 和 Codex 接入,Terminal Bench 得分 87.9,逼近 Fable 5 的 88.0。

与此同时,大洋彼岸也在降价。OpenAI 把 GPT-5.6 Sol 的输入从 $5 降到 $4、输出从 $30 降到 $20(三个月促销期)。Google 的 Gemini 3.7 Flash 价格约为上一版的一半。模型价格战的火没有灭,只是从「谁更便宜」变成了「谁的单位 intelligence 性价比更高」。

四、三件事拼在一起:竞争换了楼层

把三件事并排看:

OpenAI Anthropic DeepSeek
本周动作 开源 Codex Harness 四大 API 转正 周末半价 + V4 Pro 更新
竞争焦点 运行时框架 平台能力栈 推理定价
开放策略 Apache-2.0 开源 闭源平台 GA 闭源 + 开源 Harness(dsh)
对开发者意味着什么 可以自建 Agent 运行时 可以直接用生产级 Agent API 周末跑批更便宜了

OpenAI 开源 Harness,赌的是「运行时成为公共品」——和 DeepSeek 开源 dsh 走的是同一条路。区别在于 OpenAI 的 Codex Harness 已经在生产环境跑了数月(10 万+ 星标、5 个月 100 万行代码、1500 个 PR),而 dsh 还是开发者预览版。但 dsh 的赌注更大:一切皆插件,连 Agent 循环本身都可以替换。

Anthropic 不开源运行时,而是把平台能力做到「开箱即用」——你不需要自建沙箱、文件管理、浏览器自动化,Claude Platform 全包了。这条路对不想碰基础设施的企业团队非常有吸引力。

DeepSeek 的打法最务实:运行时开源(dsh),推理层按量收费,峰谷定价精细到「工作日贵、周末便宜」。模型和框架同天更新——多模态 Agent 是作为整体在推进的。

五、给开发者的三个判断

第一,Harness 层的竞争正式开始。 上周写了 DeepSeek Harness 的拆解,这周 OpenAI 也出了牌。加上 Anthropic 的平台化路线,Agent 运行时这条赛道已经有了三种截然不同的打法:开源拼装(dsh)、开源成品(Codex Harness)、闭源平台(Claude Platform)。选哪条路,取决于你愿意花多少力气在基础设施上。

第二,模型价格战进入「精算」阶段。 单纯比谁更便宜的时代过去了。DeepSeek 的峰谷定价、OpenAI 的促销降价、Google 的版本降价——都是在用不同方式优化「单位 intelligence 的成本」。对跑 Agent 的团队来说,理解每个供应商的定价模型,已经和理解它们的 API 一样重要。

第三,Browser Use 是个信号。 Anthropic 从截屏猜像素转向读页面结构,说明 Agent 操作软件的方式正在从「模拟人类」走向「理解机器」。这条路走通了,RPA 行业的好日子可能到头了。


(MCP 2026 路线图也在同一天发布,五个优先方向直指 Agent 身份和工具规模化的痛点——感兴趣的读者可以看我今天的另一篇文章。)

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.