上一篇我们拆了系统提示词——Harness 往 AI 脑子里塞的那十层东西。当时有个判断:Harness 是把「能聊天的模型」变成「能干活的 Agent」的那层壳。
现在这层壳,模型厂商自己要下场做了。最新消息:DeepSeek Harness 开发者预览版发布。
一家以「模型能力」著称的公司,开始官方出品 Harness——这件事的信号意义,比产品本身更值得聊。
先回顾:Harness 工程是怎么火起来的
时间线拉一遍:
- 2025 年 11 月,Anthropic 发布《Effective Harnesses for Long-Running Agents》,首次系统性地用「Harness」定义长时 Agent 的外部驾驭层,提出 initializer + coding agent 模式
- 2026 年 2 月,OpenAI 发文《Harness Engineering》,用 Codex 做「零人工代码」实验:3-7 人团队 5 个月驱动 Codex 合并约 1500 个 PR,靠的就是在 Harness 层引入本地可观测性监控和严格的单向分层架构
- 2026 年 4 月,LangChain 用 harness engineering 把 DeepAgents 在 Terminal Bench 2.0 上的得分从 52.8% 拉到 66.5%——不换模型,只改 Harness,排名从第 30 跃升 Top 5
- 2026 年 5 月,学术界发布 70 多页的首篇综述《Agent Harness Engineering: A Survey》
从提示工程,到上下文工程,再到 Harness 工程——一年之内,行业范式完成了三级跳。
LangChain 那个实验是转折点。它证明了一件事:模型能力的天花板,正在被 Harness 的设计质量封顶。同一个模型,好 Harness 和差 Harness 之间隔着 14 个百分点。
模型厂商为什么坐不住了
以前分工很清楚:模型厂商卖权重和 API,应用层自己搭 Harness。现在边界模糊了,原因有三个。
第一,模型能力正在同质化。 开源模型逼近闭源,闭源模型之间互有胜负。当「选哪个模型」越来越难回答,「怎么用好模型」就成了新的竞争维度。DeepSeek V4 Pro 多项指标已接近顶尖闭源模型——模型厂商再只卖裸模型,差异化越来越薄。
第二,交付单位变了。 客户要的从来不是 token,是「把活干完」。谁离「活干完」最近,谁拿走利润。Anthropic 的 Claude Code、OpenAI 的 Codex,本质上都是「模型 + 官方 Harness」的打包交付。现在 DeepSeek 跟进——模型厂商从卖原料,走向卖成品。
第三,Harness 是模型的放大器,也是最佳展示窗口。 厂商最清楚自家模型的脾气:哪里容易跑偏、哪里需要护栏、长任务怎么切分。官方 Harness 是把这种「模型的私有知识」产品化的方式。
一个值得注意的方向:Harness 会自我进化
学术界走得更远。小米 6 月的论文 HarnessX 提出了「自优化 Harness」:运行时捕获执行轨迹,自动分析瓶颈,生成候选 Harness 改动,再由 Critic 验证。结果是让小模型在迭代 10 轮后达到接近大模型的表现——最大提升 44%。
这指向一个未来:Harness 不是写死的脚手架,而是和模型一起进化的活系统。Anthropic 自己也说过类似的话——模型升级后,上一代 Harness 里的一些结构就不再必要了。Harness 设计里藏着大量「当前模型做不到什么」的假设,这些假设会过期。
对开发者的启示
如果你在选型或搭建 Agent 系统,三个建议:
- 别把宝全押在模型选型上。Terminal Bench 的实验说明,Harness 的优化空间可能比换模型更大,而且成本更低。
- 关注官方 Harness 的发布节奏。DeepSeek 这次出预览版,意味着「模型 + 官方驾驭层」会成为标配交付。自建 Harness 之前,先看看官方的够不够用。
- 把 Harness 当资产来管理。执行轨迹、失败案例、护栏规则——这些是会随时间增值的,不像提示词那样写完就冻住。
模型决定能力上限,Harness 决定你能兑现多少。现在,两边都开始卷了。

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论