9 月 21 日,AWS 的 Strands Agents 团队正式发布了 Strands Harness:一个 Apache 2.0 协议的开源通用智能体 Harness,Python 和 TypeScript 双版本,一行 pip install strands-harness 就能装。表面上看,这只是 Agent 生态里又多了一个开源框架;但结合它公布的基准数据,这轮发布真正值得注意的信号是:Harness 层的竞争,已经从「能不能跑通任务」转向了「默认值设计得好不好」。
先看它给了什么
Strands Harness 建在 AWS 2025 年 5 月开源的 Strands Agents SDK 之上。SDK 提供零件,Harness 则把零件组装成一台「开箱即用」的整机——create_harness() 一行调用,返回一个配好一切的通用 Agent:
- 内置 shell、文件读写编辑、网页抓取与搜索工具,外加可编程工具调用器和子 Agent 委派;
- 上下文管理三件套:超过约 1500 token 的工具返回值自动截断;上下文占用过 85% 触发摘要压缩;窗口溢出时在 Agent 循环内自恢复;
- 会话可按 ID 恢复、长期记忆默认开启、多步任务自动挂清单、发现 Agent Skills 自动加载,还能直接连 MCP 服务器。
模型侧默认走 Amazon Bedrock,但 AWS 的 VP 杰出工程师 Marc Brooker 强调:「没有任何功能强制依赖 Bedrock」,一行配置可切到 Anthropic、OpenAI、Google 或本地 Ollama。部署同样自由:AWS、GCP、Azure、Cloudflare、Modal 都在官方支持列表里,CLI 里一句 /export 还能把交互式配置直接导出成 Python 或 TypeScript 代码。
数据说了什么
AWS 用 Terminal-Bench 团队的 Harbor 评测框架在 EC2 上跑了六套基准(ALFWorld、ContextBench、GAIA、WebShop、τ³-bench、Terminal-Bench 2.1),对比 Claude Code、Codex、oh-my-pi、OpenCode 和 DeepSeek Harness。两个头条数字:相同模型下平均成本低 28%(只算 Claude Code 和 Codex 时是 45%);在 Terminal-Bench 2.1 上用同一个 Claude Fable 5,Strands Harness 花费 56.29 美元拿下 69.7 分,Claude Code 花费 248.05 美元只得 61.8 分——便宜 77%,还高了 7.9 分。
最诚实的细节是 DeepSeek Harness:它整体比 Strands 还便宜约 14%,但六套基准全面落后。AWS 把它计入对比后,头条数字从 45% 缩水到 28%。这种把不利于自己的数据放进主图的写法,在厂商基准里不多见,值得加分。
但要保持清醒:这是厂商在自家基础设施上的自测。第三方分析已经指出,聚合计算的选择与替换规则没有完全公开,逐基准的完整表格、置信区间、样本方差都缺席,AWS 承诺的后续论文值得等。把「28%」直接抄进自己的预算表之前,先在自己的任务上跑一轮对照才是正经做法。
真正的故事:默认值成了护城河
这轮发布背后有一个更有意思的行业背景。此前独立研究 HarnessTax 对 Claude Code、Codex CLI、Pi 跨 7 个模型的对比发现:换 Harness 几乎不改变任务成功率,但同一个模型在不同 Harness 下的成本差可以到 5 倍。换句话说,Harness 决定的不是你的 Agent「行不行」,而是它「贵不贵」。
而 Strands 公开的省钱手段——截断工具输出、85% 触发压缩、前缀缓存——没有一项是独家技术。Claude Code 的成本优势被拆解成了三个任何人都能抄的工程参数。那竞争还剩什么?剩的是「默认值品味」:哪些该默认开、阈值定多少、溢出怎么恢复,这些选择叠加起来才是 77% 成本差的来源。开源的意义正在于此——AWS 把自己踩过的坑(Amazon Q Developer、AWS Glue、VPC 可达性分析团队都在生产环境用了这套东西)沉淀成了所有人可以直接继承的起点。
过去一年,Harness 赛道拥挤得厉害:Anthropic 的 Claude Code、OpenAI 的 Codex、Google 的 Antigravity、DeepSeek Harness,再加上一堆开源挑战者。Strands Harness 的发布说明这个层面的战争已经白热化到「比谁的开箱默认值更省」的程度。对开发者来说,这是好时候:Model 换起来容易,Harness 的默认值却会长期塑造你 Agent 的行为和账单。下一个值得想清楚的问题是——你的 Agent,跑在谁的默认值上?
参考来源
- SiliconANGLE: AWS debuts Strands Harness, an open-source AI agent that can be deployed in any environment (2026-09-21) — https://siliconangle.com/2026/09/21/aws-debuts-strands-harness-an-open-source-ai-agent-that-can-be-deployed-in-any-environment/
- The New Stack 独家访谈(Marc Brooker),经 Pivot News 转述 — https://pivotnews.ai/build/aws-open-sources-strands-harness-claiming-45-lower-cost
- ReasonCore: Strands harness launches with AWS claiming 28% lower agent costs(基准口径与聚合规则的独立分析)— https://reasoncore.dev/post/strands-harness-launches-with-aws-claiming-28-lower-agent-costs
- World Programming: AWS Strands Agents Team Releases Strands Harness(Terminal-Bench 2.1 分项数据)— https://www.worldprogramming.org/posts/aws-strands-agents-team-releases-strands-harness-an-open-source-agent-harness-with-28-lower-token-cost-at-comparable-accuracy-xmnyxq
- Technspire: AWS Strands harness on Azure: five defaults to change first — https://technspire.com/en/blog/aws-strands-harness-on-azure-five-defaults-to-change

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论