模型正在吃掉数据栈:通用 Coding Agent 碾压手工 Data Agent 37 分,而技能文件的价值 65.7% 来自"怎么做"
事件
Stanford / Berkeley 团队(Liana Patel、Ion Stoica、Matei Zaharia 等)发表论文 《What Happens When the Model Eats the Stack?》,追踪了两年来前沿模型在 data agent 基准上的演进,得出一个反直觉的结论:
- 通用 coding agent 配上通用提示词,比精心手工设计的 data agent 高出最多 37 分,同时只用 1/4 的交互轮次。 作者把这读作"苦涩的教训(Bitter Lesson)正在吞噬数据系统栈"——为弥补模型缺陷而搭建的系统层,会被模型本身逐步吸收。
- 真正值得长期投入的方向是 persistent semantic context(持久语义上下文):关于数据环境的、可跨多次查询复用的精炼上下文,应当成为数据系统的一等抽象。作者列出的开放问题包括上下文的数据结构、存储、压缩,以及大规模知识语料上的语义一致性协议。
论文里还有一个更有实操价值的配对实验:把同一条轨迹分别打包成一份精炼的 SKILL.md 和一个更详细的 Workflow Memory 库,结果 SKILL.md 胜出 6.06 分。进一步做归因拆解后发现:
- 65.7% 的成功来自"程序性锚定"——步骤顺序、工具选择、验证动作;
- 只有 4.5% 来自"注入模型原本缺失的知识"。
同期在 YC 的论文圆桌上,另一个数据点被反复引用:同一套模型权重,弱 harness 下 ARC-AGI 只拿 30%,换一个好 harness 直接冲到 95%。 也就是说,在很多真实场景里,卡住性能天花板的不是模型,而是包在它外面的工具编排层。
为什么值得关注
- 技能文件到底该写什么,第一次有了量化答案:不是塞背景知识,而是把步骤、工具、验收标准写死、写清、写对。知识缺口交给检索和工具去补,行为一致性交给程序锚定——这是两个正交的杠杆,别混着用。
- "专用系统"的护城河在被快速侵蚀:如果你的产品价值主要来自"为模型补上它不会的东西",那么每一次模型升级都在削你的城墙。反过来,把价值放在流程编排、验证机制和上下文治理上,抗升级能力更强。
- 换更大模型之前,先换 harness:30% → 95% 的差距说明,工具编排层的 ROI 通常高于模型升级。这也给"harness 只是提示词工程"的论调正了名——当外层设计能带来数倍性能差,它就是决定产品上限的工程主体。
- 对 AI work 的启示:写 skill、写系统提示、设计 Agent 工作流时,把力气花在"让正确的事按正确顺序发生",而不是"把更多资料塞进上下文"。后者往往只是让账单变厚。
来源:arXiv 论文《What Happens When the Model Eats the Stack?》(Patel / Stoica / Zaharia 等,2026-09)、AGI Hunt 2026-09-09 报道

评论(0)
暂无评论,来抢沙发~
请 登录 后发表评论