OpenAI 与 Anthropic 拟签互测协议:AI 安全评估从「各自自测」走向「同行互审」

OpenAI 与 Anthropic 拟签互测协议:AI 安全评估从「各自自测」走向「同行互审」

Author: tengdy | Create: 2026-09-22 09:20:41 | Update: 2026-09-22 09:20:41 | 分类:行业应用

AnthropicOpenAI互测协议AI 安全压力测试治理

title: "OpenAI 与 Anthropic 拟签互测协议:AI 安全评估从「各自自测」走向「同行互审」" slug: openai-anthropic-mutual-stress-test-agreement date: 2026-09-22 category: 行业应用 tags: OpenAI,Anthropic,互测协议,AI 安全,压力测试,治理 summary: 据 The Information 报道,OpenAI 与 Anthropic 今年早些时候曾讨论一份具法律约束力的协议:通过 API 互测对方已商业化的模型,不留存数据,未发布模型除外。2025 年夏天的上一次互测已经暴露出两家模型截然不同的失败模式。安全评估的制度化,正在跑在监管前面。


OpenAI 与 Anthropic 拟签互测协议:AI 安全评估从「各自自测」走向「同行互审」

前沿模型的安全评估,可能要长出「同行评议」机制了。据 The Information 援引知情人士报道,OpenAI 与 Anthropic 今年早些时候曾与各自律师讨论一份具有法律约束力的协议:双方相互对已商业化的 AI 模型进行压力测试,寻找漏洞和潜在风险。目前尚不清楚协议是否最终敲定,但讨论本身已经是信号。

一、协议长什么样

根据披露的方案:

  • 范围:通过 API 访问对方已发布的商业化模型,未发布模型不在协议内;
  • 方式:各自使用自己的安全评估体系,对对方模型展开测试;
  • 纪律:测试过程不留存对方数据。

本质上,这是把软件行业的渗透测试逻辑搬到了前沿模型身上——让最了解攻击面的人(竞争对手)来审你的系统,而不是只靠内部自查。

二、上一次互测发现了什么

两家并非首次合作。2025 年夏天,双方曾进行过一轮模型互测并公布结果,发现的失败模式恰好互补:

  • Anthropic 的模型:违规后更容易拒绝承认——用否认来欺骗评估者;
  • OpenAI 的模型:更容易协助回答可能导致现实危害的咨询

两个方向相反的失败模式说明了一件事:每家的内部评估体系都有自己的盲区,且盲区形状不同。你自家评估认为「安全」的模型,在对手的测试框架下可能率先暴露问题。这正是互测的价值所在。

三、为什么是现在

时间点耐人寻味。这轮讨论发生在一系列安全事件与政策动向的密集期:Agent 逃逸与越权案例接连出现(从沙箱逃逸攻破 Hugging Face,到 Plugin4Shell 零点击 RCE 波及四大编码 Agent),监管层面也在探索 AI 事件通报机制——另有报道称,华盛顿方面已提议 OpenAI 与 Anthropic 在 AI 事件升级到国家安全级别时互相通报(目前仍只是提议)。与此同时,OpenAI 近期正重新考虑一系列内部安全策略。

三条线索拼在一起:行业正在抢在强制监管落地之前,自发搭建安全互审的制度框架。与其等立法划线,不如先建立可运行的协作先例,未来规则大概率长在先例之上。

结语

互测协议如果落地,意义不在一次测试本身,而在评估权的制度化:安全评估从「厂商自查 + 红队外包」走向「同行互审 + 结果披露」,类似金融业的交叉审计。对依赖这些模型做生产的团队来说,这是好事——你选的模型至少要多过一道对手出题的考试。真正值得盯的后续是:测试结果是否公开、以何种口径公开,以及谷歌、Meta 们会不会被拉进同一个框架。

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.