「最安全的AI公司」对英国监管测试机构隐瞒模型:国际AI安全体系的可信度危机
国际AI安全监测体系正在经历一场可信度危机,而触发这场危机的,是一个意想不到的角色:Anthropic。
根据Financial Times 2026年9月8日的报道(由CryptoBriefing转载),Anthropic拒绝向英国AI安全研究所(UK AI Safety Institute,AISI)提供其最新模型进行独立安全测试。这一消息迅速扩散,与同一天Anthropic研究员Jacob Coxon的辞职声明形成了令人难以忽视的呼应——24小时之内,Anthropic连续经历了两次公开的信任冲击。
需要说明的是:FT的报道基于匿名信源,Anthropic尚未官方确认。但这一报道的可信度来源于FT的新闻标准,以及英国AI治理圈对此事的广泛认知。
消息本身也许不算意外——AI公司对外部测试持审慎态度由来已久。但它发生的时间、地点和背景,让这件事的意义远超一次普通的商业摩擦。
什么是英国AISI,为什么它的存在很重要?
2023年11月,在全球第一次AI安全峰会(Bletchley Park AI Safety Summit)期间,英国政府宣布成立AI安全研究所(AI Safety Institute,AISI)。它是全球第一家专门针对前沿AI模型进行安全评估的政府机构,后在2024年更名为DSIT下属机构,并与美国的AI Safety Institute建立了双边合作协议。
AISI的核心使命是:在前沿AI模型公开发布之前,对其进行独立的技术安全评估,向政策制定者提供专业建议,并帮助建立跨国AI安全监测标准。截至2026年,AISI已对OpenAI、Google DeepMind、Meta等主要实验室的多款模型进行了评估,并发布了公开报告。
在成立之初,AISI获得了主要AI实验室的合作承诺。OpenAI、Anthropic、Google DeepMind、Meta等公司都表示愿意在新模型发布前向AISI提供测试访问权限。这些承诺没有法律约束力,是自愿性质的——但在当时,它们被视为AI行业「自我约束」的重要证明,也是Bletchley宣言的核心成果之一。
AISI的工作意义不仅在于具体的测试结果,更在于它代表的机制原则:AI公司允许外部的专业机构在公众接触模型之前进行独立评估。这是一个信任构建的过程,是政府监管和行业自律之间的桥梁。
如果这个机制运作良好,它能解决AI安全监管中最根本的一个问题:监管机构没有足够的技术能力来独立评估前沿模型,而AI公司没有足够的激励主动披露风险信息。AISI试图填补这个鸿沟。
Anthropic为什么拒绝?
目前Anthropic没有就FT的报道发表官方声明,这让外界只能通过推断来理解其决策逻辑。
在开始分析可能的原因之前,有一个重要的事实需要确认:这不是个例。根据现有报道,Anthropic并非第一家在特定情况下限制AISI访问的公司。AI安全研究界的多个信源显示,AI实验室与AISI的合作程度参差不齐——有些公司提供了完整访问,有些提供了有限访问,有些在某些模型上合作而在另一些模型上受限。
Anthropic的情况之所以引发更大争议,在于它特殊的品牌定位——「安全优先」公司拒绝安全测试,这个反差太过强烈。
从逻辑上推断,可能的原因包括:
第一,竞争敏感性。 前沿AI模型包含大量商业机密。即使是政府机构,在充分的保密协议之外,共享这些信息仍有风险。如果AISI的评估人员同时为竞争对手提供咨询,信息泄露的可能性就客观存在。这是任何AI公司都会认真考虑的因素,不只是Anthropic。
第二,测试协议争议。 AISI的测试方法论仍在快速演进,并不总是与AI公司对「安全评估」的理解一致。如果Anthropic认为特定测试方法存在缺陷或会产生误导性结论,他们可能希望先谈判测试框架,而非直接提供模型访问权限。
第三,战略时机考量。 模型发布有严格的竞争时间窗口。如果测试周期影响到与竞争对手的发布节奏,商业压力会影响决策。这是自愿合作框架下,「配合测试」和「赢得竞争」之间必然存在的张力。
第四,也可能只是流程问题。 模型开发时间线与测试安排之间的协调失败,有时会导致看起来像「拒绝」的结果,实际上只是「尚未安排好」。AISI和Anthropic的双方说法不一致,也可能反映的是流程沟通的断裂而非蓄意回避。
但无论真实原因是什么,从结果看,AISI没有在模型发布前获得独立评估机会——这是实际发生的事情,值得认真对待。
为什么这件事比看起来更严重
理解这件事的严重性,需要理解国际AI安全合作目前处于什么阶段。
2026年,全球主要经济体都在试图建立AI监管框架。美国、欧盟、英国、日本、中国——各自的路径不同,但有一个共识正在形成:对于最前沿的AI模型,某种形式的独立安全测试是必要的。
英国AISI被视为这一共识的先行者。它的成功,对于建立可操作的国际AI安全测试标准至关重要。
如果主要AI公司无法维持与AISI的合作,整个机制就面临崩溃的风险:
- AISI失去测试材料,无法建立评估基准
- 政府监管机构失去独立的技术参考,只能依赖AI公司的自我报告
- 「自愿合规」的框架失去公信力,推动更多国家转向强制性立法
- 跨国AI安全协调变得更加困难
这不是一个假设场景。Anthropic拒绝提供模型测试,已经打破了2023年峰会以来精心维护的合作叙事。即使这次只是「一次误解」,它已经损害了整个体系的信任基础。
Anthropic的矛盾:安全话语与安全实践
Anthropic一直是AI安全测试话语中最重要的倡导者之一。
在马萨诸塞州AI安全立法的博弈中,Anthropic是支持更严格测试要求的一方(而OpenAI和Google在反对),这一立场赋予了它巨大的道德话语权。
Anthropic的创始故事本身就是一个「离开OpenAI是因为那里对安全不够重视」的叙事。它的安全承诺是品牌的核心。
在这个背景下,拒绝向英国官方测试机构提供模型,不仅是一个单纯的商业决定,更是一个话语一致性的问题:
你不能一方面倡导「AI公司应该接受更严格的外部测试」,另一方面拒绝接受最权威的外部测试机构的要求。
当然,Anthropic也许有充分的理由——也许他们的担忧关乎测试方法论的有效性,也许关乎具体的保密条款,也许这只是一次时间上的误会。
但公众看到的结果是:当测试不是法律强制时,即使「最注重安全的公司」也可以选择不接受。
自愿机制的根本困境
这个事件揭示的,其实是国际AI安全治理面临的一个根本性困境。
目前几乎所有的AI安全测试协议都是自愿性质的。AI公司选择参与,监管机构提供协助,双方在平等的基础上合作。这种模式的前提是:AI公司有足够的激励保持透明,否则会失去监管信任和公众信誉。
但这个假设有一个脆弱之处:当商业竞争压力足够大,当一次潜在的负面测试结果可能影响数十亿美元的企业合同时,即使是最有安全意识的公司,也可能在计算成本和收益时做出不同的选择。
解决这个问题有两条路:
路径一:强化自愿合规的声誉激励。 让拒绝测试的代价足够高——比如让监管机构公开发布「未参与测试」的公告,让企业采购方将测试参与作为合规要求,让投资者将测试结果纳入ESG评估。
路径二:推动法律约束。 将前沿AI模型的安全测试从自愿选择变为法律义务,设置发布前测试的「护照」机制——没有通过官方测试的模型不能向公众发布。
欧盟AI法案已经在向第二条路径靠近,对高风险AI系统设定了强制评估要求。英国目前仍倾向于「轻触式监管」,但这次事件可能会加速政策辩论。
马萨诸塞州的立法争议中,已经可以看到这个分歧的雏形:当Anthropic支持更严格测试要求而OpenAI/Google反对时,整个行业其实已经承认,仅凭自愿机制是不够的。只是各方对「强制到什么程度」存在分歧。
接下来会发生什么?
短期看,这件事可能有几个走向:
-
Anthropic发表声明澄清原因。 如果他们提供了合理解释,危机可能降温。但解释本身也需要满足一个条件:它必须与Anthropic在安全立法上的公开倡导立场保持一致。
-
英国AISI调整合作机制。 如果自愿合作无法得到保证,AISI可能会寻求政策支持,建立更正式的参与要求。英国政府正在讨论AI监管框架,这次事件可能成为政策加速的触发点。
-
国际AI安全合作出现分化。 如果英国机制出现裂缝,其他国家(尤其是希望通过「监管友好型」态度吸引AI投资的国家)可能会降低安全测试标准,整个国际AI安全合作的基础可能被侵蚀。
结语:谁来测试测试者?
在AI安全领域,有一个经典的哲学问题:谁来确保安全检测系统本身是可信的?
这个问题不是抽象的。每一个被部署给数亿用户的AI模型背后,都有一个关于「谁验证过它是安全的」的假设。这个假设越来越脆弱。
英国AISI试图回答这个问题:让政府委托的专业机构在公司和公众之间扮演可信的中间人。这个设计的前提是:AI公司愿意让这个中间人存在并发挥作用。
Anthropic的选择——无论其具体动机如何——让这个前提受到了质疑。
在一个AI能力加速提升、前沿模型越来越接近「关键性风险阈值」的时代,谁来独立评估这些模型,已经不再只是一个技术问题或政策问题,而是一个关于我们是否能建立足够可信的安全机制的根本问题。
Jacob Coxon说「我们在赌命」。
而这次事件说明,连赌桌上的荷官,也并不总是被允许看清楚牌的。当独立的外部观察者都无法验证安全声明时,「安全」就从一个可证明的属性,退化为一个需要盲目信任的承诺。这是AI安全治理面临的最深层困境,也是整个行业必须正视的根本问题。
参考资料
-
FirstFT: Anthropic withheld AI model from UK testers — CryptoBriefing/Financial Times, 2026-09-08. https://cryptobriefing.com/firstft-anthropic-withheld-ai-model-from-uk-testers/
-
An Anthropic researcher just quit, saying OpenAI and Anthropic are ‘gambling with our lives’ — MSN, 2026-09-08. https://www.msn.com/en-us/news/other/an-anthropic-researcher-just-quit-saying-openai-and-anthropic-are-gambling-with-our-lives/ar-AA2bQit2
-
OpenAI, Google oppose stricter Massachusetts AI safety rules backed by Anthropic — CryptoBriefing, 2026-09-03. https://cryptobriefing.com/openai-google-oppose-massachusetts-ai-safety-rules/ (Anthropic支持严格AI安全立法的背景)
-
OpenAI commits $1 billion to cyberdefense effort amid AI safety scrutiny — Reuters, 2026-09-03. https://www.reuters.com/legal/litigation/openai-commits-1-billion-cyberdefense-effort-amid-ai-safety-scrutiny-2026-09-03/ (AI安全背景参考)