9月17日,Google DeepMind正式成立DeepMind Institute,并同步发布4篇奠基性论文。其中最引人注目的,是创始人Demis Hassabis亲自执笔的《前沿AI框架与新时代的曙光》——文中提出了一个具体的制度设计方案:建立一个类似美国金融业监管局(FINRA)的「AI前沿标准机构」(Frontier AI Standards Body),对最先进AI模型进行强制性测试与认证。

两天后,CNBC报道:OpenAI、Anthropic和Google三家竞争对手确认,已就AI安全标准展开合作性讨论。

这两件事放在一起,意味着什么?

AI治理的讨论,正在从「我们很担忧」的道德表态,走向「建立什么机构、谁来测试、谁来执行」的制度设计阶段。

DeepMind Institute:不是公关,是制度提案

DeepMind Institute不是通常意义上的智库或宣传机构。

它的三位董事是:DeepMind联合创始人Shane Legg(担任主编);Google高级副总裁James Manyika;以及Hassabis本人(Google DeepMind董事长)。成立公告明确表示:「他们不会总是同意彼此,随着更多数据的出现,他们也可能改变观点。」

这个表述很罕见——大公司通常不允许旗下机构公开表达内部分歧。DeepMind Institute的定位,更接近于「公开辩论场」而不是「公司立场传声筒」。这种选择本身是有战略意图的:在一个任何实质性立场都会引发商业和政治敏感的领域,「我们允许内部辩论」的姿态,比「我们发布统一结论」更能建立公信力。

首批4篇论文覆盖的议题包括:管理AGI潜在经济冲击的政策框架、保留AI可读推理链的必要性、人类繁荣原则,以及前沿AI模型评估框架。这个选题组合,本质上是在问:当AGI真的到来,我们准备好了什么?

Hassabis在其个人论文中写道:「我一生都在研究AGI,因为我始终相信,如果负责任地构建和部署,它将成为人类有史以来最有益的技术之一。AGI不可与标准技术突破相比——它更接近于电力或火的发现。」

但他紧接着指出:「目前,我们被锁定在一场极其激烈的多层次商业和地缘政治竞争中。前沿进展的速度,已经超过了我们对这项技术的理解。」

这段话的背景,是当前AI领域的现实:没有人真正知道接下来会发生什么,而所有顶级实验室都在竞相推进。

FINRA模型:监管架构的一次具体设计

Hassabis提案的核心,是建立一个「联邦监管的公私合营自律组织」,类比FINRA(美国金融业监管局)。

FINRA是一个有意思的参考模型。它由国会授权,但由行业自己出资和运营,核心职能是对金融专业人员和公司进行强制性注册、测试和规则执行。它不是政府机构,但有法律背书的强制权。

Hassabis设想的AI版FINRA:

  • 资金主要来自行业,以吸引世界级技术人才并提供大规模测试算力
  • 与联邦机构和美国国家实验室合作,在国家安全相关领域进行测试
  • 定义「前沿级」模型的认证标准:达到特定基准阈值的模型被标记为「前沿级」
  • 初期采用自愿提交模式:发布前30天内提交测试
  • 一旦系统运行有效,通过测试将成为在美国部署前沿模型的必要条件

特别值得注意的一点:该标准机构将逐步开发独立的、不公开的评测(「held-out tests」),防止各实验室专门针对已知评估指标优化模型。这实际上是在解决一个已知问题——当行业知道考题时,考试本身就失去了意义。

Hassabis还表示,如果安全保障落后于能力发展,该框架可以「升级」——包括协调前沿AI开发者进行集体减速。

三巨头合作:从竞争对手到同一屋檐下的安全伙伴

9月15日,CNBC确认:自7月Hassabis发布X平台帖子提出标准机构设想以来,OpenAI、Anthropic和Google已就如何共同解决安全问题展开持续性讨论。

这个时机很耐人寻味。就在讨论公开的同一周,Anthropic CEO Dario Amodei发表了引发广泛争议的「为前沿踩刹车」长文,Hassabis和OpenAI CEO Sam Altman相继表示赞同。

三家公司是激烈的商业竞争对手,同时又在这个问题上形成了罕见的一致声音。表面上看是「行业自律」,但背后的逻辑是:如果真的出现灾难性事故,所有人都没有好结果。「共同管好这件事」,比「你死我活的竞争中某人出事」对所有人都更有利。

DeepMind安全研究员Rohin Shah和Anca Dragan在Institute的另一篇论文中也提出了一个具体技术建议:限制模型在不产生可读推理链的情况下能进行的「不透明连续计算深度」(opaque serial depth)。翻译成通俗语言:AI思考的过程,人类必须能够看见和检查;当AI「沉默地思考」的能力增强到某个阈值,就需要证明这个系统仍然是可监控的。

从呼吁到机构:三个层次的转变

如果我们把过去12个月的AI治理讨论做一个时间轴,可以看到三个阶段:

第一阶段(2025年末至2026年初):个人警告。研究员辞职发声,CEO发表长文表达担忧。这是情绪驱动的阶段,缺乏具体方案。

第二阶段(2026年中):实验室内部措施。Anthropic公布「AI辅助26%内部研发」的透明度指标,同时宣布引入Accenture作为「嵌入式安全评估方」,OpenAI和Anthropic开始讨论独立评审员机制。这是公司层面的操作。

第三阶段(2026年9月):行业级制度设计。DeepMind Institute的成立,以及三巨头正式合作讨论安全标准,标志着讨论终于上升到「我们需要什么样的机构」的层级。

这个转变的意义不是解决了问题——目前什么都没有解决。真正的意义在于:讨论的性质变了。从「我们很担忧」变成了「我们在商量建什么机构,谁来负责测试」。前者可以停留在言辞层面,后者涉及资金、人员、权力和问责。

地缘政治挑战:「美国主导」方案的边界

Hassabis的标准机构提案有一个内在的地理假设:美国是制定规则的合适主体,其他国家会跟随。

这个假设在2026年的实际情况下,面临三重挑战。

欧盟的先行法规:欧盟AI法案已于2026年开始分阶段实施,建立了自己的「高风险AI系统」分类框架和强制评估要求。欧洲监管机构不会接受由美国私营机构主导的标准体系,除非它与EU AI Act的框架实现互认。而这种互认谈判的复杂程度,不亚于任何一个国际贸易协定。

中国的平行体系:中国已有自己的「生成式AI服务管理暂行办法」,以及依托国家标准委员会运作的AI标准化体系。在中国运营的AI模型需要通过国家互联网信息办公室的备案,这套流程与任何美国主导的认证体系互不相认。更重要的是,从中国政策取向来看,承认外部标准机构对本国AI系统的评估权,政治上不可能发生。

资源不对称:一个依靠行业资金的AI标准机构,其测试能力将受到行业愿意支付多少的约束。而前沿模型测试需要的算力,本身就是天文数字。谁来确保标准机构有足够资源测试它们负责评估的那类模型?

在AI地缘政治的框架下,「标准权」本身已经成为竞争对象——谁制定了规则,谁就在很大程度上决定了谁能在这个领域继续运作。

问题所在:谁来验证验证者?

Hassabis的FINRA提案有一个显而易见的弱点:提案本身来自行业内部人士。

FINRA作为类比,有一个重要的历史背景——它在2008年金融危机中的表现受到了广泛批评,被认为在监管自己的成员方面存在根本性利益冲突。

AI版FINRA面临同样的挑战:如果资金主要来自行业,专业人才也主要来自行业,那这个机构独立评估行业的能力从何而来?

TechCrunch的分析指出,安全辩论正在「从广泛的担忧声明,转向具体的披露、外部审查提案」。但从提案到真正有执行力的外部审查,中间还有很长的路。

一个被遗漏的问题:「现有模型」的处理

Hassabis的框架聚焦于「未来发布的前沿模型」需要通过认证。但一个更棘手的问题被略过了:今天已经在使用的前沿模型怎么办?

截至2026年9月,Claude Opus 5和GPT-6 Astra已经在全球数亿用户手中运行。这些模型具备了Hassabis论文中描述的「令网络安全担忧」和「核生物风险可能出现」的能力——这是Anthropic自己的威胁情报报告已经确认的。

如果FINRA式标准机构建立,它是否有追溯评估已发布模型的权力?如果有,谁来执行?如果没有,那「认证」只约束新模型,而不约束已经释放到市场中的当前能力,其实际意义会大打折扣。

这个问题没有简单答案,但它揭示了AI治理的一个根本困境:技术能力的扩散速度,始终快于制度建设的速度。当制度终于建立,它面对的往往不是一张白纸,而是已经遍布全球的、无法收回的既成事实。

DeepMind Institute的成立和Hassabis的框架,在这个意义上,也许更好地理解为「提前开始积累制度基础」,而不是「解决了现有问题」。

结语:建立机构,还是时间换空间?

DeepMind Institute的成立和三巨头安全合作,是AI治理史上一个可以被记录的时间节点。它标志着行业领袖终于开始讨论「建立什么机构」,而不只是「我们应该更负责任」。

但历史告诉我们,行业主导的自律机构,往往是在监管缺位时期的过渡性方案。它们最终要么被真正独立的外部机构取代,要么在第一次重大事故后丧失公信力。

AI领域的实验室领袖们或许都清楚这一点。他们现在推动行业自律,可能是因为相信这是最快的路径;也可能是因为,在联邦监管真正落地之前,掌握话语权是更可控的局面。

两种可能都不影响一个基本事实:相比三个月前,今天的AI治理讨论,已经往「真实的约束」方向迈进了一步。


附录:DeepMind Institute首批4篇论文的核心命题

论文一(Hassabis):前沿AI框架与新时代曙光——FINRA式标准机构设计,本文主体内容。

论文二(Rohin Shah & Anca Dragan):可推理透明度的立场——AI「沉默推理」能力增长带来的监控挑战。关键主张:缩小模型在不产生可读推理链情况下的「不透明计算深度」,或要求开发者证明不透明系统仍可监控。

论文三:经济政策框架——管理AGI潜在的经济冲击。涉及劳动力转型、收入分配和机构适应。

论文四:人类繁荣原则——对AI时代「什么对人类有益」的规范性讨论,由James Manyika参与撰写。

这4篇论文的完整组合,勾勒出DeepMind Institute未来讨论的边界:技术治理(论文一)+ 可解释性(论文二)+ 经济(论文三)+ 伦理(论文四)。这是一次刻意的学术建制化动作——将AI安全讨论从推特上的实时辩论,迁移到有文献记录、可被引用、可以积累的学术空间。

参考资料:

  • Demis Hassabis, “A framework for frontier AI and the dawning of a new age,” DeepMind Institute, 2026-09-17: https://institute.deepmind.com/essays/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age/
  • TechCrunch, “Google DeepMind launches institute to widen the AGI debate,” 2026-09-17: https://techcrunch.com/2026/09/17/google-deepmind-launches-institute-to-widen-the-agi-debate/
  • CNBC, “OpenAI, Google, Anthropic discussing collaboration on AI safety issues,” 2026-09-15: https://www.cnbc.com/2026/09/15/open-ai-google-anthropic-safety.html
  • Rohin Shah & Anca Dragan, “The case for reasoning transparency,” DeepMind Institute: https://institute.deepmind.com/essays/the-case-for-reasoning-transparency/