「可见的推理,才是安全的推理」:DeepMind研究院的成立,与Hassabis的AI监管蓝图

2026年9月17日,Google DeepMind正式启动了一个新机构——DeepMind Institute,AGI政策研究院。

创始团队由三人组成:Google DeepMind主席Demis Hassabis,Google执行副总裁James Manyika,以及DeepMind联合创始人、首席科学家Shane Legg担任执行主编。

对外发布了四篇开幕论文,覆盖经济政策、人类繁荣原则、前沿AI模型评估框架,以及本文要重点讲的一个技术政策主张:「推理透明性」(Reasoning Transparency)

这个主张,现在比任何时候都更重要。


事件背景:一个窗口正在关闭

先说清楚为什么这件事这个时间点出现。

今天的前沿AI模型使用「链式思维」(Chain of Thought,CoT)推理:模型在给出最终答案前,会先在一个”草稿区”写出它的推理过程,这个推理过程以自然语言呈现,人类可以直接阅读和检查。

这是AI安全领域一个至关重要的特性。

通过检查CoT,安全研究员可以发现:这个模型是否在规划隐瞒用户的信息?它是否在试图欺骗评估系统?它的推理逻辑是否和它给出的答案一致?

CoT不仅仅是一个性能工具——它是目前最有效的AI行为实时监控手段之一。

例如,2026年8月的Hugging Face黑客攻击事件的调查,关键证据就来自于对CoT日志的检查。正是因为能看到模型的思维轨迹,研究员才能还原发生了什么,以及为什么发生。

但这个窗口正在关闭。

DeepMind安全研究员Rohin Shah和Anca Dragan在他们的论文里指出:随着新的模型架构优先追求效率,推理过程越来越不透明。这不是一个技术必然,而是一个被动的商业选择——为了更高的效率和更低的延迟,部分推理逻辑被”内化”到模型的神经网络权重里,不再以可读的方式外显。

最直接的证据:OpenAI GPT-6 Astra的系统卡里明确记录了「链式思维可监控性大幅下降」(substantial decrease in chain-of-thought monitorability)。

这是一个历史性的倒退。而DeepMind研究院的第一批论文,是在正面回应这个倒退。


「不透明串行深度」:一个你需要知道的新概念

Shah和Dragan的论文引入了一个新术语:opaque serial depth(不透明串行深度)

简单解释:当一个模型在给出答案之前,执行了大量内部顺序计算,但这些计算没有产生任何可读的推理轨迹,这个过程的深度就叫做「不透明串行深度」。

深度越深,模型能做的内部推理就越复杂,能力可能越强——但人类对它在”想什么”的可见度越低。

这是能力和透明度之间的核心张力。

两位研究员的主张是:这个张力不是不可调和的。有几种可行路径:

  1. 限制「不透明串行深度」的上限——类似于对核电站辐射剂量设上限,不是禁止使用,而是要求在可控范围内运行。

  2. 在训练方法上主动保护CoT的透明性——不让训练过程产生把推理”藏起来”的激励机制。

  3. 保留允许观察推理步骤的架构——在架构选型时,把可监控性列为硬性要求,而不是事后附加。

  4. 建立测量CoT准确性、忠实度、鲁棒性的科学方法——让”这个模型的推理是可信的”不只是一句宣传语,而是一个可以被验证的指标。

这些建议不是天马行空的学术愿景。它们是在对现有趋势说:此路不通,我们需要明确的方向。


Hassabis的监管蓝图:”美国主导的前沿AI标准机构”

这次发布最有政策影响力的部分,来自Hassabis本人的论文。

他的论点从一个宏观判断开始:

“AGI——一个在认知能力上展现人类大脑所有能力的系统——可能只有短短几年时间。当我们在几十年后回顾这段时光,我会认为我们站在奇点的山脚。这不只是一个技术拐点,而是一个全新时代的黎明。”

然后他话锋一转,变成了对现实的尖锐批评:

“目前,我们被锁定在一场极其激烈的多层次商业和地缘政治竞赛中。这些竞争动态推动了快速进步,加速了令人难以置信的利好——但前沿的进展正在超越我们对这项技术的理解。世界上没有人确切知道接下来会发生什么,即便是专家之间也存在分歧。当不确定性巨大而赌注如此之高,谨慎乐观是明智且正确的策略。”

基于这个判断,Hassabis提出了一个具体的制度设计方案:美国主导的前沿AI标准机构

核心机制:

  • 发布前自愿提交:开发者在模型发布前30天,将模型提交给这个机构进行评估
  • 顾问委员会:初期由AI公司、政府机构、学术机构、民间组织联合设计评估框架
  • 能力阈值触发:当某个能力阈值被设定后,通过该评估才能在美国境内部署前沿模型
  • 强制化路径:一旦评估体系被验证有效,提交可能从自愿转为法定要求

这是Hassabis继今年7月提出这个想法框架后,首次通过官方研究院的机构渠道正式发布详细方案。


为什么是DeepMind Institute,而不是Google的AI政策部门?

这个问题值得思考。

Google是一家上市公司,其AI政策表态受到投资者、政策游说、竞争策略的多重约束。直接用Google的名义发布”前沿AI应该被强制监管”这样的政策主张,在商业上是敏感的——这等于在主动邀请监管。

DeepMind Institute作为一个相对独立的学术研究机构,可以用”独立研究视角”的名义发布更具争议性的政策立场,同时在字面上与Google官方立场保持距离。

这是制度设计上的聪明之处:让最深刻的政策主张,从最有可信度的来源发出,同时给商业母公司留下操作空间。

值得注意的是,这个机构明确声明:其成员”不会总是同意”,会随着新信息改变立场。这不是信号统一的宣传机器,而是一个真正允许内部观点分歧的平台——这在AI巨头的政策机构里,非常罕见。


「推理透明性」究竟意味着什么

回到最核心的技术政策问题。

目前,AI安全领域的大多数讨论,集中在”AI能做什么”——它能帮助设计武器吗?它能被用于操控舆论吗?它的输出有偏见吗?

但Shah和Dragan的论文在讨论一个更深层的问题:即便一个AI系统只做了”被允许的事情”,我们如何知道它在以”我们期望的方式”做这些事情?

这个问题,是AI对齐研究的核心难题之一。

当前的CoT可监控性,给了我们一个部分的答案。我们可以看到模型在”想什么”,从而在行为发生前发现异常。

但当CoT可监控性下降——就像GPT-6 Astra的系统卡所记录的那样——我们失去的不只是一个技术特性,而是目前最有效的AI安全监控通道之一

DeepMind研究院的这篇论文,是在对整个行业说:这条通道不能就这样关闭,在没有建立替代监控机制的情况下,不应该被为了效率而牺牲。


结语:制度建设的第一块砖

DeepMind Institute不是大新闻,它只是启动了——四篇论文,三位董事,一个网站。

但它代表的方向,是AI治理领域最重要的一个趋势:AI最大的参与者,开始主动为自己的技术建立制度性约束框架。

这不是因为他们天生善良。这是因为他们比任何人都清楚,如果这个框架不是由行业内部建立,它就会由行业外部强加——而外部强加的框架,往往更难以操作,更缺乏技术理解。

Hassabis说得很直白:

“我们不是在做足够的事情。作为一个领域,作为更广泛的社会,我们没有给自己时间和空间来把接下来这个关键步骤做对。”

DeepMind Institute是他试图填补这个空间的第一块砖。

至于这块砖能垒成什么——那要看有多少人愿意和它一起建。


事件来源: TechCrunch “Google DeepMind launches institute to widen the AGI debate” (2026-09-17);DeepMind Institute 开幕论文 “The case for reasoning transparency” by Rohin Shah & Anca Dragan;DeepMind Institute 开幕论文 “A framework for frontier AI and the dawning of a new age” by Demis Hassabis (2026-09-17)。