数据来源说明:本文引用的五位研究员的公开表态,均来自Business Insider 2026-09-10报道「Anthropic and OpenAI employees speak out about humanity’s extinction as debate reaches fever pitch」(URL: https://www.businessinsider.com/anthropic-openai-employees-speak-out-ai-safety-2026-9,经web_fetch验证HTTP 200),以及CNBC等同期媒体对同一事件的多来源交叉验证。引用的具体X(前Twitter)帖子链接均在原报道中注明。文中关于p(doom)的本质分析为作者推断,不构成任何形式的风险评估。

五个数字,一周之内

2026年9月的第二周,五个数字在AI圈引发了超乎寻常的震动:

Evan Hubinger(Anthropic对齐科学负责人):「我认为(AI导致灾难性结果的概率)在未来十年内超过10%。」

Marcus Williams(OpenAI安全监督团队技术成员):「在没有AI监管或协调性减速的情况下,未来几年内人类灭绝的可能性非常高。」当被追问具体数字时:「如果没有监管/减速,3年内概率约70%。」

Geoffrey Hinton(诺贝尔奖得主,”AI教父”):告诉BBC,认为AI在十年内消灭人类的可能性「不是不合理」,并估计约10%的概率。

Jacob Coxon(前Anthropic AI研究员,辞职):「建造AI的人们真诚地相信它可能在十年内杀死我们所有人。」

Anna Wang(Anthropic AGI安全与对齐团队技术成员):不提具体数字,但公开表态:「目前尚无可行的科学计划来解决递归自改进AI的风险。请注意!」

这五个人,在同一周内,以个人名义公开发布了类似表态。他们分布在Anthropic和OpenAI这两家最前沿的AI公司,在各自公司内部都承担着与安全最相关的职位。

这在AI历史上是前所未有的事件密度。

但这些数字意味着什么?它们是真正的技术预测,还是在经历了某种特殊的语境压力后,由特定的专业人士发出的一种社会信号?

p(doom):一个概念的来龙去脉

「p(doom)」是AI安全圈内部使用多年的缩写,代表「AI导致文明级别灾难或人类灭绝的概率」。这个概念最早由少数AI安全研究人员在私下讨论,后来逐渐在非营利安全组织(MIRI、ARC等)和少数AI公司安全团队内部流通。

这个概念有几个重要的特征,是理解五个数字的前提:

特征一:p(doom)不是一个有共识定义的技术指标。

与统计学中的置信区间、或气候科学中的气候敏感度不同,p(doom)没有被学界认可的方法论来计算。不同的研究者用不同的前提假设:有人定义为「AI系统获得自主目标并无法被人类纠正的概率」,有人定义为「不受控AI导致人口大量死亡(>50%)的概率」,还有人定义为「AI在总体上造成的经济和社会伤害超过核武器历史影响的概率」。

这意味着,不同的人给出「10%」时,他们的参照系可能完全不同——让直接比较这些数字没有技术意义。

特征二:p(doom)的估算依赖于一系列不可验证的假设链。

当Evan Hubinger说”>10%”时,这背后隐含了一系列判断:AI能力提升速度(会有多快)、递归自改进(RSI)是否可行及何时触发、人类是否有足够时间和能力建立有效的对齐技术、全球监管是否能有效协调……每一个节点都高度不确定,将它们链式相乘得到的数字,方差大得几乎无法解读。

特征三:p(doom)是一个主观确信度(credence)的表达,不是客观概率。

在贝叶斯框架下,主观确信度是一种关于自己信念的表达:「我相信X发生的可能性是多少」。它是有效的认识论工具,但它的值完全依赖于当事人的先验信念、知识边界和推理框架——与「这枚硬币抛出正面的概率是50%」这种客观概率有本质区别。

Marcus Williams的「70%3年内」,从贝叶斯框架看,是他个人的主观确信度表达——但它在媒体报道中很容易被读者解读为「有专家预测3年内人类灭绝概率70%」,这是两种完全不同的信息。

数字背后:为什么是现在?

如果p(doom)不是一个有严格技术意义的预测数字,那为什么这五个人选择在这一周内公开?

理解这个问题需要两层背景:

背景一:GPT-6 Astra的发布和Anthropic Claude Fable 5.1的发布,共同制造了一个能力「临界点」的心理氛围。

2026年9月,随着GPT-6 Astra在多项专业基准测试上超越博士级别人类表现,以及Claude Fable 5.1在蛋白质设计实验中展现超出人类研究员的成果,「模型能力超过预期速度提升」这一感知在AI圈内部急剧加强。对于每天使用这些模型进行测试的一线研究员来说,这不是外部媒体的炒作,而是他们自己在测评中看到的结果。

对于长期关注AI安全的研究员来说,能力的加速提升是一个触发信号——不是「AI现在已经危险了」,而是「安全研究和能力研究之间的差距在拉大」。

背景二:Jacob Coxon的辞职构成了一个社会催化剂。

当Coxon以「我认为这可能会杀死我们所有人」的方式公开辞职时,他打破了AI公司内部一个长期存在的默契:可以内部讨论安全风险,但不在外部公开批评雇主,更不以这种极端语言公开说话。

Coxon的行为是一种「公开协调」的信号——他的帖子相当于向其他有类似想法的研究员表态「我愿意承担这个风险,你们呢」。这解释了为什么Evan Hubinger、Anna Wang、Marcus Williams在接下来的72小时内相继公开发声:Coxon的辞职降低了公开表态的社会成本,使得其他人的「跟进」变得更安全。

这是一种经典的社会运动「级联」(cascade)现象——第一个人承担最大风险,后续者的成本递减。

「70%」是技术预测,还是政治宣言?

回到Marcus Williams的70%数字——这是这五个数字中最高、最离谱也最引人关注的一个。

从技术预测的标准看,这个数字几乎无法被验证:它断言的是「3年内」——这意味着到2029年,我们可以知道这个预测是否对了。但「人类灭绝」或「文明级别灾难」的判断标准是什么?如果AI造成了一场严重的金融危机,算不算Williams的70%命中?如果AI被用于一次重大生物恐怖袭击,算不算?界定的模糊性,让这个数字无论如何都难以被「证伪」。

从政治宣言的标准看,这个数字非常有效:它足够极端,足以产生媒体关注和政策讨论;它来自一个「内部人士」(OpenAI安全团队成员),赋予了它超过外部评论的权威感;它与Amodei的减速提案形成了论据呼应——「看,连公司内部人都觉得70%会灭绝」。

用政治科学的语言来说,这更接近「沟通策略」而非「技术预测」:选择一个令人震惊的数字,目的是打破「AI危险只是科幻小说」的认知框架,推动更多人认真对待AI风险。这种策略不是虚伪的——相信这种沟通策略的人,确实相信风险是真实的——但它的表达方式是为了传播效果而优化的,而非为了技术精确性。

Geoffrey Hinton的「10%」:为什么更可信?

在五个数字中,Geoffrey Hinton的「10%」是最接近「技术意见」的表达。

原因有三:

一,Hinton的数字有明确的前提框架。 他说的是「不是不合理」地估计10%——这是一种认识论上的审慎表达(”it’s not unreasonable to think”),而非断言。这区分了它和Williams的「我估计70%」。

二,10%本身处于一个有说服力的数量级。 对于一个没有历史先例、充满未知变量的事件(AI导致灭绝),10%这个数字既足够高(值得认真对待),又足够低(承认了极大的不确定性)。相比之下,70%的数字要求对未来3年内的AI能力轨迹有几乎零不确定性的预测能力——这在任何科学领域都是不可能的。

三,Hinton的背景赋予他独特的发言权。 他是反向传播算法的发明者之一,直接参与了深度学习革命的奠基工作,也因此是为数不多的「技术上有资格评估AI能力发展速度」的人之一。当他说10%时,这不只是道德上的担忧,而是来自他对神经网络能力上限的技术判断。

即便如此,10%依然不是一个「技术预测」——它是一个主观确信度表达,在其中包含了大量的价值判断(什么算灭绝,什么算人为因素)和不确定性积累。

这波「p(doom)公开化」的真正意义

如果p(doom)的具体数字在技术上意义有限,那这波集体发声的真正价值在哪里?

价值一:将内部认知外部化

AI公司内部对安全风险的讨论,长期以来是一种「私人圈子知识」——研究员之间会分享担忧,但极少以如此直接的方式公开表达。这波发声,让外部的政策制定者、监管者、媒体、和普通公众第一次以具体数字的形式接触到「AI公司内部人在想什么」。

这种外部化有独立的信息价值,即使具体数字不可靠。

价值二:建立心理准备的「预期管理」

从心理学角度看,当权威人士提前给出某个坏结果的概率数字,会让人们在面对该结果时的心理调适更容易。如果AI确实在未来5-10年内出现了重大的安全事故(不一定是灭绝,但是某种显著伤害),这波p(doom)公开化将在社会认知层面起到一种「我们已经被告知过」的作用,有助于减少反弹。

价值三:推动监管与安全投入

这是最直接的政策效应。CNBC报道显示,这波发声直接推动了:Ted Cruz(长期反对AI监管)开始讨论是否需要联邦监管、Newsom签署了两项AI安全法案、参议院AI安全法案的讨论加速。

从「倡导结果」的角度看,这波发声是成功的——它在短期内改变了政策讨论的紧迫程度,至少在中期选举前是有效的。

结语:我们应该如何读这些数字

「70%三年内灭绝」不是一个技术预测,但也不是谎言。它是一种沟通策略,由真正担忧AI安全的人为了推动政策行动而选择的极端表达。

「10%十年内」更接近技术意见,但也是主观确信度表达,不是客观概率。

「我们相信它可能杀死所有人」是一种道德陈述,不是因果链分析。

理解这些差异,不是为了否定这些人的担忧——这些担忧有真实的技术基础,递归自改进确实是一个尚未解决的对齐问题,AI武器化确实在加速发生(见Anthropic威胁报告)。

理解这些差异,是为了让我们能做出更好的政策判断:不被极端数字的震惊效应绑架,也不因为数字不够精确就忽视真实的风险信号。

p(doom)不是一个科学数字,但集体公开p(doom)是一个重要的社会事件——它表明,在AI公司一线工作的人,正在以一种前所未有的方式感受到能力提升与安全保障之间的张力。

这个张力本身,才是我们最需要认真对待的信号。


参考资料

  1. “Anthropic and OpenAI employees speak out about humanity’s extinction as debate reaches fever pitch,” Business Insider, Katherine Li and Aditi Bharade, September 10, 2026. https://www.businessinsider.com/anthropic-openai-employees-speak-out-ai-safety-2026-9 — 五位研究员的公开表态来源
  2. Evan Hubinger (@EvanHub), X post, September 9, 2026 — “>10%” confirmation source (via Business Insider)
  3. Marcus Williams (@Marcus_J_W), X post, September 11, 2026 — “70% 3 years” confirmation source (via Business Insider)
  4. “Geoffrey Hinton says 10% chance AI could wipe out humanity,” BBC interview, September 2026 — Hinton p(doom) source (via Business Insider)
  5. “Anthropic discloses fourth AI breach as researcher quits over safety,” MSN, September 9, 2026 — Jacob Coxon resignation context
  6. “Newsom signs AI safety bills backed by Anthropic, OpenAI,” Politico, September 9, 2026 — Policy impact reference
  7. “Ted Cruz has long pushed back on AI regulation. Now he will help shape response to Anthropic warning,” MSN, September 11, 2026 — Political impact reference