「我们必须放慢步伐」:Amodei三步减速框架,AI安全从叙事到制度的关键节点
「我们必须放慢步伐」:Amodei三步减速框架,AI安全从叙事到制度的关键节点
2026年9月12日,Dario Amodei在他的个人网站上发布了一篇题为《We Must Pace the Frontier》的文章。
这不是他第一次谈论AI安全。但这一次不同——他提出了一个可执行的框架,而不是一份警告。
在这篇文章之前,AI安全讨论主要停留在”叙事层”:研究员辞职、推特争论、国会听证、记者特稿。这些声音产生了新闻热度,但没有产生制度机制。Amodei这次提出了三步具体框架:放慢能力推进节奏、单方面嵌入独立第三方评估员、推动国际AI发展合作协调。
几小时后,OpenAI CEO Sam Altman在X上跟进:”we need to pace the frontier.”
两家竞争实验室的CEO,在同一天,协调表态。如果你认为这只是公关,你可能误读了时机。
一根导火索,十天的连锁
2026年9月9日,英国研究员Jacob Coxon从Anthropic辞职,并在X上发布了一系列帖子,措辞激烈:”Anthropic和OpenAI正在用我们的生命赌博。”
但Coxon说了一件不同寻常的事:他描述的不是外部担忧者的恐惧,而是公司内部的认知——”越资深的员工,越担心”。随后,Anthropic对齐研究主管Evan Hubinger公开回应,称他估计AI导致灾难性后果的概率超过10%。这不是表演——这是公司对齐工作的负责人的实质性风险评估。
此后,研究员的集体发声按三个层次展开:
第一层——普通研究员:OpenAI安全团队的Julie Steele在X上写道:”从个人角度,我也认为我们需要减速。”这是一个中层研究员的个人表态,具有示范效应但不代表机构立场。
第二层——对齐研究员:Anthropic的Samuel Marks说,”AI开发者相信他们的技术可能导致人类灭绝。这可能在未来几年内发生。在general,越资深的员工,越担心。”OpenAI的Jasmine Wang警告RSI(递归自改进)风险:”很难高估向RSI加速冲刺有多危险。”Anthropic的Anna Wang直接说:”目前没有可行的科学计划来解决递归自改进AI的风险。”
第三层——高管层:Pachocki(OpenAI首席科学家)此前已在博客中预测RSI的不可避免性,并以”期待”而非”担忧”的口吻描述它——这代表了公司管理层的另一种声音。
这种层次差异很重要:并非所有研究员都在说同一件事。有人在说”减速”,有人在说”风险真实存在但不可避免”,有人在说”我们在做技术上能做的极限”。这些声音的共同之处,是它们都在同一个时间窗口里变得公开——这才是真正的信号。
三步框架:具体内容是什么
Amodei的框架不复杂,但每一步都有实质含义。
第一步:放慢能力推进节奏。”我们必须放慢我们改善AI模型能力的步伐。进步看起来仍然会很快,我们必须好好利用争取到的时间。”这不是说停止,而是刻意控制节奏,为安全措施争取时间窗口。
第二步:单方面嵌入第三方评估员。Anthropic承诺将”单方面”(unilaterally)率先在公司内部嵌入独立的第三方评估员,这些评估员可以实时记录安全事件并向外部报告。Amodei在采访中提到这些评估员将是”嵌入式的”(embedded),而非定期审计。
这里有两个细节值得注意:一是”单方面”——Anthropic没有等待监管要求,也没有等待竞争对手同步;二是”嵌入式”——区别于传统的外部审计,这意味着评估员有持续的内部访问权限,能看到日常运营而非只看到提交的报告。
评估员的具体来源(学术机构?独立监察机构?政府)和报告内容是否完全公开,目前尚未明确——这是这个承诺中最需要后续跟进的细节。
第三步:推动国际合作协调。Amodei呼吁各国政府和AI实验室围绕AI发展节奏建立类似核不扩散的多边协调机制。
制度转型的核心:第三方评估员为什么关键
AI安全讨论长期面临一个结构性困境:评估安全的标准由公司自己定,公司有动机不公开风险。这是信息不对称的市场失灵。
第三方独立评估员的引入试图打破这个困境。不是事后监管,而是实时介入。这更接近金融行业的审计师模式——独立于被评估方,具有可信度,有权公开报告。
Anthropic单边承诺有几个含义:
对监管机构:提供了一个参考模板。如果Anthropic能做到,监管机构就有理由要求其他实验室也做。
对竞争对手:制造了压力。OpenAI、Google DeepMind在没有类似承诺的情况下,将处于相对弱势的公关位置。
反向自证:Anthropic愿意接受这种监督,反向证明了它认为自己的AI足够危险,以至于需要外部人士盯着。
这个逻辑的关键在于:制度一旦建立,就会产生可积累的信息资产和可追溯的责任链——这是速度约束不能提供的东西。
三个不同的声音:反驳与质疑
不是所有人都对这个框架满意。
质疑一:减速究竟减什么?。”放慢能力推进节奏”缺乏量化定义。按什么指标减速?谁来衡量?如果是Anthropic自己定义,和没有约束没有本质区别。
质疑二:竞争动态让减速不可持续。这也是最根本的结构性反驳:中国AI实验室不会自愿减速,美国战略利益也不允许美国实验室单方面让步。如果美国AI实验室减速而中国不减速,结果是什么?
Amodei的回应是需要国际协调。但国际协调从提出到实现需要多少年?核不扩散条约从1945年原子弹爆炸到1968年NPT签署,用了23年——我们有23年的时间窗口吗?
质疑三:这是否只是精心设计的公关?。Altman的同步跟进、IPO推迟声明、研究员集体发声,时间节点都在AI安全事件的热度顶点。怀疑者认为,这次”协调”更多服务于公司的形象管理。
这三个质疑都有道理。但真实动机和公关目的并不互斥——两个CEO可以同时是真心相信需要减速的人,和需要管理公关形象的公司领导者。
触发器:154页报告的真实背景
Amodei文章发表两天前,Anthropic发布了154页威胁情报报告,覆盖2025年12月至2026年8月的Claude滥用案例。
报告跨越7个危害领域:网络攻击(俄罗斯关联的GTG-20006间谍活动)、监控(马里2500万SIM卡的Lakana 360监控平台)、常规武器(也门导弹制导软件)、生物武器(多次阻断生物武器研究协助)、影响力操作、诈骗欺诈、非法蒸馏(中国AI实验室)。
报告结论:”随着模型能力不断增强,除非AI开发者和社会防御者采取行动使其更安全,否则风险将持续增加。”
这是一家拥有第一手数据的公司,在描述它亲眼看到的威胁趋势。Amodei写那篇文章的背景,不是哲学讨论,是这家公司每天都在处理的真实威胁,已经达到了一个家公司的安全团队无法独自应对的规模。
第三层洞察:制度化的意义超过速度本身
大多数讨论集中在”减速多少”。但最重要的可能不是速度,而是谁有权说什么算足够慢。
历史上对新兴技术风险的应对有两种模式:等到事故发生后再监管(航空、核电的早期历史);在事故发生之前建立预防性制度(核不扩散条约)。
AI目前处于临界点。已经有足够的事故迹象,但还没有迫使全面监管的灾难性事件。Amodei提出”嵌入第三方评估员”,本质上是在尝试建立预防性制度——不等监管机构,AI公司自己主动接受外部约束。
这个逻辑的前提是:如果Anthropic率先做到,并且运作良好,它就创造了可以被复制、最终被监管机构强制要求的模板。在缺乏国际协议的情况下,单边先行是推动行业规范最快的路径。
速度限制和制度机制的根本区别在于:速度限制是一个承诺,可以违背,可以在竞争压力下悄悄放弃;而制度机制一旦建立并运转,会产生可见的信息流和可追究的责任记录。如果第三方评估员真的嵌入到Anthropic并开始发布报告,那么每一次Anthropic在能力推进上的决策都会面临实时的外部问责——这种机制压力,比任何”承诺减速”的声明都更难以绕过。
这也是为什么这篇框架文章的历史意义,可能超过任何一次具体的安全事件:它试图将”AI安全”从一个道德立场,转化为一套可操作的制度设计。
接下来:检验这个框架的48小时
Amodei文章发布后,已经有几件可以追踪的事情在推进:
国会方面,多名议员明确引用Amodei框架作为立法参考。其中两位参议员表示将提出要求AI公司强制接受第三方评估的法案草案——这正是Amodei建议的制度化路径。
竞争对手方面,Google DeepMind和Mistral尚未发表类似声明。OpenAI虽然通过Altman表态跟进,但还没有作出具体的制度承诺。这个差距将在未来数周内接受媒体和立法者的追问。
研究员层面,多所大学的AI安全研究机构表示有意向应聘Anthropic计划中的”嵌入式评估员”职位。独立安全机构Alignment Forum和MIRI对这个概念给予了审慎的正面评价。
最终能否成功,取决于第三方评估员制度是否真正独立、评估报告的内容是否完全公开、以及这个模板能否在6到12个月内被其他实验室采纳。这些细节将在接下来的数月内显现。
Amodei说了一句话,值得记住:”进步看起来仍然会很快。我们必须好好利用争取到的时间。”
他没有说会停下来。他只是说要找到一种不被绊倒的方法。这算不算减速?取决于你认为减速的目的是什么。
参考资料
- Anthropic官网:Detecting and countering misuse of AI: September 2026 — https://www.anthropic.com/threat-intelligence-report-september-2026
- Moneycontrol:’We must slow the pace’: Anthropic CEO calls for deliberate AI slowdown — https://www.moneycontrol.com/world/we-must-slow-the-pace-anthropic-ceo-calls-for-deliberate-ai-slowdown-after-report-on-claude-misuse-article-14028677.html
- NPR:Anthropic and OpenAI CEOs call for AI development to slow down — https://www.npr.org/2026/09/12/nx-s1-5950588/openai-anthropic-ai-safety-researchers-hacks
- CNBC:Extinction warnings ramp up as more OpenAI, Anthropic researchers join calls for an AI slowdown — https://www.cnbc.com/2026/09/10/openai-anthropic-ai-safety-slowdown-extinction.html
- TechCrunch:OpenAI’s Sam Altman says it would be ‘ill-advised’ to go public in 2026 — https://techcrunch.com/2026/09/12/openais-sam-altman-says-it-would-be-ill-advised-to-go-public-in-2026/