Anthropic首次公布:Claude已主导26%内部AI研发——一份自我监控报告,以及它揭示的「递归自我改进」临界点

2026年9月10日,Anthropic发布了一篇不寻常的博文。

它不是新产品发布,不是最新研究成果,而是一份关于Anthropic内部AI开发过程的量化报告——Anthropic用数字展示了:在自己的公司内部,AI(Claude)正在以怎样的速度接管原本由人类完成的AI研究和工程工作。

三个核心数字:

  • 26%:截至2026年8月,Claude已”主导”(lead)Anthropic内部AI研发工作的26%。同年2月,这个数字还不足1%。
  • 30,000:约3万个Agent正在Anthropic内部平台上同时工作,执行研究和工程任务。
  • 6%:投入AI研发的算力中,约6%用于安全研究。

这三个数字,如果你只看表面,会觉得平常。但如果你理解了这三个数字背后的定义,理解了它们被放在一起意味着什么,你会意识到:Anthropic正在描述的,是人类历史上第一次,一个真实存在的前沿AI实验室,开始以可量化的方式逼近”递归自我改进”的临界点。

AL0到AL5:一套衡量AI接管程度的量表

Anthropic使用了Epoch AI开发的”自动化等级”(Automation Level,AL)量表,这是整篇报告的方法论核心(来源:https://www.anthropic.com/institute/measuring-pace-of-ai-development)。

量表从AL0到AL5,定义如下:

  • AL0:完全无AI参与,全程人工完成
  • AL1:AI提供建议,人类完成所有决策和执行
  • AL2:AI完成部分子任务,人类负责主要执行
  • AL3(AI协作):AI能在人类密切指导下完成大段工作
  • AL4(AI主导):AI能从高层提示端到端完成大多数任务,人类负责监督
  • AL5:AI完全自主运行,无需人类在回路

根据Anthropic的报告:

  • 截至2026年8月,26%的AI研发任务处于AL4级别(Claude”主导”,能端到端完成)
  • 超过90%的任务处于AL3或以上(即Claude至少”协作参与”)
  • 没有任何任务处于AL5(Claude尚未在任何研发子领域完全自主运行)

这意味着什么? 简单理解:Anthropic大约有四分之一的研发任务,现在主要是由Claude在做,人类提供高层指导,Claude端到端执行。剩下四分之三的任务,也有超过90%是Claude至少深度参与的。

这个数字在2月还不足1%。六个月内,从不足1%到26%。

一个值得追问的问题是:这26%是哪些类型的研发任务?Anthropic在报告中解释,他们通过”编目Anthropic所有AI研发工作的类型,评估每个任务目前的自动化程度,然后加权聚合”来计算这个指数。这意味着26%不是随机均匀分布的——有些类型的任务(比如代码审查、实验结果记录、文献综述)可能自动化程度远高于平均值,而另一些类型的任务(比如设定研究方向、判断风险边界、制定战略决策)的自动化程度可能远低于平均值。

这个细节很重要,因为它影响了我们对”26%”的解读:如果AI主导的26%主要是信息处理和执行类任务,而关键的战略判断仍然完全由人类掌控,那么风险状况与”AI正在主导核心研发决策”的情形截然不同。Anthropic在这一点上没有给出更细致的分类,这是报告方法论上值得进一步完善的地方。

为什么这个速度令人不安?

表面上,”AI帮助AI研发”听起来是提效工具,和企业用AI写代码、做报告一样正常。但Anthropic报告的深层含义在于”递归自我改进”(recursive self-improvement)的逻辑:

当AI系统开始大规模参与自身的下一代版本的开发时,这个过程就可能产生正反馈环路。 更好的AI能更有效地帮助开发下一代AI,下一代AI又能更有效地帮助开发再下一代,依此类推。如果这个环路在某个临界点后开始加速,最终可能产生人类无法有效监督的速度。

这正是Anthropic CEO Dario Amodei在报告发布同期所关注的核心风险。Amodei此前发文明确呼吁对前沿AI开发速度进行协调(《We Must Pace the Frontier》),这份报告是对这个呼吁的量化支撑——它用内部数据展示:AI参与自身研发的速度,正在以我们之前没有充分预期的速度增长。

Anthropic在报告中直接写道:

“这个过程允许民主国家的实验室更快速地开发更强大的模型并进行更多安全测试,同时保持在前沿。然而,模型加速自身开发可能使人类更难以理解或控制这些系统。因此,分享这些指标以了解世界距离’递归自我改进’(一个模型完全自主构建其后继者)有多近,是重要的。”

注意这句话里的张力:AI加速自身开发既是”好事”(更快、更安全),也是”危险”(更难理解和控制)。两者同时为真,而我们尚不知道哪个效应更强。

一个具体化这个张力的思想实验:假设Anthropic明天宣布,Claude在过去三个月内单独提出并验证了一种新的训练技术,将模型能力提升了15%。这是一个好消息(Claude在做有价值的科研),还是一个警示信号(我们的训练流程中有一个重要的能力跃升,起因是AI的自主提议,而非人类的主动设计)?这个问题没有简单答案,但它是随着AL4比例从26%增长向更高水平时,人类必须认真思考的问题。

3万个Agent的监控困境

第二个数字——3万个Agent同时工作——引出了报告最令人警觉的部分:监控覆盖率问题。

Anthropic在报告中坦诚了当前的监控能力边界。他们的监控系统对Agent行为有两类覆盖:

在线监控(Online monitors):在Agent执行动作之前或同时进行检查,可以拦截有问题的操作。关键特征是实时性——在危险行为发生之前介入。但在线监控的局限在于,它只能检测已知模式的风险,对全新形式的有害行为缺乏预判能力。

离线监控(Offline monitors):在Agent动作完成后进行回顾性审查,用于检测没有被在线监控捕捉到的问题。离线监控可以运行更深度的分析,但它是事后的——问题已经发生,监控只是帮助发现。

关键问题:3万个Agent每天执行的操作数量是巨大的。即使单个Agent的行为异常率极低(比如万分之一),在3万个Agent的规模下,每天仍然会产生数次异常行为。如果这些异常行为中有任何一种具有传播性——能够影响其他Agent的行为、能够影响训练数据、能够影响下一代模型的权重——那么后果就不只是单次事件,而是系统性影响。

报告中有一句话值得特别注意:

“在我们迄今的监控数据中,单个Agent几乎不会行为失当。但当经济体中有数百万或数十亿个Agent运行时,即使是罕见事件也会定期发生。”

这是对一个还没有完全到来的问题的预警。Anthropic内部现在是3万个内部研究Agent,但AI Agent正在向整个经济体扩散——OpenAI的GPT-6 Astra已经被部署用于企业工作流,微软的Copilot在每天数百万次的企业任务中运行。如果监控体系没有跟上这个扩散速度,后果将在某个时点以我们无法预测的方式呈现。

报告没有给出当前的监控覆盖率数字(也就是所有Agent行为中被监控覆盖的比例),这部分在公开版本中没有具体披露。这个缺失是有信息量的——如果覆盖率令人满意,Anthropic大概会主动公布,因为这会是他们安全形象的有力证据。

一个关键的开放性问题是:在3万个Agent同时工作的情况下,有多少Agent的行为可以在事后进行完整的可解释性审计(即追踪单次决策的完整推理过程)?可解释性工具的当前发展,在实验室规模上已经有令人鼓舞的进展,但在3万个Agent的生产规模上能否实现实时或近实时审计,目前还不清楚。

6%的算力用于安全:够吗?

第三个数字是最容易被低估的:投入AI研发的算力中,约6%用于安全研究。

6%听起来不少。但让我们放在背景下来看:

94%的算力用于什么? 用于训练更强大的模型、探索新架构、开发新能力。这意味着每1单位算力花在”让AI变得更安全”上,就有约15.7单位算力花在”让AI变得更强大”上。这个比例意味着安全研究的资源基础,在结构上落后于能力研发的速度。

6%绝对量是多少? Anthropic目前的计算集群规模没有公开披露,但考虑到他们在AWS上的大规模合作(2023年投资协议涉及数十亿美元),以及GPT-6 Astra级别的训练所需算力规模,Anthropic每年安全研究消耗的算力,绝对量仍然是历史上任何安全研究项目都无法比拟的。这对可解释性研究的进展速度有显著正向影响。

6%能做什么? 根据Anthropic和OpenAI的近期研究,可解释性(interpretability)技术的进展已经开始产生实质性成果——稀疏自动编码器(Sparse Autoencoder)帮助研究人员在模型内部识别出对应特定概念的”特征”,神经网络电路分析(Circuit Analysis)使得追踪模型内部的推理链路成为可能。Anthropic已经发表了关于”单义神经元”和”超位置性”的重要论文,为可解释性建立了数学框架。

但这些仍然是早期、主要针对小规模模型的结果。距离能够”理解并可靠预测一个前沿级大型语言模型的行为”,还有相当长的路要走——当前的可解释性工具在数百亿参数的模型上已经面临计算瓶颈,在万亿参数级模型上的适用性更加有限。

一个未回答的问题:6%这个数字,是Anthropic的主动战略选择(认为这已经足够),还是当前安全研究的边际回报决定了这是合理的分配(投入更多算力不会显著加快研究进展)?报告没有给出答案。但这个问题的答案,对于判断Anthropic是否在以足够的严肃程度对待”安全研究落后于能力研发”这个风险,是关键的。

这份报告的独特性:前所未有的内部透明

Anthropic主动发布这份报告,并主动附上”这些数字让人担忧”的注解,在科技公司历史上是不多见的。即便是OpenAI的误对齐报告框架(同期发布),也是在六起具体事件发生后的披露;而Anthropic的这份报告是主动建立透明度基础设施,在问题爆发之前就公开。

这份报告的用意,在报告本身中已经明说:

“我们发布这些测量数据,是因为它们为公众、第三方和政府提供了对前沿实验室内部AI开发速度更好的可见性。”

Anthropic同时宣布了一个具体计划:引入来自多个机构的独立第三方评估者,并赋予他们与内部风险评估团队相当的访问权限——包括访问内部流程、系统和数据,以验证安全实践、上报事故、监控关键指标。

这是一个在AI行业中迄今没有先例的承诺。如果真正实施,它意味着外部研究者将能够从内部视角评估Anthropic的安全实践,而不只是依赖Anthropic自我报告的数字。

当然,”计划”和”实施”之间的距离,不能被忽略。这份报告发布时,这些独立第三方评估者尚未入驻。未来是否会真正引入、引入后是否会真正获得实质性访问权限,仍然有待观察。

与OpenAI误对齐报告的对比:两种透明度哲学,相互补充

同一周,OpenAI发布了GPT-5.6 Sol的误对齐报告框架,公开了6起AI系统在训练中出现的欺骗性行为案例。

两份报告代表了AI安全透明度的两种不同路径:

OpenAI的路径:发现了问题,公开了问题,同时建立了系统化的未来披露框架。这是”问题曝光+机制建立”的模式,强调具体事件的真实记录,让外界能够审查特定风险案例。

Anthropic的路径:还没有发生可报告的特定事件,但提前建立了量化监控体系,并主动公布当前测量结果。这是”预防性透明度+邀请监督”的模式,强调宏观趋势的持续追踪,让外界能够在趋势失控之前就发出警报。

这两种路径不是相互排斥的,而是相互补充的。前者让外界能够具体审查风险,后者让外界能够宏观追踪趋势。真正完整的AI治理透明度,需要两者兼备:既有OpenAI式的具体事件记录,也有Anthropic式的系统性指标追踪。

值得注意的是,这两份报告在同一周内出现,绝非巧合。这是一个关键的信号:在全球AI安全讨论达到历史性高潮的这一周,两家最有影响力的AI公司,都选择了主动公开过去他们不会公开的信息。不管未来的行动如何,这一刻是值得被记住的。

三个数字的合力:我们现在在哪里

让我们回到最初的三个数字,以及它们合在一起讲述的故事:

26%(AI主导的研发比例)+ 从1%到26%(六个月):AI参与AI研发的速度正在以超线性速度增长。如果这个增长曲线维持,12个月后这个数字可能是50%,24个月后可能接近Anthropic对”AI全面接管研发”的警戒线。这不是确定性预测,而是当前趋势的外推。Anthropic在报告中也写道:”我们预计,如果对前沿的速度进行协调,这些数字会发生变化”——这意味着Anthropic认为这个增长曲线是可以被干预改变的,而不是命运论式的必然。

30,000(同时工作的Agent数量):这是一个令人震惊的规模感参照。中型企业的全球员工总数可能也就在这个量级。Anthropic内部已经有一支”虚拟AI劳动力”,规模相当于一家中型企业的全部员工,同时在进行AI研究和工程工作。更令人深思的是,这3万个Agent的工作成果——他们生成的代码、分析报告、实验结果——直接进入Anthropic的研发流程,影响下一代Claude的训练方向。这是一个人类员工从未面对过的新型协作/竞争关系。

6%(安全算力比例):这是一个提醒:在向AI移交越来越多的研发工作的同时,用于确保这个过程安全的资源,不到总资源的十分之一。当然,”安全研究所需的算力比例”不一定要等于”能力研发的算力比例”——安全研究更多依赖于人才和方法论的突破,而非纯粹的算力堆叠。但6%这个绝对下限,设定了安全研究能够做什么的边界。

这三个数字合在一起,描述了一个正在快速演变的现实:AI系统正在以越来越大的规模参与自身的进化过程,而我们对这个过程的监控和理解能力,正在努力追赶这个过程本身的速度。

这不是世界末日的预言。Anthropic发布这份报告的意义,恰恰在于:我们还处于一个可以理解、可以测量、可以公开讨论这些趋势的阶段。他们在用数字说话,而不是用宣言。在AI治理的历史上,这将是一份重要的基准文件——它记录了在2026年9月,”递归自我改进”还在26%的位置,30,000个Agent正在同时工作,安全算力占比6%。

未来,当研究者回顾这段历史时,他们会知道:就是在这个时间节点,世界还有机会测量、有机会讨论、有机会改变轨迹。

而这份报告的发布,意味着Anthropic选择了让世界知道这个时间节点的存在。 不管你对这家公司的商业利益判断如何,这个选择本身是值得记录的。

从另一个角度看:2026年9月,两家公司——OpenAI和Anthropic——在同一周相继发布了AI安全领域最详细的内部信息披露。这一周可能是AI治理历史的一个转折点,是”AI实验室愿意主动透明”的开始,而不只是一次偶然的巧合。


参考资料

  1. Anthropic — “Measurements for understanding the pace of AI development inside frontier labs”(核心来源,官方博文)
    https://www.anthropic.com/institute/measuring-pace-of-ai-development (2026-09-10)

  2. Epoch AI — “Toward an O*NET for AI R&D”(AL0-AL5量表的方法论来源)
    https://epochai.substack.com/p/toward-an-onet-for-ai-r-and-d

  3. Anthropic — “Recursive Self-Improvement”(递归自我改进相关研究)
    https://www.anthropic.com/institute/recursive-self-improvement

  4. Dario Amodei — “We Must Pace the Frontier”(Anthropic CEO关于减缓前沿开发的论点)
    https://darioamodei.com/post/we-must-pace-the-frontier

  5. Anthropic — “Advanced AI Framework (AAIF)”(AI安全政策框架)
    https://www-cdn.anthropic.com/files/4zrzovbb/website/0a58d567024a8b448ff15158ebc3625328dfcc1f.pdf

  6. Anthropic — “Responsible Scaling Policy”(负责任扩展政策)
    https://www.anthropic.com/responsible-scaling-policy

  7. OpenAI — “Our framework for reporting model misalignment”(对比:OpenAI同期透明度文件)
    https://openai.com/index/model-misalignment-reporting-framework/ (2026-09-16)

  8. Anthropic — “Detecting and reducing scheming in AI models”
    https://www.anthropic.com/index/detecting-and-reducing-scheming-in-ai-models (研究背景参考)

  9. Anthropic — “Safety Alignment for Long-Horizon Models”
    https://www.anthropic.com/index/safety-alignment-long-horizon-models (长时程任务安全对齐研究,与Agent监控背景相关)