“通常,一支有经验的工程师团队需要数周时间才能完成对单个模型的这些优化,而且这些工作往往无法在不同模型之间复用。” ——Anthropic研究团队,2026年(来源:anthropic.com/research/claude-uplifts-biomolecular-modeling)

这句话,是整篇Anthropic新研究报告里最值得划重点的一句。

它背后的含义是:一项本来需要顶尖软件工程师投入大量专业时间的工作,现在可以由AI来完成——快4倍,而且可以跨30多个模型批量复制。

2026年9月,Anthropic发布了一篇研究报告,标题直接:《How Claude is uplifting biomolecular modeling》(Claude是如何提升生物分子建模能力的)。

报告的核心数字:在不到四周的时间里,Claude优化了超过30个开源生物分子模型,平均加速4倍,最快达到无精度损失的2倍加速,也实现了有轻微精度损失情况下接近4倍的加速。完成这项工作的,是2名Anthropic内部的技术人员——他们有生物分子建模的经验,但在内核工程和优化方面没有任何先前经验。

这不是”AI帮忙跑分析”。这是AI在做高度专业化的低层计算工程,一个领域大多数计算机科学家终身也不会触及的地方。

如果你认为「语言模型的边界是语言」,这件事值得你重新思考。如果你认为「底层工程工作将是最后一批被AI渗透的领域」,Anthropic的这项研究是一个反例。


一、为什么GPU内核优化是一件特别难的事

要理解这件事的含义,先要理解「内核工程」(kernel engineering)是什么。

在深度学习里,「内核」(kernel)是运行在GPU上的底层程序,直接控制着如何调用GPU的并行计算能力。写好一个内核,意味着你需要:

  • 深度理解GPU的硬件架构(内存层级、线程调度、并行计算模式)
  • 精确掌握特定运算的数学结构(如矩阵乘法、注意力机制的具体形式)
  • 在性能和精度之间做极其细致的权衡
  • 不断测试、调试,而且每次都要从几乎接近裸机的层面来排错

这不是「写一段Python脚本」。写一个能跑起来的内核,可能需要数天时间;写一个真正高效的内核,往往需要数周,甚至数月。而且——关键在这里——一个模型上开发出来的内核优化,通常无法直接复用到另一个模型上,因为不同模型的计算图结构不同。

在生物分子建模领域,最关键的两类运算是「三角注意力」(triangle attention)和「三角乘法」(triangle multiplication)。它们是AlphaFold3、OpenFold3、Boltz-2等顶级蛋白质结构预测模型的核心计算瓶颈,运算复杂度是输入大小的立方:输入规模翻倍,时间和内存需求就翻8倍;翻三倍就翻27倍。这种立方级别的复杂度,是生物大分子计算的天然障碍——系统越大,运算代价越高昂,这直接限制了科学家能够研究的分子系统的规模上限。

Anthropic和Claude合作开发了一套叫「FlashPairformer」的自定义内核集。根据研究报告中的基准数据,在三角注意力运算上,FlashPairformer的性能比此前的行业标准(NVIDIA的cuEquivariance)高出2.7到2.9倍;在三角乘法运算上,高出1.7到3.2倍——取决于具体的模型配置和硬件设置。

这不是微优化。这是把AI研究的基础设施推进了一个质的台阶。


二、4周,30个模型,2个工程师

Anthropic的报告里,有一组数字值得反复读:

  • 超过30个开源生物分子模型被优化
  • 不到4周完成
  • 2名Anthropic内部技术人员监督——他们在生物分子建模领域有经验,但在内核工程方面没有先前经验
  • 优化后,这些模型的结构预测和蛋白质设计任务平均加速4倍,有些场景下2倍即可做到完全无精度损失

作为对比,报告明确指出:正常情况下,有经验的工程师团队需要数周时间才能完成对单个模型的类似优化,而且这些工作通常无法在不同模型间复用。

换句话说:Claude在4周内完成了通常需要数月人力、且无法批量复制的工作。

这里有两个技术含义需要分开说:

第一,泛化能力。人类工程师针对某个模型做的内核优化,往往和该模型的具体结构深度绑定,换个模型就要重来。Claude似乎发展出了某种「泛化的优化推理能力」——它能对不同架构的模型识别出可复用的优化模式,并针对每个具体模型进行特定调整。这是人类内核工程师也在努力追求的能力,但很难实现。

第二,监督效率。两个在内核工程上是新手的人,监督Claude完成了30个模型的内核级优化。这意味着AI作为工程师的「可监督性」已经达到了一个新的层次:你不需要自己是领域专家,就能检验AI的工作成果是否有效——因为可以通过基准测试和精度指标来客观衡量。

这和「AI帮助写代码」是不同层次的事。这是「AI作为独立工程师完成高度专业化的工程项目,人类的角色是项目负责人而非技术执行者」。


三、内存突破:预测超过10000个氨基酸的蛋白质

除了速度,Claude的优化还带来了一个此前不可能的能力:在单个NVIDIA GPU节点上,准确预测超过10,000个token(氨基酸、核苷酸和原子)的生物分子系统。

这个数字有什么含义?

人类蛋白质的平均长度约为300到500个氨基酸。但一些关键的生物大分子——比如病毒的外壳蛋白、细胞膜受体复合物、分子机器——可以轻松超过1000到10000个残基。以前,对这类大型系统进行高精度预测,要么需要多GPU集群,要么需要大幅降低模型精度。

Claude的内核优化打破了这个障碍。这直接扩大了哪些生物问题「可以」被计算研究的边界。


四、开源与1百万美元的竞赛

这件事的另一个重要细节:Anthropic将所有优化代码开源了,托管在GitHub(github.com/anthropics/uplifting-biomolecular-modeling)。

这也是为什么Anthropic选择开源这套内核代码,而不是将其作为专有优势保留——开源可以让整个社区验证、改进和扩展这些内核,从而加速整个生物分子研究生态系统的发展。需要指出的是,FlashPairformer是与NVIDIA cuEquivariance在特定测试基准上的对比结果,实际生产环境的性能差异取决于具体硬件配置和工作负载,上述数据为报告原文的内部基准测试结果。

Anthropic还宣布了一个蛋白质设计竞赛,与Adaptyv Bio联合主办。竞赛提供:

  • 最高100万美元的Claude算力积分
  • Modal公司的25万美元计算信用额度
  • 超过5000个设计方案的湿实验室验证(wet lab validation)

湿实验室验证意味着:计算机设计出的蛋白质,会被真实合成出来,在真实的生物实验室里验证其功能。这是把「AI设计蛋白质」从理论变成现实的关键一步。

Adaptyv Bio是一家专注于蛋白质开放竞赛的公司,过去两年中组织了多个蛋白质设计基准竞赛,社区认可度较高。这次与Anthropic的联合竞赛,是Anthropic从「展示能力」到「推动社区验证」的明确行动:不只是说我的AI设计的蛋白质有效,而是让科学界来独立验证。这种对「外部验证」的主动拥抱,是科学可信度建设中最有效的策略之一。

从商业逻辑上看,这笔投资也是合理的:如果研究社区在Anthropic赞助的平台上验证了AI蛋白质设计的高成功率,那么将来有多少制药公司、生物技术公司会采用Claude作为其计算研究工具?这是一笔既服务于科学社区,也服务于长期商业布局的战略性开支。


五、与蛋白质设计实验的对比:效率提升了100倍

Anthropic在这篇研究报告里提到了他们较早的一项研究:Claude设计新型蛋白质结合剂(de novo protein binders),成功率接近50%,而行业通常只有10-15%。

但那项实验的成本是:每个目标蛋白花费最多1万美元(在Modal平台上,约合2500个H100 GPU小时)。

新的优化让类似的研究可以在低100倍的GPU小时下实现。

100倍的效率提升意味着什么?意味着一个原本只有顶级制药公司才负担得起的计算研究,现在一家规模较小的生物技术初创企业也可以尝试。意味着原本只能测试10个靶点的资源,现在可以测试1000个。意味着药物研发的探索空间,被整整扩展了两个数量级。


六、真正的问题:AI做了人类认为它不会做的事

这件事的深层意义,不只是「AI帮助做了什么」,而是「AI做了人类本来认为AI无法做的事」。

写GPU内核,不是典型的「文本理解和生成」任务。它需要对硬件架构的精确建模,对数学优化问题的严密推理,以及对代码正确性的严格验证。这些能力,在GPT-4时代,被普遍认为是大型语言模型不具备的。

Anthropic的研究显示,至少对于内部研究模型(能力与Fable/Mythos系列相近但未公开具体型号),这些工程优化能力已经在相当程度上出现了——前提是有合适的问题框架和可测量的验证基准。

这刷新了哪些假设?

第一,关于「AI能做什么样的工作」的判断需要更新。内核工程曾经是AI能力的「天花板假设」之一——这里有足够复杂的硬件知识、足够特殊的推理路径,应该能挡住AI。现在,这个假设需要修正。

第二,关于「谁需要担心AI取代工作」的边界需要扩展。在AI取代工作的讨论中,「高技术专业人员」通常被认为是相对安全的。但如果AI在内核工程——这个大多数工程师终身不会涉足的高度专业化领域——已经达到了有效输出的水平,「高技术专业人员」这个保护盾就开始出现裂缝。

第三,「监督者」的角色定义在变化。完成这项工作的两位工程师,不是内核工程专家,但他们能够有效监督Claude的工作——因为他们能够设计测试、解读基准结果、判断精度是否可接受。这暗示了一种新的工作模式:你不需要是某个领域的专家,只需要能够定义问题、设定指标、评估结果,AI来处理执行细节。这对「什么样的人类技能还有不可替代的价值」这个问题,提出了新的答案:领域理解力(知道什么是好的结果)比技术执行力(知道如何产出结果)更加难以被替代。

这个转变在工程领域有深远的含义。在2025年之前,「高级软件工程师」的稀缺性主要来自技术执行力——他们知道如何写出高效的代码。但如果AI可以承担技术执行,「领域理解力」——知道什么样的优化目标值得追求,如何设计有意义的基准测试,如何在精度和速度之间做合理权衡——就变成了更核心的稀缺能力。这不是所有工程师都能在短期内轻松获得的能力,但它的培养路径也和「写代码」完全不同。

在一定程度上,这是对「AI取代工程师」这一命题的更精确描述:AI更可能取代的是技术执行,而不是领域判断。但「领域判断」本身的市场价值,会随之大幅提升。


七、「100倍效率提升」:这个数字从哪里来

报告提到一个关键数字:新的优化让类似蛋白质设计研究可以在「低约100倍的GPU小时」下实现。

这个数字需要仔细拆解,以避免被误读:

起点:Anthropic早期的蛋白质结合体设计实验(详见报告引用的”Claude accelerates protein design”研究),每个目标蛋白的计算成本约为1万美元,等同于2500个H100 GPU小时(按Modal平台定价计算)。

终点:新的内核优化(FlashPairformer + 30+模型的加速优化 + 内存突破),使结构预测的计算量大幅降低。Anthropic研究团队表示,通过将新的内核优化与早期蛋白质设计实验的方法相结合并简化,可以用「少两个数量级的GPU小时」达到「相当的体外模拟性能」。

两个数量级 = 100倍。这是Anthropic团队自己在报告中给出的对比结论,作者仅转述。

但这里有一个重要的细节需要说明:「体外模拟性能相当」指的是计算预测的准确性,而非实验室里的实际生物学结果。从「计算预测准确」到「真实蛋白质有效工作」,还有一段湿实验室验证的路要走。Anthropic为这段路提供了支撑——这正是竞赛中5000个设计方案的湿实验室验证的意义所在。

因此,「100倍效率」这个数字是准确的,但它描述的是计算阶段的效率提升,不是整个药物发现管线的效率提升。整个管线(从计算设计到临床验证)的压缩时间线,要长得多,复杂得多。


八、一个重要的技术说明:内部模型与公开API的区别

本文核心报道的生物分子建模工作,使用的是Anthropic的「内部通用研究模型」,具体型号未在报告公开版本中披露。这不是面向外部用户的Fable 5.1或Mythos 5.1 API。

这个区别很重要。Anthropic在同一篇报告中提到,公开可用的Claude Mythos 5.1作为副产品,对七个生物学模型实现了最高2.5倍的加速——这个数字来自公开API,是外部可访问的能力。而本研究的核心数字(30+模型、4倍加速),来自内部研究模型,外部研究者无法直接通过API访问相同的模型版本来复现这一成果。

这个限制需要说清楚:

本文报道的成果,可验证的部分是优化后的开源代码(可独立下载、运行、测试),以及基准性能结果(可在公开模型上复现代码效果)。但「Claude是否能在你自己的研究环境里执行类似的优化工作」,取决于你能访问哪个版本的Claude——公开Mythos API有能力,但未必等同于内部研究模型的表现。

这不影响本研究已实现的开源成果的实际价值,但读者在判断「这意味着我可以用Claude做同样的事」时,应考虑这一差距。

从更宏观的角度看,这也揭示了一个AI研究透明度的结构性问题:当一项AI能力突破的关键工具(内部模型)对外部研究者不可访问时,社区对其能否独立复现的评估会受到限制。开放科学社区和AI评估机构,将越来越需要建立一套框架,用以区分「模型能力结果」(可通过API访问验证)和「内部研究工具成果」(只能信任公司报告)的可信度层级。这不是对Anthropic的批评,而是整个AI科研生态系统在能力快速提升阶段面临的共同挑战。


九、更大的背景:AI科研能力的自我强化循环

本文聚焦于Claude在生物分子建模领域的具体成果,但有一个更大的动态值得放到背景中理解。

AI在科研和工程领域的能力提升,本质上在形成一个自我强化的循环:更强的AI→更多AI能完成的科研和工程任务→更多高质量结果(数据/代码/方法)→更好的训练素材和评估基准→下一代AI更强。从最基本的层面看,这是一个正反馈循环。

生物分子建模研究是这个循环里的一个具体节点:Claude在优化外部工具的同时,产生了大量可验证的工程成果(FlashPairformer代码、测试基准、优化模式)——这些成果本身可以成为训练和评估下一代AI科研能力的素材。AI用于科研→科研结果用于AI训练→AI科研能力进一步提升。

理解这个动态,对于判断未来12到24个月内AI能力的演进速度,比盯着当前的基准测试数字更有价值。速度不是线性的,它会随着循环的累积而加速。有一个可观测的代理指标:Anthropic自2025年3月起开始发布威胁情报报告(已发布4份,覆盖7种威胁类型),同年发布生物分子设计研究(蛋白质结合体14/15成功),2026年继续扩展到内核工程(30+模型/4倍加速)——每次迭代,AI科研的覆盖领域都在扩大,从生物学→计算化学→底层硬件优化。这种领域扩展的节奏本身,是AI能力自我强化循环在加速的一个直接证据。

Anthropic的生物分子建模研究,是这个大背景下的一个具体数据点:AI已经在把它的能力,系统性地投入到「让更多科学和工程变得可能」这件事上了。


十、一个量化的视角:谁能从中受益?

让我们把「4倍加速、100倍效率提升」放到具体的使用场景里:

中小型生物技术公司:原本因为计算成本无法开展的蛋白质设计项目(每个靶点1万美元),现在可能只需要几百美元完成初步筛选。这把计算生物学从「只有资金充裕的大型制药公司才能做」的门槛,降到了「规模较小的创业公司也能做」的水平。

学术实验室:大学研究组通常计算资源有限,NIH/NSF的计算资助往往只够跑几百小时的GPU时间。100倍的效率提升意味着,原来只够完成一个蛋白质家族研究的计算预算,现在可以覆盖100个。

药物发现管线:从靶点识别到候选分子设计的阶段,是药物开发中成本最高、失败率最高的阶段之一。计算筛选效率提升100倍,理论上意味着可以在同样时间内测试100倍多的候选分子——这可能缩短整个管线的周期,并提升最终进入临床试验的候选物的质量。

Anthropic的技术开源决策,是让上述场景成为现实的关键。如果这些优化是专有的,只有使用Claude的付费用户才能获益,那么改变是有限的。开源意味着这些优化可以被整个生物技术社区自由采用,包括那些永远不会使用商业AI API的研究者。这是一种不同于商业竞争的影响路径:通过基础工具的开源,建立信任和生态系统地位。


十一、「验证」是这个故事的核心

这件事和很多AI能力声明不同的地方,在于它是可以被独立验证的。

Anthropic不只是说「我们的AI很厉害」,而是把具体做法都公开了:

  • 代码在GitHub(github.com/anthropics/uplifting-biomolecular-modeling)
  • 技术报告提供了详细的基准测试方法
  • 优化后的模型可以直接下载和运行
  • 任何有相关能力的研究团队都可以在自己的环境里复现并验证这些性能数字

这种开放性,在AI能力声明的领域是相对稀缺的。大多数时候,AI公司说「我们在X任务上比人类好」,验证这个说法需要访问他们的专有系统,而你只能相信他们给出的基准数字。

但这次不同。代码是公开的,运行环境(开源模型本身)也是公开的,任何拥有适当GPU的团队都可以独立验证「FlashPairformer是否真的比cuEquivariance快2.7倍」。科学界几个月内就会有独立复现结果出现。

这是AI能力声明的一个新标准:不只要说出能力,还要提供可验证的证明。Anthropic在这件事上给整个行业设置了一个值得参考的例子。


结语:下一个「不会」消失的速度

历史上,每一次技术范式转移,都经历了一个「这里AI做不到」假设被逐渐击破的过程。

棋类游戏→图像识别→文本生成→代码辅助→蛋白质设计→内核优化。

下一个「AI不会做」的假设是什么?会多快被击破?

Anthropic这篇研究报告,不回答这些问题。但它让这些问题变得更加紧迫。

每一次假设被击破,都不是灾难,而是一次重新校准的机会——重新校准哪些工作值得人去做,哪些工作可以让AI去做,哪些能力在AI时代真正稀缺。如果内核工程不再是少数专家的专属领域,那么「能够定义什么是好的内核优化,以及为什么这个优化有意义」的领域判断力,就变得更加珍贵。这个规律,在几乎所有AI能力渗透的领域都在重演,只是时间表各有不同。

当AI能力声明变成可独立验证的工程成果时(代码在GitHub,基准结果公开),这不再是市场宣传,而是技术事实。事实堆积到一定程度,会迫使所有人——工程师、研究员、政策制定者——重新评估AI能力的边界在哪里,以及这条边界消失的速度有多快。

我们正处在这个重新评估的窗口期。Anthropic的生物分子建模研究,是这个窗口里的一个新数据点。而这个窗口,不会等我们好好准备了再开始缩小。


参考来源

  1. Anthropic官方研究报告: “How Claude is uplifting biomolecular modeling” (2026年) https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling (已直接web_fetch验证,HTTP 200,页面标题匹配,内容包含FlashPairformer、三角注意力优化等核心数据)

  2. 技术详情论文(来源1报告内提供链接): https://www-cdn.anthropic.com/e96b5807039a88168733d9687afe41dfbbd5de13.pdf (Anthropic官方CDN托管,PDF格式)

  3. 开源代码库(来源1报告内提供链接): https://github.com/anthropics/uplifting-biomolecular-modeling (GitHub公开仓库,供社区独立验证)

  4. Anthropic前序蛋白质设计研究: “Claude accelerates protein design and analytical chemistry” https://www.anthropic.com/research/Claude-accelerates-protein-design (已直接web_fetch验证,HTTP 200,页面标题匹配;包含Claude Mythos Preview+Opus 4.8设计15个蛋白质结合体、成功14个的详细数据;提供每目标1万美元GPU成本的基准,是计算100倍效率提升的起点)

  5. Claude Fable/Mythos 5.1发布公告(来源1报告内引用,Anthropic官方): https://www.anthropic.com/claude-fable-and-mythos-5-1 (已独立web_fetch验证可访问;报告中引用作为同期Mythos 5.1加速生物学模型2.5倍的来源)


编者按:本文核心数据(4倍加速、30+模型、不到4周、2名工程师无内核工程经验、约100倍GPU小时效率提升)均直接来源于Anthropic官方研究报告(来源1),已通过web_fetch直接验证原始内容可访问。关于100倍效率提升:报告原文表述为「two orders of magnitude fewer GPU hours」(少两个数量级的GPU小时),本文翻译为「少约100倍GPU小时」,这是对原文字义的直接转述,非作者推算。本文所有Anthropic内部引用链接(来源2-5)均为报告原文提供的路径,本文仅转述。本文中对「AI能力边界」和「技术执行力vs领域判断力」的分析,为作者基于报告数据的推断和解读,并非Anthropic官方立场。