一句话摘要:哈佛大学物理学教授Matthew Schwartz在Anthropic博客发表客座文章,描述了他AI辅助研究方法的根本性转变:停止试图让Claude像人类科学家那样工作,改为寻找最适合当前LLM能力的”Claude形状”问题。结果是他用开源工具包BootLoops在三个月内,在18个领域产出了36篇论文稿件,涵盖从散射振幅到种群遗传学、生态学、经济学和语言学,部分为前所未有的新计算结果。


2025年12月,Matthew Schwartz做了一个实验:把Claude当作研究助手,看看它在高能物理领域能做什么。

结论是:Claude Opus 4.5的表现相当于一个强劲的物理博士生,速度是人类的20倍。但这个结论背后,有一个令人沮丧的细节——

“尽管Claude最终产出了高质量的论文,但整个过程是一段煎熬。我需要纠正它写的每一句话,把它从无关的线索里拉回来,从死胡同里救出来。”

这是一种常见的AI辅助科研体验:工具明显聪明,但配合起来费力。

Schwartz决定换一个思路。


与其让AI当你想要的那种合作者,不如接受它真正是的那种合作者

这是Schwartz在这篇客座文章里的核心洞察,也是整个BootLoops项目的起点:

“我没有把Claude当成我希望的合作者,而是开始把它当成它真正是的合作者。”

这需要寻找适合Claude优势的问题。

Schwartz对Claude当前能力和局限的判断是清晰的:Claude”还不能帮助深层次的概念性问题”,但它拥有”几乎无限广度的跨学科知识、惊人的编程能力、顶尖的数学和统计知识,以及以机器速度解析论文、附录和数据的能力”。

问题是:什么样的科学问题,恰好需要的是这些特征,而不是深层次的概念创新?


“Claude形状”的问题是什么

Schwartz发展出了”Claude形状问题”这个概念:当前AI最擅长的、人类反而相对薄弱的那类科学任务。

他发现,Claude一遍又一遍地注意到同一个模式:很多领域都有一些问题,如果有人知道某个来自数学、物理或计算机科学的技术,就能直接解决这些问题——而问题恰恰是:没有人知道这个技术的存在。

跨学科的知识盲点,是当今科学研究的一个系统性问题。物理学家不知道生态学家在用低效的方法解一个在物理中早已有解析解的方程;生物学家不知道有一个来自计算机科学的算法能完美解决他们的种群动态问题。

Claude却可以跨越这些学科边界,同时调用来自高能物理、群论、微分方程和生物统计的知识。

这就是”Claude形状问题”的核心:知识整合的跨学科任务,让AI发挥”广度”优势,而不是和人类专家在”深度”上竞争。


BootLoops是什么

BootLoops是Schwartz基于这个洞察构建的开源工具包,用于定量科学中的精确计算。

他的描述是:BootLoops作为一种”框架”(harness),像Claude Code(编程辅助)是Claude处理代码任务的框架一样,BootLoops为Claude在科学计算任务中提供结构化的工作流。

具体来说,BootLoops提供了一套用于”精确计算”的工具和协议——这与许多AI科研应用中侧重于”阅读文献”或”生成假设”不同,BootLoops的目标是让Claude能做出可被数学验证的精确计算结果。

这是重要的区别:计算结果是对还是错,有明确的验证标准。这让Claude在这类任务上更容易发挥——因为它有很好的数学推理能力,而且错误可以被检测和修正。


三个月,18个领域,36篇论文草稿

用BootLoops工作了大约三个月后,Schwartz在Anthropic博客发布文章时,记录了这样的数字:

  • 在18个领域产出了36篇稿件
  • 领域横跨:散射振幅(他自己的本职领域)、种群遗传学、生态学、经济学、语言学……
  • 部分计算结果,他声称是前所未有的新计算结果

这个速度令人印象深刻:如果按传统学术方式计算,一个物理学教授在三个月内跨越18个领域做出初步研究结果,几乎是不可能的。

但Schwartz也非常谨慎地标注了这件事的局限性:“关键的概念性工作仍然需要人类专家。”

他描述了一个典型的工作流程:Claude发现了一个跨学科联系(在技术上是正确的,但在科学意义上可能并不重要),然后Schwartz需要找到相关领域的专家来判断这个联系是否真的是那个领域关心的问题。在专家的指导下,才能把BootLoops的输出转化为真正有价值的科学结果。

这是一种人机协作的新模式:AI负责广度扫描和精确计算,人类专家负责判断科学价值和把握研究方向。


阻抗失配(Impedance Mismatch)

Schwartz用物理学中的”阻抗失配”来描述AI与科研之间的核心张力,这个比喻值得仔细理解。

在电路中,当两个系统各自工作正常,但相互连接时能量传输效率极低,我们说这两个系统存在阻抗失配。解决方案不是修复某一方,而是在它们之间加入匹配层(impedance matching)。

在AI辅助科研中,阻抗失配表现为:AI系统(Claude)和科学家(Schwartz)各自能力都很强,但”科学家想要的”和”AI做得好的”之间,有一道鸿沟。

大多数科研人员试图解决阻抗失配的方式是:更好地提示(prompting)AI,让它”更像一个科学家”。

Schwartz的方法是:不改变AI,改变问题的选择方式——把问题选到AI能力覆盖的区域,而不是试图把AI推进科学家工作的领域。

这是一种认知上的转变,也是BootLoops整个设计哲学的基础。


这对AI辅助科研的未来意味着什么

Schwartz的经验,对更广泛的”AI加速科研”讨论,有几个具体的含义:

一、AI最擅长的科研任务类型,和科研人员期待的任务类型,可能并不重合。

大量关于AI加速科研的讨论,聚焦于”AI能否提出新假设”、”AI能否设计实验”、”AI能否做出概念性突破”。Schwartz的经验表明,至少在当前技术水平下,这些是”阻抗失配”最严重的领域。相反,跨学科知识整合、精确计算、文献解析——这些更适合当前AI。

二、开源工具包(如BootLoops)可能比大型科研AI平台更快推进AI辅助科研。

大型机构往往等待AI公司建立完整的科研平台。但像BootLoops这样的工具,一个教授就可以开源发布,研究人员可以直接使用,也可以根据自己的需要改造。这种去中心化的工具生态,可能比中心化的平台更快提供实际价值。

三、”人类专家判断+AI广度扫描”的分工模型,可能是近期最可行的AI辅助科研模式。

Schwartz的描述——Claude发现跨学科联系,人类专家判断科学价值——是一种清晰的分工。这不需要AI在科学上”突破”人类,只需要AI在广度和计算精度上发挥它的优势。这个模式,任何有基本编程能力的研究人员今天就可以尝试。


结语:停止让AI假装成你,让它做自己

Schwartz的文章,可以用一个非常简单的句子来总结:

停止让AI假装成你,让它做自己最擅长的事。

这听起来像常识,但在实践中,大多数人的AI使用方式正好相反:我们试图用AI模拟自己的工作流程,而不是寻找AI最适合的工作流程。

物理学中的阻抗失配,解决方案不是让两边各自变得更好,而是在中间加一个匹配层。BootLoops,在某种意义上,就是那个匹配层:它把”科学家想要的精确计算”和”AI做得好的跨学科知识整合”连接在一起。

三个月,18个领域,36篇稿件。这不是AI独立做科研,而是一个教授学会了如何正确使用AI工具后,能做到的事情。

这个”正确使用”,不是更好的提示词,而是对AI能力和局限的清晰理解,以及愿意让AI做AI而不是让AI假装是人类科学家。


参考资料

  1. Anthropic官方博客(2026-10-01):Claude-shaped science,by Matthew Schwartz(哈佛大学物理学教授)
    https://www.anthropic.com/research/claude-shaped-science

  2. Anthropic官方博客(前置文章):Vibe Physics(2025年12月),Schwartz描述Claude作为物理研究助手的早期实验
    https://www.anthropic.com/research/vibe-physics

  3. BootLoops开源工具包:用于定量科学中精确计算的框架,Schwartz基于Claude构建
    来源:Anthropic博客文章中提及(具体GitHub/项目地址未在博客中直接提供)

  4. 核心数据说明:文中”三个月、18个领域、36篇稿件”均来自Schwartz博客文章直接陈述;其余分析为编辑整理(已在文中相关处标注)


风险:这个方法论的边界在哪里

Schwartz的方法是真实有效的,但在传播过程中容易被误读为”AI已经可以独立做科研”。这里需要明确几个边界。

边界一:只适用于”精确计算型”问题

BootLoops的核心假设是:跨学科问题可以被形式化为精确的数学计算任务。这在理论物理、计算生物学等领域有效,但在需要大量直觉判断、实验操作、田野调查的领域(如临床医学、生态学现场研究),这个框架的适用性会大幅降低。

边界二:”36篇草稿”到”36篇发表论文”有很长的路

Schwartz明确用的是”drafts”(草稿)而非已发表论文。从草稿到发表需要同行评审、数据验证、实验重现。AI生成的跨学科联系有多少是真正新颖的,有多少是目标领域的专家早已知晓只是未被物理学界注意到的,目前还不知道。这是一个需要时间来回答的问题。

边界三:可重复性存疑

BootLoops是开源的,但Schwartz的具体提示策略(prompting strategy)、Claude版本选择(Claude Opus 4.5,不是所有人都用得上这个版本)、以及如何判断”哪个问题适合Claude”,在博客文章中没有完整记录。其他研究者能否系统性地复制这个方法,还需要更严格的验证。

边界四:依赖单一AI供应商的长期风险

Schwartz的整个框架深度依赖Anthropic的Claude。如果Anthropic调整API访问政策、提高价格、或者推出了与原有API不兼容的新版本,整个BootLoops工作流可能需要大幅重写。这是任何深度依赖单一AI供应商的工具都面临的通用风险。

这些边界不是在否定Schwartz的工作——而是在帮助读者更准确地理解这个方法的真实适用范围。


附录:36篇稿件是怎么生产出来的——BootLoops的工作流

BootLoops的具体工作方式,以下描述基于Schwartz博客文章中的直接描述,部分步骤为编辑整理(原文未逐步列举,而是散落在各段),仅供理解流程之用:

第一步:用数学/物理视角审查跨学科问题

Claude被要求浏览某个领域的近期文献,寻找那些”如果有人知道某个来自不同领域的技术就能解决”的问题。这是Claude广度知识的最直接应用——它可以同时从物理、数学、计算机科学、生物学的视角审视同一个问题。

第二步:识别技术匹配

当Claude识别到一个潜在的跨学科联系时——比如”生态学中的某个种群动态方程,数学上等价于高能物理中已有解析解的某类方程”——BootLoops的工具包提供了验证这个联系是否数学上正确的计算框架。

第三步:精确计算

一旦跨学科联系被确认是数学上有效的,BootLoops协助Claude进行精确计算——不是数值估算,而是解析解或高精度数值解。这是”可被验证”的关键:计算结果是精确的,对或错一目了然。

第四步:人类专家判断

这一步是BootLoops流程中最关键的,也是最不能被自动化的:Schwartz把计算结果带给相关领域的专家,问”这在你的领域是一个有意思的问题吗?”。

很多时候,答案是”数学上正确,但对我们领域没有意义”——这些计算被丢弃。 另一些时候,专家会说”这正好是我们现在最想解决的问题之一”——这些成为了正式的论文草稿。

这个四步循环,每个循环可能只需要几小时(Claude做计算),而人类专家评审可能需要几天。最终,三个月内,18个领域,36篇草稿。


附录:Schwartz之前的实验——Vibe Physics

理解”Claude形状科学”,需要了解Schwartz之前的实验”Vibe Physics”(振感物理学,一个玩弄”vibe coding”的词汇创造)。

2025年12月,Schwartz发表了第一篇Anthropic博客文章,描述了一个实验:让Claude作为纯粹的研究助手,帮助完成一篇高能物理领域的研究论文,从头到尾,包括文献阅读、推导计算、论文写作。

结果是:Claude表现相当于一个强劲的物理博士生,速度是人类的20倍。它能快速阅读论文,提出下一步研究方向,执行复杂的数学推导。

但”Vibe Physics”的反馈是二元的:令人印象深刻,同时令人沮丧。

令人印象深刻:产出了高质量的论文。令人沮丧:全程需要Schwartz的密集监督——”纠正每一句话,把它从无关线索里拉回来,从死胡同里救出来”。

这种体验,在研究AI辅助科研的学者中相当普遍。AI助手可以做很多事情,但大量时间花在了”管理AI”上,而不是”做科研”上。

“Claude形状科学”是Schwartz对这个问题的系统性回应:与其试图让AI更好地做人类科学家的工作,不如重新设计工作流,让人类和AI各做自己最擅长的事。


附录:散射振幅和种群遗传学有什么关系?

Schwartz在文章中提到,BootLoops在他本职领域(散射振幅,scattering amplitudes,高能物理的核心计算对象之一)之外,找到了和种群遗传学的联系。

这是一个令人着迷的例子,值得稍作解释。

散射振幅是粒子物理中描述粒子相互作用过程的数学对象。在过去二十年,物理学家发展出了一套极其精妙的数学工具,用于计算高维多粒子的散射振幅——这些工具本质上是处理某类复杂的求和/积分问题的高效算法。

种群遗传学研究的是基因频率在种群中随时间的变化——这涉及到追踪大量基因在世代交替中的传播,同样是一类复杂的概率求和问题。

当Claude同时了解这两个领域时,它发现:在某些特定条件下,描述多粒子散射的数学结构,和描述某类基因传播模式的数学结构,是同构的——也就是说,解决了一个问题的工具,可以直接用来解决另一个问题。

这不是”猜测”或”类比”,而是严格的数学等价关系。在Schwartz验证了数学正确性后,他联系了种群遗传学领域的专家,询问这个联系是否有实际的科学价值。

这是”Claude形状问题”最典型的例子:人类几乎不可能在日常工作中同时深度了解高能物理和种群遗传学。但Claude可以,并且可以在几小时内找到这个联系。


附录:从”AI写论文”到”AI发现连接”——两种截然不同的科研AI路线

目前AI辅助科研有两种主流的叙事:

叙事一:AI写论文。AI作为高速的写作和计算助手,帮助科学家更快地产出论文。这是大多数”AI加速科研”报道的隐含假设,也是Schwartz在Vibe Physics里最初尝试的模式。

叙事二:AI发现连接。AI用其跨学科的广度知识,识别出不同领域之间的技术联系,为人类科学家指出新的研究方向。这是BootLoops和”Claude形状科学”的模式。

这两种叙事不是互斥的,但它们对应的技术挑战和合作方式是截然不同的。

叙事一的核心困难是:让AI在一个领域做得足够好,以至于产出的内容不需要大量人工修正。这需要模型在深度上对标人类专家,而目前还有相当的差距(叙事一里的”管理AI”问题)。

叙事二的核心困难是:如何设计系统,让AI识别出的跨学科联系是真实有价值的,而不只是表面的类比或数学上成立但科学上无意义的相似性。Schwartz的解决方案是依赖领域专家的判断,但这也意味着系统不是完全自动化的。

Schwartz的贡献是:他用三个月的实际工作,证明了叙事二在今天是可行的,而叙事一在今天还很费力。这是一个基于真实经验的校准,而不是基于对AI能力的理论预期。


附录:BootLoops的意义——科研工具从精英闭环到开源社区

BootLoops是开源的。这个细节,在整个故事里可能被低估了。

传统上,先进的科研工具——无论是实验设备、软件还是方法论——集中在少数精英机构(顶级大学、大型国家实验室)。一个资源有限的大学的研究人员,很难使用到哈佛物理系开发的定制工具。

BootLoops的开源发布,意味着:任何有网络连接的研究人员,都可以免费使用Schwartz三个月实验产出的工具集,并根据自己领域的需求进行改造。

这对AI辅助科研的民主化有重要含义:AI辅助科研不只是顶级大学的特权,也不只是购得了高价订阅的研究机构的工具。

当然,要真正使用BootLoops,还需要一定的技术能力(了解如何调用LLM API,了解如何配置工具)。这仍然是一道门槛,但远低于从头构建类似系统的门槛。


附录:这件事对中国科研的含义

Schwartz的实验发生在高能物理、生态学、种群遗传学等领域。这些领域,中国有大量一流的研究团队。

如果”Claude形状科学”的方法论是有效的,那么中国的物理学家、生物学家、经济学家同样可以用类似的方式加速自己的研究——用LLM(包括国产的DeepSeek、Qwen等,或者Claude)作为广度扫描工具,自己的领域专业知识作为价值评判的锚点。

当然,这里有一个微妙的挑战:Schwartz使用的是Claude,而Claude在中国的可访问性有限制。国产大模型在跨学科知识广度上,目前与顶级闭源模型还有一定差距——但差距在缩小。

更重要的是,BootLoops的方法论本身——”让AI做广度扫描,让人类专家做价值判断”——与具体的模型选择是解耦的。任何具有足够跨学科知识广度的LLM,原则上都可以填充到BootLoops的框架里。

这意味着,随着国产大模型能力的提升,这个方法论对中国研究者的可用性会持续改善。


附录:Schwartz的身份背景为什么重要

Matthew Schwartz是哈佛大学物理学系教授,专攻高能物理(理论粒子物理)领域,特别是量子场论计算方法(如散射振幅)。

这个背景在这个故事里很重要,原因有两个:

第一,他有足够深的专业知识来识别AI输出的质量。Schwartz在评价Claude处理高能物理问题时,不是在泛泛地说”感觉很聪明”,而是从一个深度领域专家的视角,评判具体计算的正确性和科学价值。这让他的评价比一般用户的印象更有参考价值。

第二,他的跨学科探索是有技术基础的。Schwartz的专业是散射振幅计算,这是一个与很多其他领域的数学技术有深层联系的领域。他之所以能够评估Claude找到的跨学科联系,部分原因是他自己就跨越了物理和数学的边界。这不是一个随机的科学家说”AI帮我联系了A和B领域”,而是一个对这类跨领域联系有先验期望的研究者,在实验中验证了AI在这个方向上的能力。

同样重要的是,Schwartz不是第一次在Anthropic博客发表关于AI辅助研究的文章——他的Vibe Physics(2025年12月)是这个系列的第一篇。这说明他不是在一次性的展示文章里过度美化AI的能力,而是在系统地追踪和记录AI辅助科研的进展与局限。


附录:AI辅助科研的时间线——从”我们应该能做到”到”我正在做”

AI加速科研,已经讨论了很多年。但大多数讨论停留在预测和展望层面:”AI将能够……”、”在未来五年里……”。

Schwartz的案例是少数已经可以说”我正在做,这是数据”的案例之一。

2024年,Google DeepMind的AlphaFold3扩展到了核酸和配体,再次刷新了蛋白质结构预测的边界。这是AI在生命科学中的结构性突破,但它是专用的AI系统(针对特定任务优化),不是通用LLM。

2025年,有多个案例记录了LLM在数学证明(如黎曼ζ函数的一个特定问题)和离散几何猜想上的贡献(GPT系列的一个分支)。这些案例说明通用LLM在严格的数学推理上有实际能力。

2026年,Schwartz的BootLoops实验,是通用LLM在多领域、跨学科、持续三个月、产出具体量化成果层面的一个案例。

这个进展不是”AI已经在做科学”,而是”一个科学家找到了让AI在科研中真正有用的方法”。这个区别是重要的——它把AI辅助科研从空洞的期望,落地为具体的方法论和可重复的实践。


附录:局限性和批评

公平地讲,Schwartz的实验有一些需要注意的局限性:

关于36篇”稿件”:Schwartz用的词是”drafts”(草稿),不是已发表或已投稿的论文。从草稿到发表,还需要经过领域专家深度审核、数据验证、同行评审等环节。36篇草稿能有多少最终成为发表论文,目前还不知道。

关于”前所未有的新计算结果”:Schwartz声称部分结果是前所未有的,但这需要在发表后经过同行审核来验证。跨学科研究的一个常见风险是,你”发现”的联系,在目标领域的专家看来可能是已知的(只是没有被广泛传播)。

关于可重现性:BootLoops是开源的,但Schwartz的具体工作流程、使用了哪个版本的Claude、如何配置等,在博客文章中没有完整记录。其他研究者是否能复制类似的效果,需要更详细的方法论描述。

关于概念性工作仍需人类:Schwartz非常明确地指出,”关键的概念性工作仍然需要人类专家”。这意味着BootLoops的适用范围,是那些可以被形式化为精确计算问题的科研任务——不是所有科研都是这样的。

这些局限性,不是在否定Schwartz的工作,而是在提供更完整的背景,让读者能够判断这个实验的实际意义。三个月,18个领域,36篇草稿——这个数字令人印象深刻,但它仅仅是一个开始,不是AI辅助科研成熟的标志。


附录:给正在科研中使用AI的研究人员的一个实用建议

基于Schwartz的经验,可以提炼出一个对正在使用AI辅助科研的研究人员有直接参考价值的建议:

不要问”AI能帮我做什么工作?”,而要问”哪些工作是AI比我强的,哪些是我比AI强的?”

Schwartz明确描述了这个分工:AI拥有”几乎无限广度的跨学科知识、惊人的编程能力、顶尖的数学和统计知识,以及以机器速度解析论文和数据的能力”,但”还不能帮助深层次的概念性问题”。

把这个分工转化成实际操作建议:

交给AI的任务:文献广度扫描(”在相关领域有没有解决类似数学结构的技术?”)、精确计算执行(”用这个方法计算这个量”)、跨领域联系搜索(”这个方程和哪个领域的哪个问题在数学上等价?”)

保留给人类的任务:判断一个跨学科联系是否有科学价值(需要深度领域知识)、提出真正有意义的研究问题(需要对领域前沿的把握)、解释结果的科学含义(需要直觉和经验)

这个分工不是固定的——随着AI能力的提升,边界会移动。但在2026年的当下,这个分工是一个相对可靠的起点。

Schwartz花了从2025年12月到2026年夏天,才找到了这个分工的正确位置。BootLoops是这个搜索过程的产物。如果他的经验能帮助其他研究人员更快找到自己研究领域的”Claude形状问题”,那么这篇博客文章的影响,可能远超过那36篇论文草稿本身。