270亿参数打败千亿级大模型:Inherent AI的Faraday如何用「研究品味」撕开规模扩展定律的裂缝
2026年8月22日,一个消息在AI研究社区引发了安静但深远的震动:英国AI实验室Inherent发布的Faraday Agent,在「独立复现科学论文」这一基准测试上,超越了Anthropic Claude Opus 4.8和OpenAI GPT-5.5。
这件事令人震惊的不是「小公司打败大公司」——这种故事在AI行业并不少见。令人震惊的是:Faraday只有27亿参数,而它超越的对手是参数量大它数十倍的前沿大模型。
在大多数人的认知框架里,AI能力和参数规模高度相关——参数更多意味着更强的能力,这是过去几年AI行业最重要的经验规律之一,也是OpenAI、Anthropic、Google在模型训练上投入数百亿美元的基本逻辑。但Faraday的结果在这个规律上打出了一个明显的问号。
不是全盘否定,而是:在某些特定领域,参数规模可能不是决定性因素。更重要的,可能是你让模型学什么样的目标。
Faraday是谁,做了什么
Inherent是一家由Google DeepMind校友创立的英国AI实验室,2026年5月刚刚从隐身状态浮出水面,同时宣布完成了5000万美元种子轮融资(一个对初创AI实验室来说相当大的金额)。公司的核心目标是构建「AI科学家」——不只是能回答问题的AI,而是能主动发现新知识的AI。
Faraday是这个目标的第一步实证。
Inherent在其官方研究博客中详细记录了Faraday的设计理念:名字来源于Michael Faraday——那个在没有大学文凭、几乎没有正式训练的情况下,通过重复前人实验的方式发明了电动机的英国科学家。「复现是发明的前一步」,这个历史故事成为了整个项目的精神隐喻。
Faraday的具体任务是「论文复现」:给定一篇已发表的科学论文,AI需要在没有任何提示或辅助的情况下,自主重现论文中的关键图表(实验结果)。这听起来像是一个有趣但不那么重要的技术挑战,但实际上它是「自主科学研究」能力的核心先决条件。一个能独立复现他人研究的AI,也就具备了独立验证假设的基本能力——从复现到发现只有一步之遥。
Inherent为此构建了一个名为「Replica」的基准测试框架:包含来自100篇机器学习和AI4Science论文的310个任务,覆盖自然语言处理、材料科学、气象预测等多个领域,每个任务都要求AI在有限时间和计算预算内,在没有原始图表的情况下复现该图表。
在这个基准上,Faraday超越了在Claude Code和Codex框架下分别运行的Claude Opus 4.8和GPT-5.5,在所有论文类别中都产出了更高质量的复现结果,在近期发表的研究(基础模型预训练数据中不包含这些内容)上表现尤为突出。
关键问题:27亿参数如何做到这件事
Faraday只有27亿参数,基础模型是Qwen 3.6(阿里巴巴开源系列)。它的性能突破来源不是更大的模型,而是一套精心设计的强化学习训练方法,Inherent称之为「长时程强化学习(long-horizon RL)」。
这个框架有几个关键设计选择:
第一,训练目标的精确定义。Faraday的训练目标不是「在所有科学任务上得高分」,而是专门针对「复现质量」这一单一指标深度优化。Inherent为此设计了一个精密的LLM评判器(LLM judge),该评判器由一个关于「研究品味」的人类专家标注数据集训练,并通过人类研究员的评估验证其判断与专家判断的一致性。
训练目标的精确性很重要,因为宽泛的目标会导致模型在所有方向上都只得到中等回报,而精确的目标让模型可以在一个特定维度上不断深化学习,最终形成专项能力。
第二,「研究品味」作为显式训练目标。这是Faraday最有启发性的设计选择。在传统的AI训练中,「品味」这类难以量化的人类判断往往被视为无法直接训练的隐性能力,需要通过大量数据和参数规模来间接涌现。
Inherent做了一件反常的事:他们把「研究品味」分解为可以评估的具体指标(实验设计的严谨性、对原论文方法论的忠实度、负面结果的正确处理方式、资源约束下的优先级判断),然后训练一个评判器来学习这些指标的组合评分,最后用这个评判器的信号来优化Faraday的行为。
「研究品味」从「无法训练的直觉」变成了「可以优化的目标函数」。这个转化是Faraday突破的核心。
第三,长时程任务下的稳定训练。强化学习在长时程任务(需要多步骤推理、中间结果不确定)中的训练稳定性一直是个难题。Inherent通过两项技术改进解决了这个问题:多样本聚合(multi-sample aggregation,通过对同一任务多次采样来平滑奖励噪声)和回合级信用分配(turn-level credit assignment,识别哪些中间步骤对最终结果贡献最大,而不是只在最终结果上评分)。
这些技术选择共同使得Faraday能够在27亿参数的规模内,通过精准的RL训练,在「复现科学论文」这个特定任务上超越参数量多出数十倍的通用大模型。
第四,Faraday用GPT-5.5作为工具。这是一个略显讽刺但极具象征意义的细节:Faraday在执行任务时,会调用GPT-5.5 Codex作为编程工具——也就是说,Faraday(27亿参数的小模型)在指挥GPT-5.5(数百亿参数的大模型)干活。Inherent在论文中写道:「Faraday在处理一个比自己大数个数量级的模型的工作时,展现出了科学指导能力。」
这个设计本身就是一个关于AI系统设计的深刻洞察:决定AI系统价值的,不一定是模型自身的参数量,而是它对任务的理解深度和对其他工具的调用策略。
规模扩展定律的裂缝:这是例外还是趋势
Faraday的结果引发了一个更大的问题:规模扩展定律(scaling laws)是否已经开始在某些领域失效?
规模扩展定律的核心主张是:在足够的计算资源支持下,更大的模型在几乎所有任务上都会表现更好。这个规律在过去5年间大致成立,是整个大模型投资热潮的理论基础。
但「规模扩展定律在一般情况下成立」和「规模扩展定律在所有特定任务上成立」是两回事。
越来越多的研究结果表明,在一些需要「深度专业化」而非「广泛知识覆盖」的任务上,针对性训练的小模型可以超越通用大模型。DeepSeek的多个版本在编程任务上超越了更大的通用模型;特定领域的医疗AI在临床诊断任务上超越了通用大模型;现在Faraday在科学论文复现上超越了更大的通用模型。
这些案例积累起来,描绘出一个越来越清晰的模式:通用能力需要规模,特定任务的卓越性需要精准。
这对AI行业的含义是:那些花费数十亿美元训练通用大模型的公司,在某些特定领域可能会被投资少得多、专注程度高得多的专业模型所超越。通用大模型的竞争将越来越聚焦在「需要广泛知识整合」的任务上(复杂推理、多模态理解、开放域对话),而专业任务将逐渐被专业化小模型瓜分。
这不是「大模型死亡论」,而是「任务分层」的开始。
从复现到发现:科学AI的真正野心
Faraday的论文复现能力是起点,不是终点。Inherent创始人兼首席科学家Edward Hughes说得很清楚:「论文复现不是目的,它是通往目的的路径。」
理解这句话,需要理解科学发现的认知结构。科学发现的过程不是「随机猜测」,而是「有结构的探索」:先理解已有知识的边界在哪里(需要复现前人工作),再形成对边界附近「值得探索方向」的判断(需要研究品味),再设计验证这个方向的实验(需要实验能力),再从实验结果中提取洞察并修正假设(需要归纳能力)。
Faraday目前证明了第一步(复现)和第二步(研究品味)是可以通过RL训练获得的。如果第三步(实验设计)和第四步(假设修正)同样可以被训练,那么「AI科学家」就不再是科幻小说。
Inherent在论文中提到,他们已经开始尝试「想象的论文」——给Faraday一个不存在的论文的描述,要求它从零开始生成实验设计和结果。早期实验显示Faraday可以在不知道「正确答案」的情况下,生成有科学意义的探索路径。这仍然是初步结果,距离真正意义上的科学发现还很远,但方向信号是清晰的。
如果AI科学家的愿景在未来5-10年内变成现实,它将对人类的科学研究方式产生根本性影响:不是替代科学家,而是让每一个科学家能够同时运行数十个甚至数百个实验假设的验证——从线性探索变成并行探索,科学发现的速度可能会发生量级跃升。
Faraday的技术细节:Replica基准测试的设计逻辑
要真正理解Faraday的突破,需要更深入地了解Replica基准测试的设计,因为基准测试本身往往决定了什么样的能力会被发现和验证。
Inherent构建Replica时面临的核心挑战是:如何把「复现科学论文」这个需要专业判断的人类任务,转化为AI系统可以被评分的任务?
普通的基准测试(如MMLU、HumanEval、MATH等)使用的是有明确正确答案的问题——给定输入,正确输出是已知的,所以AI的表现可以用精确率/召回率等指标衡量。但「复现一张科学图表」没有唯一正确答案:不同的研究者复现同一个实验,可能会产生略有差异但同样有效的结果,这种差异是否代表复现失败,需要专业判断。
Inherent的解决方案是建立了一个两层评估体系:
第一层(自动化):对于有确定参考值的结果特征(比如曲线的终点数值、图表的趋势方向),用数值比较自动评分。
第二层(LLM评判器+人类验证):对于需要专业判断的质量特征(实验设计是否合理、对原论文方法的理解是否准确、对负面结果的处理是否诚实),训练了一个专门的LLM评判器,并用人类研究员的评估来验证这个评判器的判断与专家判断的一致性。
Inherent的论文显示,经过校准的LLM评判器与人类专家的判断一致性显著高于未经校准的基准LLM——这表明他们的评判体系是有效的,不只是在用AI「自评自」。
同时,Inherent刻意选择了「近期发表的论文」作为Faraday评估的重点场景,而不只是几年前的经典论文。这个选择很重要:大型前沿模型(GPT-5.5、Claude Opus 4.8)的预训练数据中包含了大量已发表的科学文献,如果只测试老论文,大模型可能只是在「记忆」而不是在「理解」。Faraday在最新论文(预训练数据中不可能存在)上同样超越大模型,这才是真正有说服力的证据——Faraday学到的是可迁移的「复现能力」,而不是特定论文的答案。
产业化前景:科学AI的商业化路径还不清晰
必须指出的是,Faraday目前还是一个研究级别的成果,距离大规模产业化应用还有相当距离。
首先,Replica基准测试覆盖的任务类型仍然有限——主要是机器学习和AI4Science领域,在生物化学、临床医学、材料科学等需要物理实验的领域,纯代码复现的有效性是有限的。
其次,Faraday的复现能力目前局限在「生成与原图表相似的图表」,而不是「验证原论文的核心声明」。同时,Replica基准目前主要覆盖ML和AI4Science领域,在实验生物学、临床医学等依赖物理实验的领域,AI复现能力的有效性尚待验证。一篇论文的核心声明可能需要超越单一图表的综合判断,而Faraday在这个层面的能力还未被系统性验证。
第三,Inherent是一家种子轮阶段的初创公司,5000万美元的融资对于要训练和持续迭代AI模型的公司来说是一个相对小的数字。他们需要证明Faraday的能力在更广泛的科学任务上是可扩展的,然后才能获得大规模商业化所需的资源。
Inherent的商业化路径目前不完全清晰。潜在方向包括:
- 直接面向科研机构和制药公司的研究加速工具
- 与科研出版平台(如Nature、Science的数字化业务)合作,提供自动化文献验证服务
- 面向政府科研机构的AI辅助同行评审工具
这些方向都有真实的市场需求,但每一个都需要解决特定的合规、信任和集成挑战。科学界对AI工具的接受度整体上仍然谨慎,建立足够的可信度需要时间。
DeepMind校友效应:为什么「出走者」更快
Inherent由Google DeepMind校友创立,这个背景不只是一个简历标注,它解释了为什么Inherent能在5000万美元的资金规模下,产出在某些维度上超越Anthropic和OpenAI的研究成果。
DeepMind长期以来是全球AI研究能力最强的机构之一,但它作为Google的子公司,研究方向和资源分配必须兼顾商业化需求。很多有趣但离商业化较远的研究方向(比如「让AI真正理解科学复现」)在DeepMind内部难以获得足够的资源支持,因为它的短期商业价值不明显。
当研究者从DeepMind离开,创立一家完全由研究目标驱动的初创公司,他们带走的不只是技术能力,还有「只做最重要的一件事」的纯粹性。Inherent的全部赌注都押在「AI科学家」这一个目标上,没有多线程的产品路线图,没有企业客户的功能请求要响应,没有股东对季度营收的压力。这种纯粹性是他们能做出Faraday的重要条件之一。
这个故事会在AI领域反复出现。大实验室(Anthropic、OpenAI、Google DeepMind)的研究人员在积累了足够的技术深度后,会越来越多地选择离开去创业,在更小、更专注的环境中追求他们认为最重要的研究方向。而这些创业公司,会在各自专注的领域,持续给大实验室带来竞争压力。Inherent的故事提醒整个行业:真正重要的AI突破,不总是来自资本最雄厚的地方,而是来自目标最清晰的地方。5000万美元的种子轮,加上正确的训练目标和精准的方法论选择,可以做到数十亿美元的通用模型做不到的特定任务。这是AI时代「小而精」战略真实可行性的又一次证明,也是AI研究生态健康多样性的体现。
结语:参数不是全部,目标才是
Faraday的故事最终指向一个朴素但重要的原则:决定AI能力上限的,不只是参数规模,更是训练目标的精确性和对人类专业判断的系统化编码能力。
用错误或宽泛的目标训练一个万亿参数的模型,它会成为一个万能但平庸的回答机器。用精准且深刻的目标训练一个270亿参数的模型,它可能在特定领域超越前者。Inherent用Faraday证明了这个原则在「科学复现」这个高难度场景下是有效的。
这个发现对AI研究者的启示是:在「更大、更快、更多」的军备竞赛之外,「更精准的目标设计」同样是通向AI突破的有效路径,而且所需的计算资源更少、迭代周期更短、失败成本更低。这为资源有限但方向清晰的研究团队,提供了一条真实可行的创新通道。
对于整个AI行业,Faraday的存在是一个健康的提醒:规模扩展不是唯一的答案,专业化和目标精准性是它的有效补充。那些只会做「更大通用模型」的公司,在日益专业化的AI应用场景中,可能会遭遇越来越多来自专注型小玩家的意外挑战。而那些能够把「研究品味」这类难以量化的人类智慧转化为可训练目标函数的研究者,将在未来的AI突破中占据独特的位置。我们正处在AI能力从「广度」向「精度」分化的早期,这个分化将深刻影响未来5-10年AI行业的格局,值得持续关注。
参考资料:
- Inherent官方研究博客: “Training AI Scientists to Replicate Research” (2026-08-14) — https://inherentlabs.ai/research/training-to-replicate
- 对应论文: arxiv.org/abs/2608.13331
- TechCrunch: “Inherent, founded by DeepMind alumni, says its AI ‘teammate’ just outperformed Anthropic and OpenAI at replicating research” (2026-08-22) — https://techcrunch.com/2026/08/22/inherent-founded-by-deepmind-alumni-says-its-ai-teammate-just-outperformed-anthropic-and-openai-at-replicating-research/
- Inherent官网: https://inherentlabs.ai/
- 种子轮报道: Tech.eu “London-based AI lab Inherent emerges from stealth with $50M raise” (2026-05-29) — https://tech.eu/2026/05/29/london-based-ai-lab-inherent-emerges-from-stealth-with-50m-raise/