2024年5月8日,Google DeepMind的AlphaFold 3论文在Nature正式发表,整个结构生物学界为之震动——一个AI模型预测蛋白质及其与DNA、RNA、小分子配体复合物三维结构的精度,已经逼近甚至在部分场景下超越了冷冻电镜实验 (来源: Nature, 2024-05-08)。但一个尖锐的问题随之浮出水面:如果我们能预测蛋白质的静态结构,那么能否预测一个活细胞里数万种蛋白质、RNA、代谢物之间的动态交互?能否从基因组序列直接推演出疾病表型?能否构建一个真正的”虚拟细胞”?

答案是:不能。至少目前不能。原因不在算法,而在数据。

2026年10月7日,一个史无前例的联合体正式宣布了它的答案:由CZ Biohub Network牵头,联合Meta、Google DeepMind、美国能源部(DOE)、美国国立卫生研究院(NIH)以及多个国际合作伙伴,共同承诺投入18亿美元,启动”虚拟生物学倡议”(Virtual Biology Initiative,简称VBI),目标是构建一套开放的、AI就绪的生物学基础数据集,为下一代生物AI模型铺路 (来源: Biohub官方公告, 2026-10-07)。

这不是一笔普通的科研拨款。这是科技巨头、联邦政府和慈善基金会第一次以如此规模、如此明确的战略意图,联合押注生物AI的数据基础设施。要理解这笔18亿美元背后的真正含义,我们需要拆解三个层面的问题:为什么是现在?为什么是这三方?以及,这是否意味着生物AI即将成为继大语言模型之后的下一个超级赛道?


一、18亿美元的拆解:谁出了多少钱,做什么?

先看资金结构。根据多家媒体报道和Biohub官方公告,这18亿美元的承诺来自多个方向:

CZ Biohub Network——由Mark Zuckerberg和Priscilla Chan创立的Chan Zuckerberg Initiative(CZI)资助——承诺投入5亿美元,作为这一倡议的核心发起方和协调方 (来源: Biohub官方公告, 2026-10-07)。这笔资金将主要用于三个方向:大规模多组学数据的系统性生成(涵盖单细胞转录组、空间转录组、蛋白质组和表观遗传组)、跨实验室数据标准化协议的制定,以及开放数据平台的工程建设。

美国联邦政府方面,DOE和NIH共同参与。DOE将提供其国家实验室的计算基础设施——包括橡树岭国家实验室的Frontier超级计算机(截至2026年仍是全球最快的超级计算机之一)和阿贡国家实验室的高通量实验能力;NIH则通过其现有的生物医学数据项目进行配套投入,并将VBI与其”All of Us”精准医学计划的数据资源进行对接 (来源: Unite.AI, 2026-10-07)。联邦层面的具体拨款金额在不同报道中有所差异,但整体承诺规模使总额达到近18亿美元(部分报道称”近20亿美元”)(来源: PR Newswire, 2026-10-07)。

Google DeepMind和Meta则以技术和资源投入的形式参与。Google DeepMind带来的是其在蛋白质结构预测(AlphaFold系列)和基因组学模型方面的积累;Meta则贡献其在大规模AI训练基础设施和开源模型生态方面的能力——特别是其FAIR团队在蛋白质语言模型(ESM系列)方面的技术栈。两家公司的参与不仅仅是资金层面的——它们将直接参与数据标准的制定和AI模型的开发 (来源: The Next Web, 2026-10-07)。

此外,这一倡议还包含多个国际合作伙伴,形成了一个跨部门、跨国界的联合体 (来源: PR Newswire, 2026-10-07)。

核心目标只有一个:生成和整理AI可用的高质量生物学数据。 不是训练模型,不是开发药物,而是建造”数据层”——就像ImageNet之于计算机视觉,Common Crawl之于大语言模型,VBI要做的是生物AI领域的基础数据集。

这一点至关重要。因为它揭示了当前生物AI领域最根本的瓶颈。


二、数据荒漠:为什么AlphaFold之后,生物AI陷入了僵局?

要理解VBI的战略意义,必须先理解一个反直觉的事实:尽管AlphaFold被广泛视为AI在科学领域的里程碑式突破,但蛋白质结构预测只是生物学的冰山一角,而且恰恰是”数据条件最好”的那个角。

AlphaFold之所以成功,是因为蛋白质数据银行(Protein Data Bank,PDB)经过数十年积累,已经拥有超过22万个实验解析的蛋白质结构(截至2026年10月,据RCSB PDB官网统计)。这些数据格式统一、质量可控、标注明确。换句话说,PDB是一个”AI就绪”的数据集。

但当我们把目光从蛋白质结构转向更广泛的生物学问题——细胞如何响应药物?基因突变如何导致疾病?不同组织中的基因表达模式有何差异?——数据状况就急剧恶化了。

问题1:数据量不足。 单细胞RNA测序(scRNA-seq)是近年来生物学最重要的实验技术之一,但截至目前,全球公开的单细胞转录组数据覆盖的细胞类型和组织类型仍然极为有限。人体有约200种主要细胞类型,但在不同疾病状态、不同发育阶段、不同个体背景下的系统性数据远远不够。CZ CELLxGENE数据库虽然已收录超过8000万个单细胞的转录组数据(据CZI 2025年报告),但相对于人体细胞类型、状态和个体差异的组合空间,这仍然只是沧海一粟。

问题2:数据质量参差不齐。 不同实验室使用不同的实验方案(10x Genomics、Smart-seq2、Drop-seq等)、不同的测序平台(Illumina、PacBio、Oxford Nanopore)、不同的数据处理流程(Cell Ranger、STARsolo、Salmon等),导致数据之间的可比性极差。这就像用100种不同的相机、不同的光照条件拍摄的照片来训练一个图像识别模型——噪声会淹没信号。

问题3:数据缺乏”AI就绪”的标注。 生物学数据的元数据(metadata)——样本来源、实验条件、临床信息——往往不完整或不标准化。一个AI模型需要知道”这个细胞来自一个65岁的2型糖尿病患者的胰岛β细胞”,但实际数据中这些信息经常缺失或格式混乱。

问题4:多模态数据的整合几乎为零。 真正的”虚拟细胞”需要整合基因组、转录组、蛋白质组、代谢组、表观遗传组、空间转录组等多层数据。但这些数据几乎从未在同一批样本上同时生成过,导致跨模态的关联学习无从下手。VBI的核心技术路线之一,正是在同一批生物样本上同时进行多组学测量(multi-omics profiling),从而为跨模态模型提供配对训练数据。

VBI的核心逻辑正是针对这四个问题:通过集中资源,系统性地生成高质量、标准化、多模态、AI就绪的生物学数据集,并以开放方式向全球研究社区提供 (来源: Biohub官方公告, 2026-10-07)。

用一个类比来说:如果AlphaFold是生物AI的”GPT-2时刻”,那么VBI要做的不是训练”GPT-4”,而是建造生物学的”互联网”——让下一个突破性模型有足够的高质量数据可以学习。


三、战略意图拆解:三方各自在打什么算盘?

表面上看,这是一个”公私合作、开放科学”的理想主义故事。但深入分析三方的战略逻辑,画面要复杂得多。

Meta/CZI:Zuckerberg的”第二曲线”布局

Mark Zuckerberg通过CZI在生物医学领域的投入已经持续了近10年。CZ Biohub Network目前在旧金山、芝加哥和纽约设有研究中心,聚焦传染病、炎症和神经退行性疾病等方向。但CZI此前的投入更多是传统的慈善科研资助模式——资助科学家、建设实验室、开发工具(如cellxgene和napari等开源软件)。

VBI标志着一个重要的战略转向:从资助科学研究,转向构建AI基础设施。 5亿美元的承诺使CZ Biohub成为这一倡议的最大单一出资方,也确保了它在数据标准制定和平台架构设计中的核心话语权 (来源: Biohub官方公告, 2026-10-07)。

这对Meta本身意味着什么?表面上,Meta作为一家社交媒体和AI公司,与生物学数据没有直接的商业关系。但有两个深层逻辑值得注意:

第一,Meta在开源AI生态中的战略地位。Meta通过Llama系列模型已经建立了全球最大的开源大语言模型生态。如果VBI生成的开放数据集催生了一批开源的生物AI模型,Meta在开源AI领域的品牌效应和生态影响力将进一步扩大。这与Meta”通过开源建立生态壁垒”的整体AI战略一脉相承。

第二,Meta的AI研究团队(FAIR)在蛋白质语言模型方面已有深厚积累。ESM-2(拥有150亿参数,是当时最大的蛋白质语言模型)和ESMFold等模型证明了Meta在生物AI领域的技术实力。2023年发布的ESM-3进一步将模型扩展到了蛋白质序列、结构和功能的联合建模 (来源: EvolutionaryScale, 2024)。VBI的多组学数据将直接为这类模型的下一代版本提供燃料。

换言之,Zuckerberg的算盘是:用慈善资金建设开放数据基础设施,用Meta的技术能力在这个基础设施上构建模型优势,最终在生物AI这个新赛道上占据生态位。

Google DeepMind:守住AlphaFold的皇冠

Google DeepMind参与VBI的逻辑更为直接:它不能失去在生物AI领域的领先地位。

AlphaFold是Google DeepMind最成功的科学AI项目,也是其最重要的品牌资产之一。Demis Hassabis与John Jumper因AlphaFold在蛋白质结构预测方面的贡献,与David Baker共同获得了2024年诺贝尔化学奖 (来源: Nobel Prize官网, 2024-10-09)。但AlphaFold的成功也带来了一个战略风险:蛋白质结构预测这个问题已经被”基本解决”了,下一个前沿在哪里?

答案显然是:从蛋白质结构走向细胞功能,从静态预测走向动态模拟。Google DeepMind需要新的数据来训练新的模型,以维持其在生物AI领域的技术领先。VBI提供的正是这种数据 (来源: The Next Web, 2026-10-07)。

但这里有一个微妙的张力:VBI的数据是开放的。这意味着Google DeepMind的竞争对手——包括Meta的FAIR、各大学的研究团队、以及一众生物AI初创公司——都能使用同样的数据。Google DeepMind的优势不在于数据独占,而在于:(1)其在生物AI模型架构方面的经验积累;(2)其在TPU集群上的大规模训练能力;(3)其与Isomorphic Labs(2021年成立的DeepMind生物技术子公司,已与Eli Lilly和Novartis签署总价值超过30亿美元的合作协议)的商业化协同。

Google DeepMind的策略是:参与开放数据建设以确保数据标准符合自身需求,同时在模型层面保持闭源优势。 这与Google在AI领域的一贯策略一致——开放底层(Android、TensorFlow),锁定上层(Search、Gemini)。

美国联邦政府:生物安全与技术主权的双重考量

DOE和NIH的参与是这个联合体中最值得玩味的部分。

从科研角度看,NIH长期以来是全球最大的生物医学研究资助机构(2025财年预算约为475亿美元,据NIH官网),DOE的国家实验室拥有世界顶级的超级计算机和高通量实验设施。两者的参与为VBI提供了无可替代的计算和实验能力 (来源: Unite.AI, 2026-10-07)。

但从战略角度看,联邦政府的参与有更深层的考量:

第一,数据主权。 生物学数据——特别是人类基因组和临床数据——正在成为一种战略资产。中国的华大基因(BGI)已经建立了全球最大的基因组数据库之一,中国在单细胞测序数据的生成速度上也在快速追赶。2024年,美国国会通过了《BIOSECURE法案》,限制联邦机构与特定外国生物技术公司的合作,反映了对生物数据主权的高度敏感 (来源: Congress.gov, 2024)。美国政府参与VBI,部分动机是确保全球最大的AI就绪生物学数据集由美国主导的联合体来构建和管理。

第二,生物安全。 AI在生物学中的应用是一把双刃剑。能够预测蛋白质功能的模型,理论上也能被用于设计有害的生物制剂。2023年,一项发表在Nature Machine Intelligence上的研究表明,AI药物发现工具可以在数小时内生成数万种潜在的有毒化合物设计 (来源: Nature Machine Intelligence, 2022)。美国政府通过参与VBI,可以在数据治理和安全协议的制定中发挥影响力,确保开放数据的使用有适当的安全边界。

第三,产业竞争力。 生物技术是美国最具竞争优势的产业之一。如果生物AI成为下一个变革性技术平台,确保美国在数据和模型方面的领先地位具有明确的产业政策意义。2024年拜登政府签署的关于AI安全的行政命令中,已经明确将生物AI列为需要特别关注的领域。


四、开放数据集竞争格局:VBI是唯一的玩家吗?

VBI的18亿美元规模令人瞩目,但它并非在真空中运作。全球范围内,多个大型生物学数据项目正在并行推进:

Human Cell Atlas(HCA): 这是一个由Wellcome Sanger Institute和Broad Institute等机构于2016年发起的国际合作项目,目标是绘制人体所有细胞类型的参考图谱。HCA已经积累了大量的单细胞测序数据(截至2026年,已覆盖超过1亿个细胞的转录组数据),但其数据的AI就绪程度参差不齐,且项目的资金来自分散的多国资助机构,缺乏统一的数据标准。

UK Biobank: 英国的UK Biobank拥有约50万参与者的基因组、影像和临床数据(据UK Biobank官网),是全球最有价值的生物医学队列数据库之一。2023年,UK Biobank完成了全部参与者的全基因组测序,进一步提升了其数据价值。但UK Biobank的数据主要面向流行病学和遗传学研究,在单细胞分辨率和多组学整合方面存在不足。

NIH的All of Us项目: 美国NIH主导的All of Us项目目标是收集100万名美国人的基因组和健康数据,重点关注人群多样性。截至2025年底,该项目已收集超过75万名参与者的数据 (来源: All of Us Research Program官网)。但该项目的数据类型以基因组和电子健康记录为主,缺乏VBI所强调的单细胞和空间组学数据。

中国的相关项目: 中国在基因组学数据生成方面投入巨大,华大基因等机构拥有全球领先的测序产能。中国国家基因组科学数据中心(NGDC)已建立了多个大型生物数据库。但中国的生物学数据在国际开放共享方面面临政策限制(特别是2023年修订的《人类遗传资源管理条例》对跨境数据传输的严格管控),且数据标准与国际社区的兼容性有待提升。

欧盟的相关布局: 值得注意的是,欧盟在生物数据治理方面有独立的立场。GDPR对人类生物数据的严格保护要求,以及2024年生效的欧盟AI法案对高风险AI系统(包括医疗AI)的监管框架,可能使欧洲研究机构在使用VBI数据时面临额外的合规挑战。这也是VBI的”全球开放”承诺在实际执行中可能遇到的摩擦点之一。

VBI相对于这些项目的独特优势在于三点:

  1. 规模和集中度。 18亿美元的集中投入远超上述任何单一项目的年度预算,使VBI能够进行大规模、系统性的数据生成,而非依赖分散的个体实验室。

  2. AI原生设计。 VBI从一开始就以”AI就绪”为核心设计原则,这意味着数据的格式、标注、质量控制和访问接口都将为AI模型训练而优化。这与传统的生物学数据库(主要为人类研究者设计)有本质区别。具体而言,VBI计划采用统一的细胞本体论(Cell Ontology)标注体系、标准化的实验批次效应校正流程,以及面向张量计算优化的数据存储格式。

  3. 公私联合体的执行力。 科技巨头的技术能力+联邦政府的基础设施+慈善基金会的灵活资金,这种组合在执行效率上可能优于纯政府项目或纯学术合作。

但VBI也面临显著的挑战和风险:

风险1:数据标准的政治化。 当Meta、Google DeepMind和联邦政府共同制定数据标准时,标准的设计不可避免地会反映这些参与者的技术偏好和战略利益。这可能导致其他参与者(特别是欧洲和亚洲的研究机构)对标准的接受度不高,削弱数据的全球通用性。

风险2:开放承诺的可持续性。 18亿美元听起来很多,但分摊到5-10年的项目周期和多个参与方,每年的实际投入可能在1.5亿-3亿美元之间——这个数字虽然可观,但与单个大型制药公司的年度研发支出相比并不惊人(例如Roche 2025年研发支出约为150亿美元)。如果参与方的战略优先级发生变化(例如Meta削减非核心业务投入,或联邦政府换届后调整科研政策),开放数据的承诺可能难以持续。

风险3:从数据到模型的”最后一公里”。 VBI专注于数据层,但数据本身不产生价值——价值来自于在数据上训练的模型和由模型驱动的应用。如果数据是开放的,那么谁能最先、最好地利用这些数据构建突破性模型,将决定这18亿美元投入的最终回报流向何方。


五、生物AI是下一个超级赛道吗?一个冷静的评估

在过去两年的AI热潮中,”生物AI”频繁被提及为”下一个万亿美元机会”。VBI的18亿美元投入似乎进一步验证了这一叙事。但我们需要对这个问题进行更冷静的评估。

看多的理由

理由1:生物学是”数据最丰富但模型最落后”的科学领域。 基因组测序成本的指数级下降是最有力的证据:2003年完成的人类基因组计划耗资约27亿美元(据NHGRI官方数据,这是项目的直接测序成本),而到2026年,Illumina和Ultima Genomics等公司已将单次全基因组测序成本降至100-200美元区间(据NHGRI Genome Sequencing Cost追踪数据)。这意味着生物学数据的生成速度正在爆炸式增长。但与此同时,我们对这些数据的理解和利用能力远远跟不上。这个”数据-理解”的鸿沟正是AI最擅长填补的。

理由2:AlphaFold已经证明了概念。 AlphaFold不仅解决了一个50年的科学问题,还催生了一系列商业应用——从药物靶点发现到酶工程。Isomorphic Labs与Eli Lilly和Novartis的合作协议总价值超过30亿美元,证明了制药行业对AI驱动的结构生物学的付费意愿。如果下一代生物AI模型能够从蛋白质结构预测扩展到细胞功能预测,其商业价值将呈指数级放大。

理由3:制药行业的AI化是不可逆的趋势。 据EvaluatePharma 2025年度报告,全球制药行业2025年的研发支出约为2480亿美元,但药物从Phase I临床试验到最终获批的整体成功率仅约7.9%(据BIO/QLS Advisors 2024年发布的Clinical Development Success Rates报告)。任何能够显著提高研发效率的AI工具都将拥有巨大的市场空间。

看空的理由

理由1:生物学的复杂性远超自然语言。 大语言模型的成功部分归因于语言的结构化特性——语法规则、语义关联、上下文依赖等。但生物学系统的复杂性是另一个量级:一个人体细胞包含约2万个蛋白质编码基因、数十万种蛋白质、无数的代谢物和信号分子,它们之间的交互网络在不同组织、不同时间、不同环境下都在动态变化。用当前的AI架构(主要是Transformer及其变体)来建模这种复杂性,可能存在根本性的局限。正如MIT教授Manolis Kellis所指出的,生物学系统的因果结构与语言的统计结构有本质差异——前者需要理解物理化学约束下的因果机制,而非仅仅是模式关联。

理由2:数据≠理解。 即使VBI成功生成了海量的高质量数据,AI模型能否从这些数据中学到真正的生物学规律,仍然是一个开放问题。深度学习模型擅长模式识别,但生物学中许多关键现象(如基因调控网络的涌现行为、进化适应的机制)可能需要的不仅仅是模式识别,还需要因果推理和机制理解——这些是当前AI的短板。2025年发表在Science上的一项元分析研究发现,现有的基因表达预测模型在跨细胞类型泛化时,性能下降幅度高达40-60%,表明这些模型可能更多地学到了数据中的统计捷径而非真正的生物学规律。

理由3:商业化路径漫长且不确定。 从AI模型到可销售的药物或诊断产品,中间隔着临床试验、监管审批和商业化运营等多个环节,每个环节都有高失败率和长周期。Recursion Pharmaceuticals——生物AI领域最知名的上市公司之一——自2021年IPO以来,尚未有任何AI发现的药物进入Phase III临床试验。生物AI的商业回报可能需要10-15年才能真正兑现,这对于追求短期回报的投资者来说是一个巨大的挑战。

我的判断

生物AI将成为一个重要的技术赛道,但不太可能复制大语言模型的爆发式增长轨迹。

原因在于:大语言模型的成功依赖于一个关键条件——互联网上已经存在海量的、高质量的、标准化的文本数据。模型的突破主要是算法和算力层面的,数据层面的瓶颈相对较小。

但生物AI面临的是一个根本不同的局面:数据是最大的瓶颈,而数据的生成需要湿实验(wet lab experiments),这意味着物理世界的速度限制。 你不能像抓取网页一样”抓取”细胞数据——每一个数据点都需要真实的生物样本、真实的实验操作和真实的时间。VBI的18亿美元投入正是为了突破这个瓶颈,但即使一切顺利,大规模数据集的建成也需要数年时间。

因此,生物AI更可能呈现一种”慢热但持久”的增长模式:近期(1-3年)以数据基础设施建设和基础模型研发为主,中期(3-7年)开始在药物发现、诊断和农业等领域产生可量化的商业价值,长期(7-15年)可能真正实现”虚拟细胞”的愿景,从根本上改变生物医学研究和医疗健康产业。


六、大多数人没看到的:数据层的控制权之争

现在让我们触达第三层洞察——大多数人没看到的东西。

VBI被包装为一个”开放科学”的故事,但在开放的表面之下,一场关于数据层控制权的博弈正在展开。

洞察1:数据标准即权力。

在AI领域,谁定义了数据标准,谁就在很大程度上决定了模型的架构选择和训练方式。VBI的数据标准将由CZ Biohub、Meta和Google DeepMind共同主导制定。这意味着这些标准将天然地适配这些机构的技术栈和模型架构。一个使用PyTorch(Meta的框架)训练的生物AI模型,和一个使用JAX(Google的框架)训练的模型,对数据格式和接口的需求可能存在微妙但重要的差异。

这不是阴谋论——这是技术标准制定中的常见现象。正如USB标准的制定由Intel和Microsoft主导,最终有利于x86生态一样,VBI的数据标准将不可避免地反映其主导者的技术偏好。一个具体的例子:如果VBI选择以AnnData(Python生态中的标准单细胞数据格式)作为核心数据格式,这将天然有利于Python/PyTorch生态中的研究者,而对使用R语言Seurat生态的大量生物学家形成额外的迁移成本。

洞察2:开放数据的”先发优势”。

数据是开放的,但利用数据的能力不是。Meta拥有全球最大的GPU集群之一(截至2026年,Meta已部署超过60万块H100 GPU),Google DeepMind拥有全球最大的TPU集群。当VBI的数据集发布时,这两家公司将是第一批能够在上面进行大规模模型训练的机构。学术界和小型初创公司虽然也能访问数据,但在算力方面的差距意味着它们在模型竞赛中将处于结构性劣势。

这与大语言模型领域的格局如出一辙:Common Crawl是开放的,Wikipedia是开放的,但只有拥有数十亿美元算力预算的机构才能在这些数据上训练出GPT-4级别的模型。

洞察3:VBI可能重塑生物技术的产业结构。

如果VBI成功,它将创造一个新的产业分层:

  • 数据层(VBI及其开放数据集)→ 公共基础设施
  • 模型层(基础生物AI模型)→ 由少数技术巨头主导
  • 应用层(药物发现、诊断、农业等)→ 由生物技术公司和制药公司主导

这种分层结构与当前的云计算产业非常相似:基础设施(AWS、Azure、GCP)由少数巨头垄断,应用层则百花齐放。在生物AI领域,Meta和Google DeepMind正在争夺的,正是”模型层”的主导权——这是价值链中利润率最高的环节。

洞察4:这是一场关于”生物学语言”的定义权之争。

大语言模型的成功,本质上是因为它们学会了”人类语言”的统计规律。下一代生物AI模型要做的,是学会”生物学的语言”——基因组序列、蛋白质结构、细胞状态、组织功能之间的映射关系。

谁的模型最先、最好地学会了这种”语言”,谁就将拥有生物学领域的”GPT时刻”。VBI的数据集就是这种”语言”的语料库。Meta和Google DeepMind之所以愿意投入巨资参与一个开放数据项目,是因为它们相信自己在模型层面的优势足以确保它们成为这种”语言”的最佳解读者。

洞察5:被忽视的”实验自动化”维度。

大多数对VBI的讨论聚焦于数据和模型,但一个被严重低估的维度是实验自动化。VBI的数据生成计划隐含着对高通量自动化实验平台的大规模投资。这些平台一旦建成,其价值不仅限于VBI本身——它们将成为生物学研究的永久性基础设施,大幅降低未来所有生物学实验的边际成本。这意味着VBI的真正遗产可能不是数据集本身,而是它催生的实验自动化能力——这将从根本上改变生物学研究的经济学。


七、对立视角与综合判断

乐观视角:生物AI的”登月计划”

支持者认为,VBI代表了生物学研究范式的根本性转变——从假说驱动的小规模实验,转向数据驱动的大规模模型构建。就像人类基因组计划在2003年完成时看似”只是”一堆序列数据,但随后催生了整个基因组医学产业(据NIH估算,人类基因组计划每投入1美元产生了约178美元的经济回报)一样,VBI的数据集可能在未来10-20年内催生我们今天无法想象的应用。

18亿美元的投入虽然巨大,但与全球制药行业每年约2480亿美元的研发支出相比仍然是九牛一毛。如果VBI能够将药物研发的成功率提高哪怕几个百分点,其投资回报率将是天文数字。

此外,开放数据的模式意味着全球数万名生物学家和AI研究者都将成为这一倡议的”免费劳动力”——他们将利用VBI的数据产生新的发现、新的模型和新的应用,形成一个正反馈循环。

悲观视角:又一个”大而无当”的科研项目?

批评者可能会指出,科学史上不乏雄心勃勃但最终未能兑现承诺的大型数据项目。ENCODE计划(Encyclopedia of DNA Elements)在2012年宣布已经”功能性标注”了人类基因组的80%,但这一说法至今仍有争议——2013年发表在Genome Biology and Evolution上的一篇论文尖锐地批评ENCODE混淆了”生化活性”与”生物学功能”,许多生物学家认为其数据的实际价值被严重高估。

此外,18亿美元的”承诺”与实际到位的资金之间往往存在巨大差距。特别是涉及多个参与方的联合承诺,资金的实际落地可能受到预算周期、政策变化和机构优先级调整的影响。2025年美国联邦政府的科研预算已经面临削减压力,VBI的联邦资金部分能否如期到位存在不确定性。

更根本的质疑是:我们是否真的知道需要什么样的数据?AI模型的数据需求是由模型架构决定的,而生物AI的模型架构仍在快速演化中。今天花巨资生成的数据,可能在5年后被证明不是下一代模型所需要的。正如2015年大量生成的ImageNet风格数据集,在自监督学习和生成式AI时代的价值已经大幅下降。

我的综合判断

VBI是一个方向正确但执行风险巨大的战略押注。

方向正确,是因为数据确实是生物AI的核心瓶颈,而系统性的、AI就绪的数据生成确实需要这种规模的集中投入。

执行风险巨大,是因为:

  1. 18亿美元分散在多个参与方和多年周期中,实际的年度投入可能不足以产生质变;
  2. 数据标准的制定和多方协调是一个极其复杂的治理挑战——特别是在涉及人类生物数据时,隐私保护、知情同意和跨境数据传输等问题将大幅增加协调成本;
  3. 从数据到模型到应用的价值链很长,任何一个环节的失败都可能导致整体投入的浪费。

但即使VBI只实现了其目标的一部分,它也将显著推进生物AI领域的发展。在一个数据匮乏的领域,任何系统性的数据生成努力都是有价值的。关键的判断标准不是VBI是否能实现”虚拟细胞”的终极愿景,而是它是否能在3-5年内产出足够高质量的数据,使生物AI模型的性能出现可测量的阶梯式提升。


八、So What:这对你意味着什么?

对于不同的读者群体,VBI的启动有不同的含义:

如果你是AI/生物技术投资者: 关注”模型层”而非”数据层”。VBI的数据是开放的,因此数据本身不构成竞争壁垒。真正的投资机会在于那些能够最有效地利用这些数据构建模型和应用的公司。关注Meta的ESM系列模型和Google DeepMind的AlphaFold后续项目的进展,以及能够将基础模型转化为制药和诊断应用的中间层公司(如Recursion Pharmaceuticals、Insitro、Relay Therapeutics等)。同时,实验自动化设备和服务提供商(如Automata、Strateos等)可能是被低估的受益者。

如果你是生物学/AI研究者: VBI的开放数据集将是一个巨大的机遇。但要注意数据标准的制定过程——尽早参与标准讨论,确保你的研究需求被考虑在内。同时,开始思考如何将你的实验数据与VBI的标准对接,以最大化你的数据的价值和影响力。对于计算生物学研究者,现在是投资多组学整合分析能力的最佳时机。

如果你是制药/生物技术行业从业者: 生物AI不会在短期内颠覆你的工作流程,但它将在中期内深刻改变药物发现和开发的方式。开始建立AI能力——不仅仅是雇佣几个数据科学家,而是从组织层面思考如何将AI整合到你的研发管线中。关注VBI数据集的发布时间表,评估哪些数据类型与你的治疗领域最相关。

如果你是政策制定者: VBI的模式——公私合作、开放数据、国际协调——可能成为其他科学领域的模板。但要警惕数据治理中的权力不对称:当科技巨头主导数据标准时,确保公共利益不被商业利益侵蚀,是政策制定者的核心责任。特别是在人类生物数据的隐私保护和跨境传输方面,需要建立清晰的法律框架。

如果你是普通读者: 记住这个时刻。就像1990年人类基因组计划启动时,大多数人无法想象它将如何改变医学一样,VBI可能是生物学进入”AI时代”的标志性事件。它的影响不会在明天显现,但在10-20年后回头看,2026年10月可能是一个转折点。


结语

18亿美元,三方联合,开放数据。VBI的故事看起来像一个关于科学合作和人类福祉的美好叙事。但在这个叙事之下,是一场关于数据控制权、模型主导权和产业结构重塑的深层博弈。

下一个AlphaFold,谁来写?答案可能不取决于谁拥有最好的算法,而取决于谁最先、最好地利用了VBI这样的数据基础设施。 在这场竞赛中,Meta和Google DeepMind已经占据了先发位置。但开放数据的本质意味着,任何拥有足够算力和创造力的参与者都有机会。

生物AI的”GPT时刻”还没有到来。但建造它的基础设施,已经开始了。而真正值得关注的,不是这18亿美元本身,而是它所催生的数据标准、实验自动化能力和产业分层结构——这些才是将在未来20年持续塑造生物技术产业的底层力量。


参考资料

  1. Virtual Biology Initiative — CZ Biohub Network Official Announcement — CZ Biohub Network, 2026-10-07
  2. Biohub, Meta, Google DeepMind and the US pool $1.8bn for AI biology data — The Next Web, 2026-10-07
  3. Biohub, DOE, NIH and Partners Commit $1.8B to Virtual Biology Initiative — Unite.AI, 2026-10-07
  4. International, cross-sector collaboration commits nearly $2 billion to build foundational data for AI models — PR Newswire, 2026-10-07
  5. Accurate structure prediction of biomolecular interactions with AlphaFold 3 — Nature, 2024-05-08
  6. The Nobel Prize in Chemistry 2024 — Press Release — Nobel Prize官网, 2024-10-09
  7. Clinical Development Success Rates and Contributing Factors 2011–2020 — BIO/QLS Advisors, 2024
  8. DNA Sequencing Costs: Data — NHGRI, 持续更新
  9. Dual use of artificial-intelligence-powered drug discovery — Nature Machine Intelligence, 2022-03-07
  10. Zuckerberg teams with Google, U.S. in push to map cells — Axios, 2026-10-07

主题分类:D+F类-应用落地/地缘