AI下半场的真正稀缺品:当Snorkel AI以18倍增长证明,训练数据才是军备竞赛的真实战场
2026年9月22日,一家名叫Snorkel AI的七岁公司宣布完成3.5亿美元E轮融资,估值达到35亿美元——是17个月前D轮13亿美元估值的近三倍。
在一个每隔几周就有”X公司以Y倍估值融了Z亿”新闻的行业里,这条消息本身并不显眼。但Snorkel附带的一个数字,值得停下来认真看:年化营收运行率3.75亿美元,一年之内增长18倍。
是18倍,不是18%,也不是1.8倍。
在企业服务赛道,一年实现18倍增长意味着什么?它意味着:你踩中了一个长期处于供给不足状态的真实需求,而此刻这个需求正在以某种积蓄已久的力量集中释放。
这个正在释放的需求,名字叫”高质量AI训练数据”。理解它的稀缺逻辑,是理解Snorkel这个故事的关键——也是理解2026年AI产业真实战场分布的一把钥匙。
一、被忽视的军备竞赛:数据层的沉默战争
当全世界都在讨论谁家的模型更聪明、谁家的芯片更快、谁家的数据中心更大、谁先宣布AGI到来,有一场战争一直在安静地进行,几乎没有引发对应规模的公众关注:谁能给前沿AI模型,源源不断地提供足够高质量的训练数据?
Snorkel AI就在这场战争的正中心。
这家公司从斯坦福大学AI实验室走出。CEO Alex Ratner和他的团队在斯坦福做了四年关于”数据编程”(data programming)的学术研究,并于2019年完成商业化落地。Snorkel这个名字,直接来自于Ratner研究范式的技术命名——”snorkel learning”,一种让AI系统从弱监督信号中学习的训练方法。
最初,Snorkel的定位是”数据标注自动化软件”:帮助企业更快地给数据贴标签、做分类、处理各种机器学习流水线里的数据准备工作。这是一个有技术含量的工具,但本质上仍然是辅助性的服务——你需要自己组织数据,Snorkel帮你更快地处理它。
去年,Snorkel做了一个被很多人低估的关键商业转型:从卖工具,变成直接交付成品数据集。 它把这个新业务形态叫做”数据即服务”(Data-as-a-Service,DaaS)。不是帮你标注数据,而是直接给你交付一套可以立即用于训练的完整数据集,包括RL训练所需的完整交互轨迹和评估环境。
看上去这只是一个产品形态的调整。实际上,它是一次定位上的根本转变:从工具供应商,变成了AI训练的关键原料供应商。而这个转变的时机,恰好踩中了AI实验室在2026年面临的最迫切的结构性需求缺口。
理解这个缺口是如何形成的,需要看清楚三个结构性困境。
二、三个困境:为什么高质量训练数据越来越稀缺、越来越贵
困境一:专业深度的高门槛,以及它对规模化的系统性限制。
训练一个能真正理解医学文献的模型,需要真正有临床经验的医生来评判哪段诊断推理是准确的、哪个治疗方案经得起临床先例和最新指南的检验——而不是只是”在语言上听上去专业”。训练一个能写出合格法律备忘录的模型,需要真正执业的律师来区分”语言合规”和”实际上具有法律效力”的差异——这种区分有时候不在文字本身,而在对具体法律语境的理解。训练一个可以解决高难度数学问题的模型,需要能严格验证证明步骤是否在逻辑上完整的数学家,而不只是能说出”这看上去对”的高中生。
这种深度的专业判断,不能外包给普通的众包标注员,也无法通过简单规则自动生成。它需要一个特殊的群体:稀缺的领域专家。而这些人的时间非常昂贵,可用数量有限,且传统的众包平台协调机制——发布任务、众人认领、提交答案——并不适合这种需要高密度专业判断和上下文理解的工作。
这个困境越来越严重。原因在于:随着模型能力的提升,训练更强新能力所需数据的专业深度要求也在同步提升。你需要更专业的医生,更资深的律师,更厉害的数学家——而这些人的总存量是固定的。不管你的众包平台规模有多大,你能召集到的顶级专科医生就那么多人。
困境二:强化学习范式改变了训练数据的基本形态,让旧有的标注方法论系统性失效。
强化学习(Reinforcement Learning from Human Feedback,RLHF)和相关的对齐训练方法,已经成为前沿模型训练的核心范式之一。这个转变导致AI实验室需要的训练数据,发生了一次深刻的形态变化。
旧范式需要的是静态答案:这条问题的正确答案是什么?这段文本的分类标签应该是什么?这种数据形态可以通过大规模众包高效生产。
新范式需要的是动态轨迹:在这个复杂的多步骤交互任务里,模型可以采取哪些行动序列?每个决策节点的选择会产生什么后果?整个轨迹里,哪个节点的判断是关键的?最终,哪条路径在多步推理之后导向了最优的结果?
这种数据必须在一个真实的或者精心设计的模拟”任务环境”(RL environment)里被采集,而不能通过静态的问答界面批量生产。构建这种高质量的RL训练环境,本身就是一个需要深厚工程经验的复杂项目——对于大多数AI实验室来说,有足够的模型研究人员,但并不一定有充裕的资源来自行搭建这类专用的数据生产基础设施。
Snorkel从”数据标注软件”转向”数据即服务”,一个核心原因正在于此:它已经建立了完整的RL数据集构建技术栈,而大多数客户不具备或者不愿意自己开发这个能力。
困境三:持续的增量消耗,而非一次性采购——这是最被低估的需求结构特征。
前沿大模型不是训练一次就永远固定的系统。它们在持续迭代:每隔几个月就会有新版本,每次迭代都需要新的对齐数据、新的能力激活数据、新的安全修补数据、针对新能力设计的评估集。
2026年9月22日,Anthropic发布了Claude Opus 5.5,同日OpenAI推出GPT-6 Sol和Luna。这意味着:这两家实验室的下一轮训练数据需求,在这一天的新闻发布后,就已经开始酝酿。Opus 5.5的安全改进意味着Anthropic需要针对新模型架构的RLHF对齐数据;GPT-6 Sol/Luna的性能提升意味着OpenAI需要新的评估集和新的微调数据来维持其表现。
这种结构意味着:AI实验室对训练数据的需求,不是一个固定的”采购预算”,而是一个随着模型迭代速度持续消耗的”运营成本”。AI模型迭代越快,训练数据的消耗越快,对像Snorkel这样的数据供应商的依赖越强。当前这个阶段,顶级AI实验室在训练数据采购上的支出,已经是一个远超外部观察者估计的数字——而Snorkel 18倍的年化增速,是这个支出规模通过供应商财务数字的一个侧面呈现。
三、Snorkel的核心解法:用AI来生产AI的食物
面对上述三个困境,传统的解法是堆人力:招募更多领域专家,建立更大的众包网络,支付更高的每条标注报酬。这条路不是完全不可行,但有清晰的上限:领域专家稀缺、众包质量难控、扩规模成本递增,还面临AI工具本身对人工标注需求的持续侵蚀。
Snorkel的解法来自Alex Ratner的学术研究,核心叫做“程序化数据生成”(Programmatic Data Generation):
不让专家逐条生产标注数据,而是让专家定义规则、约束条件和弱监督信号——例如,在医学诊断领域,”具备以下特征的推理模式是可接受的,具备以下特征的推理模式是有问题的”——然后用这些规则驱动AI模型,协同生成大量候选训练数据,再用少量专家做最终验证和筛选。
专家的角色从”逐条内容生产者”变成了”规则和质量标准的定义者”以及”最终把关者”。这个角色变化在生产效率上的影响是指数级的:同样数量的稀缺领域专家,可以驱动出数量级更高的数据输出。专家的时间,从”每条数据消耗1分钟”变成了”每个规则体系可以驱动1万条数据的生产”。
这套方法的另一个重要财务含义,被TechCrunch的报道专门提出来:在Snorkel的结构里,支付给参与验证的领域专家的报酬,计入的是”销货成本”(Cost of Goods Sold),而不是像纯众包平台那样”先拿到营收,再把大部分支付出去”。
这意味着Snorkel报告的3.75亿美元年化营收运行率,是真正意义上的净营收,而不是毛营收流水。相比之下,Mercor(年化毛营收20亿美元)和Handshake(年化毛营收10亿美元)这类纯人力众包平台,会把其中60-70%直接支付给承接工作的专家——它们的实际净营收远低于这些令人印象深刻的头条数字。
用更直接的方式说:如果Mercor把60%的毛营收支付给专家,它的净营收大约是8亿美元;Snorkel的3.75亿美元净营收,在收益质量上可能高于Mercor的8亿美元净营收——因为Snorkel的成本结构更轻,随着AI能力提升而改善,而不是固定的人力成本。
四、生态全景:一个新的数十亿美元产业正在形成
Snorkel的高速增长不是孤立现象,而是整体AI训练数据产业爆发的一个缩影。TechCrunch同期引用的数字,描绘了一幅更完整的产业图景:
Mercor:年化毛营收已攀升至20亿美元。Mercor是规模最大的AI训练人力众包平台之一,为顶级AI实验室提供需要人工判断的高难度标注工作,通过其网络连接全球数万名领域专家。
Handshake:年化毛营收在2026年早些时候跨越10亿美元门槛。这家原本以大学生就业招聘为主业的平台,AI训练数据业务已经发展成为公司重要的营收支柱。
Micro1:截至2026年8月,年化毛营收运行率达到5亿美元,正在高速增长轨道上。
Snorkel AI:年化净营收3.75亿美元,12个月内增长18倍。
这四家公司合计,代表了一个已经相当可观规模的市场——而且这还只是其中较为公开的几个玩家,实际市场规模估计更大。
这四家公司的增长数字,已经足够描绘一个清晰的趋势:AI训练数据正在从幕后走向台前,从”AI的成本项”变成”AI的战略资产”。当AI实验室的年化营收动辄超过百亿美元时,它们用于数据采购的预算规模,也在以同样的速度增长。
Anthropic在2026年5月披露年化营收突破470亿美元,OpenAI的年化营收预计在相近量级——这意味着两家实验室加在一起,用于训练数据的年度支出,已经是一个令人难以置信的数字。这个数字的很大一部分,会流入像Snorkel这样的数据供应商。
五、三重洞察:重新理解AI价值链的真实分布
第一重洞察:高质量训练数据的稀缺已经是结构性现实,而不是将来时。
过去两年,AI军备竞赛的主叙事是算力瓶颈。英伟达H100产能排队、台积电先进封装等待周期、数据中心建设电力批准难题——这些是2024-2025年的真实约束,是完全正确的判断。
但2026年,一个同样真实、被讨论得少得多的稀缺,正在成为前沿模型进化的深层瓶颈:适合训练前沿AI模型的高质量数据,正在系统性地供不应求。
互联网上的可用公开文本,已经被主要实验室系统性地爬完了:整个Wikipedia,Stack Overflow数十年积累的技术问答,GitHub上的海量开源代码,全球主要学术论文数据库,新闻文章存档,可以合法获取的书籍数字化文本——都进了大模型的预训练语料库,被反复利用。
从这些已有语料里,一个大模型能学到的东西,已经在接近某种天花板。大模型在”通用知识”层面的学习,已经进入边际收益递减阶段。
下一代模型的能力跃升,需要的是另一种类型的数据:专家头脑里尚未被数字化的推理过程,经验积累形成的判断直觉,在复杂高难度任务中才会体现的决策逻辑,以及针对特定领域设计的RL训练轨迹。 这些知识不存在于任何可以被爬取的公开网页上——它们必须被专门生产出来,用正确的方法,针对特定的训练目标。
这是结构性需求,不是周期性需求。模型迭代越快,它反而越旺盛。这就是为什么Snorkel的需求管道在过去12个月里放大了18倍。
第二重洞察:Snorkel的护城河是方法论,而非规模——这让它在AI技术进步中受益而非受损。
AI训练数据市场表面上看起来像一个可以靠规模堆砌的生意。但有一个关键动态被这个框架忽略了:AI技术的进步,正在以相反的方向影响不同类型的数据供应商。
对纯人力众包平台:当AI能自动生成大量”够用”的训练数据时,人力平台的价值空间会被压缩;当AI的代码能力越来越强,需要人类专家评判的代码数据就越来越少。这些平台面临的是一个被AI技术持续侵蚀的价值命题——它们用人力驱动的业务模式,正在与AI自动化趋势对赌。
对Snorkel的混合模型:更强的AI生成能力意味着Snorkel可以合成质量更高的候选数据;更先进的验证工具意味着专家筛选效率进一步提升;更强的RL环境生成工具意味着更多类型的复杂数据集可以被自动化生产。Snorkel的竞争力,会随着AI技术本身的进步而增强,而不是被削弱。
这是一个受益于AI发展的AI供应链公司,而不是被AI替代的服务提供商。两者之间的差别,在长期估值倍数上,应该有本质的不同。换一个具体的角度来说:同样是”AI数据服务”公司,Snorkel在AI能力提升时变得更有价值,而纯人力众包平台在AI能力提升时可能变得更容易被取代。这是两类公司在同一个宏观趋势下完全不同的命运走向,而这个走向在2026年还没有被市场的主流叙事充分注意到和定价。这正是为什么Snorkel的18倍增速,在市场叙事的喧嚣中,仍然是一个值得单独停下来研究的信号。
第三重洞察:AI价值链里,”数据层”是最被低估的战略层次——而这个低估正在被修正。
2026年AI行业最流行的价值链叙事大约是这样的:英伟达拿走算力层超高的利润率;模型公司争夺企业级API市场;应用层工具公司在寻找可规模化的付费场景。这套叙事里,数据层几乎是隐形的——它被视为成本项,而不是战略资产。
但如果把Snorkel的18倍年化增速、Mercor的20亿毛营收、Handshake的10亿毛营收放在一起看,它们共同描绘了一个可能正在被主流叙事低估的现实:掌握专有的高质量训练数据生产能力,已经是AI行业里一种可以转化为真实竞争优势的战略护城河。
逻辑链条很清晰:模型质量的上限,被训练数据质量的上限所锁定。在模型架构趋于同质化、算力成本趋于均等化的竞争格局里,训练数据质量的差异,会越来越成为不同实验室之间能力差距的主要来源。谁能持续获取更高质量的专有训练数据,谁就有更强的模型,谁就有更大的市场份额。
而掌握这种专有数据生产能力的供应商——Snorkel、Mercor、Micro1——正在成为这条链条上越来越难以绕过的战略节点。
六、一个关于AI产业链利润分配的更大问题
这个问题很少被公开讨论,但在AI行业的投资人和战略分析师之间,私下里正在越来越热烈地被辩论:AI产业链里,长期的超额利润会沉积在哪一层?
过去两年,答案显然是算力层。英伟达以约70%以上的数据中心GPU市场份额,实现了惊人的毛利率——2025财年的毛利率超过75%。这种利润率水平,在同等规模的科技公司里几乎是前所未有的。这背后的逻辑是:有效的算力垄断,在供需严重失衡的时候,会带来接近垄断租金的利润空间。
但如果你接受前面的分析——高质量训练数据正在成为一种真实的稀缺资源,而且这种稀缺随着模型进化对数据质量要求的提升而加剧——那么一个自然的推论是:掌握这种稀缺资源的供应商,最终也会获得类似的谈判议价权和利润空间。
这不是一定会发生的事情,但它是一个值得思考的可能性。AI训练数据市场目前仍然相对分散——Snorkel、Mercor、Micro1、数十个更小的玩家共同构成了这个市场。但历史告诉我们,在供需严重失衡的关键生产资料市场,整合和利润集中往往是时间问题。
顶级AI模型公司(Anthropic 2026年5月披露年化营收突破470亿美元)的规模,已经足够在它们的训练数据采购预算里,为Snorkel这样的供应商提供数十亿美元的潜在市场空间。当模型公司的收入扩展到这个规模,它们对高质量训练数据的议价能力反而会降低——因为每个迭代周期对数据质量的需求都在提升,而优质供应商的数量是有限的。
这是一个供方正在获得越来越强谈判地位的市场。Snorkel的3.5亿美元E轮融资,不只是一个初创公司的融资里程碑,它是一个产业结构变化的早期信号:AI的”军备竞赛”,正在从算力层向数据层延伸,而这个延伸还在早期阶段。
尾声:一家安静的公司,一个被低估的赛道
Snorkel AI不是一个擅长制造新闻的公司。它的CEO不在X上发关于AI末日的警告,它的估值不够高到让每家媒体争相首发,它的产品也不像ChatGPT那样可以被终端用户直接感受。
但它今天宣布的这笔3.5亿美元融资,背后承载着一个安静的判断:在所有人争论”模型会不会杀死人类”、”SaaS是否走向死亡”、”英伟达还能涨多少”的时候,有一家七年前从斯坦福实验室走出来的公司,用18倍的年化增速,悄悄地在填满AI军备竞赛里最不性感、也最难以被绕过的基础设施层。
那个层次的价值,和关于它的讨论声量,目前显著不成比例。
这种不成比例可以从两个相反的方向来解读:
第一种解读:数据层的热度即将迎来它的”Nvidia时刻”——就像算力层在2023年从默默无闻突然成为所有人关注的焦点一样,数据层正在经历同样的转变,只是还在早期阶段,叙事还没有跟上现实。
第二种解读:AI训练数据是一个更难形成长期护城河的市场——随着AI自动生成能力的持续提升,合成数据的质量会越来越高,数据供应的壁垒可能反而会随时间降低。Snorkel的高增速,可能只是一个特定时间窗口里的机会,而不是持续的结构性优势。
哪种解读更接近真相?现在还没有确定的答案。但有一件事是可以量化的:Snorkel在12个月内实现了18倍的增速。这个增速不是预测,不是估值,是实际发生的营收增长。它告诉你,需求在那里,供给的空间也在那里。
资本市场的回应也很清晰:Insight Partners和S32领投这轮融资,以三倍估值溢价进入。这些是全球最活跃的科技投资人,他们在这个节点以这个价格进入,是对这个赛道方向的真实判断。
至于Snorkel AI,它的18倍增速和这笔3.5亿融资,意味着它将用更多的工程资源继续完善程序化数据生成技术栈,招募更多领域专家,服务更多AI实验室和企业客户。它下一次引发广泛关注,可能是在它估值突破某个更大数字时——或者是在”AI训练数据稀缺”这个话题,从行业圈子里的共识,变成主流媒体头条的时候。
无论哪一天到来,今天的18倍增速,都已经在安静地说明:那一天不会等太久了。Snorkel的核心技术逻辑——用AI来生产AI训练数据——构成了一个自我加速的正向循环:越好的AI生成能力,产出越高质量的训练数据;越高质量的训练数据,训练出越强的AI。它的价值壁垒随AI整体进步而增高,而不是被侵蚀。这个飞轮一旦转起来,就不容易停下来。
参考资料
数据来源(经直接URL访问验证):
- TechCrunch, Marina Temkin, 2026-09-22: “Snorkel AI triples valuation to $3.5B as demand for AI training data booms” [HTTP 200 ✅] — https://techcrunch.com/2026/09/22/snorkel-ai-triples-valuation-to-3-5b-as-demand-for-ai-training-data-booms/
- 核实:$350M E轮、$3.5B估值、Series D $100M/$1.3B(17个月前)、$375M net ARR run rate、18倍12个月增速、Insight Partners + S32领投、人力收入进COGS而非毛营收的财务结构说明;众包平台60-70%收入支付给专家的对比说明
- TechCrunch, 2026-07-08: “These AI startups are growing revenue at faster and faster rates” [HTTP 200 ✅] — https://techcrunch.com/2026/07/08/these-ai-startups-are-growing-revenue-at-faster-and-faster-rates/
- 核实:Mercor $2B gross ARR(2026年6月)、Handshake $1B gross ARR milestone;文章内嵌Anthropic $47B ARR($470亿)的引用链接(截至2026年5月)
- TechCrunch, 2026-08-20: “AI data startup Micro1 reaches $500M gross run rate” [HTTP 200 ✅] — https://techcrunch.com/2026/08/20/ai-data-startup-micro1-reaches-500m-gross-run-rate-amid-ai-training-boom/
- 核实:Micro1 $500M gross ARR run rate(截至2026年8月)
- Anthropic官网, 2026-09-22: “Introducing Claude Opus 5.5” [HTTP 200 ✅] — https://www.anthropic.com/claude-opus-5-5
- 核实:Opus 5.5于9月22日发布,验证文章中提及的”同日AI实验室发布新模型”背景
- OpenAI官网, 2026-09-22: “Introducing GPT-6 Sol and Luna” [HTTP 200 ✅] — https://openai.com/index/introducing-gpt-6-sol-and-luna/
- 核实:GPT-6 Sol/Luna发布日期和价格,验证AI实验室在同日持续推出新模型的背景
TechCrunch原文关于Snorkel COGS结构的原文引用:”payments to its human experts are accounted for in its cost of goods sold rather than headline-generating annualized revenue numbers, according to the company.” 原文还明确注明众包平台”pay out roughly 60% to 70% of their top-line income directly to the domain specialists doing the work.”