2026年8月,距离General Intuition上一轮融资仅仅过去了不到2个月,Valor Equity Partners和Point72 Ventures联合入局,将这家公司的估值推至60亿美元。(来源: TechCrunch, 2026-08-24) 这个数字本身并不罕见——Physical AI赛道的估值泡沫早已让人习以为常。真正值得深究的是速度:2026年6月,General Intuition的估值还是23亿美元;8月,这个数字几乎翻了3倍。(来源: aiweekly.co, 2026-08) 两个月,两倍估值,发生了什么?

答案不在于公司的营收增长,也不在于某个产品的突破性发布——至少从公开信息来看,没有任何里程碑式的商业化事件触发了这次估值跃升。真正发生的,是资本市场对一个核心命题的重新定价:游戏视频,能不能训练出有物理直觉的机器人?

这个问题听起来像是一个极客的奇思妙想,但它背后牵涉的技术逻辑、数据经济学和产业格局,正在重塑Physical AI的竞争边界。


第一章:60亿美元的速度——2个月内发生了什么

要理解General Intuition的估值轨迹,首先需要还原时间线的密度。

2026年6月25日,TechCrunch发布了一篇题为《General Intuition’s $2.3B bet that video games can train AI agents for the real world》的报道,这是这家公司第一次大规模进入主流科技媒体的视野。(来源: TechCrunch, 2026-06-25) 彼时的叙事重心是AI智能体——用Fortnite等游戏中的视频数据训练能够理解物理世界交互的AI系统。23亿美元的估值已经不低,但在当时的语境下,这更像是一个”有趣的AI实验”,而非一个即将颠覆产业的技术平台。

仅仅13天后,2026年7月8日,另一篇TechCrunch报道出现了截然不同的叙事框架——《This startup thinks robotics is about to have its ChatGPT moment》。(来源: TechCrunch, 2026-07-08) 注意这个叙事转换的精确性:从”AI智能体”到”机器人的ChatGPT时刻”,这不是措辞的调整,而是市场定位的根本性重构。ChatGPT时刻是一个极具感召力的概念——它意味着某个技术拐点的到来,此前分散的能力将在某个时刻突然聚合成一个能被大众感知的产品形态。将这个框架套用在机器人领域,意味着有人相信通用机器人的”涌现时刻”已经近在眼前。

到8月,Valor和Point72的入局完成了这个叙事的资本化。60亿美元的估值,是市场对”机器人ChatGPT时刻即将到来”这个命题的定价,而不是对当前营收的倍数计算。(来源: TechCrunch, 2026-08-24; Crypto Briefing, 2026-08)

这里有一个大多数报道没有充分展开的细节:Valor Equity Partners和Point72 Ventures这两家机构的组合本身就是一个信号。Valor以深度参与工业和制造业生态著称,Point72则是一家以量化和技术驱动投资策略见长的对冲基金旗下风险部门。这不是两家纯粹的AI主题基金在追逐热点,而是具有不同视角的机构同时对同一个命题下注——前者看到了工业应用的落地路径,后者看到了技术曲线的拐点信号。(来源: TechCrunch, 2026-08-24)

但我们必须在此处保持清醒:截至本文发布时,General Intuition的具体融资金额、投资人持股比例、以及公司的营收规模均无公开数据。60亿美元是估值,不是融资额;估值是市场预期的函数,不是当前价值的反映。这个区别在Physical AI赛道尤为重要,因为这个赛道的技术成熟度和商业化进度之间存在巨大的时间差。


第二章:为什么是游戏视频——数据经济学的根本逻辑

要评估General Intuition的技术赌注,必须先理解机器人训练的数据瓶颈到底有多严峻。

传统机器人学习方法面临一个近乎悖论的困境:机器人需要大量真实世界的交互数据才能学会操作物体,但收集这些数据本身就需要机器人在真实世界中不断试错。这个”先有鸡还是先有蛋”的问题,在工业机器人时代被绕开了——因为工业机器人只需要在极其有限的、高度结构化的环境中执行重复性任务,不需要”通用”能力。但当目标变成通用机器人时,这个问题就变得无法回避。

现实世界数据采集的成本结构是灾难性的。一个机器人在真实环境中完成一次有意义的操作任务,从设置场景、执行动作、记录数据到标注结果,可能需要数小时的人工时间。更关键的是,安全约束极大地限制了数据的多样性——你不能让机器人在真实环境中随意摔倒、碰撞、或者以危险方式探索边界条件,而这些”失败案例”恰恰是学习物理直觉最重要的数据来源。

游戏世界从根本上打破了这个约束体系。以Fortnite为例——这款游戏每天有数以千万计的玩家在其中执行各种物理交互:跳跃、攀爬、建造、破坏、投掷、碰撞。(来源: TechCrunch, 2026-06-25) 每一个动作背后都有物理引擎的精确计算,每一个交互结果都是可复现的、可标注的。更重要的是,游戏世界中存在大量在真实世界中极难复现的”极端物理场景”——从高处坠落、在复杂地形中导航、在动态障碍物中快速移动——这些场景对于训练鲁棒的物理直觉至关重要,但在真实环境中收集这类数据的代价要么极其高昂,要么根本不可能。

这里有一个更深层的数据经济学逻辑,通常被表面叙事所掩盖:游戏数据的价值不仅在于量,更在于其内在的”标注密度”

在自然语言处理领域,互联网上的文本数据之所以能训练出GPT这样的模型,是因为文本本身就携带了丰富的语义结构——词与词之间的关系、句子的逻辑结构、段落的主题连贯性,这些都不需要额外标注,而是隐含在数据本身的结构中。这就是所谓的”自监督学习”的核心前提。

物理世界的视频数据在这个维度上远不如文本——一段机器人操作的视频,如果没有额外的标注,很难从中提取出”哪个动作导致了哪个结果”的因果关系。但游戏视频不同:游戏引擎本身就是一个完整的因果模型,每一帧画面背后都有精确的物理状态(位置、速度、碰撞检测、力的传导),这些状态数据可以作为视频的”天然标注”被提取出来。换句话说,游戏不只是提供了视频,而是提供了带有完整物理状态标注的视频——这是真实世界数据几乎无法复制的优势。

当然,这里存在一个重要的反驳视角:游戏物理引擎的精确性是有限的。Fortnite的物理引擎是为游戏体验优化的,而不是为物理精确性优化的——它可能在某些方面过度简化了真实物理(比如空气阻力、材料形变、摩擦系数的复杂性),在另一些方面则为了游戏性而刻意扭曲了物理规律(比如角色的跳跃弧度)。如果模型从这样的数据中学习,它学到的”物理直觉”是否真的能迁移到真实世界?

这是一个真实存在的技术挑战,我们将在第四章详细讨论。但在此处,需要先确立一个基本判断:即使游戏物理是不完美的,它仍然比”没有数据”或”极少量昂贵的真实数据”要好得多。机器学习的历史一再证明,数据规模和多样性对模型性能的影响往往超过数据质量的小幅提升——只要数据的”错误”是系统性可校正的,而不是随机噪声。


第三章:LAM vs LLM——两条Physical AI路线的根本分歧

理解General Intuition的技术路线,必须先理解它在对抗什么。

当前Physical AI领域存在两条主流技术路线,它们在架构假设、数据需求和能力边界上存在根本性分歧。

LLM驱动的路线,可以粗略地称为”语言-动作分离架构”。这条路线的核心假设是:大型语言模型已经积累了足够丰富的世界知识和推理能力,机器人需要做的是将LLM的语言规划能力”翻译”成物理动作。典型的实现方式是一个两层架构:上层是LLM,负责理解任务指令、进行高层规划(”拿起红色方块,放到蓝色托盘上”);下层是专门的动作控制模块,负责将高层指令转化为关节角度、力矩控制等低层执行命令。

这条路线的优势显而易见:它可以充分复用LLM在语言理解、常识推理和任务规划方面的能力,而这些能力已经被证明是可以大规模迁移的。OpenAI、Google DeepMind等大型AI实验室在这个方向上投入了大量资源,相关研究成果已经展示出令人印象深刻的任务规划能力。

但这条路线有一个深层的结构性缺陷:语言是对物理世界的抽象描述,而不是物理世界本身。当LLM说”拿起杯子”时,它处理的是”拿起”和”杯子”这两个词的语义关系,而不是”手指如何施加力、如何感知杯子的重量和摩擦系数、如何在不打翻杯子的情况下调整握力”这一系列物理交互的细节。这种从语言空间到物理空间的”翻译”,在任务足够简单时可以奏效,但随着任务复杂度的增加,翻译的误差会急剧累积。

更根本的问题是,LLM的训练数据主要是文本,其中关于物理世界的描述是稀疏的、不精确的、缺乏时序动态的。语言可以描述”玻璃杯很脆”,但无法传达”以多大的力度敲击会导致玻璃杯破裂”这样的定量物理知识。人类之所以知道如何小心地放下玻璃杯,不是因为我们读过关于玻璃脆性的文章,而是因为我们从小就积累了大量的物理交互经验——我们有”肌肉记忆”,而LLM没有。

LAM(Large Action Model,大型动作模型)路线,是对上述缺陷的直接回应。这条路线的核心假设是:物理直觉必须从动作数据中直接学习,而不能从语言数据中间接推导。LAM的目标是构建一个端到端的模型,直接从感知输入(视频、传感器数据)映射到动作输出,中间不经过语言的”翻译”步骤。

General Intuition的技术路线正是押注在LAM方向上。(来源: TechCrunch, 2026-06-25) 其核心命题是:游戏视频提供了人类通过身体交互积累的那种”物理经验”的数字化替代品——不是对物理世界的语言描述,而是物理交互本身的视觉记录,配合游戏引擎提供的物理状态数据,可以训练出真正具有物理直觉的动作模型。

这里有一个概念需要精确区分:“世界模拟器”(World Simulator)并不等同于”物理模拟器”。物理模拟器的目标是精确重现真实世界的物理规律;而世界模拟器的目标是建立一个足够丰富的内部模型,使得AI系统能够在这个内部模型中进行”心理模拟”——在真正执行动作之前,预测动作的后果。这个区别至关重要:LAM不需要完美地模拟物理世界,它只需要建立一个足够好的内部模型,使得它能够做出合理的行动决策。

从这个角度看,游戏视频的”物理不精确性”反而可能是一种优势:它迫使模型学习物理规律的鲁棒特征(重力总是向下、硬物体碰撞会产生反弹、液体会流动),而不是过拟合于某个特定物理引擎的精确参数。这与LLM训练中”噪声数据有助于泛化”的经验教训有相似之处。

然而,LAM路线也面临LLM路线不需要担心的挑战:动作空间的维度远高于语言空间。语言模型的输出空间是一个有限的词表(即使是百万级别的词汇量,也是离散的、有限的);而动作模型的输出空间是连续的、高维的——一个人形机器人可能有数十个自由度,每个自由度的控制信号都是连续值。如何在这样的高维连续空间中进行有效的学习和泛化,是LAM路线面临的核心技术挑战之一。

两条路线的对比,揭示了一个更深层的认识论分歧:Physical AI的”智能”究竟是什么性质的智能?

LLM路线隐含地假设物理智能是语言智能的一个子集——只要语言模型足够强大,它就能通过推理解决物理问题。LAM路线则主张物理智能是一种独立的智能形态,它有自己的数据基础、学习机制和评估标准,不能被语言智能所替代,只能通过大量的物理交互数据从头构建。

这个分歧不只是技术路线的选择,更是对”什么是通用智能”这个根本问题的不同回答。


第四章:从虚拟到现实的迁移——Sim-to-Real Gap的真实代价

任何严肃讨论General Intuition技术路线的分析,都必须正面回答Sim-to-Real Gap问题。这不是一个可以被”技术进步”轻描淡写带过的挑战——它是物理AI领域数十年来悬而未决的核心难题。

Sim-to-Real Gap的本质是什么?简单说,就是在模拟环境中训练出来的模型,在真实世界中的表现往往大幅下降。这种性能下降有多个来源:

视觉域差异(Visual Domain Gap):游戏渲染引擎产生的图像,无论多么精致,与真实世界的相机图像在纹理细节、光照条件、噪声特征等方面都存在系统性差异。深度学习模型对这些差异极其敏感——一个在游戏图像上训练的视觉模型,在面对真实相机图像时,可能无法正确识别它在游戏中学会识别的物体。这个问题在过去几年通过”域随机化”(Domain Randomization)技术得到了部分缓解——在训练时随机化光照、纹理、颜色等视觉参数,迫使模型学习与视觉风格无关的鲁棒特征。但这种方法有其局限性:过度的随机化会降低学习效率,而不足的随机化则无法覆盖真实世界的多样性。

物理参数差异(Physics Parameter Gap):游戏物理引擎的参数(摩擦系数、弹性系数、质量分布等)与真实物理之间存在差异。更重要的是,游戏物理通常是离散时间步长的模拟,而真实物理是连续的。在高频动作控制场景下(比如机器人手臂的精细操作),这种离散化误差会导致显著的行为差异。

感知-动作耦合差异(Perception-Action Coupling Gap):这是最难被量化、也最容易被忽视的差异。真实机器人的传感器(相机、力传感器、触觉传感器)在延迟、噪声特征、测量精度上与游戏模拟的传感器模型存在差异。更关键的是,真实机器人的动作执行存在机械延迟和误差——发出一个关节角度指令,到实际关节到达目标位置,之间有不可忽视的时间延迟和精度误差。这种延迟和误差在游戏环境中通常被理想化处理,导致模型在真实环境中面对”不听话”的执行器时表现失常。

General Intuition对这些挑战的具体技术方案,截至本文发布时暂无详细公开数据。但从已有的公开信息来看,其技术路线的核心赌注是:游戏视频训练出的大型动作模型,其泛化能力足以跨越Sim-to-Real Gap,至少在足够多的任务类别上实现可用的迁移效果。(来源: TechCrunch, 2026-06-25)

这个赌注有多大?让我们用一个具体的对比来校准。

在自动驾驶领域,Sim-to-Real迁移的失败案例已经积累了十年以上的历史教训。Waymo、特斯拉等公司最终都不得不依赖大量真实世界数据来弥补模拟数据的不足——模拟数据可以作为补充,但无法替代真实数据。自动驾驶的物理交互相对简单(主要是二维平面运动),Sim-to-Real Gap尚且如此难以克服;机器人操作涉及三维空间中的精细物理交互,其复杂度远超自动驾驶,Sim-to-Real Gap只会更难跨越。

但这里有一个重要的反驳:自动驾驶的Sim-to-Real失败,很大程度上是因为模拟环境无法精确复现真实世界驾驶场景的长尾分布——罕见的天气条件、异常的道路标记、突发的行人行为。而游戏视频的价值,恰恰在于它可以提供极其丰富的”长尾物理场景”——各种极端条件下的物理交互,这些场景在真实数据中几乎不可能被充分覆盖。如果LAM从游戏数据中学到的是物理规律的鲁棒表示,而不是特定视觉场景的记忆,那么Sim-to-Real迁移的成功率就会大幅提升。

这里出现了一个关键的技术分叉点:General Intuition的成功与否,在很大程度上取决于其模型架构是否能够实现”物理规律的抽象学习”,而不是”游戏场景的过拟合记忆”。这两者的区别,在训练阶段的评估指标上很难区分,只有在真实世界的部署中才会充分暴露。

从公开信息来看,General Intuition选择Fortnite等具有高度多样化场景的游戏作为数据来源,而不是使用专门的物理模拟器,这个选择本身透露了一些技术策略的线索。(来源: TechCrunch, 2026-06-25) Fortnite的游戏世界包含了极其多样的地形、建筑结构、物体类型和交互方式,这种多样性有助于防止模型过拟合于特定场景。相比之下,专门的物理模拟器(如MuJoCo、PyBullet)虽然物理精度更高,但场景多样性极其有限,训练出的模型往往在新场景中表现急剧下降。

这是一个”宁要多样不完美,不要精确但单一”的数据策略选择,其背后的理论依据与LLM训练中”互联网数据的多样性比精心策划的数据集更重要”的经验发现一脉相承。


第五章:资本逻辑与技术现实的张力

在深入讨论了技术层面之后,有必要回到一个更基本的问题:60亿美元的估值,对应的是什么样的预期?

Valor和Point72的入局,将General Intuition的叙事从”AI智能体公司”升级为”机器人基础设施公司”。(来源: TechCrunch, 2026-08-24; Startupfortune, 2026-08) 这个叙事升级的商业逻辑是:如果LAM路线成立,那么拥有核心大型动作模型的公司,将成为整个机器人产业链的基础层——就像GPU之于深度学习、CUDA之于GPU计算一样,LAM将成为机器人应用的必要基础设施。

这个逻辑在结构上是正确的,但它隐含了一个巨大的不确定性:LAM路线是否真的能成为机器人产业的基础层,还是会成为众多技术路线中的一条细分路径?

Physical AI赛道目前并不缺乏资本,但它极度缺乏的是”证明某条技术路线可行”的关键实验结果。在这种情况下,资本的流向往往由叙事的吸引力而非技术的可验证性决定。”游戏视频训练机器人”这个叙事,在直觉上极具吸引力——它让人联想到人类婴儿通过游戏学习物理世界的方式,它暗示了一条绕开昂贵真实数据的捷径,它将游戏产业数十年积累的内容资产转化为AI训练数据的宝库。

但叙事的吸引力和技术的可行性是两个不同的维度。在这个阶段,我们无法从公开信息中判断General Intuition的LAM是否真的能在真实机器人上实现可用的性能。(来源: pymnts.com, 2026-08) 60亿美元的估值,本质上是对这个不确定性的一次期权定价——如果LAM路线成立,这个估值可能极度低估了公司的价值;如果路线失败,这个估值将归零。

这里有一个更微妙的竞争格局分析,通常被宏大叙事所掩盖:General Intuition并不是在真空中竞争。LLM驱动的Physical AI路线,背后站着的是OpenAI、Google DeepMind、Meta等拥有极强计算资源和工程能力的巨头。这些公司的LLM路线并非静止不动——它们正在通过多模态训练、具身AI研究等方向,逐步将视频理解和物理推理能力整合进LLM架构。如果LLM路线在未来2-3年内实现了足够好的物理推理能力,LAM路线的独特价值将大幅缩水。

反过来说,LAM路线的支持者会指出:大型AI公司的研究重心和商业重心都在语言AI和多模态AI,Physical AI只是它们众多研究方向中的一个。一家专注于LAM的创业公司,可以在这个垂直领域投入远超大公司的相对资源,从而建立技术护城河。这个论点在历史上有一定依据——专注的创业公司在垂直领域往往能超越大公司的通用解决方案,至少在技术成熟的早期阶段。

两个视角都有其合理性。我的判断是:在未来18-24个月内,LAM路线和LLM路线将并行发展,各自在不同的任务类型和应用场景中占据优势,而不会出现一方完全取代另一方的局面。LAM在需要精细物理操作、低延迟响应的任务中将展现出优势;LLM在需要复杂任务规划、语言交互和常识推理的场景中将保持优势。真正有价值的问题不是”哪条路线会赢”,而是”两条路线如何融合,以及谁来主导融合的方式”。


第六章:游戏产业的意外转型——内容资产的重新定价

General Intuition的技术路线,还有一个被大多数分析忽视的产业影响:它可能从根本上改变游戏内容资产的价值评估逻辑

如果游戏视频可以训练AI模型,那么游戏公司积累的海量游戏数据——不只是视频,还包括游戏引擎的物理状态数据、玩家行为数据、场景设计数据——就具有了超出游戏业务本身的价值。Fortnite的开发商Epic Games、《我的世界》的开发商Mojang(微软旗下)、以及众多开放世界游戏的开发商,可能坐拥的不只是游戏内容库,而是Physical AI训练数据的战略资产。

这里有一个数据授权的法律和商业问题:游戏公司是否会允许其游戏数据被用于训练AI模型?游戏视频的版权归属、游戏引擎物理数据的所有权、玩家行为数据的隐私保护,这些问题都没有清晰的法律先例。General Intuition的技术路线,将不可避免地与游戏公司在数据授权问题上发生交集——这既可能成为合作机会(游戏公司将数据资产货币化),也可能成为法律风险(游戏公司主张数据所有权)。

截至本文发布时,General Intuition与主要游戏公司之间的数据授权安排暂无公开数据。但这个问题的重要性不亚于技术本身——如果游戏公司开始系统性地主张其游戏数据的AI训练价值,General Intuition的数据护城河可能面临根本性挑战。

另一个值得关注的维度是:游戏引擎公司(Epic Games的Unreal Engine、Unity Technologies的Unity引擎)在这个生态中的潜在角色。游戏引擎不只是渲染工具,它们是完整的物理模拟平台,拥有精确的物理状态数据接口。如果游戏引擎公司决定进入Physical AI训练数据市场,它们可以提供比任何游戏视频更精确、更完整的物理交互数据。这将使General Intuition的”游戏视频”策略面临来自数据源头的竞争。


结语:当动作模型拥有了物理直觉

让我们回到那个最根本的问题:General Intuition的60亿美元赌注,押的是什么?

表面上,它押的是”游戏视频可以训练机器人”。但更深层地看,它押的是一个关于智能本质的命题:物理直觉是一种可以从视频数据中学习的能力,而不是只能通过真实世界的身体经验才能获得

这个命题如果成立,其影响将是深远的。它意味着机器人训练的数据瓶颈可以被绕开——不是通过建造更多的机器人工厂来收集真实数据,而是通过挖掘游戏世界中已经存在的海量物理交互数据。它意味着通用机器人的研发成本曲线将急剧下降,因为数据采集的边际成本从”每次试验需要真实机器人和真实场景”降低到”下载更多游戏视频”。它意味着机器人产业的竞争格局将从”谁拥有最多机器人硬件”转向”谁拥有最好的动作模型”。

这个命题如果失败——如果Sim-to-Real Gap证明无法被游戏数据所弥合——那么60亿美元将成为一个关于AI泡沫的教科书案例。

但即使在失败的情景下,General Intuition的技术探索也不会毫无价值。它将为整个领域提供关于LAM路线边界条件的关键实验数据:游戏数据可以迁移什么,不能迁移什么;哪类物理交互可以从虚拟学习,哪类必须依赖真实经验。这些数据将成为下一代Physical AI研究的基础。

从更宏观的视角看,General Intuition的崛起标志着Physical AI赛道正在进入一个新的竞争阶段。第一阶段是”语言+机器人”——用LLM让机器人听懂指令;第二阶段是”视觉+机器人”——用计算机视觉让机器人看懂世界;我们现在进入的第三阶段是”物理直觉+机器人”——让机器人真正理解物理世界的运作规律,而不只是识别物体或执行语言指令。

这第三阶段的竞争,将决定通用机器人是否真的能在本十年内从实验室走向大规模商业部署。(来源: TechCrunch, 2026-07-08)

Valor和Point72用真实的资本对这个命题投了赞成票。(来源: TechCrunch, 2026-08-24) 游戏产业数十年积累的物理世界数字化遗产,正在被重新评估其作为AI训练燃料的价值。大型动作模型的”物理直觉”,究竟能走多远——这个问题的答案,将在未来2-3年内开始浮现。

在此之前,60亿美元是一个期权,而不是一个估值。


参考资料

  1. Valor, Point72 back General Intuition at $6B valuation as AI startup pushes into robotics — TechCrunch, 2026-08-24

  2. General Intuition’s $2.3B bet that video games can train AI agents for the real world — TechCrunch, 2026-06-25

  3. From Fortnite to robots: General Intuition’s $2.3B bet that video games can train AI agents for the real world — TechCrunch, 2026-06-25

  4. This startup thinks robotics is about to have its ChatGPT moment — TechCrunch, 2026-07-08

  5. General Intuition Nearing $6B Pre-Money Round, Nearly Tripling Its $2.3B June Valuation — AI Weekly, 2026-08

  6. General Intuition raises at $6B to pilot robots via game clips — AI Weekly, 2026-08

  7. General Intuition Aims to Raise Capital to Power AI Robotics — PYMNTS, 2026-08

主题分类:openclaw