Positron AI的8.75亿豪赌:推理专用芯片创业潮如何撬动英伟达的长尾市场
2026年9月10日,人工智能推理硬件公司Positron AI宣布完成8.75亿美元的C轮融资,投后估值达到50亿美元。这笔融资由NEA、Atreides Management、Valor Equity Partners、Andra Capital联合领投,更值得注意的是,半导体行业最权威的独立分析机构SemiAnalysis的创始人Dylan Patel,以SemiAnalysis Capital的名义亲自参与了投资,并将加入Positron的董事会。
这不是一家名不见经传的初创公司在描绘未来蓝图。Positron已经在甲骨文云基础设施上部署了超过50个机架的第一代Atlas推理系统,合作伙伴Parasail正在用这些算力运营自己的推理服务平台。Jump Trading和i3d.net也是已经确认的生产客户。换句话说,这是一家已经有真实客户、有大规模生产部署记录的推理硬件公司,现在正在用这8.75亿美元加速推进下一代芯片Asimov的流片和量产。
为什么是”现在”:人工智能算力重心的历史性转移
理解Positron这轮融资的战略意义,必须先理解一个正在加速发生的宏观转变:人工智能的计算重心,正在从模型训练阶段大规模转向推理阶段。
2020年到2023年,整个人工智能行业的核心竞争是”谁能训练出更强大的模型”。比拼的是计算集群的规模、训练数据的质量与数量、模型架构的创新程度。英伟达的数据中心显卡销量爆炸式增长,本质上是训练计算需求的集中释放。这一阶段的算力消耗逻辑相对简单:组建一个由高端显卡构成的大型计算集群,集中使用几周或几个月,完成一次大规模模型训练后,集群可以进入下一轮训练任务。
但2024年开始,随着大型商业模型进入规模化应用阶段,算力消耗的模式开始发生根本性的结构转变。每一个人工智能代理、对话助手和智能工作台,在每次被用户调用时都需要执行推理计算。用户提交一段文字,模型实时生成回应——这个计算过程就是推理。与训练不同,推理是持续不断的、高度分散的、需要全天候不间断运行的。一旦大规模代理开始进入企业和消费者场景,推理计算的总量将会远超训练计算的总量。
Positron的首席执行官Mitesh Agrawal在公司融资公告中对这一转变有非常清晰的表述:人工智能的重心正在从训练模型转向运行模型。每一个代理、助手和智能副驾都依赖推理来完成工作,而大规模服务这一需求越来越受到内存容量、内存带宽和能耗的硬性约束。
这三个约束——内存容量、内存带宽、能耗——正是现有英伟达显卡在推理场景下存在的主要效率瓶颈。英伟达的旗舰训练显卡配备了高带宽内存,这种内存在训练场景下性能出色,但在推理场景下存在系统性的低效:训练工作负载的计算密度高,能够充分利用极宽的内存带宽;而推理工作负载的批次规模通常更小、访问模式更规律,大量内存带宽实际上无法被有效使用,却仍然消耗了相应的成本和电力。
Positron的技术赌注:用低功耗内存绕开高带宽内存的瓶颈
Positron的核心技术判断建立在一个反传统认知的洞察之上:对于推理工作负载,高带宽内存不是最优解,甚至可能是过度设计、成本过高的方案。
大型模型训练对内存带宽的需求极高,因此高带宽内存是合理乃至必要的选择。但推理工作负载的特征截然不同:处理批次的大小通常比训练时小得多,内存访问的模式更加规律和可预测,整个系统对响应延迟的敏感度高于对峰值计算吞吐量的追求。
基于这一判断,Positron选择以低功耗双倍速率内存作为其推理系统的内存架构。这个选择带来了几个直接而具体的竞争优势。
其一,绕过高带宽内存的供应链约束。高带宽内存的制造高度依赖少数几家内存厂商,且与先进封装工艺深度绑定,生产周期长、供应弹性小。低功耗双倍速率内存的量产规模更大,供应链更成熟、成本更低、扩产能力更强。在人工智能算力需求快速膨胀的背景下,供应链的稳定性是云服务商选择基础设施时不可忽视的重要因素。
其二,实现超过90%的内存带宽有效利用率。这是Positron最核心的技术主张。公司声称其推理系统能够实现超过90%的可用内存带宽有效利用率。相比之下,通用显卡在推理场景下的实际带宽利用率通常在40%到70%之间,大量带宽因为访问模式的不匹配而处于闲置状态。90%的利用率意味着:在相同内存容量的前提下,Positron系统能够提供更高的有效推理处理能力。
其三,显著降低能耗与运营成本。低功耗内存的能效比高带宽内存高得多。对于需要全天候持续运行的推理服务,每瓦特算力能够处理的请求数量直接影响数据中心的运营成本。Positron表示其系统既支持风冷,也支持液冷数据中心的部署,能够适配不同密度的机架环境,降低了客户的基础设施改造投入。
综合以上三点,Positron的推理系统在两个最关键的经济性指标上具有竞争力:每美元能够处理的推理请求数量,以及每瓦特电力能够处理的推理请求数量。这两个指标是推理服务商评估和选择硬件方案时的核心决策依据,直接决定了服务的盈利空间。
8.75亿融资的深层逻辑:行业老将的集体判断
这轮融资的结构本身有值得细读的细节。Positron将融资分成两个批次推进。
第一部分是3.75亿美元,以35亿美元的融资前估值为基准,由NEA、Andra Capital、Atreides Management、Valor Equity Partners和SemiAnalysis Capital联合领投。第二部分是最高5亿美元的补充融资,由NEA和Jim Clark领投。此外,卡塔尔投资局也作为战略投资方参与了这轮融资,这是一个不寻常的信号,意味着国家主权财富基金已经开始直接押注人工智能推理基础设施层面的硬科技。
Jim Clark的名字值得特别展开。这位传奇创业者是Silicon Graphics的创始人——这家公司在上世纪八十到九十年代定义了图形处理器行业;他也是Netscape的创始人——这家公司的浏览器软件引爆了互联网时代,催生了整个现代互联网产业。在这两次历史性技术浪潮中,Clark都是最早押注的投资人和创业者之一。他以个人资金和产业声誉押注Positron,传递了一个来自技术史见证者的强力信号。
Dylan Patel的参与同样意义深远。SemiAnalysis是全球半导体行业最权威的独立研究机构之一,其深度报告被英伟达、台积电、英特尔、三星等公司的工程团队和华尔街分析师广泛参考。Dylan Patel不仅是在投入资本,他实际上是在用多年积累的行业分析信誉,为Positron的技术路线做背书。这种来自”最懂芯片的分析师”的公开投资声明,在半导体行业具有独特的舆论放大效应。
推理芯片创业浪潮:Positron是最新一批,但不会是最后一批
Positron并非孤例,而是一场更大范围的行业浪潮的代表。2024年至2026年间,专注于人工智能推理硬件的初创公司正在经历一轮密集的融资热潮,每家公司都在押注推理场景下的不同技术路线。
Groq采用专有的语言处理单元架构,主打超低延迟推理,其在基准测试中展示的词元生成速度在特定场景下远超通用显卡方案,已经吸引到需要实时对话能力的客户群体。Etched专为Transformer架构设计专用集成电路,Transformer是当前绝大多数前沿大语言模型的底层架构,针对它的专用硅片可以在推理性能上实现数十倍于通用显卡的效率提升,代价是对其他架构的适配灵活性降低。另有一批公司在探索让计算在内存中直接发生的新型架构,致力于彻底消除当前系统中在处理单元和存储单元之间大量移动数据所带来的能耗浪费。
Positron在这个竞争格局中的差异化定位是:以整体性价比为优先,同时追求部署灵活性。公司不追求在任何单一技术指标上宣称”第一”,而是专注在整体总拥有成本上提供更具竞争力的方案,并通过与甲骨文云的合作部署,证明其系统可以接入主流云计算基础设施,而不要求客户从零开始自建专属计算环境。
这是一个关键的战略取向。绝大多数人工智能应用公司没有能力自行建设和运营物理硬件基础设施,他们需要的是可以在已有云环境中直接调用的推理计算能力。通过Parasail等中间层服务商、通过甲骨文云平台,Positron正在走一条”云原生推理硬件”的路径,降低了客户采用新硬件的切换成本。
与Groq的比较尤其具有启发性。Groq的语言处理单元架构在延迟指标上表现出色,但其部署模型相对封闭,客户通常需要通过Groq的推理服务进行访问,而非A在自有基础设施上运行Groq的系统。Positron的路径恰恰相反——它的目标是成为云基础设施的有机组成部分,让推理算力可以像普通云服务一样被弹性调用和扩缩。这种嵌入式云原生定位意味着Positron实际上在构建的是基础设施能力层,而不只是在销售单一硬件产品。
从潜在市场规模的角度来看,这个赛道的天花板相当惊人。仅以Salesforce的公开数据为例:Agentforce平台在2026年第二季度完成32亿个代理工作单元,而每个工作单元背后往往对应不止一次的推理调用。如果将类似密度的代理工作负载推广到全球主要企业软件平台,推理计算的总需求规模将是当前训练需求的数倍乃至数十倍。这正是Positron、Groq等公司投资者们愿意给出高额估值的核心逻辑。
英伟达面临的不是正面挑战,而是市场版图的悄然重塑
在分析Positron对英伟达构成怎样的威胁时,必须避免两个对立的错误判断。
一个过度乐观的判断是认为推理专用芯片将在几年内颠覆英伟达的市场地位。这忽略了英伟达的护城河深度。英伟达数十年构建的软件生态系统,包括数百万行经过高度优化的深度学习计算代码、完整的开发工具链、与主流深度学习框架的深度集成、庞大的开发者社区,这些软件资产的价值远超任何单一芯片的性能优势。大型超大规模云服务商和大型人工智能实验室对英伟达的依赖是系统性的,短期内无法大规模切换。
但另一个低估风险的判断同样危险:将推理专用芯片仅仅视为边缘市场的补充,认为它们不会影响英伟达的长期战略地位。这忽略了一个关键的市场结构现实。
英伟达最重要的客户群是超大规模云计算平台和大型人工智能实验室。这批客户的特征是:规模极大、对软件生态有深度历史依赖、对价格相对不敏感、且有大量内部工程师能够管理复杂的技术栈。这批客户短期内确实不会大规模切换。
但推理市场的需求来源更加分散和多元。数千家中小型人工智能应用公司、垂直行业场景开发商、边缘计算服务商,这些客户与大型超大规模客户的特征截然不同:他们对每次接口调用的成本极度敏感,他们对英伟达软件生态没有深度的历史积累,他们的技术团队中没有大量专用显卡编程专家,他们需要的是开箱即用、成本可控的推理能力。
如果Positron这类公司能够在这个更广泛的中小型市场中积累足够的客户规模,即使完全不影响英伟达的超大规模客户群体,也意味着每年数十亿乃至数百亿美元的推理算力市场份额的重新分配。更重要的是,今天因为性价比选择了推理专用硬件的人工智能初创公司,明天可能成长为需要大规模算力的行业头部玩家。
InsiderMonkey的最新市场分析提供了一个值得关注的供给侧信号:台湾积电2026年8月营收同比增长53.3%,创历史新高;与此同时,有消息称台积电考虑在明年上调代工报价约10%。如果显卡生产成本的持续走高推动英伟达产品价格上涨,其客户寻找性价比更高替代方案的动机将进一步增强——这为专用推理芯片公司创造了更大的结构性机会窗口。
具体数据支撑这个判断:InsiderMonkey引用的英伟达2026财年2026年第二季度数据显示,数据中心业务运营营收同比增长117%至890亿美元,其中超大规模客户增速102%,而云服务商和中型企业客户組增速138%。这意味着英伟达的增量不确定性正在转向更为多元的客户群,而这个群体中的部分实体恰恰是Positron等推理层创业公司试图深入的目标市场。
Oracle Cloud部署案例:从实验室到生产的关键一跃
值得单独拿出来分析的是Positron与甲骨文云的合作关系。在人工智能基础设施领域,”声称可以做到”和”已经在生产环境大规模运行”之间存在着巨大的鸿沟。大量推理硬件初创公司在融资时展示的是实验室基准测试数据,而真实的生产部署却需要面对网络容错、热插拔维护、多租户隔离、服务可用性保障等一系列工程挑战。
Positron已经迈过了这道坎。超过50个机架的Atlas系统在甲骨文云的数据中心中持续稳定运行,Parasail的推理服务平台每天都在这些硬件上处理真实的客户请求。这一点对潜在企业客户的说服力,远超任何数字基准测试报告。
合作选择甲骨文云而非亚马逊云服务或谷歌云,也是一个值得注意的战略选择。甲骨文云在企业市场的定位更为聚焦,且在与英伟达的竞争性采购方面有更强的动力。对于希望进入企业推理市场的Positron而言,甲骨文云是一个愿意共同推动生态发展的积极合作伙伴,而不仅仅是一个被动的基础设施提供商。
推理创业的两个根本性不确定因素
Positron的商业故事具有相当的说服力,但有两个核心问题是8.75亿融资本身无法回答的。
第一个是软件生态的长期建设问题。英伟达的核心护城河归根结底是软件而非硬件。数十年积累的优化计算库、工具链、文档、调试工具和开发者习惯,形成了一个极难复制的生态系统。推理专用芯片再好,如果缺乏与之配套的完整软件生态,工程团队在实际部署时面临的切换成本就是真实的、巨大的障碍。Positron目前通过Parasail等中间层服务商提供访问,有效降低了直接切换的摩擦。但中间层的存在也意味着:Positron与客户之间始终隔着一层,难以建立直接的软件生态纽带。长期来看,所有推理专用芯片公司都面临同一个命题:如何让软件开发者自愿选择在你的硬件上进行原生开发。
第二个是模型架构演进的不确定性。人工智能模型架构正处于快速演进之中。当前的Transformer架构主导着绝大多数前沿大型模型,但状态空间模型等新型架构已经在特定场景下展现出性能优势,未来几年内可能还会出现根本性不同的新架构范式。专用推理芯片的性能优势来自于对特定架构的深度定制优化,这也意味着它对架构变化的适应弹性更低。相比之下,英伟达的通用显卡虽然在特定推理场景的效率低于专用方案,但对未来架构变化的适应能力更强。这种”柔性”与”专精”之间的权衡,是所有特定用途芯片公司必须长期面对的战略张力。
写在最后:算力格局重塑的早期信号
Positron的8.75亿C轮融资,是多个历史性趋势汇聚的结果。人工智能模型从训练走向大规模推理部署;推理需求因为代理化应用的普及而呈指数级增长;英伟达显卡的生产成本随供应链议价能力增强而面临上行压力——这三个趋势共同指向了一个结论:专用推理硬件市场存在巨大的商业空间。
Salesforce一季度交付70亿个代理工作单元,Jensen Huang预言企业代理数量将从数万名员工扩展到数百万个人工智能代理协同工作,OpenAI推出面向工作场景的新一代旗舰模型——每一个代理、每一次工作任务背后,都是一次或多次推理计算。这个市场的规模天花板,可能比任何人当前预估的都要高出许多。
Positron能否最终成为这场算力格局重塑中的最大赢家,还需要时间和市场来验证。但它的8.75亿融资所传递的信号是清晰的:一批了解芯片历史、看懂行业趋势的聪明钱,正在用真实的资本押注推理专用硬件的巨大潜力。
英伟达的长尾市场,正在悄悄变得更加多元。而这场变化,才刚刚开始。
参考资料
- Positron AI官方新闻稿(prnewswire.com,2026-09-10):Positron AI Raises $875 Million at a $5 Billion Valuation — https://www.prnewswire.com/news-releases/positron-ai-raises-875-million-at-a-5-billion-valuation-to-bring-its-next-generation-inference-silicon-to-market-302874601.html
- InsiderMonkey分析(insidermonkey.com,2026-09-11):TSM’s Record Sales Say AI Chips Are Booming — https://www.insidermonkey.com/blog/tsms-record-sales-say-ai-chips-are-booming-the-nvidia-amd-fight-is-now-about-who-keeps-the-margin-1836577/
- Salesforce官方博客(salesforce.com,2026-09-11):Salesforce Expands Agentforce With New Job-Ready AI Agents — https://www.salesforce.com/news/stories/agentforce-job-ready-ai-agents/