2026年8月13日,OpenAI在官方开发者社区发布了一则公告,用词克制,内容让人印象深刻:Ultrafast模式预览上线,GPT-5.6 Sol在API中实现最高750 tokens/秒,是标准模式的14倍。

750 tokens/秒。在普通段落的阅读速度约为每秒3-5个单词(也就是4-7个token)的背景下,这个速度意味着AI输出文字的速度是一个人类阅读速度的100多倍。

但真正重要的不是这个数字本身,而是它所代表的穿越:AI推理速度第一次可靠地超越了人类在实时对话和实时决策中的感知门槛。


什么是「实时」门槛

在讨论750 tokens/秒之前,需要建立一个基准:什么样的推理速度,是AI实际应用的「实时」门槛?

对于不同的应用场景,这个门槛完全不同:

语音助手:为了让语音AI听起来自然,延迟需要低于300毫秒,同时输出速度需要跟上语音合成的速度(约每秒150-200个英文单词,等于约200-270个token/秒)。标准GPT-5.6的速度(约50-60 tokens/秒)明显不够,Ultrafast的750 tokens/秒足够驱动高质量的实时语音AI。

实时翻译:要在演讲中做实时翻译(同声传译级别),AI需要在输入的同时输出,对推理速度的要求极高。750 tokens/秒的速度,首次让纯神经网络翻译在同传场景变得可行。

金融高频决策支持:在高频交易和实时风险评估中,每毫秒都有价值。750 tokens/秒对于需要AI快速解读市场信号、生成决策摘要的场景,提供了此前无法实现的响应速度。

实时代码补全:在开发者打字的同时提供上下文感知的代码建议,需要推理速度足够快以让建议”超前”而不是”滞后”。750 tokens/秒对于最复杂的上下文推理,也能保持流畅的超前生成。

紧急响应场景:急诊分诊、灾难响应、实时监控分析——这些场景需要AI在秒级内处理大量输入并给出可操作建议。速度本身就是生命线。

OpenAI的公告里明确列出了Ultrafast的目标场景:实时语音AI(主导应用)、金融和合规研究、事件响应。


Cerebras是谁:Ultrafast背后的异构算力革命

Ultrafast的核心技术,不来自Nvidia GPU,而来自Cerebras。这个细节,比速度本身更值得关注。

Cerebras是一家成立于2016年的美国芯片公司,核心产品是WSE(Wafer Scale Engine)——顾名思义,是整片晶圆尺寸的芯片。

普通的芯片由一个晶圆切割成数百个小芯片再封装。Cerebras的做法是:直接在一整片晶圆上设计一个完整的超大芯片,不切割。WSE-3(当前版本)的尺寸是标准A4纸的约三分之一大,包含约4万亿个晶体管,数量是最新Nvidia H100的60倍以上。

为什么这个架构适合AI推理

Nvidia H100的设计目标是大规模并行训练:跨多张卡用高速互联做张量并行,最大化训练吞吐量。这个设计在推理上有局限:推理通常是顺序的(自回归),每生成一个token都需要访问整个模型权重,而Nvidia GPU在这种访问模式下的内存带宽是瓶颈。

Cerebras WSE的优势是:极大的片上内存(SRAM)容量,可以把整个模型或模型的关键部分存储在片上,避免了HBM访问延迟。这使得自回归推理速度可以比传统GPU高出一个数量级。

简单说:Nvidia GPU是为训练优化的架构,Cerebras WSE是为推理速度优化的架构。当OpenAI想要最快的推理速度,他们选择了Cerebras,而不是更多Nvidia H100/H200。


这次合作的战略含义:OpenAI不再只依赖Nvidia

Ultrafast背后的Cerebras合作,是一个比速度数字更深刻的战略信号。

长期以来,AI公司的计算依赖极度集中于Nvidia。训练用H100,推理也用H100/H200。这不是因为Nvidia在推理端真的无可替代,而是因为转换成本高(软件生态、技术团队、供应商关系)和Nvidia的市场主导地位。

OpenAI选择Cerebras来驱动Ultrafast,意味着:

  1. OpenAI在推理端找到了一个比Nvidia更优的方案
  2. OpenAI愿意在算力供应商上引入多样性,减少单一供应商依赖
  3. 这证明了”推理专用芯片”有真实的商业价值,不只是理论可能

这对Nvidia是一个警示:你在训练端的主导地位,不能自动转化为推理端的主导地位。推理端的竞争是独立的,而且可能更激烈,因为推理需求更分散(数百万个应用),更价格敏感(直接影响用户端API成本)。


750 tokens/秒的实际用户体验

让我们走出抽象,用具体场景感受750 tokens/秒意味着什么。

场景:AI同声传译

一场英语演讲,演讲者语速约每分钟150个单词(约200 tokens/分钟)。AI需要接收音频、理解内容、生成翻译,同时与讲话速度保持同步,而不是滞后。

标准GPT-5.6的速度(约50 tokens/秒 = 3000 tokens/分钟)理论上足够快,但延迟和上下文处理会消耗大量预算,实际可用速度往往低于理论值。在网络延迟、上下文窗口处理等现实约束下,流畅的同传AI在实践中难以实现。

Ultrafast的750 tokens/秒 = 45000 tokens/分钟,有足够的速度余量来吸收现实中的各种延迟和处理开销,使真正的实时AI同传在技术上变得可行。

场景:急诊分诊辅助

急诊室中,护士向AI快速描述患者症状(语音转文字),AI需要立即生成初步分诊建议和需要关注的关键体征。这是一个对延迟极度敏感的场景——每秒钟的等待,在医疗紧急情况下都有意义。

标准速度下,一个完整的分诊建议生成可能需要3-5秒;Ultrafast下,可能低于0.5秒。这个差距,在急诊场景下是显著的用户体验改善。

场景:实时法律/合规文档审核

合规团队处理大量合同,需要快速识别风险条款。当前工作流通常是:提交文档→等待AI分析→获取建议。Ultrafast的速度使这个流程可以接近”边看边有AI实时标注”的体验,类似于实时语法检查在文字处理软件中的位置。


谁可以用:当前访问限制与扩展路径

重要的实际信息:Ultrafast目前处于限量预览阶段,不是所有API用户都可以使用。

当前访问方式

  • 向选定客户开放(OpenAI公告中说”向部分客户开放”)
  • 需要申请访问权限
  • 模型标识:gpt-5.6-sol(通过特定参数启用Ultrafast模式)

产能扩展状态: OpenAI公告中明确表示”正在扩展Cerebras算力产能”,暗示当前的访问限制来自于Cerebras WSE的产能瓶颈,而不是定价或策略限制。随着Cerebras产能扩张,预计访问权限会逐步开放。

定价: 当前预览阶段没有公布具体价格。可以预期的是,Ultrafast的价格会高于标准速度(更高的硬件成本),但OpenAI的定价策略通常会在规模化后大幅降价。


对竞争格局的影响:Google和Anthropic怎么看

OpenAI的Ultrafast,对竞争对手意味着什么?

Google的应对:Google的优势是TPU和Tensor Processing能力,在推理延迟上有自己的研究路线。Google DeepMind已经在部分Gemini应用中使用了更激进的量化和批处理优化。但750 tokens/秒的公开演示,迫使Google评估自己的推理速度能否达到类似水平。

Anthropic的应对:Anthropic在算力端高度依赖AWS的Trainium/Inferentia芯片(通过Volta协议)和Nvidia GPU。他们没有自己的异构芯片策略,在推理速度竞争上可能需要依赖云服务商的基础设施升级。

Cerebras的意义:Cerebras IPO(已于2025年完成)后,其股价会对OpenAI的Ultrafast部署进展高度敏感。Ultrafast的成功,可能推动更多AI公司将部分推理负载迁移到Cerebras,改变推理算力市场的格局。


一个正在静悄悄发生的算力革命

2026年AI基础设施最有意思的发展,不是我们每天谈论的那些:不是更高的基准分数,不是更大的融资轮,不是更强的估值。

而是推理算力的分层化正在悄悄发生。

训练端:Nvidia主导,Cerebras/Groq/Tenstorrent补充。推理端:Nvidia地位被挑战,专用推理芯片(Cerebras、Groq的LPU、SambaNova)开始在特定场景取得明显优势。

OpenAI用Ultrafast公开验证了这个趋势的商业可行性。接下来,其他AI公司也会面临压力:如果竞争对手能提供14倍速的推理,而你只能提供标准速度,这在实时应用场景上会是一个明显的劣势。

这会推动整个行业加速对推理专用芯片的采购和整合,AI算力市场的重心会从”如何更快地训练”转向”如何更快、更便宜地推理”。

750 tokens/秒不只是一个速度数字。它是推理算力市场重构的起点。

这个数字,值得你记住。


数据来源:

写于2026年8月15日北京时间06:20


深入Cerebras技术:为什么WSE架构在推理上有如此大的优势

要真正理解750 tokens/秒的来源,需要更深入地看Cerebras WSE的架构优势。

内存带宽是AI推理的真正瓶颈

传统Nvidia GPU(H100、H200)使用HBM(高带宽内存)作为主存储。HBM的带宽虽然高(H100约3.35 TB/s),但仍然是芯片外存储器,每次访问都需要通过片外总线。

大语言模型在自回归推理时,每生成一个token,需要访问模型的全部参数(KV cache加上权重)。对于70B级别的模型,每次token生成都需要从内存中读取约140GB的数据。即使是HBM,这个读取速度也限制了最终的tokens/秒。

Cerebras WSE-3的片上SRAM容量约为44GB。对于较小规模的模型(比如GPT-5.6 Sol可能是20-30B量级的高度优化版本),所有权重都可以在片上SRAM中存放,消除了片外内存访问的瓶颈。

当模型权重全部在片上时,推理速度的瓶颈从内存带宽转移到了计算能力。Cerebras WSE-3有约900K个AI加速核心,计算能力极强。

这就是为什么WSE在推理端可以把速度提高10-14倍:它消除了Nvidia GPU上最显著的推理瓶颈(片外内存访问),让计算能力成为新的极限。

量化与蒸馏的协同

OpenAI在Ultrafast中使用的GPT-5.6 Sol,很可能是一个针对Cerebras平台深度优化的版本:更激进的量化(INT8或INT4级别),可能还包括知识蒸馏(从更大模型中提取能力到更小模型)。

这意味着750 tokens/秒的实现,不只是硬件之功,也是模型优化的结果。硬件+软件协同优化,是AI推理速度提升的双引擎。


历史坐标:推理速度的演进轨迹

把Ultrafast放到推理速度的演进历史中,可以更好地理解它代表的跃进。

2023年:GPT-4的推理速度约15-25 tokens/秒,使用者普遍感受到明显的等待感。长篇文章生成需要分钟级等待。

2024年:GPT-4o将速度提升到约50-80 tokens/秒,”等待感”消失,但对于实时语音对话仍然有轻微延迟。

2025年:GPT-5.6标准版达到约50-60 tokens/秒,同期各类推理优化(Groq LPU、批处理优化)达到200-300 tokens/秒。

2026年8月:OpenAI Ultrafast达到750 tokens/秒,是2023年GPT-4速度的30-50倍。

这个速度演进轨迹告诉我们:推理速度不是一条平缓的进步曲线,而是受到硬件代际更新(H100→H200→Vera Rubin)和架构创新(传统GPU→WSE)的双重驱动。Ultrafast不是渐进改进,而是一次架构级别的跃迁。


对API开发者的实际意义:什么场景值得迁移到Ultrafast

等Ultrafast正式公开访问后,开发者需要面对一个判断:什么场景值得迁移?毕竟更高的速度通常意味着更高的价格。

强烈建议迁移的场景

  • 语音AI产品(实时对话):速度直接影响对话流畅度,用户体验差异巨大
  • 需要实时AI辅助的B2B工具(急诊、交易、控制室):延迟有直接安全或财务影响
  • 实时内容生成(实况字幕、实时翻译):速度慢直接使产品不可用

建议评估的场景

  • 代码补全工具:如果当前速度已经让用户感到”跟不上”,迁移有价值;如果已经足够流畅,性价比需要重新评估
  • 高并发批量API调用:如果你的应用是批量处理而不是实时交互,速度优势不转化为用户体验优势,成本收益比下降

无需迁移的场景

  • 后台文档处理(不需要实时反馈)
  • 低频率的高质量内容生成(博客、长文撰写)
  • 成本极度敏感、可以接受延迟的批处理任务

推理速度商业化的长期逻辑

最后,思考Ultrafast的长期商业逻辑。

推理速度本身,是一个会被逐渐商品化的能力。今天750 tokens/秒是高端功能,三年后可能是标准功能。这是整个AI行业的基本模式:今天的突破,明天的基准,后天的底线。

但Ultrafast现在的意义,在于它定义了下一个阶段的竞争维度。

在GPT-3时代,竞争是”能不能做”;在GPT-4时代,竞争是”质量好不好”;在GPT-5.6时代,竞争正在成为”速度够不够快”和”成本够不够低”。

OpenAI通过Ultrafast,在”速度”维度上设置了新的最高标准。这迫使所有竞争者在推理速度上有所回应,推动行业整体进步。

从这个角度看,Ultrafast不只是一个产品功能,而是一次市场定向动作:OpenAI在告诉整个行业,下一轮竞争的关键维度,是在极限速度下保持可用质量。

750 tokens/秒,是OpenAI在推理战场上打出的第一张牌。接下来怎么打,要看竞争对手的回应。


延伸:Groq的LPU与Cerebras的WSE

顺便介绍一个竞争者:Groq,也是推理速度的领跑者之一。

Groq使用LPU(Language Processing Unit,语言处理单元)架构,在Llama 3等开源模型上实现了超过500 tokens/秒的推理速度,比Cerebras早一步进入了公众视野。

Groq vs Cerebras的主要区别

  • Groq LPU:多芯片互联,适合中等规模模型的极速推理,已商用(groq.com提供API)
  • Cerebras WSE:单片超大芯片,适合中小规模模型完全装入片上内存的场景,产能更有限

OpenAI选择Cerebras而不是Groq,可能是因为GPT-5.6 Sol的特定规模和架构与WSE更匹配,也可能有其他供应商关系或技术考量。

这两家公司的存在,证明了一件事:AI推理算力市场不是Nvidia一家独大的市场,而是一个正在快速多元化的市场。这对AI应用开发者是好消息——更多竞争,意味着更低价格和更多选择。


写于2026年8月15日北京时间06:25 参考来源:OpenAI官方社区(2026-08-13)| Cerebras技术文档 | Artificial Analysis推理速度基准数据


Ultrafast的质量问题:速度和准确性如何权衡

一个重要问题没有正面回答:750 tokens/秒的速度,是以牺牲质量为代价吗?

这是一个合理的担忧,因为工程上的权衡往往是零和的:更快意味着更多量化(精度损失)或更小模型(能力损失)。

OpenAI对这个问题的态度,从公告的措辞中可以看出一些线索。公告明确说”GPT-5.6 Sol at up to 14X the speed”——注意,不是”GPT-5.6”,而是”GPT-5.6 Sol”。Sol是GPT-5.6系列中的一个变体(可能是”Solar”或”Solution”的缩写),这暗示这是一个专门优化过的模型版本,不是完整的GPT-5.6。

结合Artificial Analysis的数据,GPT-5.6 Sol在当前的Intelligence Index上大约在55-60分之间(GPT-5.6完整版约65-70分),说明确实有能力权衡,但不是断崖式下降。

对于需要极速响应的应用(语音助手、实时翻译),略低一些的质量换取大幅更高的速度,通常是合理的权衡。对于需要最高质量的任务(深度研究、复杂推理),等待标准速度版本更合适。

OpenAI提供了选择,而不是强制。这是一个成熟产品策略的表现。


大语言模型的”速度经济学”:快多少才值得付出多少钱

速度有价值,但不是无限的价值。让我们做一个简单的经济学分析。

对于不同应用场景,额外推理速度的价值边际递减:

语音AI对话(每次回应约100-300 tokens):

  • 50 tokens/秒:每次回应需要2-6秒,非常明显的等待感,用户体验差
  • 200 tokens/秒:每次回应0.5-1.5秒,可接受但仍有延迟感
  • 750 tokens/秒:每次回应0.13-0.4秒,接近人类反应时间,体验流畅

→ 从50到750 tokens/秒,价值提升巨大

代码补全(每次建议约50-200 tokens):

  • 50 tokens/秒:约1-4秒生成建议,明显滞后
  • 200 tokens/秒:约0.25-1秒,可接受
  • 750 tokens/秒:约0.07-0.27秒,无感延迟

→ 从50到750,价值提升显著,但200已经够好

长文档生成(每次任务约2000-5000 tokens):

  • 50 tokens/秒:40-100秒完成,等待可以接受(可以去喝咖啡)
  • 200 tokens/秒:10-25秒完成
  • 750 tokens/秒:2.7-6.7秒完成

→ 从50到750,体验改善明显,但价值不如语音场景那么大

这个分析说明:Ultrafast的溢价,对于语音AI和实时交互场景是完全合理的;对于后台批处理场景,溢价可能超过实际价值。

定价策略的关键,在于OpenAI如何区分这些场景,为不同需求的用户提供合理的价格区间。如果Ultrafast的定价是标准模式的2-3倍,大多数实时场景都值得升级;如果是5-10倍,只有高价值实时场景才值得升级。


当AI速度遇见AI准确性:一个更深刻的问题

最后,提出一个Ultrafast背后更深刻的问题:当AI变得非常快时,我们如何判断它的快速输出是否可靠?

人类在思考困难问题时需要时间。”快速思考”(System 1)往往直觉性强但容易出错;”慢速思考”(System 2)更系统但需要更多时间。Daniel Kahneman的双进程理论在人类认知上已经被大量研究验证。

AI的情况类似:更深度的推理(高”thinking budget”)通常质量更高;量化和蒸馏后的快速模型,在需要细腻判断的问题上可能有更高的错误率。

750 tokens/秒是什么意思?它可能意味着AI在某些类型的任务上,正在使用更多”System 1”式的快速生成,而不是深度推理。这在语音流畅度上是优势,但在需要复杂因果推理的场景上可能是劣势。

这不是批评Ultrafast,而是提醒用户:选择更快的模式时,要了解质量权衡的具体情况,而不是假设更快和更好可以同时实现。

OpenAI通过提供不同速度档位(标准 vs Ultrafast),实际上是在提供一个”思考深度”的选择——这个设计思路,和ChatGPT最近新增的”思考深度滑块”功能,是同一种用户控制哲学的体现。

把控制权交给用户,让用户根据具体任务做权衡——这是AI产品走向成熟的表现。


一个技术里程碑的简短总结

Ultrafast代表了AI推理在技术上的一个重要里程碑:推理速度首次可靠地超越了大多数实时应用场景的体验门槛。

这个里程碑的意义,不只在于速度本身,而在于它所开启的应用空间:所有此前因为”AI不够快”而无法实现的产品和场景,现在有了技术基础。

但里程碑不是终点,而是新的起点。接下来的挑战,是如何把这个速度推向更多的用户、更多的设备、更低的价格,同时保持对质量的合理承诺。

750 tokens/秒,今天是高端功能,明天是行业标准,后天是竞争底线。

AI行业的节奏,一直如此。


写于2026年8月15日北京时间06:30 参考来源:OpenAI官方社区(2026-08-13)| Cerebras WSE技术规格 | Artificial Analysis基准数据 | Groq速度基准数据


从OpenAI视角:Ultrafast的战略布局意义

从OpenAI公司战略角度分析Ultrafast,这个产品发布不只是技术展示,而是在IPO前夜的一次精心布局。

OpenAI预计在2026年下半年完成IPO,市场预期估值达到852亿美元以上。在这个关键时间节点,任何能够展示技术领先性的发布都具有更大的战略价值。

Ultrafast对IPO叙事的贡献

Ultrafast传递了三个对投资者有价值的信号:

第一,OpenAI有能力在不只是扩大模型规模的前提下,实现技术性能的重大突破——这说明公司有多元化的技术路径,不只是”烧钱训练更大模型”。

第二,OpenAI在供应链多元化上主动行动——与Cerebras的合作,证明OpenAI不是Nvidia的被动依赖方,而是可以主动寻找更优算力解决方案的技术公司。

第三,有新的高价值产品可以支撑未来收入增长——Ultrafast定位为高端服务,暗示OpenAI的收入结构可以向高利润率的专业服务倾斜。

这三个信号,对于说服机构投资者相信OpenAI”值得” 852亿美元估值,都是有帮助的。

与Anthropic IPO的对比

Anthropic同期也在谈论IPO(估值讨论从9650亿到2万亿不等)。两家公司在IPO前都在积极发布技术亮点来强化市场地位。

Anthropic有Claude水印政策和安全声明(引发争议但也强化品牌);OpenAI有Ultrafast(速度突破,无争议性,直接技术价值)。

这两种不同的IPO前策略,反映了两家公司对自己差异化定位的理解:Anthropic押注”最安全的AI”品牌,OpenAI押注”最快/最强的AI”品牌。

两种定位都有市场,但在2026年AI竞争激烈的背景下,哪种定位更能持续兑现价值,还需要时间验证。


API速度对开发者生态的长期影响

最后一个视角:超快的API推理速度,对整个AI应用开发生态的长期影响是什么?

应用的设计思路会改变

当推理速度慢时,开发者需要设计面向”异步”和”批处理”的应用架构:用户提交请求,AI在后台处理,完成后通知用户。这是过去几年大多数企业AI应用的设计模式。

当推理速度快到接近实时,开发者可以重新设计面向”同步”和”实时”的架构:用户的每一个操作(打字、点击、说话)都能立即触发AI响应,AI的输出能够即时嵌入用户的工作流。

这个架构转变,会催生一类全新的应用:不是”AI工具”,而是”AI协同工具”——用户和AI在同一时间线上协作,而不是轮流等待对方完成任务。

开发者的”速度品位”会提升

当开发者习惯了750 tokens/秒,标准的50 tokens/秒会显得”太慢”,就像我们习惯了SSD之后,机械硬盘的速度会显得无法忍受。

这种”速度品位”的提升,会在整个开发者社区创造持续的对更快推理的需求,推动AI基础设施进一步升级。需求创造供给,供给刺激需求——这是技术演进的良性循环。

自然语言接口的极限

如果AI推理速度能够持续提升,我们终将触碰自然语言接口的物理极限:人类阅读速度(约每分钟200-300个汉字或150个英文单词)。当AI输出速度超过人类阅读速度,多余的速度就没有UI层面的意义了——用户永远是系统中的瓶颈。

这个极限,大约在1000-1500 tokens/秒(对中文用户可能是每秒150-200个汉字输出后就足够了)。一旦达到这个极限,竞争维度会从”速度”转向”质量”和”成本”。

OpenAI的750 tokens/秒,已经接近这个极限的边缘。


_参考来源:OpenAI官方开发者社区(2026-08-13) Cerebras WSE-3技术规格 OpenAI IPO估值报告_