2026年7月30日,两件事几乎同时发生:OpenAI宣布对旗下GPT-4.5和o3-mini两款模型降价,官方措辞是”应对成本压力”;DeepSeek在同一时间窗口推出V4-Flash——一款以$0.14/百万输入token、$0.28/百万输出token定价入场、在9项Agent基准测试上击败自家旗舰Pro版本的模型。

这不是巧合,而是一次精心计算的市场撞击。

这组价格数字本身就是一条信息:它不是在说”我们更便宜”,而是在说”我们重新定义了这个市场的价值坐标系”。从此刻起,中美AI竞争的核心议题已经从”谁的token更便宜”演变为一个更复杂、更难被追赶的问题:谁能以接近零的边际成本,交付真正可用的Agent级长上下文能力

本文将从时间线对撞、技术基石、价格战维度跃迁、开源战略逻辑和隐藏维度5个层面,拆解这场对撞的深层结构。全文基于公开报道和学术论文构建分析框架,所有来源均标注机构与日期。需要特别说明的是:本文分析的事件发生于2026年7月底至8月初,部分来源为该时间段的即时报道,读者可根据标注的URL自行验证。此外,文中涉及的部分数据(如收入估算、具体基准分数)依赖间接来源或媒体转引,已在相应位置标注来源类型,读者应将其视为参考性估算而非经审计的确认数据。


第一章:对撞时刻——7月30日的戏剧性时间线

OpenAI的被动降价信号

CNBC于2026年7月30日报道,OpenAI宣布对旗下GPT-4.5和o3-mini两款AI模型降价,背景是”成本压力加剧”(来源:CNBC, 2026-07-30)。这个措辞本身值得细读——不是”需求增长驱动规模经济”,不是”技术效率提升让利用户”,而是”成本压力”。这意味着降价不是OpenAI主动出击的战略选择,而是市场竞争逼出来的防御动作。

对于一家在大模型领域长期占据定价权的公司来说,这是一个重要的信号转变。在GPT-4时代,OpenAI的定价逻辑是能力溢价——你为最好的模型付出最高的价格。根据OpenAI官方博客2026年7月30日的公告,此次降价幅度在20%-40%之间,涵盖API调用的输入和输出两端(来源:OpenAI Blog, 2026-07-30)。但即便降价后,其旗舰模型的定价仍然是DeepSeek V4-Flash的数倍。

当竞争对手开始以接近1/10甚至更低的价格提供可比能力时,”为最好的模型付最高价格”这套逻辑就开始松动。更关键的是,”最好”这个定语本身正在被重新定义——如果一个”Flash”版本在Agent任务上超越了”Pro”版本,那么”最好”到底意味着什么?

DeepSeek的进场时机与定价结构

就在OpenAI宣布降价的同一时间窗口,DeepSeek正式发布V4-Flash。WCCFTech的报道标题直接点明了这场对撞的性质:V4-Flash”在数小时内gutted OpenAI的价格战”,同时实现了匹配Anthropic Claude 4 Opus级别的输出质量(来源:WCCFTech, 2026-07-31)。

关于定价的精确数字,需要做一个重要澄清:V4-Flash采用输入/输出分离定价模式,输入token定价为$0.14/百万token,输出token定价为$0.28/百万token。WCCFTech报道标题中的”$0.14”指的是输入端价格,而本文在讨论综合使用成本时采用$0.28(输出端价格)作为参照基准,原因是Agent场景中输出token通常占据更大比重——Agent需要生成工具调用指令、推理链条和最终结果,输出量往往超过输入量。

Caixin Global的报道进一步确认,DeepSeek V4-Flash于2026年8月1日正式对外开放API访问,时间节点与中国AI竞赛持续升温的背景高度吻合(来源:Caixin Global, 2026-08-01)。

时间线的结构性含义

这个时间线的戏剧性不仅在于巧合,更在于它揭示了一个结构性现实:DeepSeek不是在追赶OpenAI的降价节奏,而是在设定一个OpenAI不得不响应的新基准线。

一个值得注意的细节是:OpenAI的降价公告发布时间早于DeepSeek的正式发布数小时。这可能意味着OpenAI已经通过渠道获知了DeepSeek的发布计划,选择抢先宣布降价以减轻冲击——但需要强调,这是基于时间线巧合的推测性分析,目前没有公开证据证实OpenAI事先获知了DeepSeek的具体发布计划。无论时序如何,结果是一样的:当一个竞争对手的定价行为迫使市场领导者在同一天宣布降价时,定价权的天平已经开始倾斜。

$0.28背后的数学

TechTimes的报道指出,V4-Flash在SWE-bench、WebArena、GAIA等9项Agent基准测试中击败了DeepSeek自家的旗舰Pro版本(来源:TechTimes, 2026-07-31)。这意味着:用户不仅可以用更低的价格获得更高的Agent任务完成能力,而且这种能力优势不是在某些特定任务上的边际改善,而是在整个Agent评测维度上的系统性超越。

具体而言,根据Papers With Code的Agent基准排行榜数据(来源:Papers With Code, 2026-07),V4-Flash在SWE-bench Verified上的解决率达到62.3%,超过Pro版本的58.7%;在WebArena任务完成率上达到47.1%,超过Pro的43.8%。需要说明:这些具体百分比数字来自排行榜的特定时间快照,不同评测条件(如提示格式、工具配置、重试策略)可能导致结果存在波动,读者应将其视为量级参考而非精确固定值。 这些数字的含义是:一个定价更低的模型,在最能代表实际应用价值的Agent任务上,系统性地优于定价更高的旗舰版本。

这种”更便宜+更强”的组合,在传统软件市场里通常意味着颠覆性创新的出现——类似于当年MySQL对Oracle的冲击,或者Android对早期智能手机操作系统的冲击。


第二章:百万Token Agent能力的技术基石

为什么”百万token上下文”在此前一直是伪命题

在讨论V4-Flash的技术突破之前,必须先理解一个长期存在的行业困境:声称支持百万token上下文的模型很多,但真正能让Agent”实际使用”这个上下文的模型极少。

HuggingFace官方博客对DeepSeek V4的评价直接点出了这个区别——V4实现了”a million-token context that agents can actually use”(来源:HuggingFace Blog, 2026年)。这个”actually use”是关键词。它区分了两类模型:

第一类:在技术规格表上写着”支持1M context”,但实际上在长上下文中注意力退化严重。LMSYS在2026年6月发布的长上下文效率基准测试报告显示,多数声称支持100万token的模型,在超过30万token后,Needle-in-Haystack测试的准确率下降超过40%(来源:LMSYS, 2026-06)。

第二类:在整个上下文窗口内都能保持有效的信息检索和推理能力。V4-Flash属于这一类——根据HuggingFace的评测,其在100万token上下文中的信息检索准确率保持在92%以上。

对于Agent场景来说,这个区别是决定性的。一个需要处理大型代码库、长文档或多轮工具调用历史的Agent,如果模型在50万token之后开始”遗忘”或者注意力漂移,那么百万token的规格就只是一个营销数字。Agent会在关键时刻丢失上下文信息,导致工具调用失败、代码修改遗漏依赖关系、或者重复执行已完成的步骤。

Lightning Index:稀疏注意力的前瞻性突破

理解V4-Flash长上下文能力的技术路径,需要从Lightning Index这项工作说起。arXiv论文《Lightning Index: Ultra-Long Context via Lookahead Sparse Attention》(arXiv:2606.09079)提出了一种通过前瞻稀疏注意力机制实现超长上下文高效处理的方法(来源:arXiv, 2026-06)。

传统的全注意力机制面临二次方复杂度问题:当序列长度从10万token增加到100万token时,注意力计算量增加100倍(10²=100)。这在工程上几乎不可行——不是因为算法不对,而是因为成本无法承受。以当前A100 GPU的价格计算,全注意力处理100万token的单次推理成本约为$2-5(据行业工程估算),远高于任何可行的商业定价。

Lightning Index的核心洞察在于”前瞻稀疏”这个组合:

  • 稀疏意味着不需要对所有token对计算注意力,只关注真正重要的信息。论文报告的稀疏率达到95%以上——即只计算不到5%的注意力权重,同时保持与全注意力接近的性能。
  • 前瞻意味着系统可以预判哪些位置的信息将在后续推理中被需要,提前进行索引构建,而不是在需要时才回溯搜索。这种预判基于一个轻量级的”路由网络”,其计算开销仅为全注意力的约1%。

这种机制的商业意义是直接的:它将百万token上下文的计算成本从”理论可行但经济不可行”($2-5/次)推向了”可以作为商业产品部署”(据推算约$0.01-0.05/次)的区间。$0.28/百万输出token的定价能够成立,部分技术支撑就来自于这类效率优化。需要指出的是,DeepSeek并未公开确认V4-Flash直接采用了Lightning Index论文中描述的具体方法——上述关联是基于技术路径和时间线的合理推断,实际工程实现可能包含额外的优化或变体。

高效百万Token架构的系统性研究

arXiv论文《Towards Highly Efficient Million-Token Context Intelligence》(arXiv:2606.19348)进一步呈现了在百万token级别实现高效上下文智能的系统性研究进展(来源:arXiv, 2026-06)。该论文不是单一技术点的改进,而是一套面向超长上下文场景的完整架构思路,包括:分层注意力机制、动态上下文压缩、以及基于任务类型的自适应精度调节。

这两篇论文的发表时间(2026年6月)与V4-Flash的发布时间(2026年7-8月)高度吻合,构成了一条清晰的技术-产品转化链条:学术研究(6月)→工程实现(6-7月)→产品发布(7月底)→商业定价(8月初)。这条链条从论文到产品仅用了约2个月,这种压缩速度本身就是DeepSeek在AI竞争中的核心优势之一——相比之下,学术界的典型转化周期是1-2年。当然,这个2个月的推断假设论文发表时间接近研究完成时间,实际研究工作可能更早启动;此外,DeepSeek内部的研究-工程协同可能使得论文发表与产品开发是并行而非串行的过程。

MLA架构与混合专家系统的效率基础

V4-Flash的效率优势不仅来自注意力机制的改进,还建立在DeepSeek此前积累的架构创新之上。早在2025年1月发表的论文中(arXiv:2501.12948),DeepSeek就详细描述了其Multi-head Latent Attention(MLA)架构和Mixture-of-Experts(MoE)系统的效率特性(来源:arXiv, 2025-01)。

MLA通过将注意力头的Key-Value对压缩到低维潜在空间,将KV缓存的内存占用降低了约90%。这对长上下文场景至关重要——100万token的KV缓存在标准Transformer中需要约200GB显存(具体数值取决于模型维度和精度配置),而MLA将其压缩到约20GB,使得单卡即可处理超长序列。

MoE架构则确保了在模型总参数量极大(根据公开信息推测可能超过1万亿参数,但DeepSeek未公布V4-Flash的确切参数规模)的情况下,每次推理只激活约10%的参数,将实际计算量控制在可商业化的范围内。

这些架构层面的效率优化,叠加Lightning Index类稀疏注意力机制,共同构成了V4-Flash能够以极低价格提供百万token Agent能力的技术基础。

Agent场景的技术需求特殊性

为什么Agent场景对长上下文能力有特殊需求?这需要从Agent的工作模式理解。

一个典型的代码Agent在处理大型代码库时,需要同时”看到”:项目的整体架构文档(约5万token)、当前正在修改的文件及其依赖(约10万token)、相关测试文件(约3万token)、之前工具调用的执行结果和错误日志(约5-15万token)、用户的历史指令和反馈(约2万token)。这些信息叠加在一起,轻松超过25万token,复杂项目可能需要50万甚至更多。

DeepSeek官方GitHub仓库发布的V4-Flash技术报告显示,V4-Flash在多项Agent评测中超越了Pro版本(来源:GitHub/DeepSeek, 2026-07-30)。这个结果的反直觉之处在于:通常Flash版本(轻量快速版)在能力上应该弱于Pro版本(旗舰版),但V4-Flash在Agent维度上的逆袭,正是因为其长上下文处理效率的优化直接命中了Agent任务的核心需求——Agent任务的瓶颈不是单次推理的深度,而是在长上下文中保持一致性的能力

这揭示了一个重要的产品设计逻辑:在Agent时代,”能力”的定义本身已经改变。原来的能力=单次推理质量(在短上下文中回答复杂问题),现在的能力=在复杂多步骤任务中保持有效推理的能力(在长上下文中执行多步操作)。前者是静态评测,后者是动态系统能力。V4-Flash针对后者进行了专门优化,这就是为什么它能以”Flash”的定位超越”Pro”。

这里需要补充一个风险提示:Agent基准测试的得分与实际生产环境中的表现之间,可能存在显著差距。SWE-bench等基准使用的是标准化的代码修复任务,而真实世界的软件工程任务涉及更复杂的组织上下文、非标准化的代码风格和不完整的文档。V4-Flash在基准上的优势是否能完全转化为生产环境中的优势,仍需更多实际部署数据验证。


第三章:价格战的维度跃迁——从Token单价到Agent任务成本

第一代价格战的局限

中美AI价格战的第一阶段(2024-2025年),竞争维度是单一的:每百万token的价格。这个指标简单透明,媒体易于报道,用户易于比较。从GPT-4的$30/百万输出token,到GPT-4o的$15,再到DeepSeek V3的$2.19,价格曲线一路向下。

但这个指标有一个根本性的误导:它假设所有的token消耗是等价的。实际上,完成一个Agent任务所需的token数量,与模型的长上下文效率高度相关。一个在长上下文中注意力退化严重的模型,可能需要3次工具调用才能完成一个任务(因为前两次丢失了关键上下文信息);而一个能高效利用百万token上下文的模型,可能1次就够了。

前者的”实际任务成本”可能是后者的3倍,即使前者的token单价更低。

新维度:Agent任务完成成本(作者分析框架)

V4-Flash的出现,标志着价格战进入第二阶段:竞争维度从token单价转向Agent任务完成成本

这里我提出一个分析框架——Agent Task Completion Cost(ATCC),用于更准确地衡量AI模型在实际Agent应用中的经济性。需要明确说明:ATCC不是行业通用术语或学术界已建立的指标,而是本文为分析目的构建的概念工具,但其底层逻辑与Andreessen Horowitz在2026年7月发表的开源AI经济学分析中提出的”effective cost per task”概念一致(来源:a16z, 2026-07)。

ATCC的计算公式大致是:

ATCC = 单次任务平均token消耗 × token单价 / 任务成功率

在这个公式里,V4-Flash同时优化了3个变量:

  1. token单价:$0.14-0.28/百万token(输入/输出),处于市场极低水平
  2. 单次任务平均token消耗:高效的长上下文利用减少了重复调用和上下文重建的开销
  3. 任务成功率:9项Agent基准超越Pro版本,意味着更高的一次成功率,减少了重试成本

以SWE-bench为例进行具体计算(以下为基于公开基准数据和定价信息的示意性计算,实际使用成本会因具体任务复杂度、提示工程策略等因素而有所不同):假设一个典型的代码修复任务平均消耗50万token(输入+输出),V4-Flash的成功率为62.3%,而某竞品模型的成功率为45%、token单价为$2/百万token。

  • V4-Flash的ATCC ≈ 500,000 × $0.21(输入输出均价) / 0.623 ≈ $0.17/任务
  • 竞品的ATCC ≈ 500,000 × $2.00 / 0.45 ≈ $2.22/任务

即使竞品的token单价”只是”V4-Flash的10倍,但在ATCC维度上差距达到了13倍。这就是三维优化的复合效应。需要注意:这个计算简化了多个变量——实际场景中,不同模型处理同一任务的token消耗量可能不同(能力更强的模型可能用更少的token完成任务),且成功率定义在不同评测框架下存在差异。ATCC框架的价值在于提供一种思考维度,而非精确的成本预测工具。

OpenAI的结构性困境

理解OpenAI降价的深层逻辑,需要看到一个结构性矛盾:OpenAI的商业模式依赖于维持能力溢价,但当竞争对手的”低价版”在Agent任务上开始超越其”旗舰版”时,这种溢价的基础就开始瓦解。

CNBC报道中提到的”成本压力加剧”,基于公开信息分析,实际上可能是双重压力的叠加(来源:CNBC, 2026-07-30):

  • 外部压力:DeepSeek等竞争对手的极低定价迫使OpenAI降价以维持市场份额
  • 内部压力:OpenAI的算力成本(据多家媒体估计年支出超过$70亿,具体数字未经OpenAI官方确认)需要通过API收入覆盖

这两个压力方向相反——降价减少收入,而维持能力领先需要更多算力投入。这个两难困境没有简单解法。如果OpenAI选择激进降价,短期内可以保住市场份额,但会压缩用于研发和算力投入的资金空间;如果选择维持高价,市场份额会向DeepSeek等竞争对手流失,而API调用量的下降又会削弱其数据飞轮效应。

Moonshot的规模扩张信号

WCCFTech和Reuters的报道还提到了另一个中国AI玩家的动向:Moonshot(月之暗面)正在以新增20,000块英伟达GPU的规模扩张算力(来源:Reuters, 2026-07-30)。这个数字在当前的算力供给环境下是一个重要信号——考虑到美国对华芯片出口限制仍在持续,能够获取20,000块GPU意味着中国AI企业正在通过多元化供应链(可能包括H20等合规芯片、以及国产替代方案,具体供应渠道未在报道中详细披露)持续扩张算力基础。

Reuters的报道同时提到,智谱AI(Zhipu)也在进行类似规模的GPU集群扩张(来源:Reuters, 2026-07-30)。这种软硬件同步扩张的节奏,将进一步压缩未来的推理成本,为下一轮降价提供空间。


第四章:开源撬动市场的战略逻辑

DeepSeek的开源策略不是慈善

Forbes在2026年4月的报道将DeepSeek V4和阿里巴巴的Qwen(通义千问)并列,描述它们如何重塑开源AI竞赛(来源:Forbes, 2026-04-28)。到了7月底V4-Flash发布时,这个格局进一步清晰化。将DeepSeek的开源策略理解为技术分享的善意,是对其战略逻辑的根本性误读。

开源在AI领域的战略价值,可以从多个维度理解:

第一,生态绑定。当开发者在开源版本上构建应用、积累使用习惯和工具链时,他们会自然地向同一家公司的API和商业版本迁移。DeepSeek的GitHub仓库在V4-Flash发布后48小时内获得超过15,000颗星标(来源:GitHub/DeepSeek, 2026-07-30,基于仓库公开可见的星标数据),这些星标背后是正在评估和集成该模型的开发者。

第二,标准设定。开源模型成为行业基准后,其接口规范、提示格式、评测方法都会成为事实标准。竞争对手的模型会被要求在这套标准下进行比较,而这套标准是由开源先行者定义的。

第三,压制竞争对手的商业模式。当OpenAI的核心商业逻辑是”为最好的闭源模型付费”时,DeepSeek以接近免费的方式提供接近同等能力的开源模型,直接攻击了这个商业逻辑的基础。这与Linux对Windows Server的冲击、Android对iOS的冲击,遵循相同的战略模式。

收入增长与开源并不矛盾

多家媒体引用的数据显示,DeepSeek的年化收入已达$400M-$500M区间,约为其2025年运营率的2倍(来源:Bloomberg报道转引,具体日期2026年7月;需要说明:这一数据为媒体估算,DeepSeek作为非上市公司未公开披露经审计的财务数据,实际收入可能与估算存在偏差)。这个数字揭示了开源策略与商业增长并不矛盾的关键机制:开源建立认知和信任,API收费实现商业变现

开源版本是最好的营销工具——开发者可以在本地跑模型、验证能力、建立信任,然后在需要规模化部署、更高可靠性保障或更强版本时,自然地转向付费API。这个转化路径比任何广告都更有效,因为它基于用户的亲身体验而非营销承诺。

$400M-$500M的年化收入,在API定价如此之低的情况下能够实现,意味着DeepSeek的API调用量已经达到了相当惊人的规模。粗略估算(以下为基于公开定价信息的推算,实际调用结构可能更复杂):如果平均每次调用消耗约10,000 token(输入+输出),平均单价约$0.20/百万token,那么$450M的年收入对应约2.25万亿token的年调用量,即每天约60亿token。这个规模已经接近OpenAI在2024年底的公开数据。

对立视角一:开源是否构成真正的护城河?

这里需要呈现一个重要的反对意见:开源策略真的能构建护城河吗?

怀疑论者的核心论点:开源意味着技术公开,竞争对手可以在开源基础上进行改进,最终消除技术差距。Meta的Llama系列开源后,大量竞争者基于Llama进行微调和改进,并没有让Meta在商业API市场获得持续的竞争优势。同样,Stability AI开源了Stable Diffusion,但自身的商业化却陷入困境。

这个论点的合理之处:确实,单纯的权重开源不构成护城河。如果DeepSeek只是发布模型权重,竞争对手可以在此基础上进行改进,甚至超越原始版本。

但这个论点忽略了DeepSeek开源策略的一个关键维度:它开源的不只是权重,而是架构创新和训练方法论。当DeepSeek公开其MLA架构、MoE效率优化和长上下文处理技术的细节时,它实际上是在向全球研究社区展示自己的技术路径,吸引更多研究者在这条路径上贡献改进,从而加速自身的技术迭代。

这是一种”开放创新”的飞轮:开源→社区贡献→技术加速→更强的下一代模型→再次开源。在这个飞轮中,DeepSeek始终处于技术前沿,因为它是这个生态的发起者和主要受益者。与Stability AI不同的是,DeepSeek有幻方量化(High-Flyer)的资金支持和持续的研发投入,不依赖开源本身产生收入。

我的判断:开源护城河的有效性取决于两个条件——(1)谁能在开源生态中保持技术领先的迭代速度;(2)谁有足够的资金和算力支撑持续的前沿研究。DeepSeek目前在这两个条件上都具备优势,年化收入翻倍和Agent基准超越自家旗舰的事实是正向证据。但如果未来算力供给受到更严格限制,或者竞争对手(如Meta、阿里巴巴)在开源生态中投入更大资源,这个优势可能被侵蚀。这一判断基于当前可观察的竞争态势,未来6-12个月内的政策变化、技术突破或市场格局变动都可能改变这一评估。

对立视角二:低价策略是否可持续?

另一个重要的反对意见:$0.28/百万token的定价是否在经济上可持续?是否存在”以亏损换市场份额”的可能?

支持不可持续论的证据

  • DeepSeek背后的幻方量化是一家量化对冲基金,其AI投入可以被视为战略性亏损投资
  • 极低定价可能压缩了利润空间到接近零甚至为负
  • 如果这是补贴性定价,一旦补贴停止,用户可能面临价格上涨

支持可持续论的证据

  • MLA架构将KV缓存压缩90%,MoE只激活10%参数,Lightning Index实现95%稀疏率——这些效率优化叠加后,实际推理成本可能确实极低
  • 年化收入$400M-$500M且在增长,暗示业务已接近或达到盈亏平衡
  • Andreessen Horowitz的分析指出,开源AI模型的推理成本正在以每年50-70%的速度下降(来源:a16z, 2026-07),这意味着当前的低价在未来可能变成高利润

我的判断:基于DeepSeek公开的架构效率数据,$0.28/百万输出token的定价在技术上是可以实现正毛利的——前提是调用量足够大以摊薄固定成本。这不是补贴性定价,而是效率驱动的定价。但利润率可能很薄(估计5-15%,此为基于公开技术参数和行业成本结构的推测性估算,非基于DeepSeek内部财务数据),这意味着DeepSeek的商业模式更像是”薄利多销”而非”高毛利”。

对立视角三:Agent基准领先是否等于商业价值领先?

还有一个值得正视的质疑:在9项Agent基准上超越Pro版本,是否真的意味着V4-Flash在商业应用中更有价值?

质疑的合理性:基准测试是标准化的、可重复的任务,而真实世界的Agent应用面临的挑战远比基准复杂——包括模糊的用户指令、不完整的环境信息、需要常识推理的边缘情况、以及多Agent协作场景中的协调问题。一个模型可能在SWE-bench上表现优异,但在面对企业内部非标准化的代码库和工作流时表现平庸。

此外,Pro版本可能在其他维度(如创意写作、复杂推理、多语言能力)上仍然保持优势,而这些维度在Agent基准中未被充分衡量。DeepSeek选择以Agent基准作为核心宣传维度,本身就是一种叙事策略——它突出了V4-Flash最强的一面,而非全面的能力画像。

我的判断:Agent基准领先是一个强信号,但不是充分条件。它证明了V4-Flash在结构化Agent任务上的能力,但用户在做采购决策时,还需要考虑自身具体场景与基准任务的匹配度、模型在非标准化场景中的鲁棒性、以及长期可靠性。建议企业用户在正式部署前,使用自身业务数据进行小规模验证测试。

闭源阵营的战略困境

与开源阵营形成对比的是闭源阵营的处境。当OpenAI、Anthropic等公司面对开源竞争时,他们的选择空间是有限的:

选项A:激进降价。这是OpenAI正在做的,但会压缩研发投入,可能形成恶性循环。

选项B:维持高价,依靠能力差异化。这要求闭源模型在能力上保持显著领先,但当V4-Flash在Agent基准上超越Pro版本时,这个领先正在被侵蚀。Anthropic的Claude 4 Opus在某些推理任务上仍然领先,但差距在缩小。

选项C:自己也开源。Meta已经走上这条路(Llama系列),但OpenAI的商业模式更难兼容大规模开源——其估值的很大一部分建立在闭源模型的独占性上。

选项D:转向服务层。不在模型本身竞争,而是在部署、定制、安全合规、企业支持等服务层面建立差异化。这可能是最可行的长期路径,但需要大规模的组织能力转型。

没有一个选项是没有代价的。这就是为什么DeepSeek的开源策略对闭源阵营构成的不只是价格压力,而是战略困境。


第五章:大多数人没看到的维度

约束驱动创新:中国AI的系统性效率优势正在固化

媒体报道通常将DeepSeek的成功归因于”更低的人力成本”或”更聪明的工程师”。这两个解释都不够准确,也不够深刻。

更准确的描述是:DeepSeek代表了一种约束驱动创新(constraint-driven innovation)的范式。由于在高端GPU供应上受到美国出口管制限制(H100/A100受限,只能获取H20等降级版本),中国AI团队被迫在算法效率上进行更深度的优化——包括稀疏注意力、混合专家架构、训练效率改进、KV缓存压缩等。

这些优化的副产品,是在相同算力下实现更高性能,或者在更低成本下实现相同性能。Lightning Index的前瞻稀疏注意力机制、MLA架构的KV缓存压缩、以及面向百万token上下文的高效架构研究,都是这种约束驱动创新的直接产物。

这里有一个大多数人没看到的关键点:即使未来算力供给约束放松(比如出口管制放宽,或国产GPU性能追上),这些效率优化成果已经被固化在架构设计中,不会消失。它们会叠加在更强的硬件之上,产生更大的性能优势。

这意味着,芯片限制对中国AI的影响可能与直觉相反:短期内确实造成了算力瓶颈,但长期来看,它迫使中国团队在软件效率上建立了结构性优势。当限制解除时,这些团队将同时拥有效率优势和算力优势——这比只有算力优势的竞争对手更可怕。

但这个论断也有其局限性,需要诚实面对:约束驱动创新的前提是约束程度处于”可克服但需要创新”的区间。如果芯片限制进一步收紧到连H20也无法获取的程度,或者国产GPU的性能差距在未来几年内未能显著缩小,那么约束可能从”创新驱动力”变为”发展天花板”。此外,美国AI团队并非不进行效率优化——他们只是在效率和算力两个维度上同时推进,只不过算力充裕降低了效率优化的紧迫性。如果美国团队开始认真投入效率优化(例如受到成本压力驱动),中国团队的效率优势可能被部分抵消。

Agent能力评测体系本身正在成为竞争战场

V4-Flash在9项Agent基准测试上超越Pro版本,这个事实本身揭示了一个更深层的竞争动态:评测体系的定义权正在成为竞争资源

当一家公司在某套基准测试上表现出色时,它有动机推广这套测试作为行业标准;当另一家公司在不同维度上有优势时,它会推广不同的评测框架。Papers With Code的Agent基准排行榜(来源:Papers With Code, 2026-07)显示,不同的评测框架(SWE-bench vs WebArena vs GAIA vs ToolBench)给出的模型排名存在显著差异。

DeepSeek选择以Agent基准作为V4-Flash的核心宣传维度,不只是因为它在这些测试上表现好,更是因为Agent能力是未来AI应用的核心价值驱动因素。通过在Agent评测上建立领先,DeepSeek实际上是在说:我们的竞争优势在未来最重要的应用场景上

这是一种前瞻性的叙事控制——它不只是在报告当下的产品性能,而是在定义未来竞争的评判标准。

价格战的终局不是零利润,而是寡头化

一个常见的担忧是:AI价格战最终会导致所有玩家都陷入零利润竞争,类似于互联网早期的流量大战或共享单车的烧钱竞赛。

但这个类比忽略了AI基础设施的一个关键特性:规模经济的非线性效应。当调用量达到一定规模时,多个正反馈循环同时启动:

  1. 算力利用率提升:更大的调用量意味着GPU利用率更高,固定成本被更多请求分摊
  2. 推理优化积累:更多的实际请求数据帮助优化批处理策略、缓存命中率和路由效率
  3. 数据飞轮加速:更多的用户交互数据可用于模型改进和Agent能力优化

DeepSeek年化收入在低定价下依然实现翻倍增长,正是这种规模效应的体现。

价格战的真正终局,不是所有人都亏损,而是只有少数能够在规模和效率上同时达到临界点的玩家能够盈利。其他玩家要么被淘汰,要么找到差异化的利基市场(如特定行业垂直场景、特定地区合规需求等)。

最终可能存活的玩家数量,我的判断是全球范围内不超过5-7家:美国方面可能是OpenAI、Anthropic、Google、Meta(开源);中国方面可能是DeepSeek、阿里巴巴(Qwen)、以及1-2家其他玩家。这一判断是基于当前竞争格局和规模经济逻辑的推测性预判,实际终局受技术突破、政策变化、资本市场波动等多重不确定因素影响,可能与预判存在显著偏差。 这个终局对整个AI生态的重塑影响,远比单次降价公告更深远。

被忽视的风险:地缘政治与数据合规

在讨论DeepSeek的竞争优势时,有一个经常被技术分析忽略的维度:地缘政治风险和数据合规约束。

对于欧美企业用户来说,使用中国公司的AI API存在数据主权和合规方面的顾虑。欧盟的AI Act、美国的行政命令对AI供应链的审查,都可能限制DeepSeek在某些高敏感度场景中的应用。这意味着即使DeepSeek在技术和价格上具有明显优势,其可触达市场(Total Addressable Market)可能受到非技术因素的限制。

反过来,这也解释了为什么OpenAI即使在价格上不占优势,仍然能够维持相当的市场份额——对于受监管行业的企业客户来说,供应商的地缘政治属性是采购决策的重要因素。

我的判断:地缘政治因素会限制DeepSeek在北美和欧洲受监管行业的渗透速度,但不会阻止其在以下场景中的快速增长:(1)中国国内市场;(2)东南亚、中东等对数据主权要求相对灵活的市场;(3)全球范围内对成本敏感的中小企业和开发者。这些市场的总量足以支撑DeepSeek的规模效应。但需要注意,地缘政治环境正在快速变化——2026年下半年至2027年的政策走向可能显著改变这一评估,特别是如果美国进一步收紧对中国AI企业的制裁范围。


结语:当Agent能力成为新战场,均衡点在哪里

短期(未来12-18个月):价格下行通道尚未结束

从当前的竞争态势看,AI模型价格的下行通道远未结束。DeepSeek以$0.14-0.28/百万token入场,Moonshot和智谱扩张20,000块GPU的算力,OpenAI被动降价——这些信号共同指向一个方向:未来12-18个月内,主流模型的API价格将继续下降,可能再降50%以上。这一预判基于当前可观察的竞争动态和技术成本下降趋势,但实际降幅取决于算力供给变化、需求增长速度、以及是否出现新的技术范式转换。

对于企业用户来说,这意味着现在签订的长期AI服务合同可能在12个月后显得过于昂贵。建议采用短期合约或按量付费模式,保留切换供应商的灵活性。

中期(2-3年):能力维度的竞争将超越价格维度

价格竞争有物理下限——推理成本不可能降到零,因为算力、能源、运维、带宽都有实际成本。当价格接近这个下限时(根据当前成本结构推算,可能在$0.05-0.10/百万token区间),竞争将主要在能力维度展开。

在Agent能力这个新战场上,百万token上下文的有效利用只是起点。下一阶段的竞争可能围绕:

  • 多模态Agent能力(同时处理代码、文档、图像、视频)
  • 工具调用的准确性和可靠性(从62%提升到90%+)
  • Agent任务的自主规划能力(从执行指令到自主分解复杂目标)
  • Agent系统的安全性和可控性(防止Agent执行有害操作)

DeepSeek通过V4-Flash在Agent基准上的领先,已经在这个新战场上建立了早期优势。但这种优势的持续性,取决于其在后续技术迭代中能否保持领先节奏。

长期:开放生态vs闭源护城河的终极博弈

中美AI竞争的深层结构,是两种商业模式的博弈:以DeepSeek为代表的开源+低价模式,与以OpenAI为代表的闭源+能力溢价模式。

历史上,类似的博弈在操作系统(Linux vs Windows)、数据库(MySQL/PostgreSQL vs Oracle)、云计算(开源工具链 vs 专有服务)等领域都有先例。结果通常不是一方完全消灭另一方,而是市场分层:开源主导大众市场和基础设施层,闭源在特定高价值场景保持份额和溢价。

AI领域的分层可能类似:

  • 开源主导层:对成本敏感、定制需求强、技术能力充足的企业部署场景
  • 闭源溢价层:需要最高能力保证、最强安全合规、最完善支持服务、以及地缘政治合规的场景

但这个均衡点的形成,前提是闭源阵营能够维持真实的能力差距。当V4-Flash在Agent基准上超越Pro版本时,这个前提正在受到挑战。如果这个趋势延续——如果开源模型在能力上持续追平甚至超越闭源模型——那么闭源模型将面临越来越难以维持的能力溢价,市场分层的边界将向有利于开源的方向移动。

需要承认的不确定性:上述分层模型假设了相对稳定的技术演进路径。如果出现范式级别的技术突破(如全新的架构范式、量子计算与AI的结合、或者AGI级别的能力跃迁),当前的竞争格局可能被彻底重塑,上述分析框架的适用性将需要重新评估。

对读者意味着什么

如果你是AI应用的开发者或企业用户:现在是重新评估AI基础设施成本结构的时机。$0.14-0.28/百万token的Agent级能力,意味着大量此前因成本过高而不可行的应用场景开始变得经济可行——比如对整个代码库进行持续性Agent监控、对长文档进行实时摘要和问答、或者构建能够处理复杂多步骤工作流的自主Agent。但在选择基础模型时,不要只看token单价,要计算Agent任务完成成本——这才是真实的使用成本。同时建议在正式生产部署前,使用自身业务数据进行至少2-4周的对比测试,因为基准测试性能与特定业务场景的实际表现之间可能存在差距。

如果你是AI行业的投资者或战略规划者:中美AI竞争的竞争维度已经升级。未来的赢家不一定是token最便宜的,而是在Agent任务成本、长上下文效率、开源生态影响力这三个维度上能够同时领先的玩家。DeepSeek目前在这3个维度上都展示出强劲的竞争力,但这个竞争格局仍在快速演变——特别要关注Anthropic在Agent安全性上的差异化路径,以及Google在多模态Agent上的投入。投资决策还需考虑本文未深入讨论的因素,包括各公司的团队稳定性、监管政策走向、以及潜在的技术路线风险。

如果你是AI研究者:Lightning Index等面向超长上下文的效率优化研究,正在从学术论文快速转化为商业产品的核心竞争力。这个转化速度(论文到产品约2个月)本身就是一个值得研究的现象——它意味着基础研究与工程实现之间的距离正在被压缩到数月而非数年。如果你的研究方向与长上下文效率、Agent能力优化、或稀疏注意力机制相关,你的工作可能比你想象的更快进入商业应用。


7月30日的对撞,不是价格战的终点,而是一个新竞争维度的起点。在Agent能力成为新战场的时代,技术效率、商业定价和生态策略的三角博弈,将决定未来AI格局的最终形态。而这个形态的轮廓,正在以每月可见的速度变得清晰。


参考资料

  1. DeepSeek’s V4 Flash Guts OpenAI’s Price War Within Hours, Matching Opus-Grade Output At $0.28 Per Million Tokens — WCCFTech, 2026-07-31

  2. OpenAI cuts prices for two of its AI models as cost worries mount — CNBC, 2026-07-30

  3. DeepSeek Retrained V4-Flash Beats Its Flagship Pro on Nine Agent Benchmarks — TechTimes, 2026-07-31

  4. Lightning Index: Ultra-Long Context via Lookahead Sparse Attention — arXiv, 2026-06

  5. Towards Highly Efficient Million-Token Context Intelligence — arXiv, 2026-06

  6. A million-token context that agents can actually use — HuggingFace Blog, 2026

  7. DeepSeek Releases Official V4-Flash Model as China’s AI Race Intensifies — Caixin Global, 2026-08-01

  8. DeepSeek V4-Flash Technical Report — GitHub/DeepSeek, 2026-07-30

  9. 来源: OpenAI Blog, 2026-07-30 — API Price Updates July 2026(GPT-4.5及o3-mini降价20%-40%公告)

  10. Anthropic Claude 4 Opus Benchmark Performance — Anthropic Research, 2026-06

  11. Agent Benchmark Leaderboard: SWE-bench, WebArena, GAIA Comparison — Papers With Code, 2026-07

  12. The Economics of Open Source AI: How DeepSeek Changed the Equation — Andreessen Horowitz, 2026-07

  13. China AI Startups Moonshot, Zhipu Expand GPU Clusters Amid US Chip Restrictions — Reuters, 2026-07-30

  14. MLA Architecture and Mixture-of-Experts Efficiency in Large Language Models — arXiv, 2025-01

  15. Long Context Efficiency Benchmarks: Needle-in-Haystack and Beyond — LMSYS, 2026-06

  16. 来源: Forbes, 2026-04-28 — “How DeepSeek and Qwen Are Reshaping the Open-Source AI Race”

  17. 来源: Bloomberg, 2026-07 — DeepSeek年化收入数据($400M-$500M区间,约为2025年运营率2倍;媒体估算,非经审计数据)