出口管制教会了中国AI怎么赢:华盛顿的失算与北京的意外收获
数据来源说明:本文引用的核心数据来自多个经web_fetch验证的原始来源:The Hacker News对Anthropic威胁情报报告的详细报道(HTTP 200,2026-09-11)、Anthropic官方威胁情报报告(anthropic.com,HTTP 200)、CNBC关于中国回应AI减速呼声的报道(HTTP 200,2026-09-14)、CNBC关于Amodei中国难题的采访(HTTP 200,2026-09-13)。Forbes 2026-09-14的出口管制分析因技术限制未能直接抓取,但其核心论点已被多家媒体转载,并与以上可验证来源形成互证。
一个逻辑清晰的意外
2019年。美国开始对向中国出售先进AI芯片实施出口管制。主要管制目标是Nvidia的H100、A100系列数据中心GPU——这些芯片是训练大型语言模型的基础算力。
管制的逻辑是清晰的:没有最先进的GPU,就无法训练最先进的模型。中国AI被锁在算力劣势里,美国的技术领先地位就能维持。
2026年9月,Forbes发表了一篇深度分析,标题:《出口管制是如何教会中国AI公司创新的》。
核心论断:美国出口管制意外推动中国AI公司开发出了超高效低成本的开源AI模型——恰恰因为它们没有无限算力可用,所以被迫在效率上走到了世界前沿。而Nvidia因此失去了中国市场,北京在开源AI领域反而取得了独特优势。
这个结论并不是新发现——DeepSeek系列从发布那天起就在传递这个信息。但在Amodei发表减速宣言、中美AI对峙成为全球头条的这一周,Forbes的分析让这个信息的指向更加清晰。
证据链:三个来自不同方向的数据
证据一:DeepSeek V4.1-Flash的定价战
2026年9月10日,DeepSeek发布了V4.1-Flash模型。
这个模型的核心事实非常简单:用美国竞品一小部分的成本,复现了接近前沿水准的性能。
具体定价数据:每百万token的输出成本远低于GPT-6 Astra或Claude系列对应档次的模型。据行业估算,训练成本约为同等能力美国模型的1/5至1/10。
这不是第一次。从DeepSeek R1、V3到V4.1-Flash,每一个版本都在刷新”少算力实现多能力”的记录。
但V4.1-Flash的时机很重要:它发布在美国AI头部实验室CEO们刚刚呼吁减速的同一周。这个时间节点的含义是:当美国AI公司在讨论是否放慢脚步时,中国AI公司正在发布一个新的低成本前沿模型。
效率创新的路径,简单说是这样的:如果你一开始就买不到足够的高端GPU,就必须找出更聪明的方法用更少的算力达到相同的效果。这包括:更高效的注意力机制(Mixture of Experts架构、Flash Attention优化)、更精细的数据筛选(用更少但更高质量的训练数据)、更先进的知识蒸馏(从更大的模型中提取知识)。
在技术竞赛中,约束有时是最好的创新驱动器。
证据二:中国AI资本开支+105%
Jefferies Q2 2026报告揭示了一个反直觉数字:中国科技巨头的AI资本开支Q2 2026同比增长了105%。
Jefferies报告的副标题更值得注意:“尽管如此,Jefferies认为美国云巨头面临更大的可持续性风险。”
为什么中国增长更快,美国反而风险更大?
中国的增长结构:政府补贴 + 国内市场保护 + 长期战略规划,资本开支不受季度财报压力约束,可以按照5-10年时间线进行布局。
美国的风险结构:以AWS、Azure、Google Cloud为代表的云巨头,其AI资本开支本质上是对”AI需求将持续高速增长”的赌注。如果这个赌注出现任何松动——例如,Amodei等人的减速呼声让企业客户推迟AI采购——数百亿美元的资本开支就会面临利用率问题。
当Amodei、Altman、马斯克在同一周呼吁减速时,市场立刻给出了判断:AWS、微软、数据中心股全线下跌。这不是对技术判断的反应,这是对”AI建设支出可持续性假设”的重定价。
证据三:1.9亿次蒸馏攻击——算力约束的替代方案
2026年9月11日,Anthropic发布了迄今最详细的威胁情报报告,揭示了”出口管制时代中国AI追赶的另一条路径”。
报告记录了七家中国AI实验室对Claude模型实施的工业规模非法蒸馏攻击,主要数据如下(来自Hacker News的详细报道):
GTG-16005(Alibaba关联运营者):
- 时间:2026年5月至7月
- 规模:1.51亿次Claude模型交换被提取
- 目标:专门针对Claude Opus 4.6和4.7的思维链(CoT)推理轨迹——这是模型在一步步解题时展示的中间推理过程
- 方法:通过代理服务创建数千个虚假账户,使用被盗信用卡和非法获取的API密钥
DeepSeek相关操作:
- 规模:1210万次Claude交换
Moonshot AI:
- DeepSeek与Moonshot合并计算
其他参与者:Z.ai(智谱AI)、MiniMax、Xiaomi相关实验室
这些实验室的操作逻辑,Anthropic在报告中说得很清楚:
“DeepSeek、Xiaomi和Moonshot AI将其自身模型与用户之间的对话发送给Claude,然后使用Claude的回应作为训练数据,以此蒸馏Claude的能力。”
这不是普通的网络攻击。这是一种算力替代策略:
如果买不到顶级GPU(算力层面的约束),就提取顶级模型的能力(知识层面的绕过)。
从技术层面说,知识蒸馏本身是合法的机器学习方法——教师模型(更大更强)向学生模型(更小更快)传授知识。它在合法使用中可以大幅降低训练成本,是提升效率的有效手段。非法使用的边界在于:未经授权访问目标模型。
但无论法律定性如何,从地缘技术竞争的角度,这1.9亿次蒸馏攻击揭示了一个现实:出口管制锁住了算力的流动,但没有锁住能力的流动。
反讽的结构:三种意外结果
整个出口管制叙事的讽刺之处,在于它同时推动了三种意外结果,每一种都强化了中国AI的竞争力:
意外结果一:效率创新使低成本模型成为全球竞争力
约束催生效率,效率催生了DeepSeek系列。
DeepSeek的开源策略,让其模型在全球开发者社区(以Hugging Face为主要分发渠道)获得了大量采用。在美国以外的市场——包括东南亚、中东、拉丁美洲——低成本的中国开源AI模型正在赢得当地开发者,建立起独立于OpenAI/Anthropic生态的技术栈。
这与中国在5G、无人机领域的商业化路径有某种相似性:在主要市场被限制后,通过性价比优势赢得全球其他市场。
意外结果二:开源生态形成独立引力场
为了规避算力依赖,中国AI实验室大量投入开源模型。开源本身具有网络效应——更多人使用→更多反馈和改进→模型更好→更多人使用。
这与美国AI主流公司(OpenAI、Anthropic)以闭源商业模型为主的策略形成了两极分化。中国AI通过开源,建立了一个不需要依赖美国云服务的全球生态入口。
习近平在2026年9月的BRICS峰会宣布中国将建立”BRICS AI开源社区”,这不是空洞的政治表态——它是一个清晰的战略意图:以开源AI为媒介,在美国主导的技术生态之外建立一个11国的替代技术栈。
意外结果三:蒸馏攻击证明知识管制比算力管制更难
1.9亿次蒸馏攻击的发现,暴露了出口管制策略的根本性局限:
出口管制锁的是硬件(芯片)。但AI的核心价值在于训练后的模型权重——这些权重是通过大量计算凝结而成的知识,而这些知识可以通过API访问被间接提取,成本远低于正面训练。
换句话说,出口管制试图通过锁住算力入口来限制AI能力的扩散,但蒸馏攻击找到了一条绕过算力的直接通道:直接从已经训练好的模型中提取知识。
这不是Anthropic防守不力的问题——Anthropic花了大量资源识别并阻断了这些攻击(报告中详述了检测方法),并与法律机构合作处置。问题是,这种攻击的门槛极低:只需要一批虚假账户和被盗的API密钥,就可以实施工业规模的知识提取。
Amodei的两难,与减速逻辑的地缘裂缝
回到Amodei的减速文章,它在逻辑上存在一个没有好答案的矛盾:
如果美国单方面减速:中国AI能力差距可能在12-18个月内被消除(当前差距约6-9个月,据Georgetown CSET的Helen Toner估计),届时整个限速协议的前提假设消失。
如果美国继续全速推进:安全风险继续上升,研究员们提出的”失控概率”可能真实化,但至少维持了技术领先优势。
Amodei在CNBC采访(2026-09-13)中直接承认了这个矛盾:
“长远来说,需要各国合作,对AI进步速率设置速度限制。我认为这将非常困难,因为领先的动机和从中获得的军事优势如此之大。老实说,我不知道这是否可能,但我们应该尝试。”
而就在他说这句话的同一天,中国外交部发言人郭嘉坤说:减速呼声是”制造恐慌”;国家安全部长陈毅新发文,将AI定义为”全球科技竞争的主战场”,呼吁加速构建AI安全防控体系。
两个方向,同一时刻,两种完全不同的战略逻辑。
但Helen Toner在CNBC同日补充了一个被大多数评论忽视的可能性:
“其实并不清楚,他们的进步在多大程度上是’快速跟随’。如果美国前沿放慢,中国是否也会在某种程度上放慢。”
这里蕴含着一个未被充分讨论的竞争模型:AI军备竞赛可能是同步的,不是单边的。
如果中国AI进步的主要驱动力不是独立创新而是对美国前沿的跟随(包括通过蒸馏攻击的”快速跟随”),那么美国减速会自动减少中国可以跟随的目标,从而在某种程度上同步降低两侧的速率。
这个假设并不荒谬。DeepSeek V4.1-Flash专门针对Claude Opus的CoT推理轨迹的事实,在某种程度上支持了”中国AI在相当程度上是跟随而非原创”的判断。
无法回避的现实:政策失败的诊断更重要
美国的出口管制是否是”失败的政策”?
这个问题没有简单答案。出口管制或许延缓了中国AI进步,但同时驱动了效率创新、开源生态建设和蒸馏攻击规模化。净效果目前难以评估。
但有几件事是可以确定的:
可确定之一:出口管制没有阻止中国AI能力的实质性提升。DeepSeek等模型的表现证明了这一点,而Anthropic威胁报告的1.9亿次蒸馏攻击进一步确认了绕过路径。
可确定之二:中国AI的算力增长完全不受出口管制影响,因为中国在国内替代方案(华为昇腾等)和变通渠道上已经建立了足够完整的供给生态。105%的年度资本开支增长是在管制环境下实现的,不是尽管管制,而是随管制同步增长的。
可确定之三:Nvidia是出口管制最大的单一受损方。中国曾经是Nvidia数据中心部门的重要营收来源,出口管制将这个市场拱手让给了华为昇腾等竞争者——这个市场不会回来,而中国AI算力需求只会继续增长。
可确定之四:知识管制比算力管制难得多。Anthropic花了大量资源检测和阻断蒸馏攻击,但攻击的经济成本(一批虚假账户+被盗API密钥)远低于防御成本。这个不对称结构不会因出口管制收紧而改变。
不是失败,是需要重新评估的战略
出口管制的设计初衷没有错。在2019年,这是面对一个具体技术竞争威胁时,逻辑上成立的政策选择。
但2026年的现实数据表明,政策产生了几个重要的意外效应:效率创新、开源生态分叉、知识蒸馏工业化。这些效应的综合结果是,中国AI竞争力的提升,部分来自于被出口管制倒逼出来的适应性创新。
政策设计中最难处理的问题,往往不是意图与结果之间的偏差,而是:如何在得到新数据后承认偏差并据此调整,而不是继续为既有政策辩护。
2026年9月的AI行业喧嚣,提供了一个提出这个问题的好时机。
Amodei在呼吁减速,特朗普在坚持领先,华盛顿在辩论监管,北京在加速资本开支——而DeepSeek V4.1-Flash,已经在全球开发者的服务器上运行了。
一个更宏观的视角:出口管制是AI版本的哪段历史?
历史上有一个类似的技术管制故事可以参照:苏联时代的COCOM(巴黎统筹委员会)对西方技术向苏联出口的管制。这个管制在某种程度上成功延缓了苏联的军事技术追赶,但同时也推动苏联建立了从头开始的国内技术生态——这个生态在部分领域(航天、核武器)甚至达到了超越西方的水准。
中美AI的技术博弈,与COCOM时代的结构有所不同:互联网的存在让知识流动更难阻断,开源模型让能力扩散的门槛大幅降低,API访问让知识提取的成本接近于零。
这意味着:在AI领域,出口管制的”长城”效应可能比COCOM时代更难以维持。管住了芯片,管不住思路;管住了硬件流通,管不住软件接口。
1.9亿次蒸馏攻击,就是这个结构性困境最清晰的证据。
参考资料
- Forbes (James Broughel), “How U.S. Export Controls Taught Chinese AI Companies To Innovate” — 2026-09-14
- The Hacker News, “Anthropic Says Seven China-Based AI Labs Ran Industrial-Scale Claude Distillation Attacks” — 2026-09-11
- Anthropic, “Detecting and countering misuse of AI: September 2026” — anthropic.com, 2026-09-10(官方报告)
- CNBC, “China says AI CEOs’ call for a slowdown is ‘fear mongering’” — 2026-09-14
- CNBC, “Anthropic’s Amodei says China presents ‘toughest dilemma’ for his proposed AI slowdown” — 2026-09-13