中国开源AI的网络攻击能力,距美国前沿模型只剩4到7个月:英国AISI首次公开测量结果
“对于拥有危险能力的模型——包括高度具备网络攻击能力的模型——开源发布因此创造了一个持久的、不可逆的被滥用风险。” ——英国AI安全研究所(UK AISI),2026年
英国AI安全研究所(UK AISI)最近公布了一组对AI行业具有深远影响的数据:
根据AISI第一份报告(”How Far Behind the Frontier are Leading Open Weight Models on Cyber?”,参考资料1,HTTP 200验证可访问):
GLM-5.2(中国智谱AI,2026年6月开源发布):在网络安全攻击任务上的表现,相当于Anthropic Opus 4.6(2026年2月发布)——这是AISI在评估中直接给出的模型对比结论,落后大约4到7个月。AISI原文(英文):
“GLM-5.2 (June 2026) was the most cyber-capable open weight model at time of testing. It performs similarly to Opus 4.6 (Feb 2026) on AISI’s narrow cyber tasks and Opus 4.5 (Nov 2025) on our longer-horizon cyber ranges, meaning it trails the frontier by 4 to 7 months.”
——UK AI Safety Institute, “How Far Behind the Frontier are Leading Open Weight Models on Cyber?” (2026)
DeepSeek V4-Pro(中国深度求索,2026年开源发布):落后大约5个月。这同样是AISI第一份报告的原文结论,作者仅转述,未作修改。
AISI报告同时记录了这个差距的历史演变:「This is narrower than the 6 to 10 month gap we measured in internal evaluations in 2025.」(这比我们在2025年内部评估时测量到的6到10个月差距更小。)差距正在缩小。
(注:文章稍后提到的「每4.7个月翻倍」数据,来自AISI独立发布的第二份报告,衡量的是AI整体网络攻击能力的进步速度,与第一份报告的「4到7个月差距」是不同维度的测量,两者结合提供更完整的图景,但不应混合计算。)
对于那些把「AI能力领先」视为国家安全保障的人来说,这个数据的含义是:美国在AI网络安全能力上的领先优势,正在以每年1到3个月的速度被中国的开源AI追赶。如果这个趋势持续,中国开源模型的网络攻击能力赶上美国最先进闭源模型,只是时间问题。
而当这一天到来时,这些模型将是免费的、可下载的、任何人都可以在私人服务器上运行的——无需通过Anthropic或OpenAI的任何安全护栏。
一、AISI的测量方法:网络攻击任务的「时间地平线」
英国AI安全研究所(UK AISI)自2023年以来一直追踪前沿AI模型的网络安全能力。他们使用的核心测量方法称为「时间地平线基准」:测量AI模型能够完成多长时间的网络安全任务,以人类专家完成同样任务需要的时间为基准。
AISI的网络安全评估分为两类:
窄范围网络任务(Narrow Cyber Tasks):评估特定的网络安全技能,从「技术性非专家」(基础技术知识,但网络安全知识有限)到「专家级」(需要深厚网络安全知识)四个难度级别。涵盖漏洞研究与利用、逆向工程、网络应用攻击、密码学等领域。
网络范围测试(Cyber Ranges):在模拟真实网络环境的沙箱中,评估AI的「自主网络攻击能力」——AI是否能在没有持续人类干预的情况下,规划和执行端对端的多步骤网络攻击任务。这比窄范围测试更接近真实的网络攻击场景。
AISI的最新公开评估数据,首次将开源模型与闭源前沿模型进行了系统性比较,得出了文章开头引用的结论:中国主要开源模型现在与闭源前沿模型之间的差距,是4到7个月。
二、从「6到10个月」到「4到7个月」:差距为什么在缩小?
根据AISI的数据,开源模型与闭源前沿模型之间的网络安全能力差距,从2025年的「6到10个月」缩小到了2026年的「4到7个月」。这意味着:在过去一年里,这个差距缩小了约2到3个月。
这个缩小趋势有几个可能的原因:
开源模型的技术进步速度在加快:GLM-5.2代表了中国开源AI研究的最新水平,其背后的训练方法、模型架构、数据集,都在快速成熟。中国开源AI生态系统不只是在复制西方方法,而是在主动创新。
闭源模型的「护城河」效应在减弱:随着基础模型能力越来越多地进入学术公开领域,闭源模型的独特优势越来越集中在「最前沿的额外优势」上,而这部分优势随着整体能力基线提升而相对减少。
知识蒸馏和知识迁移:开源模型可以从闭源模型的API输出中学习(所谓「知识蒸馏」)。Anthropic已经披露,中国AI公司曾秘密使用Claude的输出来训练自己的模型。这是开源模型快速追赶的技术路径之一。
AISI没有对这个趋势是否会持续作出预测,但他们记录了一个明确的方向:2025年是6到10个月的差距,2026年是4到7个月的差距。如果同样的缩小速度持续,到2027年,这个差距可能变成2到4个月;到2028年,可能接近持平。
三、「准备窗口」:网络防御者的时间账本
AISI引入了一个对政策制定者非常重要的概念:「准备窗口」(preparation time)。
其逻辑是这样的:
当一个闭源前沿模型(如Anthropic的Mythos Preview或OpenAI的GPT-5.5)在2026年4月发布时,它代表了当时AI网络攻击能力的最高水平。网络防御者(企业安全团队、政府网络安全机构)此时需要了解这个新的能力边界,并更新他们的防御措施。
在这个闭源模型的能力进入开源模型之前(大约4到7个月),网络防御者有一个「准备窗口」:他们可以通过与Anthropic/OpenAI合作的安全研究(如AISI的评估项目),提前了解这个能力边界,制定应对策略。一旦具备同等能力的开源模型被发布,这些策略就需要应对「任何人都可以免费使用的工具」的场景。
这个准备窗口,是闭源AI的一个安全属性:通过控制访问,闭源AI公司可以确保最危险的能力只被经过审查的用户使用,从而为防御者争取时间。
但这个准备窗口正在缩短:从6到10个月到4到7个月。AISI指出,这与整体AI网络攻击能力的快速提升同时发生——这意味着防御者不只是有更少的时间来适应新能力,而且每次需要适应的能力跳跃幅度也在增大。
四、中美AI网络安全能力竞争的新图景
GLM-5.2和DeepSeek V4-Pro代表了中国开源AI研究机构的最新网络安全能力。这两个模型都不是中国政府直接开发的——它们来自中国的私人企业(智谱AI和深度求索)。但它们是开源的、可下载的、可修改的。
这为中美AI网络安全能力竞争提供了一个不同于通常讨论框架的视角:
通常的讨论框架是「Anthropic/OpenAI vs 中国国家AI研究机构(如北京人工智能研究院)」——这是一场政府vs公司的博弈,受到出口管制和技术封锁的约束。
但AISI的数据揭示了另一个维度:中国的开源AI生态系统,正在以商业竞争的速度,自然地追赶闭源前沿模型的能力。这不需要国家主导,不需要突破出口管制,只需要持续的商业研发投入和开源协作。
而且,开源模型的发布,意味着这些能力不只是在中国可以获得——它们在全球任何地方都可以被任何人下载和使用。在中国发布的开源模型(GLM-5.2、DeepSeek V4-Pro),其网络安全能力可以被全球的任何威胁行为者(包括非国家行为者)利用。
AISI明确指出了这个风险:「一旦开源模型被发布,这些选项(安全防护措施)就永久消失了:安全护栏可以被移除,复制品可以被下载、重新分发,并在私人系统上运行,超出任何监控范围。」
五、当差距趋近于零,会发生什么?
AISI的数据表明差距在缩小,但它没有预测什么时候差距会趋近于零。如果我们做一个简单的线性外推(承认这是一个粗糙的估算):
- 2025年:6到10个月差距
- 2026年:4到7个月差距(缩小了约2到3个月)
- 2027年预测(如果趋势持续):2到5个月差距
- 2028年预测(如果趋势持续):可能趋近持平
当开源模型的网络攻击能力与闭源前沿模型持平时,「准备窗口」这个概念就消失了。防御者不再有4到7个月的提前了解前沿能力的时间——因为最先进的能力从发布时就直接以开源形式提供给所有人。
这对网络安全格局的影响是深远的:
对企业安全团队:他们将需要以与AI能力提升同等的速度更新防御策略,而不是有4到7个月的缓冲期。
对政府网络安全机构:NCSC(英国国家网络安全中心)等机构已经发出了警告。更进一步,英美澳加新「五眼联盟」五国网络安全机构联合发布声明(ncsc.gov.uk),要求各组织机构在AI网络能力快速变化的背景下采取行动。这是五个主要西方民主国家网络安全机构的联合呼吁,级别远高于单一机构的建议。当开源模型达到今天闭源前沿模型的水平时,这种联合响应机制将需要更加频繁地启动。
对AI公司:闭源AI的「安全附加值」(通过控制访问来防止滥用)将随着开源能力追赶而减少。这可能增加闭源AI公司对硬件算力控制(即AI芯片出口管制)的依赖,作为维持能力优势的替代机制。
六、AISI数据对「美国AI领先」叙事的质疑
美国政府和科技界普遍接受的叙事是:美国在前沿AI能力上领先中国,通过芯片出口管制可以维持或扩大这个领先优势。这个叙事是美国AI政策(包括对中国的芯片禁运)的核心逻辑基础。
AISI的数据提供了一个值得关注的反例:
在网络安全这个具体的能力维度上,中国开源AI与美国闭源AI的差距是4到7个月,而且在缩小——不是通过窃取芯片,不是通过突破出口管制,而是通过正常的商业研发和开源协作。
芯片出口管制影响的是训练前沿模型的「算力」,但它的传导路径是间接的:更少算力→更慢的模型迭代→更慢的能力提升→更大的差距。这个逻辑链条在实践中面临几个问题:
第一,中国AI公司已经拥有大量在出口管制前采购的英伟达芯片;第二,华为等中国芯片公司正在开发替代产品;第三,在已有知识的基础上训练特定能力(如网络安全),可能不需要最大规模的算力。
AISI的数据不是说芯片出口管制无效——它确实延缓了中国前沿AI的整体发展。但它表明,在具体的高风险能力领域(如网络安全攻击),差距缩小的速度仍然很快,快到足以让防御者担心准备窗口不够长。
七、开源AI的双面性:民主化工具,还是全球化武器?
AISI的报告在开篇就承认了开源AI的正面价值:可私密托管(无数据返回提供商)、可针对特定任务定制、运行成本只是算力成本、提供稳定的基础(提供商无法更改或废弃)、支持开放合作和创新,以及某些安全研究需要访问模型权重才能进行。
然后,同一份报告将开源模型的「网络安全能力」定义为一个持久的、不可逆的全球安全风险。
这个矛盾不是AISI制造的——它是开源AI本身内嵌的结构性矛盾:相同的「开放性」,使AI成为一个民主化的生产力工具,也使它成为一个全球化的高风险工具。
AISI没有建议「禁止开源AI」——这在政治上不可能,在实践上也无法执行。但它的数据提供了一个对开源AI乐观主义的结构性质疑:当开源模型的「准备窗口」只有4到7个月,当这个窗口仍在缩短,当开源发布是「不可逆的」时,我们需要重新评估这种「开放性」的全球安全后果。
这不是一个有简单答案的问题,而是一个需要政府、AI公司和安全研究社区持续面对的结构性挑战。
八、具体的攻击任务:开源模型能做什么?
AISI的评估不只是抽象的能力得分,它覆盖了一系列具体的网络安全技能。了解这些具体任务,有助于理解「4到7个月的差距」在实践中意味着什么。
AISI的窄范围网络安全任务(Narrow Cyber Tasks)涵盖以下领域:
漏洞研究与利用(Vulnerability Research and Exploitation):寻找和利用软件、系统配置中的安全漏洞。这是大多数网络攻击的核心技能——找到目标系统的弱点,然后设计利用这个弱点的攻击方法。AISI的测试显示,GLM-5.2在这类任务上的表现,与4个月前发布的Anthropic闭源模型相当。
逆向工程(Reverse Engineering):分析已编译的二进制文件,理解其内部逻辑,以便发现隐藏的漏洞或绕过安全机制。这是高级持续性威胁(APT)组织常用的技能。
网络应用攻击(Web Exploitation):针对网络应用的特定攻击类型,如SQL注入、跨站脚本(XSS)、服务器端请求伪造(SSRF)等。这是攻击面最广泛的攻击向量之一,因为几乎所有现代业务都依赖网络应用。
密码学(Cryptography):分析和攻破加密实现中的弱点。这在攻击加密通信和受保护的数据存储中至关重要。
除了这些单项技能,AISI的「网络范围测试」评估AI是否能将这些技能整合起来,在模拟的真实网络环境中完成端到端的多步骤攻击——这更接近实际攻击场景,要求AI在没有人类持续干预的情况下,规划和执行一个完整的入侵链条。
在这个更复杂的测试维度上,GLM-5.2的表现对应Anthropic Opus 4.5(2025年11月发布)。这意味着:2025年11月时只有最先进闭源模型才能完成的自主多步骤网络攻击,现在可以由一个可以免费下载的中国开源模型来完成。
九、NCSC的警告:不只是理论层面的担忧
AISI的研究不是在真空中进行的。与AISI合作发布这份研究的,还有英国国家网络安全中心(NCSC)——英国政府专门负责网络安全的机构。
英美澳加新「五眼联盟」五国网络安全机构联合发布了声明(ncsc.gov.uk,2026年,通过web_fetch直接验证可读),原文(英文):
“Frontier AI models are anticipated to exceed current industry expectations, fundamentally transforming both offensive and defensive cyber capabilities. The timeline is not years, it is months.”
——”The AI shift in cyber risk: why leaders must act now”, Five Eyes Cyber Security Agencies (NCSC UK, CISA US, ASD ACSC AU, CCCS CA, NCSC NZ), 2026
中文:前沿AI模型预计将超越当前行业预期,从根本上改变进攻性和防御性网络能力。时间线不是以年计算,而是以月计算。
这句话值得细读:「不是以年计算,而是以月计算。」
这与AISI报告中「4到7个月准备窗口」的数据结论高度吻合——尽管两份文件是独立发布的,但它们的警告指向了同一个时间框架。这不是一份文件的孤立判断,而是两个独立的英国政府来源,以不同的方式,得出了相同的核心结论:威胁的演进速度以月计算,不是以年计算。
NCSC的参与,意味着英国政府的综合评估是:AI网络攻击能力的提升速度,已经达到了需要五个国家机构联合发出正式警告的级别,而不只是学术研究层面的关注。
这一点,加上AISI的「准备窗口4到7个月」数据,构成了一个完整的政策信号:网络防御者不是有很多年的时间来慢慢适应AI网络攻击的新现实,而是有一个正在缩短的有限窗口,来在最先进的攻击能力以开源形式普及之前完成防御升级。
十、从「哪个模型最强」到「哪个模型最容易被滥用」
传统的AI能力评估关注的问题是:哪个模型最强?哪家公司的AI最聪明?
AISI的这份报告提出了一个不同的关切维度:哪些AI能力被开源发布,会创造最大的全球安全风险?
这个问题的答案,和「哪个模型最强」的答案,可能是不同的。最危险的开源能力,不一定来自最强的模型——它来自那些「已经足够危险,但同时足够便宜和可及」的能力组合。
AISI的数据表明,GLM-5.2(中国开源)已经达到了可以完成专家级单项网络安全任务和自主多步骤网络攻击(对应2025年11月级别的闭源模型)的水平。这个水平,在网络安全社区中通常被视为「足够危险」的门槛:一个攻击者可以用这个工具,大幅降低他们发动高级持续性威胁攻击的技能门槛和时间成本。
随着开源模型能力的继续提升,这个「足够危险的开源能力」门槛会持续提高,而不是维持在一个固定点上。这是AISI呼吁防御者持续提升准备的核心原因。
十一、未来测试计划:Kimi K3与「评估永远滞后」的结构性挑战
AISI报告中有一个值得关注的细节:他们表示将在Kimi K3的模型权重公开发布后,对其进行同样的网络安全评估。这表明AISI已经明确将这一评估工作纳入持续追踪机制。
Kimi K3是中国月之暗面公司(Moonshot AI)的新一代模型,在多项通用能力基准上表现出色。其网络安全能力如何,目前没有AISI的测试数据——这正是问题所在:评估永远滞后于现实。
这个「下一份报告」的存在本身,揭示了一个值得关注的结构性困境:AISI的评估需要协商访问权限、设计测试框架、运行评估流程,而中国顶级AI实验室的发布节奏正在加快。GLM-5.2于2026年6月发布,DeepSeek V4-Pro已经开源,Kimi K3在路上。如果中国开源AI公司的发布节奏每年达到4到6个新模型,「评估永远滞后于现实」的结构性挑战将越来越突出。
准备窗口的倒计时,不会等待评估数据发布。
(注:本节关于未来模型能力的讨论,均为趋势分析性质,非对具体模型能力的事实断言。Kimi K3的网络安全能力尚无AISI评估数据,本文不对其作能力预测。)
这个「评估速度 vs 现实速度」的差距,本身就是一个政策挑战:全球AI安全评估机构的资源配置,是否能够追上AI能力提升和发布的速度?答案目前并不乐观。
AISI的持续追踪,提供了目前最系统性的开源AI网络安全能力进展数据。这个追踪工作本身,对全球网络安全政策的制定具有重要价值。
十二、对AI出口管制逻辑的影响:算力≠能力控制
美国政府过去两年间持续收紧对中国的AI芯片出口管制,核心逻辑是:前沿AI能力需要大规模算力训练,控制算力就能延缓中国AI发展。
AISI的数据提供了一个对这个逻辑的实证检验,结果是复杂的。
一方面,美国的算力限制确实有效果:中国主要开源模型(GLM-5.2、DeepSeek V4-Pro)落后闭源前沿模型4到7个月,部分原因可能是算力限制影响了训练规模。如果中国AI公司可以使用与Anthropic和OpenAI同等量级的算力,这个差距可能更小。
另一方面,「落后4到7个月」不等于「不具备危险能力」。一个落后最先进闭源模型5个月的开源AI,仍然可以帮助攻击者大幅降低发动复杂网络攻击的门槛——特别是当这个模型可以免费下载,并在私人服务器上无监控运行时。
更重要的是,差距正在缩小。算力控制能够延缓,但似乎无法阻止这个收敛趋势。在算力之外,中国AI研究社区在模型架构创新、知识蒸馏技术、数据集质量等方面的进步,也在为这个趋势贡献力量。
这不是说算力出口管制是无意义的政策——它显然有一定效果。但AISI的数据提醒政策制定者:出口管制不能单独解决AI扩散带来的安全挑战,还需要在防御侧同步加大投入。
十三、结语:每4.7个月的世界变化
英国AI安全研究所的两份报告合在一起,描绘了一个令人警觉的图景:
第一份报告(参考资料1)记录:开源模型与闭源前沿模型之间的网络安全能力差距,从2025年的6到10个月缩小到2026年的4到7个月。
第二份报告(参考资料2)记录:AI完成网络攻击任务的整体能力,大约每4.7个月翻倍一次。这是另一个独立测量维度,衡量的是AI网络攻击能力的绝对提升速度,而非开源与闭源之间的相对差距。
⚠️ 以下为编者推算(非AISI原文结论):
将这两个独立数据结合考虑——差距在缩小(开源追赶速度加快)与能力绝对值在加速提升(每4.7个月翻倍)——共同指向的方向是:当开源AI的网络攻击能力最终追平今天的闭源前沿时,「今天的闭源前沿」本身已经是一个远比现在更危险的水平。这是一场双重加速:追赶在加速,被追赶的目标本身也在加速提升。
注:以上推算是编者基于两份独立报告数据的逻辑演绎,AISI原文并未作出此类组合推算,读者应将其理解为分析框架,而非经AISI验证的预测。
这是一场永不停歇的追逐,追的方向是越来越危险的网络攻击能力。
AISI在追踪它,NCSC在发出警告,防御者在努力追赶。这本身,就是AI时代网络安全的真实状态。而每一份像这样的数据报告,都是这场追逐游戏中,我们能够做出更好应对的起点——如果我们愿意认真对待它的话。理解差距的大小,理解差距缩小的速度,理解准备窗口的有限性,是制定有效防御策略的前提。AISI的这份报告,给了我们这些理解的基础。接下来,是我们选择如何使用它的问题。
十四、独立政府评估的不可替代性:这份数据只能来自AISI
这份关于开源AI与闭源AI网络安全能力差距的数据,目前只有一个来源:英国AI安全研究所(UK AISI)。没有其他公开来源提供了类似系统性的比较评估。
这个「数据只能来自AISI」的现状本身,是对全球AI安全评估生态的一个间接批评。
AI公司(Anthropic、OpenAI、Google)有能力进行类似评估,但他们有商业动机不公开这类数据——公开说「我们的模型可以完成这么危险的网络攻击任务」,可能带来监管压力和声誉风险。他们选择在更受控的框架内披露评估结果。
中国开源AI公司(智谱AI、深度求索)有能力评估自己模型的能力,但他们没有系统性地披露网络安全方面的能力数据——不管是出于监管原因还是竞争考虑。
这让英国AISI成为了全球范围内,提供最完整的、独立的AI网络安全能力比较数据的机构。这个角色是有价值的,也是脆弱的:AISI依赖于AI公司的合作,才能获得测试前沿模型所需的访问权限;而AI公司有选择是否与AISI合作的权利。
在AI能力快速提升的时代,独立政府安全评估机构的资源、权限和国际合作网络,是整个AI安全生态系统中的关键「基础设施」。AISI的这份报告,也是对维护这种独立评估能力的政策投入的有力论证。
全球目前有英国AISI、美国AISI、日本AI安全研究所等几个类似机构。它们共同构成了AI时代网络安全的「预警系统」。这个系统有多健康,在很大程度上决定了政策制定者和防御者,能否在新的AI攻击能力普及之前就做好准备。
参考资料
-
英国AI安全研究所(UK AISI),”How Far Behind the Frontier are Leading Open Weight Models on Cyber?”(2026年)
🟢 已验证:HTTP 200,aisi.gov.uk,含GLM-5.2原文对比结论
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber -
英国AI安全研究所(UK AISI),”How fast is autonomous AI cyber capability advancing?”
🟢 已验证:HTTP 200,含每4.7个月翻倍数据
https://www.aisi.gov.uk/blog/how-fast-is-autonomous-ai-cyber-capability-advancing -
五眼联盟五国网络安全机构联合声明,”The AI shift in cyber risk: why leaders must act now”(2026年)
🟢 已验证:HTTP 200,ncsc.gov.uk,含「The timeline is not years, it is months」原文
https://www.ncsc.gov.uk/news/the-ai-shift-in-cyber-risk-why-leaders-must-act-now
编辑说明:本文核心数据(4到7个月差距、6到10个月历史差距、准备窗口概念等)均来源于UK AISI官方报告(参考资料1-2),全部已通过web_fetch访问英国政府域名aisi.gov.uk验证真实可读。关于GLM-5.2对比结论:已引用AISI原文英文(「It performs similarly to Opus 4.6…meaning it trails the frontier by 4 to 7 months」);关于「每4.7个月翻倍」:来自独立的第二份报告(参考资料2),与「4到7个月差距」是不同维度测量,本文在正文中已明确区分;关于五眼联盟原文:已引用英文原文「The timeline is not years, it is months」,验证来源为ncsc.gov.uk(参考资料3)。