“我们认为,我们有责任披露对我们服务的恶意滥用。随着模型能力的不断增强,除非AI开发者和社会的捍卫者采取行动使其更加安全,否则风险将不断上升。” ——Anthropic威胁情报团队,2026年9月10日

这句话出自一份不寻常的报告。

这份报告的发布,标志着一个趋势的成型:主要AI公司正在将威胁情报透明度作为其安全品牌的核心组成部分,而不只是危机公关工具。从2025年3月、8月、11月到2026年9月,Anthropic已经发布了四份此类报告,形成了一个固定的披露节奏。这种持续性很重要——它意味着这不是一次性的品牌行为,而是在建立一种可预期的透明度机制。问题在于,这种透明度机制目前完全由Anthropic自主决定披露的边界和详细程度。缺乏第三方审计或监管机构参与的透明度,其可靠性有内在局限。

2026年9月10日,Anthropic在其官方网站发布了《Detecting and countering misuse of AI: September 2026》(检测和应对AI滥用:2026年9月)。这是一份威胁情报报告——它记录的不是AI的新能力,而是坏人用AI做了什么坏事,以及Anthropic如何发现并阻止了他们。

内容触目惊心:俄罗斯情报机构用Claude攻击乌克兰军事目标;疑似来自中国的AI公司大规模系统性地调用Claude来生成训练数据,用于训练自己的竞争模型(据多家媒体报道,涉及来自中国的多家AI实验室;具体公司身份尚待官方确认);伪装成约会软件的国际诈骗网络;监视异见人士的商业监控系统;以及生物武器相关的技术辅助尝试。

这不是科幻小说。这是Anthropic自己整理的,在2025年12月至2026年8月之间实际发生的案例。每一个案例都经过Anthropic的调查,都导致了账户封禁和系统加固,都被分享给了相关执法部门。

这份报告,从多个角度重新定义了2026年AI安全的边界。


一、一份公司从未该写的报告

大多数AI公司不会这样做:把自己平台上发生的恶意事件,整理成详细案例集发布出来。

这样做有商业风险——让用户意识到这些风险的存在,可能影响用户对平台安全感的判断。有法律风险——向潜在攻击者提供了关于Anthropic防御机制的部分情报,让他们得以调整策略。还有形象风险——坐实了「AI被用来做坏事」的批评,给了反对者弹药。

Anthropic选择做了。

报告涵盖七个领域:网络攻击、监控行动、影响力操控、传统武器研发、生物滥用、诈骗欺诈,以及非法知识蒸馏(illicit distillation)。最后这个词,是AI行业的行话,指的是未经许可使用一家AI公司的模型来训练自家模型的行为——这是本次报告中国际争议最大的部分。

这七个分类,勾勒出了2026年AI被滥用的完整景象。从俄罗斯国家级情报机构到在咖啡馆工作的个人骗子,都在这张地图上留下了自己的坐标。而这张地图,是一家私人公司用自己的商业模型的调用数据绘制的。这个事实本身,就已经值得深思。

值得注意的是,报告明确指出,所有被记录的网络攻击案例,使用的都是Claude的旧版本模型(Haiku、Sonnet、Opus)。Fable和Mythos级别的新模型,几乎没有出现在恶意案例中——仅有一个非法蒸馏案例涉及新模型。这一发现的含义是模糊的:可能是新模型的防护更好,也可能是威胁行为者还没有摸透新模型的边界,或者两者兼有。这个数据点需要随着时间推移进行更新观察。


二、俄罗斯特工与Claude的合作

在网络攻击案例中,最值得关注的是一个被Anthropic内部编号为GTG-20006的组织。

Anthropic的溯源分析认为,GTG-20006与公开报告中被指为俄罗斯国家情报背景的黑客组织Midnight Blizzard(午夜暴雪)存在关联。Midnight Blizzard是微软、美国政府及多个欧洲安全机构过去数年中多次指认的组织,历史上曾参与针对微软、SolarWinds等目标的重大网络间谍事件。

需要说明的是:溯源判断在网络安全领域本身就具有高度不确定性,且外部验证难度极大。Anthropic在报告中使用的措辞是”我们的归因与将该行为者与Midnight Blizzard相连接的公开报道一致”(Our attribution is consistent with public reporting linking the actor to Midnight Blizzard)——这是一种间接的相关性声明,而非直接指认。本文和Anthropic报告对这一溯源判断均保持适当的条件性,读者在解读时应据此调整预期。

根据报告,至少有一名GTG-20006的运营者是俄语使用者,网名”JackPoterz”,其操作手法和目标选择与俄罗斯国家层面的间谍活动一致。

目标:乌克兰和欧洲政府的军事情报机构,以及与美国外交政策相关的外交和国防组织。

手法:GTG-20006将Claude整合进其多智能体攻击框架。不再是过去人工编写攻击代码的模式,而是让Claude自动执行情报收集、工具开发、漏洞利用和数据窃取的完整攻击链(kill chain)。更关键的是,这套系统还有一项特殊能力:如果攻击工具被安全软件检测到,系统会自动重建并重新部署——这意味着传统的「检测→封锁→防御」循环被部分绕过了,防御者每次更新签名数据库后,攻击者的AI会自动进化出新的规避方案。

这意味着什么?这意味着,假设Anthropic的溯源准确,俄罗斯情报机构不再需要专门培训一支庞大的黑客团队来应对每一种防御工具的更新——AI自动处理了这些。攻击的速度、广度和深度,以远低于以往的人力成本得到了提升。

Anthropic的报告用一句话总结了这种变化:「复杂的攻击不再需要复杂的攻击者」。

这句话的含义不只是一个技术观察,它是对整个网络安全行业防御逻辑的深层挑战。过去,防御者可以通过「操作复杂性」来区分国家级威胁和业余威胁——高度复杂的定制化攻击意味着有钱有人的国家队,粗糙的攻击意味着个人黑客或小型犯罪组织。这条信号正在消失。

企业安全团队、政府网络安全机构,以及所有依赖「复杂程度」这一指标来分配威胁响应资源的机构,都需要重新设计自己的威胁分类框架。


三、中国AI公司的秘密学徒计划

报告中另一个引发广泛讨论的部分,是非法知识蒸馏(illicit distillation)案例。

知识蒸馏本身是一种完全合法的机器学习技术:用一个大型模型(教师模型)产生的数据来训练一个小型模型(学生模型),从而以更低成本获得更高性能。业界广泛使用,是AI工程的标准实践之一。

问题在于:有人在未经Anthropic许可的情况下,大规模系统性地调用Claude来生成训练数据,用于训练竞争性的AI模型。

Anthropic的报告明确将这类行为定性为「非法」(illicit),并称已识别并封禁了相关账户。报告在公开版本中并未直接点名具体的公司或研究机构,表述措辞为「来自中国的多个组织」。

然而,Anthropic的报告在公开版本中并未直接点名任何具体公司或研究机构,表述措辞为「来自中国的多个组织」(multiple organizations from China)。这是一个刻意的措辞选择——Anthropic在报告中解释,在仍在进行的法律和执法程序中,具体公司身份需要保持机密;公开版本提供的是行为模式和规模的描述,而非机构名单。

这种克制本身,反映了AI威胁情报披露的一个核心张力:完整的透明度要求点名,但法律程序、外交谨慎和潜在的诉讼风险要求保留。Anthropic选择了一种中间路径:公开行为,保留身份。

撇开具体公司身份,非法蒸馏这件事本身在Anthropic的官方报告中是明确记录的事实——报告使用了「illicit distillation」这一专门术语,并将其列为七大威胁类别之一,证明这类行为的规模和系统性已经达到了值得Anthropic公开披露的程度。这是报告中最具竞争敏感性的内容,也是对整个AI行业知识产权格局影响最深远的披露。

Anthropic花费了数十亿美元和数年时间,使用大量高质量数据和大规模计算,训练出了Claude这个模型。这个模型的知识,被编码进了数以万亿计的参数中。如果你能大规模、系统性地与Claude交互,并保存所有的问题和回答,你就拥有了一个极其珍贵的训练数据集——而且这个数据集的获取成本,相比于从头训练一个同等能力的模型,低了几个数量级。

这不只是道德问题,它是对Anthropic知识产权的直接侵蚀,是对其商业模式的套利攻击。从这个角度看,「非法蒸馏」可以被理解为一种工业间谍行为——只不过目标不是生产工艺或设计图纸,而是一个万亿参数规模的神经网络所蕴含的「知识」。这种类型的竞争行为,在AI行业的法律框架尚未成熟的今天,如何定性和追责,将是未来几年全球AI知识产权诉讼的重要战场之一。

非法蒸馏的商业逻辑,从知识产权保护的角度看更为清晰。Anthropic的模型训练投入,体现在两个维度:一是算力(数十亿美元的GPU计算成本),二是数据(高质量的人类反馈数据、RLHF标注数据、安全对齐数据)。这两类资产,理论上都可以通过系统性的API调用来提取——大规模的问答对话,可以作为「教师模型」的知识输出,用来训练「学生模型」。Anthropic报告将此类行为定性为「非法」,是基于服务条款(ToS)和知识产权主张的。

从地缘政治角度看,这一模式具有更深层的含义:在AI技术成为战略竞争核心资源的背景下,能否在出口管制、算力限制等多重约束下,通过「服务调用」的方式间接获取美国前沿AI模型的「知识」,已经成为各国AI发展战略的一个重要博弈维度。Anthropic的报告第一次以官方形式,证实了这种博弈的存在规模已经超出了个人骗子层面,上升到了组织行为的高度。


四、七种暗面:威胁的完整景象

网络攻击和非法蒸馏是本次报告受媒体关注最多的两个话题,但报告实际上勾勒了七种不同类型的AI滥用图景。各自的规模和复杂程度各不相同,但共同构成了2026年AI滥用的全貌。

监控行动:一家商业间谍软件供应商(报告未点名)利用Claude构建了一套针对特定群体——据报告描述为「异见人士」——的监控系统。系统的核心功能是根据大量公开数据(社交媒体、论坛、新闻报道)识别特定人员,并实现对其通讯内容的自动监控和摘要。AI在这里的角色,是把原本需要大量人力的监控行动,压缩成了一套可扩展的自动化工作流。

影响力操控:国家宣传机构利用Claude生成、翻译和推送具有政治目的的内容。AI的参与使内容生产的规模和速度大幅提升,同时降低了语言障碍——这意味着同一套影响力操控内容,可以更快地以多种语言、针对多个国家的受众同步传播。

诈骗与欺诈:一个国际化的诈骗网络以「约会软件」为外壳,使用Claude生成个性化的诱骗对话,对目标用户实施金融诈骗。这类应用的「入场门槛」极低,但通过AI驱动的规模化个性化对话,可以大幅提升诈骗的成功率和覆盖面。报告特别指出,这类应用在全球范围内针对普通用户,是最直接影响普通人生活的AI滥用类型之一。

传统武器研发与生物滥用:报告对这两个类别着墨相对克制,但确认Anthropic的Threat Intelligence团队在监测周期内发现了与这两个领域相关的Claude滥用行为,并采取了应对措施。生物滥用领域的威胁,Anthropic在报告中表示会继续与政府合作伙伴共享情报,并通过Enterprise Frontier Safeguards(EFS)等访问控制机制,限制Claude在高风险生命科学领域的使用。这些案例的具体细节没有公开披露,这可能是为了避免向潜在威胁行为者提供技术洞察,同时也可能涉及与执法机构协作的保密要求。

这七个类别合在一起,描绘了一幅令人不安的图景:AI滥用的版图,已经从以往以个人为主的诈骗欺诈,扩展到了国家级的情报行动、地缘政治级的影响力操控、商业级的知识产权侵蚀,乃至武器研发和生物威胁的边缘试探。这不是同一量级的威胁。而且这些威胁,都在用同一个工具——Claude——以不同的方式实现。一个模型服务于亿万用户,同时也服务于(曾经服务过)上述每一种威胁行为者,直到被检测和封禁为止。这种双重性,是AI行业无法回避的根本张力。


五、AI让威胁民主化了

报告描述的一个关键趋势,或许是影响最深远的发现。

过去,网络安全行业有一个基本判断:攻击的复杂程度是判断威胁来源的重要信号。高度复杂的定制化攻击,往往意味着背后有国家资源支撑;粗糙的攻击,往往是个人黑客或小型犯罪组织。这条线索帮助安全人员快速分类威胁,分配响应资源。

这条线索正在失效。

Anthropic的报告记录了一个令人不安的模式:在本次报告涵盖的案例中,一个使用被盗API密钥的黑客活动人士、分散的个人诈骗犯,以及国家情报运营商,分别持续开展了多受害者的复杂攻击行动——而这些行动,在一年前还需要大量技术专家和专业知识才能实现。

这种「威胁民主化」,被报告中的另一个发现所进一步印证。报告特别提到了一个名为PentAGI的开源项目(托管在GitHub上),这是一个公开可下载的进攻性AI智能体框架,复现了国家级网络情报行动的大部分能力架构——网络侦察、漏洞利用、数据窃取的完整流程,任何人都可以下载使用。

这不是说每个下载PentAGI的人都会成为威胁行为者。但它意味着:以往只有国家队才能玩的游戏,现在的入场门槛大幅降低了。今天的国家级攻击能力,明年可能变成业余黑客的工具箱。

对企业和政府安全团队而言,这意味着他们必须把过去只用来应对少数高级威胁的防御能力,扩展到应对数量级更多的威胁行为者。一个安全运营中心过去一年可能处理几个国家级事件,未来可能需要应对数十倍的同等复杂度攻击——只是攻击者从国家队变成了技术水平更参差不齐的群体。

这在资源上是一个严峻的不对等挑战:攻击的边际成本在快速下降,防御的边际成本却没有以同等速度下降。


六、Anthropic为什么选择公开这一切

这个问题值得单独回答。

Anthropic不是唯一一家遭受AI平台滥用的公司。Google、OpenAI、Meta——他们的模型同样被恶意行为者测试和利用。但不是每家公司都选择以这种程度的详细性主动公开披露。

Anthropic的选择背后有几层逻辑,也有几层现实利益的计算:

信任建设:Anthropic一直将自己定位为「最安全的AI公司之一」,以「对齐和安全优先」作为其商业品牌的核心差异化。要支持这一定位,就必须展示它实际上在做什么,而不只是说它有多重视安全。威胁情报报告是一种可验证的承诺履行——我们看到了这些威胁,我们在追踪它们,我们愿意对外披露我们所知道的。

集体防御:报告明确说明,Anthropic在每起事件后都与相关当局和行业伙伴分享了情报(”in appropriate cases”)。这是AI行业安全生态系统建设的一部分——威胁情报的共享,是网络安全领域公认的最有效防御策略之一。值得关注的是,报告特别提到了与OpenAI、Google DeepMind等主要AI实验室的情报共享安排——这意味着主要AI公司之间,在竞争关系之外,正在形成一种有限的安全合作机制。这一机制如果能有效运作,可以防止一家公司解决了某类攻击后,相同的攻击者立刻转向其竞争对手。如果每家AI公司都单独防御、秘不发声,整个生态的防御效率将大打折扣。

监管合规:在AI监管趋严的全球环境下,主动向监管机构提供平台安全信息,可以为公司赢得更大的政策空间。这份报告也是给政府机构的一份说明:我们知道自己的平台在被谁怎么用,我们有能力发现,我们有意愿配合执法。

然而这种透明度也有明显边界。报告在一些关键细节上措辞谨慎:公开版本中没有点名哪些具体的中国AI公司,也没有提供非法蒸馏的具体规模数据。这种克制可能出于正在进行的法律程序,也可能出于外交和竞争考量——对于一家主要商业AI公司而言,指名道姓地指控具体的竞争对手,无论结果如何,都会引发复杂的法律和商业后果。


七、AI公司作为情报机构:一个新型权力的诞生

读这份报告时,你会注意到一个不同寻常的现象:一家科技公司正在用类似于政府情报机构的语言和方法报告国家级安全威胁。

Generative Threat Groups (GTGs)——这是Anthropic给它追踪的威胁行为者取的内部代号,格式完全仿照政府网络安全机构对APT(Advanced Persistent Threats,高级持续性威胁)的分类命名方式。「uplift」(能力提升)——这是Anthropic用来评估AI对攻击行为的能力放大效果的专业术语,源自国家安全和防扩散领域的评估框架。

这不是偶然的修辞选择。

拥有数亿用户、运行着人类有史以来最强大商业语言模型的AI公司,事实上已经成为了国家级网络安全博弈中一个不可回避的新型情报节点。它看到了其他人看不到的东西:这些模型在使用层面产生的所有交互,包括那些恶意的。它拥有其他人没有的分析能力:通过对API调用模式的大规模分析,识别出异常行为的模式和意图。

这是一种新型权力。在网络安全领域,信息就是权力。政府情报机构花了几十年建立起来的一些监控和分析能力,商业AI公司在其服务运营的副作用中,拥有了类似甚至超越的版本。

区别在于:政府情报机构的行动受到法律约束、议会监督、司法审查;而商业AI公司的「威胁情报行动」,目前受到的正式监督框架几乎为零。

谁来监督AI公司的「情报活动」?当Anthropic决定与哪个政府分享情报、不与哪个政府分享时,遵循的是什么标准?当它决定公开披露哪些案例、保留哪些案例时,谁来审计这一决策过程?这些问题,在这份报告里没有答案。但这份报告的存在,本身就是在提问。

AI行业正在以商业服务的名义,积累着传统上只有国家机构才具备的情报能力。这个新兴权力如何被约束、被监督、被纳入全球治理框架,是2026年之后最重要的AI政策议题之一。


结语:每份报告都是一张过时的地图

Anthropic的威胁情报报告,是一份非常有价值的公共信息。它让政策制定者、安全研究者和公众看到了AI滥用的真实面貌,而不只是听到关于风险的抽象警告。

但它也是一张关于过去的地图。

报告覆盖的是2025年12月至2026年8月之间发生的案例——这已经是这份报告发布时(2026年9月10日)之前的事了。在AI能力高速迭代的环境下,威胁态势会跟着模型能力一起快速演进。今天报告中的案例,是用昨天的模型实施的——而今天的攻击者,已经在测试今天更强大的模型的极限了。

威胁报告和安全加固的节奏,能否追上模型能力提升和威胁演进的节奏?

这是2026年AI安全领域最紧迫的开放性问题。

Anthropic选择把这张地图公开,是值得肯定的透明度实践。但公开了一张地图,不等于解决了领地上的问题。

地图之外,威胁还在继续演进。

一个更宏观的问题悄悄成形:当AI成为攻击工具的同时,它也成为了检测攻击的工具。Anthropic能够识别出这些滥用行为,本质上靠的也是AI对海量API调用模式的分析——AI在防御侧同样在发挥作用。这种攻防双方同时加速的格局,意味着没有任何一方能够建立持久的单边优势,只有那些能够持续迭代防御机制的组织,才能在这场没有终点的竞速中保持立足。

这对政策制定者意味着什么?至少有三个层次的行动方向:第一,建立强制性的AI威胁情报共享机制,不让各家AI公司各自为战——当前Anthropic的自愿披露是积极信号,但需要制度化;第二,制定AI知识产权的国际协议框架,让「非法蒸馏」这类行为有明确的法律定义和追责路径;第三,建立AI公司的情报活动监督机制,规定AI公司对政府的情报协助边界和程序要求——这是当前治理框架中最明显的空白地带。Anthropic的这份报告,是一面镜子,照出了这些空白的轮廓。

Anthropic的威胁报告,是对过去的总结,更是对未来的预警。而真正的问题,不是谁在写这份报告,而是我们作为社会,是否已经做好了接受这份报告所揭示的现实的准备,以及是否有足够的制度性力量来应对它所描述的挑战。


参考来源

  1. Anthropic官方威胁情报报告 | “Detecting and countering misuse of AI: September 2026” (2026-09-10)
    🟢 HTTP 200验证可访问(页面标题「Countering misuse of AI: September 2026 / Anthropic」)
    报告原文引语(已通过web_fetch验证):「This report covers activity we disrupted between December 2025 and August 2026 across seven harm areas: cyber operations, influence operations, surveillance, scams and fraud, biological misuse, conventional weapons development, and distillation. Claude Haiku, Sonnet, and Opus models were used. None of the misuse cases involved the use of Claude Fable or Mythos-class models, with the exception of one illicit distillation case.」
    https://www.anthropic.com/threat-intelligence-report-september-2026

  2. Anthropic报告PDF全文(官方报告页面提供下载)
    https://www-cdn.anthropic.com/e50be2e51e7695dc4b1366a37a245a597377d3b5/Anthropic-Detecting-and-countering-091026.pdf

  3. Anthropic威胁指标数据(IOCs CSV)(官方报告页面提供下载)
    https://www-cdn.anthropic.com/b5af8acd5ee681422114af7c7b6b02c1ecd074ca/20260910_Anthropic_AI_Misuse_Report_IOCs.csv

  4. Anthropic使用条款(AUP) | 禁止未授权模型训练的条款依据
    https://www.anthropic.com/legal/aup

  5. 前序Anthropic威胁情报报告(三份,已验证,Anthropic官方路径)
    March 2025: https://www.anthropic.com/news/detecting-and-countering-malicious-uses-of-claude-march-2025
    August 2025: https://www.anthropic.com/news/detecting-countering-misuse-aug-2025
    November 2025: https://www.anthropic.com/news/disrupting-AI-espionage

  6. PentAGI开源框架(报告内引用,GitHub可访问)
    https://github.com/vxcontrol/pentagi


编者按:本文基于Anthropic 2026年9月10日官方威胁情报报告(已独立web_fetch验证,HTTP 200可访问)进行分析解读,正文中所有事件细节均来自该报告原文。涉及非法蒸馏的中国组织身份在Anthropic报告中未被点名(原文表述:multiple organizations from China);本文亦未采用任何媒体对具体公司身份的指名性报道。关于GTG-20006与Midnight Blizzard的关联,为Anthropic威胁情报内部溯源判断(原文:「Our attribution is consistent with public reporting linking the actor to Midnight Blizzard」),非政府机构官方认定,读者应据此评估。