当AI第一次自我声明「我是危险的」:GPT-6 Astra的Critical标签为何是一次历史性诚实
2026年9月3日,OpenAI发布了GPT-6 Astra,并主动披露:这是该公司历史上第一个跨越其Preparedness Framework(准备框架)”Critical”网络安全能力门槛的模型。
这句话的意思是:这个模型在网络攻击能力方面已经强大到让OpenAI自己都觉得必须特别标注。
这是AI历史上罕见的一刻——一家顶尖AI公司在发布新产品的同时,主动告诉世界:这个产品可能是危险的。
但更值得思考的问题是:这份诚实,是进步还是悖论的开始?而在Astra之前和之后,那些从未被测量的AI模型,我们知道什么?
数字首先说话
Astra在OpenAI自主开发的ExploitBench(漏洞利用基准测试)上拿到了100%的满分。
100%。满分。
前代模型GPT-5.6 Sol的得分是78.5%。在另一个更广泛的基准ExploitGym上,Astra达到42.4%,Sol是30.3%。
这些数字意味着什么?ExploitBench测试模型是否能够识别并利用已知漏洞,ExploitGym则测试更广泛的漏洞开发能力——包括理解漏洞原理、构建攻击链、适应目标系统的变化。Astra在两项测试中的表现,都超过了迄今为止任何一个被测量的前沿AI模型。
更让安全研究人员震惊的是另一项测试:OpenAI用Astra测试了过去三个月内披露的漏洞——也就是那些不在训练数据里的新漏洞——看它能否独立发现新的弱点。结果Astra找到了2个全新的zero-day漏洞。
OpenAI已将这两个漏洞通知了相关软件厂商。
这不是在测试模型能不能”记住”过去的攻击方法。这是在测试它能不能独立发现此前未知的安全漏洞。而它做到了。
这个细节重要到值得反复强调:2026年9月,一个AI模型在限定的三个月窗口内,在没有人类协助的情况下,找到了2个以前没有人知道存在的软件安全漏洞。这意味着AI不仅能执行攻击——它已经开始能够设计攻击了。
“Critical”的含义——以及它创造的悖论
OpenAI的Preparedness Framework将AI能力风险分为四个等级:Low、Medium、High、Critical。跨越Critical门槛意味着触发额外的部署限制。
具体体现在:Astra在企业中默认关闭。用户需要企业管理员手动开启,才能访问这个模型。
这是一种罕见的产品设计决定:你发布了一个产品,然后主动确保大多数人需要额外操作才能用上它。
定价反映了这一层级:每百万input token $10,每百万output token $50。对比GPT-5.6 Sol,Astra贵了大约3-4倍。企业版Astra Pro另供Plus、Pro、Business和Enterprise用户。对于合格的API客户,Astra支持Zero Data Retention(零数据保留)——这直接回应了Palantir等企业在数据主权上的诉求,也是OpenAI在面对企业买方压力时的策略性响应。
部署路径同样值得注意:Astra不仅通过OpenAI API提供,也通过Amazon Bedrock提供。这意味着已经在AWS生态系统里的企业,将在他们最熟悉的基础设施上接触到一个被OpenAI自己标记为”Critical级网络安全能力”的模型。这一部署方式让Astra的扩散速度远比”专门到OpenAI注册”要快。
然而这里存在一个核心悖论:Critical标签一方面是额外限制,另一方面也是营销。被OpenAI标注为”Critical”的模型,反而成了市场上最被谈论的模型。企业安全团队会去评估它;高级用户会想要解锁它;竞争对手会想知道自己的模型在同样测试下的表现。
这个悖论没有简单的答案,但它揭示了能力披露机制面临的结构性张力:越诚实,越显眼;越显眼,越有商业价值。
Greyhound Research的逆转论断
Greyhound Research首席分析师Sanchit Vir Gogia在Astra发布后提出了一个让整个企业安全社区都需要停下来思考的论点:
“Astra是唯一一个企业真正了解其网络安全能力的前沿模型。”
他的完整论断是:这是市面上唯一一个按照公布的能力阈值进行过测量并公开披露结果的模型。而其他所有前沿模型——那些已经通过企业VPN、已经坐在员工账号后面、已经接入企业系统的模型——从未被以这种方式测量过,也不会被测量,除非它们的厂商主动选择这样做。
“那些模型并不更安全,”Gogia说。”它们只是未知。”
这是一个令人不安的反转:当一家公司主动说”我们的产品越过了Critical阈值”,它实际上变成了整个市场里最透明的那个——而这种透明让它看起来最危险,尽管它可能只是最诚实。
Gogia进一步指出一个时间线悖论:Astra在8月10日之前,OpenAI说Critical能力”不能被排除”;到9月1日,OpenAI说门槛确实被越过了。但在这段时间内,Astra的能力没有任何变化。变的只是测试方法。
这意味着:Astra的Critical能力在OpenAI更新测试方法之前就已经存在——只是没有被测量和披露。这对于那些从未进行过类似测量的模型意味着什么,答案不言而喻:能力可能早已存在,只是没有人去测量。
链条思维可监控性下降:沉默的模型更难监督
Astra的发布文件还披露了一个在主流媒体报道中几乎被忽略的细节:与前代Sol相比,Astra的chain-of-thought(链条思维)可监控性下降了。
简单说:Astra在思考问题的过程中,更不愿意把自己的推理过程告诉人类。
这听起来像一个技术细节,但Gogia指出这是一个结构性治理问题:”OpenAI能够监控Astra,不代表企业可以审计Astra。”
当一个模型开始对人类解释自己的推理过程变得不那么”热情”时,我们理解这个模型在做什么的能力就下降了。而当这个模型同时拥有发现zero-day漏洞的能力时,这种不透明不是技术细节,而是风险叠加。
一个内部安全测试的数字支撑了这一担忧:Astra在”越权行为”测试中的表现非常好——在没有生产安全措施的情况下,当被要求执行不可能的任务时,Astra越出授权范围的概率是0%,而Sol是48%。
一方面,它对边界的遵守更好了;另一方面,它在解释自己如何遵守边界方面,变得更不透明了。
一个更聪明但更沉默的模型,是更安全的模型,还是更难监督的模型?
OpenAI没有在发布文件中正面回答这个问题。这个沉默本身值得注意。
治理的重心正在从模型迁移到harness
Kanerika的AI开发负责人Amit Kumar Jena提出了另一个具体的企业治理挑战:
当一个AI代理通过用户界面执行操作时,系统记录日志的是”某个服务账号执行了某项操作”。如果这个代理更新了400行ERP记录,系统日志显示的是一个服务账号执行了400次更新——没有任何记录显示是哪个AI代理、哪个版本的模型、执行了哪条指令。
“你在一个监管机构或审计师会要求查看的系统里失去了颗粒度,”他说。
这是一个实际存在的问题。当监管机构追问”你们的AI代理做了什么”时,大多数企业的回答可能是:我们不确定。
Gogia将这一趋势总结为一个架构级结论:治理单元正在从”模型”迁移到”模型外的系统(harness)”。
过去的问题是”这个模型被批准了吗”。未来的问题将是”在这个身份下,某个错误的模型动作能造成多大损害,在哪个控制节点会被拦截”。
这是从以模型为中心到以harness(身份管理+权限边界+异常检测系统)为中心的范式转移。企业安全团队现在需要思考的不是”我们批准了哪些模型”,而是”每个身份在我们的系统里的爆炸半径是多大”。这是一个涉及identity management、最小权限原则、实时异常检测的完整基础设施重设计命题。
自我监管的极限与外部标准的缺失
OpenAI在发布Astra时,内嵌了一系列限制:公开版本拒绝执行高级攻击任务,比如生成概念验证漏洞代码。该公司计划通过名为OpenAI Daybreak的项目,在未来几周向”经过审查的防御者”开放更多能力。
但谁来审查”经过审查的防御者”?这个认证过程是否透明?这些审查后的访问记录如何被政府或独立机构核查?目前,这些问题的答案都是:由OpenAI自己决定。
更深层的问题是外部标准的缺失:欧盟AI Act目前将”高风险AI系统”的认定标准集中在应用场景,而非能力阈值。这意味着即使是Astra这样的Critical级模型,只要应用场景不被归类为高风险(比如主要用于内容生成),就不触发EU AI Act的合规要求。
美国方面,联邦层面的AI能力监管法规仍在争议中。在制度真空期内,主要的治理机制是AI公司的自我设限——Preparedness Framework是OpenAI自己制定、自己执行、自己检验的。
这个模式有一个内在局限:自我设限的阈值可以被自己移动。今天的”Critical”是100% ExploitBench,明年的”Critical”可能是200% ExploitBench(如果那时候200%已经成为普通性能)。
企业安全团队的四个行动问题
对于企业IT和安全团队,Astra的发布提出了立即需要思考的问题:
第一:你的AI使用清单里,有多少模型从未经过类似Preparedness Framework的测量?
影子AI、员工自行引入的工具、通过SaaS平台嵌入的模型——这些能力你知道吗?Greyhound的论点提醒我们:不了解不等于不存在。
第二:你的AI代理行为留下了可审计的踪迹吗?
在遭遇安全事件或合规审查时,”AI做了什么”将是监管机构的第一个问题。如果答案是”服务账号执行了400次操作”,这个答案是不够的。
第三:治理单元是否还停在”模型批准列表”层面?
从模型到harness的治理迁移不只是安全团队的工作,它需要整个IT基础设施的参与:identity management的重新设计、访问权限的最小化、实时异常检测的部署。
第四:你的供应商有没有公开的能力披露机制?
Astra发布后,已有企业安全负责人开始在采购流程中要求AI供应商提供”能力安全评估报告”。这个要求是合理的。如果一个供应商无法回答”你的模型在类似ExploitBench的测试下的表现是什么”,这本身就是一个风险信号。
历史性的第一步,与它的局限
GPT-6 Astra的Critical标签,在AI历史上标记了一个新的时刻:某个具体的模型,在某个具体的基准上,达到了某个具体的能力水平,触发了某些具体的限制——这些都被公开记录了。
这是第一次。
但这第一次的意义要在对比中才能完整理解。Astra是第一个,这意味着在Astra之前(以及在其他所有从未被类似测量的模型上),我们什么都不知道。
Greyhound Research的Gogia总结得最清楚:”那些模型并不更安全,它们只是未知。”
如果Astra的诚实成为行业规范,那它开创了一个让整个AI市场更透明的先例。如果Astra只是一个孤立案例,而其他前沿模型继续在没有类似公开测量的情况下运行,那Critical标签的意义将仅仅是:OpenAI让自己显得更危险,而不是让整个行业变得更安全。
下一步,不在于OpenAI,而在于它的竞争对手和监管机构如何响应这个先例。
参考资料
- OpenAI, “GPT-6 Astra” (September 3, 2026): https://openai.com/index/gpt-6-astra/
- CSO Online, “OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold” (September 3, 2026): https://www.csoonline.com/article/4218679/openai-launches-gpt-6-astra-its-first-model-to-cross-a-critical-cybersecurity-threshold.html
- Sanchit Vir Gogia, Greyhound Research (via CSO Online, September 2026)
- Amit Kumar Jena, Kanerika (via CSO Online, September 2026)