2026年9月3日,OpenAI发布GPT-6 Astra时夹带了一个行业从未见过的声明:这款模型首次跨越了OpenAI自己制定的「准备框架」中网络安全风险的「Critical(关键)」等级门槛。公司在博客中写道,Astra在ExploitBench测试中取得100%成绩——而其前任GPT-5.6 Sol的成绩是78.5%。Astra还在ExploitGym测试上达到42.4%,对比Sol的30.3%。Astra同时将计算机操作安全基准上的意外行为率较GPT-5.6 Sol降低了89%,较Claude Fable 5.1降低了74.7%。

这不是普通的基准分数比拼。这是一家顶级AI实验室第一次公开承认:我们造出了一个真正危险的工具,然后我们选择发布它。

一、准备框架:从约束到参考

理解这件事的重要性,需要先了解OpenAI「准备框架(Preparedness Framework)」的设计逻辑。该框架将模型在网络安全、生物武器、核武器、化学武器等高危领域的能力分为Low(低)、Medium(中)、High(高)、Critical(关键)四个等级。OpenAI此前在框架文档中明确宣称,一旦某款模型在任何类别达到Critical,该模型将不得发布——除非公司能证明有足够的缓解措施可以将风险降低到可接受水平。

GPT-6 Astra测试了这个规则的边界,并且穿越了它。

OpenAI的解释是:Astra在专业ExploitBench上得到100%(该测试针对已知漏洞的精确复现),但在面向更广泛真实场景的ExploitGym上「仅」得到42.4%。公司认为这仍在可控范围内,并援引了一系列配套的缓解措施。

与此同时,OpenAI配套推出了Daybreak计划——通过该计划,只有经过OpenAI严格审核的网络安全研究人员才能解锁Astra的高级进攻性能力,包括生成零日漏洞利用代码(Proof-of-Concept exploits)和高级渗透测试辅助。普通API用户和ChatGPT订阅用户获得的是经过过滤的版本,后者会自动拒绝执行上述任务。

问题是:谁来审核这套逻辑是否充分?

在发布前的内部测试阶段,OpenAI专门测试了Astra能否在三个月发布窗口内自主发现此前未公开的安全漏洞——以验证其能力是真正的推理能力,而不是在训练数据中记忆已知漏洞。结果是,Astra主动发现了2个零日漏洞(Zero-day vulnerabilities),OpenAI在发布当日同步向受影响的软件厂商披露,并等待补丁发布后才在文档中提及。这是AI辅助漏洞发现的真实案例,也是OpenAI用来证明「以攻促守」价值的关键数据点。

但这类数据点的结构性问题在于,它展示了已知的、可控的好处,却无法量化未知的、分散的风险:在所有可能接触到Astra的行为者中,有多少潜在攻击者会用它造成两个漏洞披露以外更大的伤害?这不是OpenAI能独自回答的问题。

二、Greyhound Research的反向解读:标签是披露事件,不是能力事件

分析机构Greyhound Research首席分析师Sanchit Vir Gogia提出了一个在网络安全和AI治理圈内迅速传播的反向视角,值得完整引用。

「Astra的能力在8月10日和9月1日之间没有发生任何变化,」他在分析文章中写道,「8月10日OpenAI说Critical能力’无法排除’,9月1日它说门槛已被满足。改变的是测试方法,不是模型本身。」

这个观察的含义令人深思。如果一个模型被判定达到Critical级别,仅仅是因为评估者采用了更系统化的测试方法——而模型的实际能力并没有在那段时间内发生跃升——那么两个问题不可回避:

第一,在准备框架建立之前已经部署的那些模型,它们的真实网络安全能力等级是多少?没有人知道,因为没有人测量过。

第二,当前企业环境中有多少个已经具备Critical级别能力、正在被日常使用、但从未被用公开门槛评估过的模型?同样没有人知道。

Gogia的结论精确而犀利:「Astra现在是唯一一款企业真正了解其网络安全能力的前沿模型,因为它是唯一一款根据公开门槛被测量的。而所有那些未标注能力等级、已经坐在企业员工凭证后面运行的模型,从来没有被这样测量过,而且除非其供应商选择测量,否则不会被测量。那些模型并没有因此变得更安全。」

这是一个关于信息不对称的深刻洞见:通过准备框架公开承认危险,反而比隐瞒危险更能促进安全治理。OpenAI做了一件看似矛盾的事——它用透明度创造了一种独特的信任,即使(或正是因为)这种透明度揭示了真正的风险。悖论在于:其他没有建立类似框架的公司,并不因为缺乏这种透明度就变得更安全,而是变得更不可测。

三、Daybreak:分层能力访问的商业化实验

Daybreak计划在设计逻辑上颇为精妙,值得仔细解析其商业和治理双重含义。

从产品架构来看,Daybreak实际上实现了一个能力分层访问模型,将同一款底层模型拆分成不同能力水平的版本向不同用户群开放:

  • 公开版本(所有ChatGPT Plus/Pro/Business/Enterprise订阅用户及标准API用户):Astra提供专业写作、代码生成、计算机操控等完整能力,但自动拒绝执行高级进攻性网络安全任务,如生成Proof-of-Concept漏洞利用代码、对企业系统发起渗透测试
  • Daybreak版本(经审核的网络安全专业人员和研究机构):解锁完整的进攻性能力,包括Astra在ExploitBench上达到100%成绩所对应的那些功能
  • ChatGPT Work / Codex集成版本:专注于生产力场景,包括计算机操控、代码审计、文档分析等

OpenAI宣布将在「接下来数周」内更广泛地开放Daybreak,这个时间线的公开本身就包含两层信息:第一,Daybreak从一开始就不是长期的能力封锁,而是发布期的冷却窗口;第二,OpenAI预期在短期内将Critical级别的进攻性网络安全能力向更广泛的专业用户群开放,这是一个既定的商业计划,不是一个假设性的未来可能。

值得特别关注的是,GPT-6 Astra同步在亚马逊云服务(AWS) Bedrock上提供,标准API定价为每百万输入token 10美元、每百万输出token 50美元。这意味着Critical级别的网络安全能力通过企业级云渠道进行大规模分发,而Daybreak的访问控制机制是在OpenAI侧执行的,AWS侧并没有对应的能力门控机制。

这在企业合规层面引发了一个新的多方责任问题:当Critical级别AI能力通过云平台部署在企业内部环境时,如果发生安全事件,责任如何在OpenAI、AWS和使用该能力的企业之间分配?现有的云服务协议和AI使用条款,大多没有专门针对AI Critical能力的责任条款设计。这是一个明显的制度滞后。

四、与Anthropic Mythos的隐性竞争:设计哲学的分歧

这个故事还有一层不可忽视的行业背景。Anthropic在今年较早时发布了Claude Mythos 5.1——一款专门面向网络安全和生命科学专业人士的高危能力模型,通过「受信任访问计划(Trusted Access Program)」向经过严格审核的机构开放。

表面上看,两家公司走了非常相似的路径:研发出具备高危能力的前沿模型 → 公开承认危险性 → 设计分层访问控制机制 → 定向开放给可信专业用户。

但存在一个值得深究的设计哲学差异:

Anthropic的Mythos是「默认封闭,例外开放」——它从未向任何普通用户发布,包括Claude Pro订阅用户。Mythos对普通用户来说不存在,因为Anthropic认为这款模型的进攻性能力超出了受限版本所能安全控制的范围。

OpenAI的Astra是「默认开放,部分受限」——所有ChatGPT订阅用户都获得了Astra,只是获得的是经过过滤的版本。Daybreak是在这个基础上进一步开放的层次,而不是原本封闭的层次。

这个差异的含义远不止语义游戏。「默认封闭」意味着即使过滤机制出现漏洞,普通用户也无法访问高危功能,因为他们从一开始就没有这个入口;「默认开放」意味着过滤机制成为关键安全依赖,一旦出现Jailbreak(越狱)有效路径,可能影响数亿用户。

历史上,每一款发布了「受限版本」的高危AI模型,都在随后数月内出现了针对其过滤机制的有效绕过方法。这不是推测——这是过去几年AI安全研究的实证记录。Astra的「受限版本」面临同样的命运,只是时间问题。关键问题是,OpenAI的安全响应速度能否跑赢漏洞发现和利用的速度。这是一场实时的猫鼠游戏,而历史上,猫很少能持续占据优势。

五、企业处境:从模型管控到harness治理

对于企业IT和安全团队,Astra的发布不是一个抽象的政策问题,而是一个具体的运营挑战。

Kanerika AI开发负责人Amit Kumar Jena指出了一个经常被忽视的实操可见性问题:当AI代理通过用户界面操作企业系统时,系统日志会将这些操作记录为「人」执行的,而不是AI执行的。一个代理更新了400条ERP记录,在审计日志里显示的是服务账户执行了400次更新,没有任何关于是哪条指令、哪个模型版本、哪个代理会话触发这些操作的信息。

这意味着当Astra(或任何具备computer use能力的AI代理)进入企业系统后,传统的访问控制日志无法区分「人的操作」和「AI代理的操作」。在渗透测试和安全审计场景中,这个可见性缺失是一个严重的问题:如果Astra的进攻性能力(无论是通过Daybreak授权还是通过某种绕过)被用于企业内部系统,事后的取证分析将面临巨大困难。

Greyhound的Gogia因此提出了一个正在被越来越多企业安全架构师接受的论断:「治理单元正在从模型转向包裹在模型外面的harness(控制框架)。」核心问题不再是「哪款模型被批准了」,而是「给定一个身份,在某个控制点介入之前,它能造成多大伤害。」

这个视角与企业软件生态系统当前的演进方向高度一致。Salesforce在9月11日发布的Enterprise AI Harness明确阐述了类似逻辑:AI推理可以是开放式的,但企业执行通常不能是。Harness的比喻精确地描述了这一点:不是限制马(模型),而是给马套上缰绳(治理框架)。问题不再是「这匹马有多快」,而是「缰绳有多牢」以及「谁握着缰绳」。

对于安全团队,这意味着工作重心的根本性转移:从「审批使用哪款模型」(清单管理问题)转向「为所有AI代理构建统一的权限边界、行为日志和实时异常检测机制」(系统工程问题)。这两类工作在难度、资源需求、技能要求上完全不同。前者是一个合规驱动的流程管理问题,后者是一个需要AI安全专业知识的实时运营问题。

现实是,大多数企业安全团队目前既没有这方面的专业知识,也没有足够的工具支持。这个差距将在未来18-24个月内变成企业IT领域最紧迫的能力建设需求之一。

六、模型性能的另一面:对齐与能力的双重跃升,以及它对治理的含义

在网络安全风险的讨论之外,GPT-6 Astra还展示了在对齐方面的重要进展——而这个进展本身,与治理悖论之间存在一个意想不到的互动关系,是这次事件中大多数分析所忽视的维度。

OpenAI的内部计算机操控安全基准测试了模型在最复杂企业场景下是否会超出授权范围行动——包括暴露机密信息、过度分享仪表板、删除数据等。在这个测试中,Astra产生意外结果的概率比GPT-5.6 Sol低89%,比Claude Fable 5.1低74.7%。这个数字是显著的:Astra不仅更「强」,在按照人类意图行动方面也更「稳」。

但这个对齐改进与Critical级别的网络安全能力同时存在,构成了一个需要明确表达的悖论:对齐研究的进步,可能成为更激进的能力发布的加速剂。逻辑是:「我们的模型对齐更好,所以更可以放心部署,包括部署到更高危的场景。」这个推论在单独的技术评估中是有道理的,但在系统层面,它意味着对齐改进不会减少Critical能力的传播,反而可能通过提供「安全性证明」而加速传播。

这是治理悖论的一个被忽视的维度:如果安全性改进成为发布加速的理由,那么安全研究的净效果对整体安全态势是正还是负,需要在系统层面而非模型层面来评估。当前没有机制做这种系统层面的评估。

七、治理悖论的本质:谁来为Critical决策

这里有一个根本性的制度困境需要直接面对。

OpenAI在准备框架中写道:Critical级别的模型「如没有缓解措施则不得部署」。但谁来决定缓解措施是否「足够」?目前的答案只有一个:OpenAI自己。

这不是批评特定公司,而是描述一个正在形成的制度空白:当前全球没有独立的第三方机构有能力、有权限、有数据访问权在发布前对Critical级AI模型的网络安全风险进行实质性评估。准备框架是OpenAI的自我监管工具,不是行业标准,更不是任何国家的法律要求。

Amodei在2026年9月12日发表的减速宣言中提出的第一步——「允许第三方评估机构无限制访问模型以核查安全实践与事件上报,Anthropic承诺将单方面率先执行、随时接受第三方审计」——正是针对这个空白的直接回应。Altman当天公开表态将效仿,宣布OpenAI将执行相同的独立评估承诺,并表示「我们很快会有更多分享」。

但截至本文撰写时(2026年9月14日),这些承诺仍是口头的,没有具体的时间表,没有明确的评估机构名单,没有关于「无限制访问」意味着什么的定义,也没有关于评估结果如何影响发布决策的约束性规则。

这揭示了AI自我监管的核心悖论:当约束只存在于约束者的文件里,并由约束者自己判断是否达标时,这个约束究竟约束了什么?

Astra的发布给出了一个具体答案:它约束的是公司的公共信誉和市场信任,而不是发布决定本身。在竞争压力下,「有足够缓解措施」成为穿越红线的通行证,而「足够」的定义权掌握在发布决定者手中。

这或许就是2026年AI安全治理的真实状态——不是通过外部权力强制,而是通过透明度施压。问题是,透明度压力能否在前沿模型能力曲线继续陡峭上升的过程中跑赢治理空白的扩大。历史上,在技术能力快速发展的窗口期,自我监管机制很少能独立跑赢。

这个问题的答案,将在未来12个月内变得更加清晰——或者更加令人担忧。具体地说,可以关注两个可观测信号:第一,独立评估机构是否真正建立并开始运作(不是框架文件,而是有人员、有经费、有实际访问权限的机构);第二,下一款跨越某个新高危门槛的前沿模型发布时,是否仍然由开发者单边决定「缓解措施足够」,还是有独立评估结果作为决策输入。这两个信号,将告诉我们准备框架是否正在向真正的约束演进。

还有一个值得提及的背景:根据GPT-6 Astra发布页面的信息,OpenAI正在为企业提供「零数据保留(Zero Data Retention)」选项,这意味着企业可以在调用Astra时确保其输入输出不被用于模型训练。这是针对企业合规需求的重要特性,但它同时也意味着:这些使用场景对OpenAI自己的安全监控能力形成了部分限制。当攻击者通过零数据保留模式使用Astra时,OpenAI无法从这些交互中学习并改进安全过滤——这是信息隐私保护与安全监控之间的基本张力,在Critical级别的网络安全模型上体现得格外突出。

在这个意义上,Astra的发布不仅是一个技术里程碑,也是AI安全治理演进进程中的一个节点性事件:它让「准备框架是否真的约束发布决策」这个此前只存在于学术讨论中的问题,第一次在真实的市场压力下得到了实践检验。答案令人深思。


参考资料

  • OpenAI官方博客:《GPT-6 Astra: The next generation in intelligence for work》,2026-09-03,https://openai.com/index/gpt-6-astra-next-generation-work/
  • Computerworld报道:《OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold》,2026-09-03,https://www.computerworld.com/article/4218691/openai-launches-gpt-6-astra-its-first-model-to-cross-a-critical-cybersecurity-threshold-3.html
  • The Guardian报道:《OpenAI boss and Elon Musk back calls to put brakes on ‘reckless’ AI development》,2026-09-13,https://www.theguardian.com/technology/2026/sep/13/openai-sam-altman-elon-musk-back-anthropic-calls-brakes-ai-development
  • 日报整合条目(来源openai.com、computerworld.com、cnbc.com),事件时间2026-09-03至2026-09-13