编辑说明:本文核心数据来自CNBC对OpenAI GPT-6 Astra发布的独家报道(2026年9月3日,直接采访Sam Altman和Greg Brockman)、OpenAI官方发布声明(openai.com/index/pacing-model-development-cyber-capabilities/,2026年9月1日)以及CNBC对OpenAI Daybreak网络安全项目的此前报道(2026年8月10日)。文中所有引用均标注来源。文章发布时间距报道事件不超过30天。


2026年9月3日,OpenAI推出了GPT-6 Astra——但与以往每一次发布不同的是,这一次,OpenAI在公告里放了一个此前从未出现过的标签:「Critical」(关键)网络安全威胁评级。

这是OpenAI历史上第一个在发布前被自己评定为具备「关键」级别网络安全风险的模型。在OpenAI的内部能力评估框架(Preparedness Framework)中,「Critical」是最高危险级别,意味着该模型具备的能力,已经足以使此前需要高度专业技能才能实施的网络攻击,变得对技能较低的攻击者也可行。OpenAI的评估结论是:如果Astra的完整网络安全能力不加限制地公开可用,将系统性地降低高级网络攻击的实施门槛。

然而,这个「Critical」评级并没有阻止Astra发布。OpenAI做出的决策是:对普通用户发布功能经过削减的版本,对一个经过审核的特别研究圈子(Daybreak项目成员)开放完整的网络安全能力,并且在发布前接受了特朗普政府的正式审查。

一个AI公司主动公布自家产品达到了自己定义的最高安全风险门槛,然后在采取了一定管控措施的前提下选择发布,并且公开说明了这些措施和评估结论。这件事本身,比Astra在任何技术性能基准测试上的得分更值得深入理解——它代表了AI行业正在被迫面对的一个根本性问题:当AI能力本身就构成危险时,「安全发布」是否可能,以及这个词的含义是什么。

CNBC记者在2026年9月3日对Sam Altman和Greg Brockman进行了直接采访,本文关于Astra发布的所有具体细节,均来源于这篇报道(cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html)和OpenAI同期发布的官方声明(openai.com/index/pacing-model-development-cyber-capabilities/)。


什么是「Critical」网络安全评级:一个历史性的自我声明

要理解这个评级的分量,需要先理解OpenAI的内部安全评估体系的来龙去脉。

OpenAI从2025年起,在面对越来越强大的AI能力时,建立了一套专门针对AI模型「危险能力」的内部评估框架,业内通常称之为「准备框架(Preparedness Framework)」。这个框架将AI模型在核生化武器(CBRN)、网络安全、欺骗性说服等几个高风险能力维度分别评级,每个维度都有从低到高的四个评级:低(Low)、中(Medium)、高(High)、关键(Critical)。

网络安全维度的具体评级标准,OpenAI在2026年9月1日的官方声明(openai.com/index/pacing-model-development-cyber-capabilities/)中进行了明确描述。「Critical」评级对应的标准是:模型所具备的网络安全能力,已经足以将此前需要高度专业技能和资源(即专业的网络安全团队或国家级行为者)才能实施的网络攻击,变得可以由技能相对较低的攻击者通过模型辅助以更一般性的手段实施——也就是说,Astra降低了高级网络攻击的「技术门槛」。

GPT-6 Astra是OpenAI历史上第一个在这个网络安全维度上被内部评估为达到「Critical」的模型。在Astra之前,已发布的所有OpenAI模型,在这个维度上最高只达到「高(High)」评级。

这个评级结论意味着什么?从技术角度,它意味着Astra具备了帮助使用者规划、实施和自动化复杂网络攻击的能力,且这种辅助能力在质量上达到了此前只有专业安全团队才具备的水平。从政策角度,它意味着如果Astra的完整网络安全能力不加限制地公开可用,将会显著扩大「能够实施复杂网络攻击的人数」——因为大量原本不具备足够技术能力的攻击者,将通过Astra的辅助获得足够的能力。

但OpenAI并没有因为达到这个门槛而选择不发布。他们做出了一个在AI行业历史上尚无先例的「分层发布」决定:

普通用户版本(面向ChatGPT Plus、Pro、Business、Enterprise用户以及API用户):Astra的高级网络安全能力被有意削减和限制,普通版本的Astra在网络安全维度的评级,低于「Critical」阈值。

Daybreak项目成员(经审核的特别访问圈子):被认定为从事防御性网络安全研究的机构,在签署特定使用协议后,可以访问Astra的完整网络安全能力。这个圈子包括经过OpenAI审核的安全研究公司、学术机构和特定企业安全团队。

这个分层设计,体现了OpenAI的一个核心判断:「Critical」级别的网络安全能力,不是「不能存在」,而是「不能无限制地公开存在」。防御性安全研究者需要能够测试针对这种级别AI辅助攻击的防御能力,这本身需要接触「Critical」级别的攻击辅助能力;但同时,如果这种能力对所有人开放,进攻性滥用的概率和后果将难以管控。


Daybreak项目:谁能访问「Critical」能力,以及这套机制的现实局限

Daybreak是OpenAI在2026年8月正式设立的一个应用制(application-based,即申请制)网络安全特别研究项目,最初目标是在Astra正式发布前,筛选出一批可以先行测试其完整网络安全能力的可信研究伙伴(来源:CNBC 2026年8月10日报道)。

根据CNBC的报道,Daybreak的参与者需要经过OpenAI的审核流程,核心筛选标准是:申请方将模型的高级网络安全能力用于防御性安全研究(如渗透测试、漏洞发现、安全团队培训),而非进攻性网络攻击。参与者需要签署特定的使用协议,明确规定了允许的用途范围,并同意OpenAI的使用监控条款。Daybreak的参与机构包括安全研究公司、大学学术安全实验室以及经审核的大型企业安全团队。

为什么需要Daybreak这个机制?

先进AI的网络安全能力,具有非常典型的「双用途(dual-use)」性质:同样的「能够分析漏洞、生成利用代码、规划渗透路径」的能力,既可以被防御性安全研究者用于提前发现系统漏洞并修补,也可以被恶意行为者用于发动网络攻击。这两种用途在技术上难以区分,甚至完全相同——防御性渗透测试和进攻性黑客攻击,使用的是同样的工具和方法。

在这种双用途性质面前,「不发布」和「无限制发布」都是不理想的选择:「不发布」会让防御性安全社区无法使用AI辅助来应对越来越复杂的网络威胁;「无限制发布」会将工具平等地提供给攻击者和防御者,考虑到攻守不对等的现实(攻击者只需找到一个漏洞,防御者需要守住所有漏洞),这会系统性地偏利进攻方。Daybreak是OpenAI在这两个极端之间找到的一个中间路径:限制访问,但不阻断访问,并且将访问资格绑定在可核实的防御性用途上。

这套机制的现实局限

诚实地审视Daybreak,需要承认它面临几个难以完全解决的挑战:

第一,用途核实问题:OpenAI如何在事后验证Daybreak成员确实将能力用于防御性而非进攻性用途?使用协议可以创造法律责任,但实际上的用途核查,在技术上非常困难。一旦能力被访问,OpenAI对其后续用途的可见性是有限的。

第二,访问范围边界:Daybreak成员的完整访问,是否意味着他们的内部安全团队、研究人员,乃至某些外部合作方,也会接触到这些能力?这个访问链条在实践中如何被控制,目前没有公开的详细说明。

第三,筛选标准的主观性:谁是「可信的安全研究者」,这个判断由OpenAI做出,没有独立的第三方审核。这不一定意味着判断不准确,但它创造了一个依赖单一评估者的系统性风险:如果OpenAI的筛选有盲区,这个盲区不会被外部发现,直到问题已经发生。

尽管如此,Daybreak代表的分层访问管控理念——不是「全给」或「全不给」,而是「给有合理理由获得的人,并明确限定用途」——是目前双用途AI能力管控领域最实质性的尝试之一,值得在未来的AI治理政策讨论中作为一个可参照的模型来认真分析。


特朗普政府的正式审查:一个新先例的出现

Astra发布前,还发生了一件在AI行业历史上值得单独记录的事:OpenAI接受了特朗普政府对该模型的「正式审查程序(formal review process)」。CEO Sam Altman在接受CNBC采访时明确提到了这一点,原文表述是Astra「went through a formal review process with the Trump administration before release」。

这是OpenAI首次公开确认,一款前沿AI模型的发布,经历了与联邦政府的正式审查对话——不是事后通知,不是非正式沟通,而是在发布决定做出前的「正式审查」。

需要指出的是,Altman没有说这次审查影响了发布决定,也没有透露审查的具体内容、与哪个联邦机构对话、或者审查的结论。所以目前可以确认的,只是「有过这个过程」,而不是「这个过程对发布决定有实质影响」。对这个细节的理解,应该保持在「已发生」而不是「已产生约束力」的范围内。

尽管如此,这个先例的出现本身具有重要意义,原因是它改变了AI发布的规范性预期:在此之前,AI模型发布是公司的单方面决策,政府的角色主要是事后监管(如果监管框架存在的话)。如果「正式政府审查前置」成为惯例,AI公司的发布决策过程将面临外部约束的制度化——无论这个约束的实际力度如何,「预期存在审查」本身就会影响公司的内部决策逻辑。

这个先例出现在同期(2026年9月15日)OpenAI、Google和Anthropic开始讨论AI安全合作框架的背景下,形成了一个有意思的并行趋势:一方面,大型AI公司之间开始探索横向安全合作;另一方面,OpenAI开始与政府建立纵向的前置审查关系。这两个方向,如果都能持续演进,可能共同构成一个比「AI公司自我监管」更具外部约束力的治理框架的雏形。

一个尚未回答的问题:如果特朗普政府的审查认为Astra不应该发布,OpenAI会接受这个判断吗?Altman的表述没有提供这个问题的答案,而这个问题的答案,将决定「正式政府审查」究竟是真正的外部约束,还是只是一个让双方都能说「我们进行了对话」的程序性动作。


Astra的发布决定背后的权衡逻辑

OpenAI为什么选择发布一个自己评定为「Critical」风险的模型?这个问题比它看起来要复杂得多,而且OpenAI自己的官方表述也提供了比较完整的推理链条,值得仔细拆解。

OpenAI的官方理由:根据Greg Brockman在媒体说明会上的表述(来源:CNBC 2026年9月3日报道),OpenAI为Astra添加了额外的保障措施,并且基于内部评估相信这些保障措施「足以最小化(sufficiently minimize)严重伤害的发布风险」。他还强调:「AI只有在安全是核心时才能造福人类,所以我们正在投入比以往更多的计算资源和精力到安全、保障和对齐研究中。」

注意这里的关键措辞:「足以最小化」(sufficiently minimize)而不是「消除(eliminate)」。这不是措辞上的疏漏,而是OpenAI有意选择的表述——他们承认保障措施降低了风险,但没有声称将风险降至零或接近零。这种措辞上的诚实,是Astra发布整体透明度实践中一个值得单独记录的细节。

更深层的商业和战略逻辑:从另一个角度来理解,如果OpenAI在Astra达到「Critical」评级后选择不发布,或者无限期推迟发布,会发生什么?Anthropic的Claude在同期已经达到了相近的能力水平(同期CNBC报道OpenAI内部评估对比),Google DeepMind的同级别模型也在加速研发中。在这种竞争环境下,单边不发布不能阻止同级别能力模型的存在,只能让OpenAI在商业上处于劣势,而对整体风险的影响有限。

这个逻辑,和OpenAI首席科学家Pachocki在9月6日的博客中表述的观点形成了直接关联:「我预期并希望自愿减速将变得普遍,直到共同的安全标准被建立起来。」——Pachocki的「希望」而不是「现实」的措辞,暗示了他本人也知道,在共同安全标准尚未建立的情况下,单边减速的可持续性是有限的。

这种透明度,在伦理上值得认可——它远好于「我们的产品绝对安全」的过度自信表述。但它也把一个核心问题留给了公众和政策制定者:当最有能力评估风险的行动者——即模型的开发者本身——告诉你他们知道自己正在发布一个具有「关键」风险水平的技术,但认为他们的保障措施「足以」时,你应该相信他们的判断吗?而你又如何拥有足够的信息来独立评估这个「足以」?

OpenAI给出的答案是:通过主动披露、通过与政府的审查对话、通过Daybreak项目限制完整能力的访问,来实现这种可信度。但在一个不存在独立第三方评估机构的行业里,这些机制的可靠性,本质上取决于相信OpenAI自我评估的准确性——这是一个只能通过事件历史逐步建立的信任,而不是可以通过逻辑推论直接得到的保证。


「Critical」门槛的历史意义:一条正在被穿越的边界

回顾OpenAI设置这个评级系统的时间背景,可以看出一些值得深思的东西。

OpenAI建立准备框架(Preparedness Framework)、设定「Critical」作为最高风险门槛时,隐含了一个期待:「达到这个门槛的模型」将是一个需要认真审视是否应该发布的重大决策节点。Astra的发布表明,当他们真的到达了这个节点时,他们的决策是:发布,但做分层限制。

这个决策有其合理性——Daybreak机制设计合理,政府审查前置也是积极的尝试。但这个决策不可避免地重设了这条边界的含义:「Critical」不再意味着「这个能力水平需要特别的停顿和思考才能继续」,而是意味着「这个能力水平需要限制性访问,但可以继续推进」。

这种「边界含义漂移」,是AI能力评级体系面临的深层挑战。不是因为参与者不诚实,而是因为每一次「在风险存在的情况下仍然推进」的决定,都会在实践层面重新校准「这个风险级别意味着什么」的集体预期。当下一代达到某个新风险级别的模型到来时,它将面对一个已经被Astra案例重新校准过的基准:上一代「Critical」都能管控地发布,为什么这一代不能?

这不是一个指责OpenAI的论点,而是对任何单一组织单边设定和执行自己的安全评级框架所内在局限的客观描述。有效的能力评级框架,需要外部独立验证机制的介入,才能抵抗这种随时间的基准漂移。


对AI能力评估体系的一个清醒观察

Astra的发布,为AI能力安全评估这个整体议题,提供了一个可供未来政策和行业讨论参照的清晰案例研究。

值得肯定的部分:OpenAI建立了能力评级体系,用这个体系真实评估了Astra,发现它达到了高风险门槛,然后进行了限制性发布,公开披露了评级结论、保障措施的具体表述(包括「足以最小化」这个带有明确限定的承认),以及发布前与政府的对话。这个整体流程,代表了目前AI行业里最高水平的透明度实践之一。更重要的是,OpenAI首席科学家Pachocki在同期博客(openai.com/index/an-alien-mind/,2026年9月6日)里明确承认「没有任何AI公司已经解决了对齐和监控问题」,这种自我承认在主观诚实性上是可信的。

值得持续追问的部分:这整套评估体系是OpenAI内部的——标准由OpenAI设定,评估由OpenAI执行,发布决定由OpenAI做出,监督主要来自事后对Daybreak用途数据的观察,以及特朗普政府审查(细节未公开,对最终决定的影响未明确)。在这个体系里,对OpenAI诚信和判断力的信任,是整个系统运转的前提。这种「依赖开发者诚信」的治理模式,在低风险阶段是合理的起点,但在能力已经达到「关键级别」的阶段,需要被外部独立验证机制补充。

目前,真正独立于AI公司之外、具有实质技术能力验证AI系统危险能力水平的外部机构,在全球范围内都不存在——这是Astra案例留给政策制定者最清晰的功课:不是「OpenAI做错了什么」,而是「缺少一种外部验证机制,使得评估结论的可信度不依赖于信任任何单一行动者」。


Astra发布的更大背景:一个星期内发生了什么

2026年9月第一周,在Astra发布的同一天和前后几天,AI行业同时发生了多件值得并排阅读的事件,它们共同构成了一个对当前AI发展阶段的清晰描述:

9月3日(同一天):Anthropic威胁情报主任Jacob Klein在CNBC公开描述了中国AI实验室通过数万个暗网欺诈账号,工业规模盗取Claude训练数据的机制,并指控Kimi K3是非法蒸馏Claude的产物。就在OpenAI宣布新模型达到「Critical」网络安全能力的同一天,另一家顶级AI实验室正在描述另一种AI安全威胁的现实——AI能力不只是自己发展,也在被他人非法复制和扩散。

9月6日(三天后):OpenAI首席科学家Pachocki发表博客,公开承认「没有任何AI公司已经解决了对齐和监控问题到足以继续负责任地以最大速度扩展太长时间」。这个声明,与同一家公司三天前刚刚发布了一款「Critical」网络安全风险模型,形成了一种张力——不是矛盾,而是对一个同时正在发生的、多维度的困境的清醒描述。

9月9日(六天后):Anthropic研究员Jacob Coxon公开辞职,发帖说AI公司「正在拿我们的生命赌博」,Anthropic对齐研究负责人Evan Hubinger公开回应,称他认为AI在未来十年内有超过10%的概率「杀死所有人」。

这四件事——Astra达到「Critical」评级、Kimi K3被指控非法蒸馏、Pachocki承认对齐问题未解决、Coxon辞职Hubinger表态——在同一个星期内发生,不是因为偶然,而是因为它们都是同一种深层现实的不同侧面表达:AI能力正在快速扩展,在商业、安全、伦理等多个维度上同时产生着以前不存在的挑战,而现有的应对机制(自我评级、分层发布、政府审查、行业讨论)都处于建立中而非成熟期。

Astra是这种现实最具体可量化的表达:一款被自己的创造者评为「关键危险级别」的模型,在2026年9月3日发布了。

结语:当AI公司开始公开标注自家产品的危险能力级别

GPT-6 Astra最值得被历史记录的,不是它在任何基准测试上的性能数字,也不只是它的「Critical」评级本身,而是这个事实:2026年9月,OpenAI在一款产品的发布公告中,主动标注了这款产品达到了公司内部定义的最高网络安全风险门槛,然后明确描述了他们为管控这个风险采取的分层措施和仍然存在的风险,然后在公开透明的前提下选择了发布——而不是悄悄发布,也不是拒绝承认风险存在。

这种透明度实践,在AI行业史上是全新的,也是应该成为行业规范的方向。不是因为以前没有AI系统具备高级的网络安全能力,而是因为以前没有任何主要AI公司会在发布公告里主动说「我们的内部评估表明这个模型具有关键级别的网络安全风险,这是我们的定义标准,这是我们的应对措施,这是我们仍然不确定的地方」。这种表述方式,要求开发者在发布时有意识地公开呈现不确定性,而不是只呈现确定性。

OpenAI在Astra案例中做的这件事,具有两种截然不同但都成立的解读方式:

解读一(成熟化):一家AI公司拥有足够清醒的自我认知,建立了有效的内部风险评估框架,并且在有商业压力发布产品的情况下,选择了诚实面对风险并公开说明——而不是淡化风险或不提风险。这是一个行业走向安全文化成熟化的积极信号,值得认可和鼓励。

解读二(能力边界的现实化):一家AI公司的模型能力,已经到达了需要公开标注「关键危险级别」的水平。无论保障措施多么完善,这本身意味着AI系统的潜在危害能力已经进入了新的阶段。而且随着模型代际更替加速,「Critical」评级的下一次出现,可能不需要等太久。

这两种解读不互斥,而且可能同时是真的。认为它们互斥,是在寻求一种不存在的确定性。

未来几年,如何解读和有效应对主动标注的AI危险等级,将成为AI治理中最核心的实践问题之一:社会、监管机构和用户如何在没有能力独立验证「保障措施足以」这个判断的情况下,建立或不建立对AI开发者自我评估的信任?这个信任,目前主要建立在「透明度本身」上——而Astra的发布方式,是目前这个方向上走得最远的一个案例。这个先例将如何影响后续的发布决策和监管期望,值得持续观察。


参考资料

  1. CNBC(2026-09-03):OpenAI begins rolling out Astra model after warning of its advanced cyber capabilities — Sam Altman和Greg Brockman接受CNBC直接采访;Critical评级、Daybreak项目、政府审查等信息的原始来源
  2. CNBC(2026-08-10):OpenAI launches Daybreak: a cybersecurity application program for its frontier models — Daybreak项目背景
  3. OpenAI官方声明(2026-09-01):Pacing model development and cyber capabilities — 发布前的能力评估和保障声明
  4. OpenAI首席科学家Jakub Pachocki博客(2026-09-06):An Alien Mind — 对齐研究进展判断
  5. CNBC(2026-09-15):OpenAI, Google, Anthropic discussing collaboration on AI safety issues — 行业安全合作背景