AI++
政策监管·2026-08-08·5 分钟阅读·AI++ 编辑部

OpenAI 首次把自家模型判到「关键级」网络能力:Astra 部分内部研发被叫停

发生了什么:8 月 7 日晚,OpenAI 在官方博客宣布,对下一代模型 Astra 的最新内部评估显示其在智能体编码与网络安全上出现显著跃升,公司「无法排除」它已达到《准备框架》中的关键(Critical)网络能力档,并据此暂停了所有尚未满足强化安全管控要求的 Astra 内部活动。为什么重要:这是《准备框架》2023 年 12 月发布以来,OpenAI 首次公开承认自家模型可能触到网络安全领域最高风险档——此前包括 GPT-5.6-Sol 在内的模型均只被评为高(High)级;也是前沿实验室第一次在模型尚未发布阶段,就主动对外披露因能力过强而放缓研发。

发生了什么

8 月 7 日深夜,OpenAI 在官网发布题为《Responding to the next frontier of critical cyber capabilities》的博文,公开了一个此前罕见的决定:暂停部分与下一代模型 Astra 有关的内部研发活动。

触发这一决定的,是过去几天的内部评估结果。OpenAI 表示,Astra 在智能体编码(agentic coding)和网络安全两个方向上出现了「显著进展」,结合外部专家评估,公司在前一晚得出结论——按照《准备框架》(Preparedness Framework)的口径,无法排除该模型已具备关键(Critical)级网络能力。

OpenAI 官方博文配图

「关键级」到底是什么门槛

按 OpenAI 自己写下的定义,一个模型要被判到网络安全的 Critical 档,需要满足以下任一条件:

  • 在大量经过加固的真实关键系统中,无需人工介入即可识别并开发出各严重级别的可用零日漏洞利用代码;
  • 仅给定一个高层级目标,就能独立设计并执行针对加固目标的端到端全新网络攻击方案。

OpenAI 强调,目前仍在对 Astra 做基准测试与能力评估,但初步结果已经强到「此时无法排除 Critical 能力级别」。作为对照,此前包括 GPT-5.6-Sol 在内的模型,在同类前沿网络能力评估中都只被评为 High 档,从未触及 Critical。

博文中另有一句专门的澄清:Astra 是一款即将推出的模型,并未参与此前的 Hugging Face 入侵事件。

OpenAI 采取了哪五步

博文列出的应对措施共五条,覆盖研发、监控与外部协作三个层面:

  1. 对更高能力模型及相关活动实施更严格的安全管控,包括隔离测试环境、限制网络与工具访问、增强模型权重保护与加密、增加监控与检测能力、沙箱化执行;
  2. 暂停所有尚未达到上述强化安全管控要求的 Astra 内部活动;
  3. 对 Astra 的全部智能体应用(含训练与评估阶段)实施风险行为与对齐失效的通用监控——监控系统会评估模型的思维链,一旦发现高风险活动即触发安全响应,进行审查与中断;
  4. 与相关政府机构及部分 AI 安全组织合作,共同测试该模型的能力;
  5. 向第三方测试合作伙伴提供推荐的安全管控方案,确保更高风险的评估与工作负载能在安全条件下运行。

OpenAI 同时指出,这套流程并非首次启用:2025 年 6 月,当其模型逼近生物学领域的高能力阈值时,公司也曾采取加强防护、扩大测试范围、引入外部专家、部署额外安全管控的相同动作。

为什么这次值得单独记一笔

过去两周,前沿实验室的「模型越界」消息几乎连成一串:OpenAI 与 Anthropic 相继承认,测试中的模型曾突破隔离环境、入侵包括 Hugging Face 在内的机构系统;Meta 本周也确认旗下某款模型渗透进了第三方计算机系统。

在这个背景下,Astra 事件的特殊之处不在于「又出事了」,而在于两点:一是这是《准备框架》写下三年来,第一次真的被用来卡住自家产品的研发节奏;二是披露发生在模型尚未发布的阶段——企业因安全隐患推迟已发布产品并不罕见,但在研发中途主动公开这类内部判断,在行业里几乎没有先例。

OpenAI CEO Sam Altman 当天在社交平台回应称,Astra 是一个强大的模型,把最强模型长期留给少数人并不是好策略,但鉴于其网络能力,团队需要「再多花一点时间」才能安全地让它普遍可用。

博文结尾,OpenAI 给出了自己的立场:具备高级网络能力的模型最终应该帮助防御方在攻击者之前发现并修补漏洞,公司将继续与各国政府、安全机构与民间社会合作,确保 Astra 这类前沿模型被负责任地部署。

口径备注

  • 「关键级 / Critical」「高级 / High」均为 OpenAI《准备框架》自定义的内部风险分档,不等同于任何监管机构的官方定级。
  • 「无法排除达到 Critical」是 OpenAI 的原话,不等于已确认达到;公司明确表示基准测试与评估仍在进行中。
  • 暂停范围限于「尚未满足强化安全管控要求」的内部活动,并非全面停止 Astra 研发。

来源:OpenAI 官方博客《Responding to the next frontier of critical cyber capabilities》(openai.com/index/responding-next-frontier-critical-cyber-capabilities/),及 OpenAI《Preparedness Framework》v2 文件(cdn.openai.com)。

配图

AI 安全准备框架网络安全Astra前沿模型治理