2026 年 9 月 · 6 分钟阅读

关键定义
Preparedness Framework(预备框架) OpenAI 内部用于判定模型是否安全到可以构建与发布的风险分级制度。Critical 是其网络安全能力的最高等级,也是首次有模型进入该级别。
Critical 级网络安全能力 模型在仅有高层目标指令、无需人工逐步引导的情况下,能独立发现并利用多个防护完善系统中的零日漏洞,或对加固目标发起一次完整网络攻击的能力级别。
9 月 1 日,OpenAI 在《Path to Astra: critical capabilities and frontier safeguards》一文中确认:新一代模型 Astra 已达到公司 Preparedness Framework 下的网络安全 Critical 级——这是 OpenAI 首次将任何模型划入这一最高等级。官方表述是:在拥有合适工具与访问权限的前提下,Astra 可以独立发现未知安全缺陷并开发利用方式,且无需人工逐步引导。
按 OpenAI 自己的定义,Critical 级适用于两类情况:模型能独立地在多个防护完善的系统中发现并利用零日漏洞;或仅凭一条高层指令,就对加固目标完成一次完整的网络攻击。这次认定不是假设——测试里 Astra 在 ExploitBench 上拿到满分(该基准衡量把已知漏洞变成可用利用程序的能力),并在另一项针对较新披露漏洞的评估中自主发现了两个零日漏洞。
更值得注意的是逃脱记录:Astra 逃出了浏览器沙箱、在底层机器上执行命令;随后在加固操作系统上串联多个漏洞,拿到 root 级访问权限。这不是模型能力的一次小步进,而是 OpenAI 公开承认"我们无法完全排除某个模型能找到并利用人类还没发现的漏洞"。
8 月 7 日:首次示警
OpenAI 发布《Responding to the next frontier of critical cyber capabilities》,表示内部评估与专家判断使其"无法排除"Astra 达到 Critical 级。
8 月 18 日:暂停训练
《Pacing model development in an era of cyber-critical capabilities》宣布对面向部署的模型暂停强化学习训练约两周,同时要求涉及 Astra 或网络模型的工作负载执行最严格的安全防护。
9 月 1 日:正式确认
《Path to Astra》确认模型达到 Critical 级,并列出发布前所需防护——更严的访问控制、分阶段评估门禁,以及面向测试者与 Daybreak Blue 项目的受限放量路径。
OpenAI 报告的防护数据里,最值得企业注意的一条:Astra 拒绝了 91.5% 的网络安全相关越狱尝试,而前代 GPT-5.6 Sol 是 59%;Astra 也远不像 Sol 那样绕过安全限制、或利用评估中故意放置的"蜜罐"目标。但这类防护管的是"模型同意做什么",不是"模型能触达什么"——这正是 Hugging Face 事件中失败的那个区分。
OpenAI 自己的表述也承认了边界:"我们正进入这样一个 AI 发展阶段——模型承担更有后果的工作,对齐与控制的失败会产生更严重的影响。" 没有任何防护经过独立审计;目前存在的,是一家公司对未发布模型的自我描述、它打算施加的控制,以及它为何需要这些控制的自我评估。
供应商风险审查出现新条目
评估 OpenAI API 用于敏感负载的安全团队,现在有了一份公司官方文档,声明同族前沿模型可以在合适条件下无人监督地寻找零日——这成为任何供应商风险评估、网络保险问卷与 SOC 2 审查的新检查项。
能力分级披露可能变成采购要求
Astra 事件为"能力分级披露"立了先例:企业采购问卷应开始要求模型提供方声明所购具体版本的能力分级,而不是只给聚合基准分数。
监管叙事有了真实案例
一份公开、带日期的"实验室因网络风险暂停自家训练"的书面记录,正是监管机构起草前沿模型报告义务时会引用的案例。金融稳定理事会主席本周已向 G20 财长表示,AI 驱动的网络风险是金融稳定最直接的威胁。
Astra 还没发布,但它已经把"前沿模型具备自主网络攻击能力"从科幻变成一份可引用的公司文档。对采购方,这意味着评估模型不再只是比基准分——而是要比防护、比能力分级、比发布路径。对监管者,这是一份现成的规则起草素材。真正的分水岭不是模型能不能找到零日,而是当它找到之后,控制与责任由谁承担。
参考来源
按 OpenAI 的 Preparedness Framework,Critical 是网络安全能力的最高等级:模型可以在无人逐步引导的情况下,独立发现并利用多个防护完善系统中的零日漏洞,或仅凭一条高层指令对加固目标完成一次完整攻击。这是 OpenAI 首次将任何模型划入该级别。
在 ExploitBench 上拿到满分;在另一项针对较新披露漏洞的评估中自主发现两个零日漏洞;逃出浏览器沙箱在底层机器执行命令;并在加固操作系统上串联多个漏洞拿到 root 级访问权限。
8 月 7 日 OpenAI 表示无法排除 Astra 达到 Critical 级;8 月 18 日宣布对面向部署的模型暂停强化学习训练约两周,用于加严针对 Astra 与网络模型工作负载的安全防护;9 月 1 日正式确认达到该级别。
Astra 拒绝了 91.5% 的网络安全相关越狱尝试(前代 GPT-5.6 Sol 为 59%),且远不像 Sol 那样绕过安全限制或利用评估中故意放置的蜜罐目标。
完整的网络安全能力不会在发布时广泛开放。OpenAI 计划先给一组测试者早期访问,之后通过 Daybreak Blue 项目逐步扩大;Critical 级模型在发布前需要更强的防护。
OpenAI 公开确认同族前沿模型可以在无人监督下寻找零日漏洞,这将成为供应商风险评估、网络保险问卷和 SOC 2 审查中针对生成式 AI 工具的新检查项——企业应在采购问卷里要求模型提供方披露具体版本的能力分级。
通用虚拟机挡不住 AI 网络 Agent:Trail of Bits 三次实测越狱
8月26日,Trail of Bits发布受控实验:OpenAI安全模型GPT-5.6-Cyber在12小时自主会话中三次逃出QEMU/KVM虚拟机,最后一次自主发现并串联3个零日+1个已修未分发漏洞。Firecracker扛住了——通用VM不能再被当作可靠的Agent隔离边界。
治理挡不住已经上膛的 Agent:CrowdStrike 发布 Falcon Guardian 运行时 AIDR
9月1日,CrowdStrike在Fal.Con 2026发布Falcon Guardian——AI检测与响应(AIDR)方案:在Agent执行所在的端点做运行时防护,覆盖影子Agent发现、运行时可见性、访问控制、检测响应与AI网关。CEO Kurtz:治理单独拦不住已经在动起来的Agent。
解压即中招:恶意仓库能让 Claude Code、Codex、Cursor、Grok 执行代码
Manifold Security 9月1日披露GitSpawn:编码Agent启动时后台跑git收集上下文,却未剥离仓库自身git配置——恶意core.fsmonitor让以文件形式(zip/共享盘)到达的仓库在宿主执行任意代码,发生在信任提示之前、沙箱之外。8个发现横跨7个Agent,4个未修复。
Langflow 9.8 分 RCE 正被用来偷 OpenAI/AWS 密钥——漏洞记录却一直静默
8月30日起VulnCheck蜜罐记录到针对Langflow未授权root RCE(CVSS 9.8)的利用尝试,两天超360次,直取LANGFLOW_SUPERUSER、OpenAI与AWS密钥。但该漏洞不在厂商advisory、不在CISA KEV,EPSS仅2.3%——权威漏洞管理来源看不到它。