但这个位置可能明天就要换人了。 就在 Fable 5.1 发布不久,OpenAI 更新了 Astra 的安全评估博客,他们说这款模型能找零日漏洞、拼攻击链、逃离浏览器沙箱,还能从普通账户一路冲到 root。 好家伙,现在发模型之前先放一个危险声明已经成套路了。就像 APPSO 之前文章写的,越狱已经成了新的 Benchmark。 Sam Altman 随后也发文称,OpenAI 的下一款模型很快发布。他透露 Astra 早已完成训练,能力和对齐都有明显提升。 但 OpenAI 团队既兴奋,也焦虑。团队需要留出足够时间处理安全和对齐问题。Altman 说: 「没有人完全理解」如此强大的 AI 会带来什么后果。 (看来奥特曼这次又瘫坐在椅子上了)。 也就是说, GPT-6 这次真的要来了。 虽然 Astra 命名还没确定,但它的定位肯定是旗舰模型,要冲着 Fable 5.1 发起冲击了。 OpenAI 独一档的模型 在博客中,OpenAI 给 Astra 定了一个新等级—— Critical,关键级网络安全能力。 此前没有任何 OpenAI 模型被划到这个等级。 「Critical」只对应网络安全专项。它不等同于 AGI,也无法代表 Astra 的全部能力。 按照 OpenAI 的《Preparedness Framework》,达到这一级别的模型可以发现未知漏洞,并在许多加固系统中开发可用的零日攻击。 模型需要合适的工具和权限,但不需要人类逐步指导。即使只收到一个高层目标,它也可能自行规划和执行针对加固目标的新攻击策略。 OpenAI 的定级结合了公开基准、内部基准和专家主导评测。其中有一套测试叫 ExploitBench。 这套测试会给模型一个已经公开的漏洞。模型需要写出真正可用的攻击代码,不能只复述漏洞原理。 结果 Astra 完成了这套测试里的全部题目,拿到了满分「大结果」。 这个满分不等于 Astra 能攻破所有现实系统,它只代表 Astra 在这套已知漏洞题库中全部成功。公开题库有一个 Bug,里面的内容可能进入过训练数据,模型也许见过类似答案。 OpenAI 因此专门准备了一套内部测试,题目包含 20 个在 2026 年 6 月至 8 月披露的高危 V8 漏洞。Astra 的任意代码执行成功率远高于 GPT-5.6 Sol,使用的输出 Token 也少得多。 OpenAI 安全工程人员、前 Indent CEO Fouad Matin 表示,Astra 的能力和 Token 效率都高于 GPT-5.6 Sol,目前官方还没公布具体成功率和 Token 数量。 评测过程中,Astra 还发现了 2 个此前未知的零日漏洞,随后它利用 2 个漏洞形成一条完整攻击链。 跑完这些题后,专家又把 Astra 放进受控的浏览器和操作系统环境。 Astra 在浏览器打开一个 HTML 文件后,它构造出完整攻击链,逃出沙箱,并在宿主机上执行命令。在另一组操作系统评测中,Astra 找到多个漏洞,并把它们组合成本地提权链。 Astra 的权限也从普通用户升到了 root。 沙箱用来限制网页代码的活动范围,root 则拥有整台机器的最高权限。 OpenAI 特别标注,这些成绩来自拥有 Daybreak Blue 权限的 Astra。默认生产配置不会开放同样的工具和权限。 越会攻击,反而越少「偷家」 在网络安全越狱测试中,Astra 对违规请求的拒绝率达到 91.5%。GPT-5.6 Sol 的拒绝率是 59%。 按照 OpenAI 的说法, Astra 是其「迄今最对齐的模型」。 这得益于预训练阶段的干预,以及强化学习中更谨慎、更一致的评分。 团队还根据此前的 Hugging Face 事件设计了「蜜罐」测试。模型遇到很难或无解的任务时,周边系统会留下可用于作弊的目标。 在没有生产防护的模拟环境中,GPT-5.6 Sol 有 56% 的测试会尝试访问这些目标。 但 Astra 完全没有这样做。 自动审查拒绝操作后,Astra 也没有尝试绕过审查,面对蜜罐捷径时,它仍然通过正常方式解出了一部分任务。 当然,这些结果只适用于特定测试。OpenAI 仍为正式发布版本加入了模型拒绝、系统分类器、跨会话监控和离线检测。 同时,被系统判断为高风险的账户,会遇到更保守的模型边界。监控系统也会结合更多跨会话信息识别潜在滥用。 OpenAI 还在继续内部和外部红队测试。过去发现的越狱方法会反复回归检查,新发现则进入 7 × 24 小时快速响应流程。 安全团队需要防止恶意用户借助 Astra 发动攻击,即使没有恶意用户,模型自行采取未经授权行动的风险也要被监控。 Hugging Face 攻击事件后,虽然这个攻击和Astra没关系,但 OpenAI 宣布暂停