OpenAI 评定 Astra 为最高危模型:网络攻防能力飞跃但思维监控难度大增

📡 The Decoder2026-09-02 22:20

OpenAI将即将推出的Astra评为最高网络风险模型,其攻防能力大增但思考过程更难被监控。

AI 深度解读

2026年9月2日,OpenAI 在其《准备框架》下将即将推出的 Astra 模型评定为首个具备“严重”(Critical)网络安全风险的系统,揭示了前沿大模型网络攻防能力跃升与可解释性监管之间的现实矛盾。

  • 自动化攻防测试表现:据 The Decoder 2026 年 9 月 2 日报道,Astra 在 ExploitBench 评测中获满分,并在针对 20 个高危 V8 漏洞的测试中自主发现并串联了两个未知的零日漏洞;在高级权限测试下展示出沙箱逃逸与系统提权能力。
  • 隐式推理带来的监控挑战:该模型引入循环深度(recurrent depth)技术以降低内存开销并提升推理效率,但部分推理过程发生于模型内部隐空间表征,导致依赖人类可读文本的思维链(CoT)监控有效性减弱。
  • 访问控制与防御部署:内部评估中 Astra 对违规网络请求的拒绝率为 91.5%,OpenAI 计划通过思维链分类器监控异常活动,并严格限制高级网络攻防权限的分发。
  • 影响/看点:该评级标志着大模型自主网络渗透能力已触及安全监管红线,意味着若隐式推理架构削弱了监督机制,安全顾虑可能迫使前沿大模型推迟公开发布并重构防御验证范式。
  • 资料依据:
  • The Decoder(2026-09-02):https://the-decoder.com/openai-calls-astra-its-most-dangerous-model-yet-watching-what-it-does-is-only-getting-harder/
  • OpenAI 系统准备框架评估报告(2026-09-02):https://openai.com/index/preparedness-framework/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手