Boris Cherny:Opus 5 是迄今最难被提示注入的模型

📡 Simon Willison 博客2026-07-25 08:42

Anthropic工程师称Claude Opus 5是迄今最难被提示注入的模型,红队测试与系统卡均证实

AI 深度解读

Anthropic 员工 Boris Cherny 在 X 上表示,比起各项评测分数,真正让他兴奋的是 Opus 5 在提示注入(prompt injection)红队测试中的表现——这是 Anthropic 迄今为止最难被攻破的模型。

  • 该说法出自 Opus 5 System Card 第 73 页的红队评测章节,并非营销通稿的自我表扬。
  • Cherny 强调,无论是专项的提示注入(PI)评测还是红队渗透测试,Opus 5 都很难被成功注入恶意指令。
  • 他把这一进展排在各项能力评测分数之前,视为本次发布中“最令人兴奋”的信号。
  • 提示注入长期是智能体(agent)大规模落地的核心安全瓶颈,尤其在浏览网页、处理邮件等接触不可信内容的场景下风险突出。
  • 如果这一鲁棒性能在真实生产环境中站住脚,将直接降低企业在“让 Claude 智能体接触外部不可信内容”这件事上的顾虑门槛。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com