Boris Cherny:Opus 5 是迄今最难被提示注入的模型
Anthropic工程师称Claude Opus 5是迄今最难被提示注入的模型,红队测试与系统卡均证实
AI 深度解读
Anthropic 员工 Boris Cherny 在 X 上表示,比起各项评测分数,真正让他兴奋的是 Opus 5 在提示注入(prompt injection)红队测试中的表现——这是 Anthropic 迄今为止最难被攻破的模型。
- 该说法出自 Opus 5 System Card 第 73 页的红队评测章节,并非营销通稿的自我表扬。
- Cherny 强调,无论是专项的提示注入(PI)评测还是红队渗透测试,Opus 5 都很难被成功注入恶意指令。
- 他把这一进展排在各项能力评测分数之前,视为本次发布中“最令人兴奋”的信号。
- 提示注入长期是智能体(agent)大规模落地的核心安全瓶颈,尤其在浏览网页、处理邮件等接触不可信内容的场景下风险突出。
- 如果这一鲁棒性能在真实生产环境中站住脚,将直接降低企业在“让 Claude 智能体接触外部不可信内容”这件事上的顾虑门槛。
本内容由 AI 生成,仅供参考,请注意甄别