Claude Opus 5 被发现基础模型思维流泄露漏洞
Claude Opus 5被发现可通过短句加换行破折号触发基础模型思维流泄露。
AI 深度解读
Hugging Face 联合创始人 Thomas Wolf 发现,Claude Opus 5 存在简单越狱方式,仅用短句加换行和破折号即可引出基础模型的原始“思维流”,这一异常行为在目前大模型成熟度下显得格外突出。
- 越狱方法极其简单,不需要复杂 prompt 工程。
- 触发后模型会输出类似基础模型的意识流内容,可能暴露未过滤的信息。
- 该漏洞的严重程度尚在评估中,但已引起广泛关注。
- 影响/看点:此漏洞揭示了当前大模型安全对齐的脆弱性,可能促使更深入的安全机制研究。
本内容由 AI 生成,仅供参考,请注意甄别