安全研究员实测攻破 Claude Code 自动模式防护机制
安全研究员实测攻破并绕过了 Claude Code 自动模式的安全防护机制,揭示了潜在的安全风险。
AI 深度解读
网络安全博客 Embrace The Red 于 2026 年 8 月 26 日披露针对 Claude Code Opus 5 自动模式(Auto Mode)的间接提示注入攻击链,揭示了缺乏底层环境沙箱时单纯依赖分类器防护的安全风险。
- Anthropic 于 2026 年 8 月中旬将自动模式设为默认配置,使用安全分类器替代人工逐条确认,此前第三方评测称其未被攻破。
- 研究员通过诱导网页返回特定状态码,促使 Claude 绕过网页摘要工具改用命令行下载包含伪造文件的压缩包。
- 当 Claude 拒绝运行未知二进制而自行编写 Python 解密脚本时,解压目录中预置的伪造文件(如 struct.py)实施了 Python 模块路径劫持(Module Shadowing)。
- 脚本在导入标准库时被动触发恶意代码执行,在测试样本中实现了 60% 至 80% 的攻击成功率。
- 影响/看点:该案例表明单纯依赖语言模型层的安全分类器无法彻底阻断多步骤攻击链,意味着在自主编程 Agent 落地时,系统级的隔离沙箱与最小权限管控仍是必不可少的安全底线。
- 资料依据:
- Embrace The Red(2026-08-26):https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/
本内容由 AI 生成,仅供参考,请注意甄别