研究:智能体记忆文件存在提示注入攻击风险,拒绝执行不等于清除指令
华盛顿大学研究发现,智能体记忆文件被注入恶意指令后模型多拒绝执行但不会清除,下次会话仍会生效。
AI 深度解读
华盛顿大学一项研究揭示了AI编程智能体的一个隐蔽安全隐患:即便模型拒绝执行记忆文件里的恶意指令,也不代表它会把这条指令清理掉——指令会一直留在CLAUDE.md这类持久化文件里,下一次会话照样卷土重来。
- 研究把「是否执行」和「是否移除」拆成两个独立问题:Claude Opus等模型面对记忆文件中的恶意指令大多会拒绝执行,这是好消息
- 坏消息是拒绝执行不等于清除威胁——绝大多数情况下模型不会主动把恶意指令从记忆文件里删掉
- 攻击面精确锁定在claude-code、codex这类会把CLAUDE.md等文件当持久化工作区记忆、每次会话开头重新加载的智能体工具
- 团队采用多会话探测方法,在4个模型上验证:一次拒绝只对当次会话生效,污染的记忆文件会在后续每一次新会话中重新起作用
- 说明当前主流的智能体记忆机制普遍缺少对已识别恶意内容的自动清理或告警环节
- 对使用CLAUDE.md、AGENTS.md等持久化记忆文件的团队是个具体提醒:定期审查记忆文件内容、给协作产生的记忆文件加校验,比信任模型「会自己拒绝」更靠谱。
本内容由 AI 生成,仅供参考,请注意甄别