新论文揭示安全漏洞:仅凭正常交互即可反向重构智能体隐藏的 Skill 技能文件
新研究发现隐藏的智能体技能文件无法靠保密防御,攻击者仅需数十次正常调用即可逆向重构其绝大部分能力。
AI 深度解读
一项关于智能体安全的新研究于 2026 年 8 月披露了名为 “Daydreaming” 的黑盒提取方法,证实仅凭正常的任务交互即可高比例重构智能体内部隐藏的专有 Skill(技能)文件。
- 该研究针对 4 个受害大模型和 7 类智能体技能进行测试,Daydreaming 方法在黑盒执行环境下平均恢复了原始技能 86.8% 的功能逻辑,提取效率约为此前 SigLeak 方法的 4 倍。
- 该攻击手段不需要白盒权重或直接诱导提示词泄露,攻击者仅需中位数 32 次常规 API 调用,通过输入自适应构建的诊断任务,即可从模型输出中逆向映射出内部规则、阈值与工作流。
- 实验表明,即使系统部署了过滤直接询问提示词的披露防御机制,该方法依靠正常功能执行特征依然能够成功提取。
- 这一发现证明通过隐藏代码或提示词实现的所谓 “保密” 无法构成智能体核心资产的有效安全边界。
- 影响/看点:智能体技能容易被逆向重构意味着单纯依靠提示词工程或隐藏工作流构建的技术壁垒可能失效,安全防护需转向服务端逻辑硬编码或沙箱级执行隔离。
- 资料依据:
- X 平台 DAIR.AI 官方账号:https://x.com/dair_ai/status/2093805947860967907
- arXiv 预印本平台:https://arxiv.org
本内容由 AI 生成,仅供参考,请注意甄别