Pick Your Poison:通过毒化样本选择大幅提升大语言模型后门攻击成功率
研究表明精心挑选投毒样本可将大模型后门攻击成功率从3%提升至80%,并提出SAILS算法用于高效筛选最危险的毒化数据集合。
AI 深度解读
arXiv 于 2026 年 9 月 14 日收录了关于大语言模型后门攻击的研究,提出毒化样本集合选择优化方法 SAILS,指出传统随机采样评估严重低估了模型在最坏情况下的脆弱性。
- 研究发现在固定的微调数据和投毒样本数量下,仅改变毒化样本集合的组合选择,LLaMA-3-8B 上的后门攻击成功率就会在 3% 到 80% 之间剧烈波动。
- 该研究将毒化选择形式化为有预算约束的集合优化问题,通过数百次微调评估训练集合评分器,从数百万候选集合中筛选高危样本组合。
- 实验结果表明,SAILS 相比现有的影响函数基线使留出集攻击成功率平均提升 30 个百分点,并能有效迁移至全量微调、代码生成及智能体后门场景。
- 影响/看点:这表明模型安全防御不能仅依赖平均随机测试,未来在开源微调数据治理和对齐审计中,需要建立针对样本协同组合效应的深度审查机制。
- 资料依据:
- arXiv 论文库(2026-09-14):https://arxiv.org/abs/2609.15029
- Hugging Face 论文库(2026-09-14):https://huggingface.co/papers/2609.15029
本内容由 AI 生成,仅供参考,请注意甄别