Pick Your Poison:通过毒化样本选择大幅提升大语言模型后门攻击成功率

📡 HuggingFace Daily Papers2026-09-14 08:00

研究表明精心挑选投毒样本可将大模型后门攻击成功率从3%提升至80%,并提出SAILS算法用于高效筛选最危险的毒化数据集合。

AI 深度解读

arXiv 于 2026 年 9 月 14 日收录了关于大语言模型后门攻击的研究,提出毒化样本集合选择优化方法 SAILS,指出传统随机采样评估严重低估了模型在最坏情况下的脆弱性。

  • 研究发现在固定的微调数据和投毒样本数量下,仅改变毒化样本集合的组合选择,LLaMA-3-8B 上的后门攻击成功率就会在 3% 到 80% 之间剧烈波动。
  • 该研究将毒化选择形式化为有预算约束的集合优化问题,通过数百次微调评估训练集合评分器,从数百万候选集合中筛选高危样本组合。
  • 实验结果表明,SAILS 相比现有的影响函数基线使留出集攻击成功率平均提升 30 个百分点,并能有效迁移至全量微调、代码生成及智能体后门场景。
  • 影响/看点:这表明模型安全防御不能仅依赖平均随机测试,未来在开源微调数据治理和对齐审计中,需要建立针对样本协同组合效应的深度审查机制。
  • 资料依据:
  • arXiv 论文库(2026-09-14):https://arxiv.org/abs/2609.15029
  • Hugging Face 论文库(2026-09-14):https://huggingface.co/papers/2609.15029

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手