解析同策略蒸馏中的长度膨胀现象:EOS 终止标记不一致成主因

📡 HuggingFace Daily Papers2026-09-17 08:00

研究发现同策略蒸馏中生成长度膨胀的主因是师生模型EOS标记不一致,并提出共享语义停止动作来解决。

AI 深度解读

北卡罗来纳大学等机构的研究揭示了同策略蒸馏(OPD)中学生模型输出长度异常膨胀的核心机理,发现基础学生模型与后训练教师模型之间的终止标记不一致是主要诱因。

  • 在 Qwen3、Llama 和 Gemma 等主流模型家族中,即使声明的停止词集合相同,学生与教师模型仍可能将终止概率分配给不同的 EOS 标记。
  • 该标记概率错位会抑制学生模型原有的终止行为,同时无法可靠转移教师偏好的替代标记,从而导致学生模型持续生成直至耗尽预算。
  • 研究证实仅在解码阶段对齐停止词集合并不充分,而将功能等价的 EOS 标记作为共享语义停止动作处理能显著缓解长度膨胀;阶段性分析进一步显示训练后期仍存在独立于标记对齐的二次长度增长现象。
  • 影响/看点:该机制定位为大模型推理蒸馏中的“长文本幻觉与冗余生成”提供了低成本的纠偏方案,若结合多阶段训练控制,有望在不牺牲推理质量的前提下显著压缩学生模型的端到端生成延迟与算力浪费。
  • 资料依据:
  • arXiv(2026-09-17):https://arxiv.org/abs/2609.20511
  • GitHub(2026-09-17):https://github.com/UNCSciML/opd-eos

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手