清华等提出 One-Shot OPD:单条查询即可实现策略在线蒸馏 87% 收益
清华等高校联合提出 One-Shot OPD 技术,仅用单条查询便实现全量数据在线策略蒸馏 87% 的增益。
AI 深度解读
清华大学 NLP 团队联合多家研究机构于 2026 年 9 月 29 日发布研究,提出 One-Shot OPD 方案,证明仅使用单条查询进行策略在线蒸馏即可获取全量数据 87% 的性能收益。
- 研究团队针对大模型后训练阶段的在线策略蒸馏(OPD)进行极简压缩,在数学任务上将模型得分从 59.1 提升至 68.5,接近全量数据蒸馏所得的 69.8 分。
- 该技术在代码编写、指令遵循以及智能体工具调用等多类评估场景中均展现出跨架构有效性,已在 Qwen、Llama 和 OLMo 等开源模型上得到验证。
- 该方法通过让学生模型在极少的前缀分布下对齐教师模型,有效降低了后训练阶段高价值合成数据生成与清洗的计算成本。
- 影响/看点:该方案改变了对后训练蒸馏依赖海量高质量数据的认知,若在更大参数规模与更复杂长推理任务中泛化成立,将显著降低轻量化模型对齐的训练成本。
- 资料依据:
- X:面壁智能 OpenBMB(2026-09-29):https://x.com/OpenBMB/status/2104919127056101611
本内容由 AI 生成,仅供参考,请注意甄别