苹果机器学习研究:大模型预训练扩展与剪枝一体化流程 IDEA Prune
苹果提出大模型一体化流程IDEA Prune,将放大预训练与结构化剪枝结合,提升有限算力下的部署效率。
AI 深度解读
苹果机器学习研究页面介绍了IDEA Prune,一种把“大模型预训练—结构化剪枝—恢复训练”整合到同一流程中的方法;该研究的关注价值在于,它讨论的不是训练完成后简单压缩模型,而是能否在模型尚未部署时先利用更大容量学习,再有计划地压缩到目标规模。
- 论文由Yixiao Li等人提出,论文原稿于2025年3月7日发布,实验重点是将2.8B参数模型压缩至1.3B参数。
- 方法采用单一余弦退火学习率安排训练过程,并以迭代方式逐步移除前馈网络中的神经元,减少一次性剪枝造成的知识损失。
- 论文报告称,在最多2T训练词元的实验中,整合式流程优于从目标规模模型直接训练,以及先独立预训练再剪枝的朴素流程。
- 实验还表明,放大模型并非越大越好:扩大容量能够改善表示学习,但过度扩大后再压缩会增加性能退化,因此扩展比例需要结合目标模型和训练预算选择。
- 这些结果主要来自论文设定下的语言模型和数据集实验,不能直接推出所有架构、任务或商业模型都能获得同等收益。
- 影响/看点:如果该流程在更多模型规模和下游任务中保持稳定,模型压缩可能从“事后补救”转向训练阶段的联合设计,从而为有限推理预算下的模型部署提供新路径;成立条件是剪枝后的质量、训练总成本和工程复杂度能够同时优于直接训练小模型。
- 资料依据:Apple Machine Learning Research《IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining》,2025年,https://machinelearning.apple.com/research/idea-prune-pipeline;arXiv论文,2025年3月7日,https://arxiv.org/abs/2503.05920
本内容由 AI 生成,仅供参考,请注意甄别