实证研究:近年大模型预训练的飞跃主要源于数据而非架构
最新实证研究对比2019至2025年技术演进,指出大模型预训练的性能飞跃主要源于数据进步,而非架构改良。
AI 深度解读
研究人员 Dwarkesh Patel 与 Jerry Han 发布实证研究,量化评估了 2019 至 2025 年间预训练大模型算力效率提升的驱动来源,为评估模型架构与数据策略的实际价值提供了参考依据。
- 研究在最高 1e19 FLOPs 的算力预算下,将 2019 至 2025 年具有代表性的开源模型架构(从 GPT-2 到 OLMo-2)与各年份公开数据集进行交叉组合训练,并使用 OLMES 基准测试综合评估终端能力。
- 实验结果表明,在 1e19 FLOPs 算力规模下,数据集与筛选清洗技术的演进带来了约 12.0 倍的算力效率提升,而架构算法改进带来了约 3.7 倍提升,数据优化带来的效率增益是架构优化的 3.24 倍。
- 线性模型拟合显示,模型改进与数据改进的效果呈现高度独立性与可加性,二者线性叠加解释了评估得分中 88% 的方差,未观察到强烈的架构与数据协同绑定效应。
- 影响/看点:该结论意味着模型研发中数据质量管理与清洗合成的投入回报可能明显高于单纯微调网络架构,但该推论的成立边界受限于当前中小规模算力与公开数据集的实验设定。
- 资料依据:
- Dwarkesh Patel(2026-09-08):https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data
本内容由 AI 生成,仅供参考,请注意甄别