用不到 1000 美元将 3.8B 大模型训练至 0.384 CORE 评测分
开发者分享以不足 1000 美元的成本,将 3.8B 大模型训练至 0.384 CORE 评测分的实践经验。
AI 深度解读
开发者 Hugo Vergnes 公布了一项低成本模型预训练实验,使用 998 美元算力成本在 650 亿 Token 数据上从零训练出一个 3.8B 参数模型,并达到 0.384 的 CORE 评测分。
- 实验耗时 43 小时,算力总支出控制在 998 美元以内,完成了 38 亿参数规模语言模型的从零预训练。
- 训练基于约 65B Token 规模的精选数据,模型在 CORE 基准测试中取得了 0.384 的基准得分。
- 详细记录了数据清洗配比、学习率调度策略及分布式训练中的算力利用效率优化手段。
- 影响/看点:该实践展示了小团队在极度受限预算下进行中小规模模型预训练的可行路径,但模型上限仍受限于训练数据总量与算力预算规模。
- 资料依据:
- Hugo Vergnes 个人技术博客(2026-09-10):https://hugovergnes.github.io/little-lm-3-8b/
本内容由 AI 生成,仅供参考,请注意甄别