Dust:无需反向传播训练Transformer
Dust提出一种无需反向传播即可预训练Transformer的方法。
AI 深度解读
Q Labs 发布 Dust 研究,提出一种在激活空间加入扰动、通过前向计算估计更新方向的方法,用于训练 Transformer 而不执行反向传播;其价值在于探索“计算换梯度”的替代路径。
- 研究在 2026 年 10 月发布,作者称 Dust 使用每个 token 作为虚拟种群成员,以提高零阶估计的并行度。
- 在 10 万至 2000 万 token 的实验中,Dust 的测试损失在部分设置下低于反向传播,或随着种群规模扩大逐步接近。
- 论文同时承认,该方法目前并未达到可替代反向传播的计算效率,实验主要集中在小型 GPT 式模型和有限训练预算。
- 作者还报告,Dust 相比权重空间进化策略需要更小的种群规模,但相关效率优势包含基于实验外推的部分。
- 影响/看点:该方法可能为非可微模块或特殊硬件训练提供思路,但能否扩展到更大模型、更多数据和真实生产训练,取决于种群规模、显存开销与总计算成本是否仍具优势。
- 资料依据:
- Q Labs Research(2026-10-06):https://qlabs.sh/research/dust
- qlabs-eng/dust(2026-10-06):https://github.com/qlabs-eng/dust
本内容由 AI 生成,仅供参考,请注意甄别