Meta 探索字节级大模型缩放规律:仅需六分之一数据追平 Token 模型

📡 DAIR.AI2026-09-21 01:35

Meta 研究字节级语言模型缩放规律,通过蒸馏技术仅用六分之一训练数据即追平传统 Token 模型表现。

AI 深度解读

Meta FAIR 与华盛顿大学研究团队公布字节级语言模型缩放研究,探索摆脱传统分词器词表限制的模型蒸馏与训练效率规律。

  • 针对传统分词器在词表固定与性能上限方面的约束,研究提出将 Token 教师模型概率蒸馏至 1B 参数的字节级学生模型架构。
  • 论文设计了边际化(Marginalize-It)与词尾标记(End-Of-Token)两种对齐概率分布的方法,其中精确标记词尾的方法能够完整保留教师模型的输出概率分布。
  • 实验拟合的缩放规律表明,字节级模型在低算力区间略逊于分词基线,但随算力增长展现出更高性能上限,且利用 End-Of-Token 仅需六分之一训练数据即可追平传统蒸馏模型。
  • 影响/看点:该研究证实了无分词器模型在长尾语种与多语言表征上的扩展潜力,但其能否在生产环境中替代分词架构,仍取决于字节级序列带来的更长上下文计算与推理开销的优化程度。
  • 资料依据:
  • DAIR.AI(2026-09-20):https://x.com/dair_ai/status/2101726926838620444
  • arXiv(2026-09-11):https://arxiv.org/abs/2609.12303

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手