唐杰探讨模型最优规模:估测 Fable 仅约 2.5T 参数,Kimi K3 训练算力达 2-3 万卡 Blackwell
唐杰发文探讨模型规模权衡,并推测Fable参数量约为2.5T、Kimi K3耗费约2-3万卡算力训练。
AI 深度解读
清华大学教授唐杰于 2026 年 9 月 10 日在社交平台发文,就前沿大模型的最优参数规模与训练算力配置展开技术探讨。
- 唐杰指出确定模型最优规模并非简单线性扩展,需系统权衡高质量训练数据量、激活参数量、交互环境数量以及目标推理成本。
- 引用行业讨论信息指出,前沿模型 Fable 的总参数量可能在 2 至 2.5T 之间,而非此前传闻的 10T 级别。
- 提及 Kimi K3 模型总参数量约为 2.8T,训练消耗了约 2 万至 3 万张 Blackwell 等效卡算力,基准能力接近 Fable 5。
- 影响/看点:讨论反映出模型研发正从单纯追求绝对参数规模转向算力效益与推理成本的最优平衡,这一趋势的持续取决于高质量合成数据构建与后训练强化学习算法的演进效率。
- 资料依据:
- X:唐杰(2026-09-10):https://x.com/jietang/status/2097870259931988235
本内容由 AI 生成,仅供参考,请注意甄别