AMD 发布最强开源 MoE 模型 Instella-MoE 系列,16B 参数
AMD发布Instella-MoE系列开源MoE模型,总参数16B,激活参数2.8B,使用自有GPU训练。
AI 深度解读
AMD推出开源MoE模型Instella-MoE,以16B总参数量、2.8B激活参数和自有GPU训练打造的高效语言模型,值得关注其开源策略和性能表现。
- 总参数量16B,激活参数仅2.8B,采用27层解码器架构,体现高效稀疏计算。
- 共6个版本,涵盖预训练、中训练、长上下文、SFT、DPO、RL,覆盖完整训练流程。
- 训练完全基于AMD ROCm软件栈,并在MI300X/MI325X GPU上完成,展现软硬件协同能力。
- 性能方面,Base版跑分低于Qwen3.5-4B-Base但高于其他同类模型;Think版在更少激活参数下超越Gemma-4-E4B-it。
- 推理阶段通过SGLang框架实现专家并行,首Token响应时间缩短39.2%。
- 影响/看点:AMD此举强攻AI开源生态,挑战英伟达主导地位,为开发者提供更多硬件选择。
本内容由 AI 生成,仅供参考,请注意甄别