蚂蚁百灵发布 Ling-3.0-flash 混合推理 MoE 模型
蚂蚁百灵发布Ling-3.0-flash,124B参数仅激活5.1B,性能媲美自家1T旗舰模型,原生支持256K上下文。
AI 深度解读
蚂蚁百灵团队发布新一代混合推理 MoE 模型 Ling-3.0-flash,以远小于旗舰模型的参数规模逼近甚至超越自家千亿级旗舰在多数基准上的表现,并已上线 OpenRouter,即日起至 8 月 3 日免费开放试用。
- 模型总参数 124B,但每 token 仅激活 5.1B,用旗舰模型 1/8 总参数、1/12 激活参数就打平或反超其千亿级 flagship 的多数基准成绩
- 架构采用原生混合线性注意力,KDA 与 MLA 层按 5:1 堆叠,配合 1/64 专家激活比例提升 MoE 计算效率,原生支持 256K 上下文、可扩展到 1M
- 官方放出七个应用演示,覆盖 3D 场景生成(Blender MCP)、多智能体自主科研团队协作、Office 文档端到端处理、纯代码生成设计系统、浏览器内多媒体应用、跨平台营销文案改写、日程自动化闭环等
- 演示重点展示的是长链条工具调用与空间/多步推理能力,而非单纯的问答质量
- 评论区有用户追问是否开放权重,官方尚未在该片段中明确回应
- 看点:用更小激活参数打平旗舰模型的路线,延续了近期 MoE 模型“以效率换算力”的行业趋势,免费试用期或将吸引开发者验证其智能体场景实战表现。
本内容由 AI 生成,仅供参考,请注意甄别