蚂蚁百灵发布 Ling-3.0-flash-VL 原生多模态模型,支持 1M 上下文与 SGLang 首日适配

📡 蚂蚁百灵2026-09-09 15:11

蚂蚁百灵发布原生多模态模型 Ling-3.0-flash-VL,支持 1M 长上下文并获得 SGLang 首日适配。

AI 深度解读

蚂蚁百灵发布 Ling-3.0-flash-VL 原生多模态大模型,具备 1M 超长上下文能力并获得 SGLang 推理框架首日适配,展现了稀疏架构在长视频与长文本推理中的工程优化路径。

  • 蚂蚁百灵于 2026 年 9 月 9 日公布该模型细节,采用 124B 总参数、每个 Token 激活约 5.5B 的 MoE 稀疏结构。
  • 模型架构由 ViT 视觉编码器与 MLP 投影层构成,引入 VideoRoPE 进行时空位置编码以支持原生图像与视频理解。
  • 骨干网络采用 42 层 KDA 与 Gated MLA 按 5:1 比例组成的混合注意力机制,以保障 1M Token 上下文的高效处理。
  • 推理框架 SGLang 在发布当天完成适配,协助降低大规模长上下文并发请求的显存占用与计算时延。
  • 影响/看点:超长上下文多模态与推理框架的首日适配有助于降低长视频分析与长文档检索的计算成本,其实际应用价值取决于在百万 Token 尺度下的检索精确度与复杂推理稳定性。
  • 资料依据:
  • X:蚂蚁百灵 (@AntLingAGI)(2026-09-09):https://x.com/AntLingAGI/status/2097583669926109550
  • Hugging Face(2026-09-09):https://huggingface.co/inclusionAI/Ling-3.0-flash-VL

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手