通义千问发布 Qwen3.8-Omni-Flash 全模态智能体模型技术报告
通义千问团队发布 Qwen3.8-Omni-Flash 技术报告,该模型支持百万级上下文,主攻全模态长程智能体任务。
AI 深度解读
阿里巴巴通义千问团队于 2026年9月25日 发布技术报告,推出面向跨文本、音频和视频长程智能体任务的原生全模态模型 Qwen3.8-Omni-Flash,并开源两套配套交互与插件框架。
- 模型架构方面,继承 Qwen3.8-Next 的稀疏混合专家(MoE)设计,并将上下文窗口拓展至 100 万 token,支持长时序多模态输入与长程动作规划。
- 训练方法方面,采用原生多模态协同训练策略,在维持文本基础能力的同时,将智能体推理与规划能力迁移至音频和视频任务。
- 开源配套方面,团队同步开源用于扩展现有智能体框架音视频能力的 Qwen-MM-Plugins,以及面向实时多模态交互、工具调用与子智能体调度的 Qwen-Live-Harness 框架。
- 影响/看点:该成果意味着开源多模态智能体正从单一感知交互向复杂音视频生产流水线演进,其实际应用价值取决于高分辨率音视频长序列推理在边缘或云端部署时的计算资源开销与延迟表现。
- 资料依据:
- arXiv(2026-09-25):https://arxiv.org/abs/2609.25611
- X:DAIR.AI(2026-09-25):https://x.com/dair_ai/status/2103573552611926373
本内容由 AI 生成,仅供参考,请注意甄别