通义千问正式发布 Agent 原生全模态模型 Qwen3.8-Omni-Flash
通义千问推出Agent原生全模态模型Qwen3.8-Omni-Flash,支持原生音视频理解与工具调用。
AI 深度解读
通义千问团队于 2026 年 9 月 18 日正式发布 Agent 原生全模态模型 Qwen3.8-Omni-Flash,强调多模态感知与复杂任务规划执行的统一。
- 模型具备原生音视频联合理解与推理能力,可结合工具调用完成长流程视频解析、自动剪辑与内容转译。
- 在智能体基准 WildClawBench-MM 与 UniClawBench 上平均得分提升 19.5 分,官方称其音视频能力接近 Gemini 3.8 Flash。
- 支持 1M Token 上下文并具备 Agent 级主动感知机制,视频输入调用成本较上一代下降约 89%。
- 阿里同步开源了多模态插件库 Qwen-MM-Plugins 与测试套件 Qwen-Live Harness,并上线云端 API 与体验平台。
- 影响/看点:该模型将全模态理解与 Agent 工具调用深度绑定,若开源生态工具与低推理成本优势持续兑现,可能降低长流程音视频应用的开发门槛。
- 资料依据:
- 通义千问(2026-09-18):https://x.com/Alibaba_Qwen/status/2100785962414702599
本内容由 AI 生成,仅供参考,请注意甄别