阿里发布首个面向智能体能力的全模态模型 Qwen3.8-Omni-Flash
阿里云发布全模态模型Qwen3.8-Omni-Flash,原生整合音视频理解、推理与智能体工具调用能力。
AI 深度解读
阿里云于 2026 年 9 月 18 日发布首个围绕智能体能力构建的全模态模型 Qwen3.8-Omni-Flash,展示了端到端音视频理解与工具调用的整合路径。
- 模型原生整合音视频感知、推理与工具调用能力,支持联合解析视音频内容并跨流程调用工具,以执行视频剪辑、翻译与摘要等任务。
- 官方测试数据显示,其在 WildClawBench-MM 与 UniClawBench 基准上的 Agent 表现平均提升 19.5 分,并在 OmniVideoBench 上借助主动探索机制降低 51.8% 的 Token 消耗。
- 上下文窗口达 1M Token,视频输入成本较 Qwen3.5-Omni-Plus 降低约 89%,同时开源了 Qwen-MM-Plugins 与 Qwen-Live Harness 配套工具。
- 影响/看点:若多模态交互与工具执行的低成本方案在实际生产中保持稳定,将有助于推动长视频智能处理与实时音视频 Agent 应用的落地。
- 资料依据:
- 阿里云(2026-09-18):https://x.com/alibaba_cloud/status/2100801080959639624
本内容由 AI 生成,仅供参考,请注意甄别