阿里千问开源多模态Agent模型Qwen3.8-Omni-Flash

📡 The Decoder2026-09-19 22:30

阿里千问开源多模态Agent模型Qwen3.8-Omni-Flash,支持音视频联合处理与自主工具调用。

AI 深度解读

阿里巴巴通义千问团队发布多模态 Agent 模型 Qwen3.8-Omni-Flash,其支持音视频一体化处理与自主工具调用,以较低的 API 调用定价对标主流多模态轻量模型。

  • 该模型支持 100 万 token 上下文窗口,可自主结合外部工具执行视频剪辑、短视频翻译与长视频摘要等端到端任务。
  • 官方公布的 API 定价为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,在音频和视频处理费率上相对同类轻量级模型具有明显价格差异。
  • 配合模型发布,团队同步开源了用于工作流扩展的 Qwen-MM-Plugins 以及支持摄像头与麦克风实时交互的 Qwen-Live Harness 工具套件。
  • 影响/看点:低成本的音视频一体化多模态能力可能降低实时智能助理与视频内容处理 Agent 的开发门槛,但其能否在生产环境中大规模普及,取决于长上下文下音视频时序推理的准确度与工具调用的稳定性。
  • 资料依据:
  • The Decoder(2026-09-19):https://the-decoder.com/qwen3-8-omni-flash-undercuts-gemini-flash-pricing-while-matching-its-multimodal-benchmarks/
  • Qwen-MM-Plugins 官方 GitHub 仓库(2026-09-19):https://github.com/QwenLM/Qwen-MM-Plugins
  • 阿里云百炼官方文档(2026-09-19):https://www.alibabacloud.com/help/en/model-studio/qwen-omni

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手