阿里Wan 3.0上线DeepInfra平台,支持音视频一体化多模态生成
阿里视频生成模型Wan 3.0上线DeepInfra,支持单模型生成30秒含同步音频的1080P视频。
AI 深度解读
阿里云于2026年8月28日宣布视频生成模型Wan 3.0正式上线第三方推理平台DeepInfra,推进了音视频联合生成能力在国际开发者生态中的部署应用。
- 原生音视频生成能力:阿里云官方发布信息显示,Wan 3.0在单模型内部同时实现视频画面与对应音频的联合生成,支持输出最长30秒的1080P视频片段。
- 多模态参考机制:该模型集成了Omni Reference机制,支持将图像、文本文件乃至网页内容作为生成参考输入,用以保障多镜头切换时的角色与风格一致性。
- 平台接入与计费标准:在DeepInfra平台的调用价格为每秒视频0.20美元,同时开发者亦可通过阿里云百炼(Model Studio)与Qwen Cloud调用该模型的官方API。
- 影响/看点:将原生音视频一体化模型接入第三方低延迟推理服务,可能降低海外开发者搭建视频生成应用的对接门槛,其推广速度将取决于开发者对0.20美元/秒调用单价与画质稳定性的综合评估。
- 资料依据:
- 1. 阿里云官方X公告(2026年8月28日):https://x.com/alibaba_cloud/status/2093272820453371985
- 2. DeepInfra服务平台(2026年8月28日):https://deepinfra.com
本内容由 AI 生成,仅供参考,请注意甄别