MiniMax发布多模态生成模型H3

📡 X.PIN2026-07-31 15:19

MiniMax发布多模态生成模型H3,可统一理解文本图像视频音频,原生生成2K立体声视频,权重即将开源。

AI 深度解读

MiniMax发布了新一代多模态生成模型H3,主打在统一上下文里同时理解文本、图像、视频和音频,并能原生生成带立体声的视频内容,面向商业内容创作场景。

  • H3可直接生成最长15秒、2K分辨率的视频片段,且2K画质由基础模型直接产出,而非后期超分辨率放大得到,画面细节和运动一致性理论上更有保证
  • 支持视频到视频的运动迁移等可控多模态编辑能力,创作者可以把一段视频的运动方式迁移到另一段素材上,降低精细化调整的门槛
  • 单次任务可处理最高达10万输入token的复杂上下文,却把输出压缩到约4千token,说明模型在长上下文理解和精简表达之间做了针对性优化
  • 官方表示模型权重即将开源,这对希望本地部署或二次开发多模态生成能力的团队是个利好信号
  • 看点:国产多模态生成模型在视频原生2K、立体声同步生成等工程细节上的推进速度不慢,权重开源后能否形成生态,是接下来的观察重点。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com