MiniMax H3全模态生成模型发布,支持15秒2K分辨率生成

📡 IT之家2026-07-31 10:00

MiniMax发布全模态生成模型H3,支持文本图像视频声音统一理解,最高15秒2K分辨率输出

AI 深度解读

稀宇科技(MiniMax)发布全模态生成模型H3,主打文本、图像、视频、声音统一理解与生成,最高可出15秒2K分辨率视频,是国内厂商在多模态生成赛道的最新一击。

  • 支持对图文视频音频混合上下文的统一理解,能输出带原生双声道的音视频内容,而非简单拼接音轨
  • 邀测反馈显示其在指令遵循、视频中文字与品牌信息呈现、「V2V Motion Transfer」(把一段视频的动作迁移到另一素材上)等商用场景表现突出,面向广告、电商、UI/UX、游戏等行业客户
  • 新增专属Caption模型和全模态理解管线,单素材推理消耗约10万token,压缩产出约4千token的描述,试图用更细粒度理解支撑生成质量
  • 2K分辨率并非靠传统超分模块「猜」出细节,而是让H3基础模型对自己的低分辨率结果做in-context重新生成,复用基模已具备的生成能力
  • 模型权重宣布未来数日内开放
  • 若权重如期开源,将是国内少数具备15秒2K级全模态生成能力且愿意放权重的模型,值得关注其开源后的实际生成质量与算力门槛。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com