MiniMax 优化视频模型 H3 推理性能:在 8 张 B200 上实现超 2 倍实时去噪

📡 MiniMax2026-09-15 07:34

MiniMax 优化了视频模型 H3 的推理性能,在 8 张 B200 上实现超 2 倍实时去噪且画质无损。

AI 深度解读

MiniMax 宣布其多模态视频生成模型 H3 结合推理框架 SGLang-Diffusion 与加速方案 VDN-H3,在 8 张 NVIDIA B200 加速卡上实现了超过 2 倍实时速度的去噪生成,降低了长视频生成的计算延迟。

  • 端到端推理表现:在预热完成后,系统耗时 9.0 秒即可生成 14.4 秒的 768p 分辨率视频,其中 8 步去噪环节仅耗时 6.9 秒。
  • 采样与架构优化:借助 VDN-H3 的混合注意力机制与少步数蒸馏采样,在 103 条测试提示词的评估中,8 步去噪相比原本 50 步稠密 H3 未测得质量下降。
  • 框架层协同调度:SGLang-Diffusion 针对视频扩散流程进行了算子优化与分阶段调度,改善了硬件并行计算效率。
  • 影响/看点:这一推理优化若能在复杂动态场景和高分辨率下保持时序连贯性与画质稳定,将降低视频生成模型的实际部署成本并推动其实时交互应用。
  • 资料依据:
  • X:MiniMax 官方账号(2026-09-14):https://x.com/MiniMax_AI/status/2099642910853788051
  • GitHub:sgl-project/sglang(2026-09-14):https://github.com/sgl-project/sglang

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手