谷歌DeepMind发布GenCeption,基于Wan2.1实现多视觉任务统一

📡 IT之家2026-07-21 15:00

谷歌DeepMind发布GenCeption模型,基于阿里Wan2.1将视频生成器用于深度估计和分割等视觉任务。

AI 深度解读

谷歌 DeepMind 发布 GenCeption,基于阿里 Wan2.1 视频生成模型,实现单一模型完成深度估计、分割等多项视觉任务。

  • GenCeption 将预训练的视频生成器逆向改造为视觉分析引擎,一次前向传播即可输出深度图、表面法线、分割掩码等。
  • 基于阿里开源视频模型 Wan2.1 训练,数据仅 7500 段合成视频(800 个人体模型+200 段动作捕捉),但泛化能力强,可处理真实多人视频及动物、机器人等未见类别。
  • 小模型处理 81 帧约 6 秒,14B 大模型约 10 秒,输出细节甚至优于训练数据(如保留猫胡须)。
  • 打破“一个任务一个专用模型”格局,通过文本提示指定任务,实现多任务统一。
  • 影响/看点:GenCeption 展示了视频生成模型在视觉理解上的潜力,为通用视觉模型提供了新范式,有望降低多任务部署成本。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com