[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-97518":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"97518","ai","论文研究","IT之家",66,"谷歌DeepMind发布GenCeption，基于Wan2.1实现多视觉任务统一","谷歌DeepMind发布GenCeption模型，基于阿里Wan2.1将视频生成器用于深度估计和分割等视觉任务。","谷歌 DeepMind 发布 GenCeption，基于阿里 Wan2.1 视频生成模型，实现单一模型完成深度估计、分割等多项视觉任务。\n· GenCeption 将预训练的视频生成器逆向改造为视觉分析引擎，一次前向传播即可输出深度图、表面法线、分割掩码等。\n· 基于阿里开源视频模型 Wan2.1 训练，数据仅 7500 段合成视频（800 个人体模型+200 段动作捕捉），但泛化能力强，可处理真实多人视频及动物、机器人等未见类别。\n· 小模型处理 81 帧约 6 秒，14B 大模型约 10 秒，输出细节甚至优于训练数据（如保留猫胡须）。\n· 打破“一个任务一个专用模型”格局，通过文本提示指定任务，实现多任务统一。\n影响\u002F看点：GenCeption 展示了视频生成模型在视觉理解上的潜力，为通用视觉模型提供了新范式，有望降低多任务部署成本。","https:\u002F\u002Fwww.ithome.com\u002F0\u002F979\u002F535.htm",null,"2026-07-21 15:00:10"]