品玩7月21日讯,据 The Decoder 报道,谷歌DeepMind正式发布GenCeption模型,创新性地将预训练视频生成器逆向改造为多任务视觉分析引擎。该模型基于阿里巴巴通义万相Wan2.1开发,旨在打破计算机视觉领域“一任务一模型”的传统格局。
GenCeption通过单次前向传播即可根据文本提示完成深度估计、图像分割、3D姿态估计等五类核心任务。其训练数据仅含7500段合成视频,规模远低于同类模型,但性能仍匹配或超越了DepthAnything等专用模型。
在泛化能力上,GenCeption展现出跨域适应性,能有效处理真实多人视频及动物、机器人等未见类别,部分输出细节甚至优于训练渲染结果。目前,该模型在处理速度与多任务联合训练的性能平衡上仍有优化空间。



