谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造成单一模型,可同时完成深度估计、图像分割等核心视觉任务。
该模型基于阿里 Wan2.1 训练,一次前向传播即可输出结果,小模型处理 81 帧视频约需 6 秒。

谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造成单一模型,可同时完成深度估计、图像分割等核心视觉任务。该模型基于阿里 Wan2.1 训练,...
谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造成单一模型,可同时完成深度估计、图像分割等核心视觉任务。
该模型基于阿里 Wan2.1 训练,一次前向传播即可输出结果,小模型处理 81 帧视频约需 6 秒。
谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造成单一模型,可同时完成深度估计、图像分割等核心视觉任务。
该模型基于阿里 Wan2.1 训练,一次前向传播即可输出结果,小模型处理 81 帧视频约需 6 秒。

IT之家:https://www.ithome.com/ 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型, 将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。
IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。

但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。
谷歌 DeepMind 团队为此提出 GenCeption 模型方案, 尝试 将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎 。
GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好 深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计 等核心视觉任务。
GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。

训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。
泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。

性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

Video Generation Models are General-Purpose Vision Learners:https://arxiv.org/html/2607.09024v1
Aioga 编辑摘要:谷歌 DeepMind 发布 GenCeption 模型,将预训练视频生成器逆向改造成单一模型,可同时完成深度估计、图像分割等核心视觉任务。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。
背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。
Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: RSS · 原始域名: ithome.com
来源: IT之家(RSS)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-21T07:00:10.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。