Aioga
AI资讯 / 论文研究
返回 AI资讯

Google DeepMind 提出 GenCeption,将视频生成模型改造为通用视觉模型

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-19T10:17:49.000Z热度 47

Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。它仅用 7,500...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。

它仅用 7,500 段合成视频训练,数据量仅为竞品的 1/7 至 1/500,但在多个基准上匹配甚至超越了 DepthAnything 3 等专用模型。

中文正文 · AI 翻译

谷歌Deepmind推出的新模型GenCeption使用预训练的视频生成模型作为经典计算机视觉任务的基础。在深度估计、分割和3D姿态估计方面,它达到了最先进的性能,同时所需的训练数据非常少。

Image description

语言模型几乎是预测下一个单词的学习副产品,成为了多功能处理系统。这个任务似乎要求模型在训练过程中吸收语法、世界知识和上下文关系。这是大型语言模型新兴能力的主要解释:https://the-decoder.com/openais-sora-is-the-gpt-1-of-video-with-plans-to-scale-and-unlock-emergent-ai-capabilities/。

计算机视觉仍然缺乏等效的训练方法。专业模型主导该领域,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”。每个模型都使用自己的架构。广告

A single model generates depth, normals, segmentations, and pose from the same video based on a text prompt. Despite training mostly on synthetic data, it generalizes to real-world footage and object classes it never saw.

在一篇新论文中:https://the-decoder.com/,Deepmind研究人员认为大型文本生成视频模型可以弥合这一差距。生成逼真的视频需要理解场景的空间几何、物体的运动以及基本物理规律。这些模型在训练时也使用文本描述,这将语言与视觉内容联系起来。由于标注数据相对便宜,它们可以在庞大的数据集上训练。广告 DEC_D_Incontent-1

GenCeption建立在阿里巴巴开源的Wan2.1视频模型基础上:https://the-decoder.com/alibaba-launches-wan2-2-its-improved-open-source-video-generation-model/。主要变化是架构更简单。扩散模型通常通过许多小步骤从噪声生成视频。而GenCeption则在一次前向传播中生成预测,使其足够快速用于实际计算机视觉任务。

Architecture diagram of GenCeption showing how an input video and text prompt flow through VAE and text encoders into a pre-trained DiT that produces dense task outputs as RGB video and sparse task outputs via learnable tokens and an MLP, all in a single forward pass.

研究人员使用一种简单的方法让一个模型处理多种任务。无论输出是深度图、表面法线图还是分割掩膜,GenCeption都将其表示为标准的三通道RGB图像。它还将摄像机运动转换为图像表示。广告

文本提示告诉模型要执行的任务,就像给聊天机器人下达指令一样。团队为3D关键点预测等不生成图像的任务添加了可训练模块。

训练在所有任务中使用一个损失函数。研究人员没有针对每个任务更改架构,而是处理训练数据以满足任务的特定要求。Ad DEC_D_Incontent-2

大部分训练数据来自一个包含 7,500 个视频的合成数据集。团队将 800 个数字人模型与来自动作捕捉数据集的 200 个动作序列结合,然后在 Blender 中以不同的背景和摄像机角度渲染结果。真实视频仅用于语言引导的分割。Ad

Left, a radar chart comparing GenCeption as both specialist and generalist against models like DepthAnything3, SAM3, D4RT, and VGGT-Ω across ten vision tasks. Right, a log-scale plot of depth accuracy (AbsRel) versus number of training frames.

根据研究,GenCeption 在许多基准测试中表现与或超越最先进的结果,尽管每个任务只使用一个架构。其深度估计与专门模型(如 DepthAnything 3)相匹配。GenCeption 在表面法线估计上超过了 NormalCrafter 和 Lotus-2。在 3D 姿态识别上,它也优于 Genmo 和 TRAM。在复杂的语言引导分割任务中,它与 Meta 的 SAM 3 结合 Gemini 3.5 Flash 的表现相当。

像 D4RT 和 VGGT Omega 这样的模型在数百万个视频上进行训练。GenCeption 使用的数据量少 7 到 500 倍,也能达到类似结果。在相同条件下测试时,视频生成预训练也超过了 V-JEPA 和 VideoMAE V2 等方法。作者将这些结果归因于生成任务,而不仅仅是数据量。他们认为视频生成有助于模型学习有用的空间和运动表示。

GenCeption 几乎完全在显示单个人的合成视频上训练,但它仍然可以处理包含多人画面以及无关类别(如动物和类人机器人)的真实视频。研究显示,一些输出比用于训练的 Blender 渲染还要细致。结果能够保留猫的胡须和单根毛发的边缘。

Grid showing a dog, tiger, and hippopotamus alongside their corresponding depth maps, normals, segmentation silhouettes, and 3D skeletons.

跨所有任务的联合训练确实会影响 3D 关键点估计。研究人员怀疑,这个任务所需的额外组件干扰了基础模型在预训练过程中学习的机制。

他们的结论是,应尽可能少地更改原始模型的架构。处理速度也需要改进。较小的模型处理一个有81帧的视频大约需要六秒钟,而较大的模型有140亿个参数,大约需要十秒钟。

作者们拒绝了视频生成器只是娱乐工具的观点。他们认为,这些模型已经包含了一种类型的通用“世界模型”:https://the-decoder.com/openais-sora-2-answers-science-questions-directly-in-its-generated-videos/,可以支持计算机视觉的基础模型。这样的系统可以在图像处理方面发挥与大型语言模型在文本中类似的作用。

这种框架是否成立仍有争议。一个国际研究团队最近提出了统一定义:https://the-decoder.com/researchers-define-what-counts-as-a-world-model-and-text-to-video-generators-do-not/ 并使用 OpenWorldLib:https://the-decoder.com/,明确排除了文本到视频模型,因为它们缺乏来自现实世界的反馈。

前 Meta 首席 AI 科学家 Yann LeCun 更进一步,认为生成视频模型是死胡同。Meta 的 V-JEPA 2:https://the-decoder.com/metas-latest-model-highlights-the-challenge-ai-faces-in-long-term-planning-and-causal-reasoning/ 遵循他倡导的替代方法,预测抽象概念而不是像素。清华大学的一个基准测试:https://the-decoder.com/ 指出了像素预测的局限性。Sora 2、Seedance 2.0 和 Veo 3.1 即使输出看起来很可信,也在基础物理和逻辑测试中反复失败。

GenCeption 将视频生成用于更狭窄的目的。研究人员并不要求 Wan2.1 预测世界的行为,而是用它来提取用于特定任务的特征,例如深度估计和分割,其中这些学习到的特征可以超越专门的系统。Google Deepmind 也在用 Genie 3:https://the-decoder.com/google-deepminds-genie-3-generates-interactive-3d-worlds-that-stay-consistent-for-multiple-minutes/ 探索不同方法,构建用于训练 AI 智能体的交互式 3D 环境。

保持关注 AI 动态。清晰、有用,无废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-19T10:17:49.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。它仅用 7,500...

The Decoder:AI News(RSS)2026-07-19T10:17:49.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。