视频通用模型来了!何恺明等新作GenCeption:训练量仅1/500,精度持平SOTA!
「再证「生成即理解」」
目录
01 视觉领域长期无解的底层痛点
02 把文生扩散改造成前馈通用感知器
2.1 核心改造:迭代扩散转为单步前馈推理
2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间
2.3 可规模化合成数据训练管线
03 性能、数据效率、涌现能力三重突破
3.1 多任务统一SOTA,单模型对标数十款专用专家模型
3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度
3.3 三大原生涌现能力
04 工程落地价值与长远行业影响
4.1 短期落地场景价值
4.2 中长期行业变革意义
4.3 待解决开放问题
05 写在最后
大语言模型依靠自预测预训练完成大一统,但计算机视觉长期停留在“单一任务专用模型”的碎片化阶段:做深度估计要用DepthAnything,分割依赖SAM,人体姿态、相机位姿、3D关键点又要单独训练专属网络。
Google DeepMind联合MIT、牛津大学等机构在ECCV 2026发表的最新论文给出了一个颠覆性结论:
大规模文生视频扩散模型,就是视觉领域等价于LLM“下一个Token预测”的通用预训练目标。
在此基础上提出的GenCeption,用一套统一主干+统一损失,依靠文本提示就能完成深度估计、表面法线预测、分割、相机位姿估计和3D关键点预测等数十类视频感知任务。
训练数据量仅为现有SOTA模型的1/7~1/500,还诞生了仿真到真实、跨类别零样本等多项涌现能力。
01 视觉领域长期无解的底层痛点
如今计算机视觉赛道分工极度割裂,根源在于三类无法同时兼顾的历史预训练方案缺陷,这也是GenCeption全部设计逻辑的出发点。
1. 专用任务模型路线
DepthAnything、SAM、Sapiens等模型各司其职,主干、解码器、损失函数全部独立设计。新增一类感知任务就要完整重训一套网络,研发成本极高;模型之间无法复用时空、3D几何先验,对动态视频时序一致性建模能力薄弱,只能处理静态图像。
图 | DepthAnything
2. 传统自监督视觉预训练(VideoMAE、V-JEPA)
以掩码重构、特征预测为目标,缺少原生图文对齐能力,无法用自然语言指令调度任务;仅能提取视觉特征,不内置4D时空、物体物理交互先验,想要做深度、法线这类几何任务,必须额外搭建下游专用头,数据利用效率极低。
图 | VideoMAE
3. 图像扩散复用方案(Marigold、Diception)
仅基于静态图像扩散,处理连续视频时预测结果会剧烈时序抖动;只能覆盖少量稠密视觉任务,无法拓展3D关键点、相机位姿这类稀疏结构化输出,通用性存在天然天花板。
图 | Marigold
三类方案全都无法同时满足通用视觉模型三大硬性要求:内置4D时空物理先验、原生图文对齐、可规模化拓展全品类感知任务。而文生视频扩散模型的训练目标天然同时满足三点,这是GenCeption的核心立论根基。
02 把文生扩散改造成前馈通用感知器
整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干,核心改造思路是抛弃扩散迭代采样,将多步去噪流程转为单步前馈推理,搭配统一表征方案、合成数据多任务微调流水线,全程一套主干、一套损失搞定所有视觉任务。
2.1 核心改造:迭代扩散转为单步前馈推理
图 | GenCeption完整架构流程图:输入视频+文本提示,单步前馈输出稠密/稀疏视觉结果
传统文生视频需要数十步迭代去噪,速度慢,不适合感知推理。GenCeption做了关键简化:输入不再是噪声潜向量,直接送入原始视频干净潜特征,时序步长固定t=0(整流流模型终止状态),仅单次前向传播输出预测。
原文整流流DiT预测速度项v,模型输出取-v即可对齐目标潜空间,无需多轮迭代。这套改造完全保留预训练阶段学到的全部时空、几何、图文先验,不改动主干网络权重结构,只调整输入输出逻辑,兼顾预训练权重复用与推理速度。
图 | 范式变迁总览图:左侧GenCeption完整技术路线,右侧传统专用模型与统一通用模型架构对比
1.3B小规模模型单段81帧480×832视频推理仅5.92秒,14B大模型10秒完成,完全满足视频实时感知需求。
2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间
这是实现“无任务专属网络”最关键的设计,所有视觉输出全部映射至0~1三通道像素空间,仅靠文本提示(如“输出深度”“输出3D关键点”切换任务,不用更换解码器、损失。
1. 稠密任务(深度、表面法线、分割、射线图)
单通道信息(深度图)直接复制填充RGB三通道;3维法线直接使用R/G/B分别对应XYZ三轴;相机位姿这类高维射线数据设计“罗斯科分块射线图”(图5),旋转、平移分量分区域塞入同一帧RGB画面,适配统一VAE解码器。
图 | 罗斯科射线图:将6维相机射线信息压缩至单张3通道图像
2. 稀疏任务(2D/3D人体关键点)
新增一组可学习序列Token追加至视频潜序列,经过独立轻量MLP回归坐标。为匹配预训练时序位置编码,采用位置插值适配视频长度,仅新增极少量参数,不会破坏主干预训练时空建模能力。
所有任务统一使用单一L2损失,不再为深度、分割、姿态分别设计定制损失函数。传统多任务训练需要反复调平衡权重,GenCeption直接把任务差异转移到数据预处理阶段:深度图采用对数归一化消除尺度歧义,法线统一值域,不同任务仅调整训练数据混合比例,大幅降低多任务调参成本。
2.3 可规模化合成数据训练管线
图 | 深度、法线预测定性效果示例
现实带标注高质量视频数据集稀缺,尤其是同时包含深度、法线、分割、人体关键点、相机位姿多标签素材。GenCeption完全以合成虚拟视频作为主要训练数据,仅指代分割补充少量真实数据集。
数据生成流程:采用800组人物3D资产+200套CMU动作捕捉动画,搭配多样HDRI场景、可变相机焦距生成7500段合成视频,Blender批量渲染多模态真值(深度、掩码、人体关节)。训练前统一将RGB输入、多模态目标全部编码缓存为潜向量,大幅加速训练速度。
这套数据方案的核心优势:无需大量人工标注、可无限扩充人物动作与场景,同时带来极强仿真到真实世界迁移能力,也是模型数据效率碾压竞品的关键。
03 性能、数据效率、涌现能力三重突破
实验不单纯罗列刷榜数字,分层解读指标真实价值,同时对比V-JEPA、VideoMAE等主流预训练基线,明确GenCeption行业定位。
3.1 多任务统一SOTA,单模型对标数十款专用专家模型
图 | 左:多任务雷达图(通用模型vs各领域专家模型);右:数据效率对比曲线
左雷达图覆盖表面法线、深度、相机位姿、前景抠图、文本指代分割、3D人体六大主流视频感知任务。14B GenCeption通用模型在绝大多数基准上和DepthAnything3、SAM3、D4RT、Sapiens等专用模型持平甚至超越;仅少数细分任务略低于单任务专家微调版本,但差距极小。
图 | 多任务定量对比节选
14B通用模型在Hi4D法线mAE=11.47,KITTI深度AbsRel=0.156,EMDB人体MPJPE=71.8,对比专用模型没有明显短板。
需要客观说明指标边界:现有SOTA专用模型大多采用百万级真实标注视频训练,GenCeption仅依靠少量合成数据达到同等精度,纸面性能差距意义远不及数据效率优势。
3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度
图 | 数据效率曲线直观体现核心工程优势
在深度估计统一测试基准上,D4RT、VGGT-Ω需要百万级训练帧,GenCeption仅需0.9M1.23M帧,数据量缩减7500倍仍能实现相近AbsRel误差。
图 | 预训练基线横向对比
同等微调数据下,基于文生视频WAN主干的GenCeption全面超过V-JEPA、VideoMAE最大版本模型。核心原因是视频扩散预训练强制模型学习真实世界4D时序因果、物体恒存、物理交互,而掩码自监督仅学习局部视觉纹理,缺少全局几何逻辑。
图 | 迁移不同预训练层数的训练损失曲线
从零随机初始化DiT训练损失几乎不下降,随着迁移预训练层数增加,收敛速度与最终精度同步提升,完整预训练层损失最低,证明视频生成预训练得到的世界先验是通用视觉的核心底座。
3.3 三大原生涌现能力
这是传统专用视觉模型完全不具备的特性,也证明视频扩散模型学到了通用世界表征,而非单一任务拟合特征。
1. 仿真到真实零样本迁移
模型全程仅用人形合成视频训练,无需真实人物素材,直接适配户外、室内各类真实视频,深度、分割细节甚至优于渲染合成素材(图6人物发丝、动物毛发精细预测)。单物体训练,支持多实例真实场景推理
训练视频单帧仅包含单人,但输入多人、多物体真实画面,可精准区分不同目标完成分割、姿态预测(图10a)。
图 | 泛化能力效果图:多人物实例泛化
2. OOD域外类别零样本泛化
训练集只有人类,输入猫、猩猩、河马、机器人等完全未训练物体,依旧能精准输出深度、掩码、3D关键点(图10b)。
图 | 泛化能力效果图:跨类别零样本(动物、人形机器人)
指代分割测试中,训练未出现“火箭”,输入提示词the rocket仍可精准分割目标。
图 | 文本指代分割定性结果,支持颜色、空间、运动、未知物体推理
该特性意味着模型掌握物体通用几何结构,而非记忆人类专属特征,距离通用世界模型更近一步。
04 工程落地价值与长远行业影响
4.1 短期落地场景价值
1. 多模态视频分析平台
安防、影视后期、虚拟拍摄仅部署单套模型,通过提示词切换深度、抠图、人体姿态、镜头位姿分析,替代5~10款独立推理模型,大幅降低显存与算力开销。
2. 数字人、虚拟内容生产
依靠合成数据训练,无需大量真人拍摄标注,一次性完成人体法线、关键点、前景分割,大幅降低虚拟资产制作标注成本。
3. 低成本机器人视觉感知
室内机械臂、巡检机器人依靠少量仿真数据训练,同时完成深度、物体分割、关键点检测,无需分别训练感知网络,降低机器人数据采集风险与成本。
4.2 中长期行业变革意义
长久以来计算机视觉和NLP存在巨大鸿沟:NLP依靠生成式预训练实现大一统,视觉却始终任务割裂。GenCeption直接证明文生视频生成是视觉领域等价于LLM下一词预测的通用预训练范式。
未来视觉基础模型不再需要分别训练分割、深度、姿态专用底座,一套文生视频预训练主干,通过统一表征+文本提示即可适配绝大多数感知任务,彻底改变视觉模型研发流水线。同时涌现的跨类别、仿真转真实能力,为通用机器人世界模型、具身智能提供全新训练路径。
4.3 待解决开放问题
平衡稠密像素输出与稀疏关键点两类任务的表征冲突,缩小通用模型与单任务专家精度差距;
- 拓展流式长视频推理,适配监控、自动驾驶长时序连续感知;
- 扩充合成数据物体、极端环境覆盖范围,提升恶劣工况、非常规物体泛化能力;
- 轻量化蒸馏方案,让通用视觉模型落地嵌入式边缘设备。
05 写在最后
GenCeption打破计算机视觉长期碎片化研发模式,证实大规模文生视频扩散模型内置完整4D时空、几何、图文世界先验,可作为通用视觉基础模型的预训练底座。
通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新,实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务,数据效率远超传统自监督与专用模型路线,同时诞生仿真到真实、跨类别零样本等涌现能力。
尽管通用多任务训练存在小幅精度损失、轻量化落地受限等短板,但该工作打通了“生成模型反向作为感知底座”全新技术路线,为统一通用视觉大模型、具身智能世界模型提供极具参考的完整框架,或将重塑后续视觉基础模型的研发思路。
Ref
论文标题:Video Generation Models areGeneral-Purpose Vision Learners
论文链接:https://arxiv.org/abs/2607.09024
项目链接:https://genception.github.io/