Vit和VideoMAE

📅 2026/7/28 10:07:04 👁️ 阅读次数 📝 编程学习
Vit和VideoMAE

Vit : Vision Transformer 视觉Transformer
VideoMAE :Video Masked Autoencoders 视频掩码自编码器,是对Vit在视频上的进化。

  1. 传统工业视觉:单独使用 ViT / VideoMAE
  2. 大模型时代:作为 LLM 的视觉 Encoder

两者用途完全不同,是两种模型的神经架构。


一、单独使用 ViT,在工业上最常见业务是什么?

先说结论:

ViT 单独使用最多的不是普通图片分类,而是需要“高级视觉理解”的任务。

普通分类:

猫/狗/汽车

CNN已经很好。

ViT真正发挥优势的是:

  • 大规模视觉理解
  • 图像检索
  • 医疗影像
  • 遥感
  • 自动驾驶
  • 工业检测

1. 图像分类(早期主要用途)

最早 ViT 就是为了 ImageNet 分类提出的。

流程:

图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别

例如:

ImageNet:

狗 猫 汽车 飞机

代表模型:

ViT

Google原始版本:

  • ViT-B/16
  • ViT-L/16
  • ViT-H/14

但是现在工业分类:

很多仍然用:

  • ResNet
  • EfficientNet
  • ConvNeXt

原因:

CNN:

  • 更快
  • 更省算力
  • 小数据效果好

2. 工业视觉检测(非常重要)

例如:

工厂:

检测:

  • PCB缺陷
  • 芯片缺陷
  • 产品瑕疵

以前:

CNN:

图片 | ResNet | 分类

现在:

ViT:

图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断

优势:

可以捕获:

长距离关系。

例如:

PCB:

一个地方的小缺陷,可能和远处线路有关。


常用模型:

Swin Transformer

工业视觉非常常见。

原因:

纯ViT Attention计算量大。

Swin:

窗口Attention:

更适合高分辨率图片。


3. 图像检索(非常重要)

例如:

淘宝搜同款。

输入:

鞋子图片:

图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品

常用:

  • CLIP ViT
  • DINOv2
  • EVA

4. 医疗影像

例如:

CT:

CT切片 ↓ ViT ↓ 疾病判断

MRI:

脑部影像 ↓ Transformer ↓ 病灶分析

因为医疗图像:

需要全局关系。


5. 自动驾驶

例如:

摄像头:

Camera ↓ ViT/Swin ↓ 环境理解

识别:

  • 车辆
  • 行人
  • 道路

Tesla、Waymo路线大量使用Transformer视觉。


二、单独使用 VideoMAE,在工业上最常见业务是什么?

VideoMAE定位:

视频理解(Video Understanding)

不是生成视频。


1. 视频行为识别(最直接)

你的 UCF101 就属于这个。

例如:

监控:

检测:

  • 打架
  • 摔倒
  • 奔跑
  • 入侵

流程:

视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警

代表模型:

VideoMAE

MCG-NJU

经典。


2. 视频搜索

例如:

视频网站:

搜索:

“一个人在滑雪的视频”

系统:

视频:

VideoMAE:

视频Embedding:

向量数据库:

搜索。


3. 视频监控分析

工业非常大。

例如:

智慧城市:

摄像头:

人流 车辆 异常事件

VideoMAE:

理解:

时间变化。


4. 体育分析

例如:

足球:

  • 球员动作
  • 战术分析

篮球:

  • 投篮动作
  • 防守动作

5. 机器人

机器人:

需要:

理解环境变化。

例如:

机器人看到:

人拿杯子。

Video Encoder:

提取:

动作变化。


三、单独 VideoMAE 工业常用模型有哪些?

目前主要:


① VideoMAE

最经典。

特点:

自监督预训练。

模型:

  • VideoMAE Base
  • VideoMAE Large
  • VideoMAE Huge

② VideoMAE V2

更大规模。

适合:

大数据训练。


③ Video Swin Transformer

工业应用很多。

结构:

视频版Swin。


④ MViT

Multiscale Vision Transformer。

Meta提出。

特点:

多尺度视频理解。


⑤ SlowFast

虽然不是Transformer,但是工业仍大量使用。

Meta提出。

视频行为识别经典。


四、现在进入大模型时代:LLM里面最常用的Vision Encoder是什么?

这个和单独视觉完全不同。

现在:

LLM需要的不是分类器,而是“视觉Token生成器”。


1. 图片LLM最常用Vision Encoder

第一梯队:


CLIP ViT

目前最经典。

例如:

LLaVA:

结构:

CLIP ViT-L/14 ↓ Projector ↓ LLaMA

用途:

图片问答。


SigLIP

Google提出。

现在很多新模型使用。

例如:

Gemini相关路线。

优势:

比CLIP训练方式改进。


EVA-CLIP

国内外很多视觉大模型使用。

特点:

更强视觉能力。


InternViT

商汤/InternVL路线。

例如:

InternVL:

InternViT + LLM

2. 视频LLM最常用Video Encoder

这里目前比图片复杂。

因为视频成本巨大。

常见:


InternVideo

非常热门。

结构:

Video Encoder ↓ LLM

VideoMAE

很多研究使用。

例如:

VideoMAE ↓ LLM

Video Swin Transformer

也是常见。


CLIP逐帧 + 时间模型

工业也很多:

Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM

原因:

计算便宜。


五、单独模型 vs LLM视觉Encoder 对比

单独ViTLLM视觉Encoder
目标完成视觉任务给LLM提供视觉理解
输出分类/特征视觉Token
后面有没有LLM没有
训练目标分类/自监督视觉语言对齐
例子ImageNetGPT-4V、LLaVA

六、你作为音视频工程师,最相关路线

结合你的方向:

视频分析:

例如:

摄像头异常检测:

推荐:

RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警

AI数字人/视频生成:

不是VideoMAE。

路线:

语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频

视频大模型:

未来路线:

视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频

最后总结一句:

单独使用:

ViT:

图片理解、检索、工业检测、医疗、自动驾驶。

最常见模型:

  • ViT
  • Swin Transformer
  • DINOv2
  • CLIP ViT

VideoMAE:

视频理解、行为识别、监控分析、视频搜索。

最常见模型:

  • VideoMAE
  • VideoMAE V2
  • Video Swin Transformer
  • MViT

在LLM里面:

图片:

CLIP ViT、SigLIP、EVA-CLIP、InternViT

视频:

InternVideo、VideoMAE、Video Swin、CLIP+Temporal Transformer