尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

Vit和VideoMAE

Vit和VideoMAE
📅 发布时间:2026/7/28 10:07:04

Vit : Vision Transformer 视觉Transformer
VideoMAE :Video Masked Autoencoders 视频掩码自编码器,是对Vit在视频上的进化。

  1. 传统工业视觉:单独使用 ViT / VideoMAE
  2. 大模型时代:作为 LLM 的视觉 Encoder

两者用途完全不同,是两种模型的神经架构。


一、单独使用 ViT,在工业上最常见业务是什么?

先说结论:

ViT 单独使用最多的不是普通图片分类,而是需要“高级视觉理解”的任务。

普通分类:

猫/狗/汽车

CNN已经很好。

ViT真正发挥优势的是:

  • 大规模视觉理解
  • 图像检索
  • 医疗影像
  • 遥感
  • 自动驾驶
  • 工业检测

1. 图像分类(早期主要用途)

最早 ViT 就是为了 ImageNet 分类提出的。

流程:

图片 ↓ ViT Encoder ↓ 分类Head ↓ 1000类别

例如:

ImageNet:

狗 猫 汽车 飞机

代表模型:

ViT

Google原始版本:

  • ViT-B/16
  • ViT-L/16
  • ViT-H/14

但是现在工业分类:

很多仍然用:

  • ResNet
  • EfficientNet
  • ConvNeXt

原因:

CNN:

  • 更快
  • 更省算力
  • 小数据效果好

2. 工业视觉检测(非常重要)

例如:

工厂:

检测:

  • PCB缺陷
  • 芯片缺陷
  • 产品瑕疵

以前:

CNN:

图片 | ResNet | 分类

现在:

ViT:

图片 ↓ ViT ↓ 异常特征 ↓ 缺陷判断

优势:

可以捕获:

长距离关系。

例如:

PCB:

一个地方的小缺陷,可能和远处线路有关。


常用模型:

Swin Transformer

工业视觉非常常见。

原因:

纯ViT Attention计算量大。

Swin:

窗口Attention:

更适合高分辨率图片。


3. 图像检索(非常重要)

例如:

淘宝搜同款。

输入:

鞋子图片:

图片 ↓ ViT ↓ Feature Vector ↓ 向量数据库 ↓ 找相似商品

常用:

  • CLIP ViT
  • DINOv2
  • EVA

4. 医疗影像

例如:

CT:

CT切片 ↓ ViT ↓ 疾病判断

MRI:

脑部影像 ↓ Transformer ↓ 病灶分析

因为医疗图像:

需要全局关系。


5. 自动驾驶

例如:

摄像头:

Camera ↓ ViT/Swin ↓ 环境理解

识别:

  • 车辆
  • 行人
  • 道路

Tesla、Waymo路线大量使用Transformer视觉。


二、单独使用 VideoMAE,在工业上最常见业务是什么?

VideoMAE定位:

视频理解(Video Understanding)

不是生成视频。


1. 视频行为识别(最直接)

你的 UCF101 就属于这个。

例如:

监控:

检测:

  • 打架
  • 摔倒
  • 奔跑
  • 入侵

流程:

视频 ↓ VideoMAE ↓ 动作分类 ↓ 报警

代表模型:

VideoMAE

MCG-NJU

经典。


2. 视频搜索

例如:

视频网站:

搜索:

“一个人在滑雪的视频”

系统:

视频:

↓

VideoMAE:

↓

视频Embedding:

↓

向量数据库:

↓

搜索。


3. 视频监控分析

工业非常大。

例如:

智慧城市:

摄像头:

人流 车辆 异常事件

VideoMAE:

理解:

时间变化。


4. 体育分析

例如:

足球:

  • 球员动作
  • 战术分析

篮球:

  • 投篮动作
  • 防守动作

5. 机器人

机器人:

需要:

理解环境变化。

例如:

机器人看到:

人拿杯子。

Video Encoder:

提取:

动作变化。


三、单独 VideoMAE 工业常用模型有哪些?

目前主要:


① VideoMAE

最经典。

特点:

自监督预训练。

模型:

  • VideoMAE Base
  • VideoMAE Large
  • VideoMAE Huge

② VideoMAE V2

更大规模。

适合:

大数据训练。


③ Video Swin Transformer

工业应用很多。

结构:

视频版Swin。


④ MViT

Multiscale Vision Transformer。

Meta提出。

特点:

多尺度视频理解。


⑤ SlowFast

虽然不是Transformer,但是工业仍大量使用。

Meta提出。

视频行为识别经典。


四、现在进入大模型时代:LLM里面最常用的Vision Encoder是什么?

这个和单独视觉完全不同。

现在:

LLM需要的不是分类器,而是“视觉Token生成器”。


1. 图片LLM最常用Vision Encoder

第一梯队:


CLIP ViT

目前最经典。

例如:

LLaVA:

结构:

CLIP ViT-L/14 ↓ Projector ↓ LLaMA

用途:

图片问答。


SigLIP

Google提出。

现在很多新模型使用。

例如:

Gemini相关路线。

优势:

比CLIP训练方式改进。


EVA-CLIP

国内外很多视觉大模型使用。

特点:

更强视觉能力。


InternViT

商汤/InternVL路线。

例如:

InternVL:

InternViT + LLM

2. 视频LLM最常用Video Encoder

这里目前比图片复杂。

因为视频成本巨大。

常见:


InternVideo

非常热门。

结构:

Video Encoder ↓ LLM

VideoMAE

很多研究使用。

例如:

VideoMAE ↓ LLM

Video Swin Transformer

也是常见。


CLIP逐帧 + 时间模型

工业也很多:

Frame ↓ CLIP ViT ↓ Temporal Transformer ↓ LLM

原因:

计算便宜。


五、单独模型 vs LLM视觉Encoder 对比

单独ViTLLM视觉Encoder
目标完成视觉任务给LLM提供视觉理解
输出分类/特征视觉Token
后面有没有LLM没有有
训练目标分类/自监督视觉语言对齐
例子ImageNetGPT-4V、LLaVA

六、你作为音视频工程师,最相关路线

结合你的方向:

视频分析:

例如:

摄像头异常检测:

推荐:

RTSP视频流 ↓ 抽帧 ↓ VideoMAE / Video Swin ↓ 行为识别 ↓ 报警

AI数字人/视频生成:

不是VideoMAE。

路线:

语音 ↓ LLM ↓ Diffusion Video Model ↓ 视频

视频大模型:

未来路线:

视频 ↓ Video Encoder (VideoMAE / InternVideo) ↓ Projector ↓ LLM ↓ 理解视频

最后总结一句:

单独使用:

ViT:

图片理解、检索、工业检测、医疗、自动驾驶。

最常见模型:

  • ViT
  • Swin Transformer
  • DINOv2
  • CLIP ViT

VideoMAE:

视频理解、行为识别、监控分析、视频搜索。

最常见模型:

  • VideoMAE
  • VideoMAE V2
  • Video Swin Transformer
  • MViT

在LLM里面:

图片:

CLIP ViT、SigLIP、EVA-CLIP、InternViT

视频:

InternVideo、VideoMAE、Video Swin、CLIP+Temporal Transformer


相关新闻

  • 从“空调关关”焦虑到智能家居实践:远程控制与自动化解决方案
  • 零破坏改造:用ESP8266+舵机实现传统开关智能化
  • 西安黄金回收认准实体门店!无套路无扣费|2026最新高位金价变现指南(全店详细地址) - 奢侈品回收探店ing

最新新闻

  • 5分钟快速上手:MouseClick鼠标连点器终极使用指南
  • 从Demo到落地:揭秘企业Agent与开放式Agent架构差异,解决AI应用难题!
  • 无VR一体机高效开发指南:Unity模拟环境搭建与核心交互实现
  • 终极解决方案:LinkSwift网盘直链下载助手全解析
  • 从XSS到RCE:Electron应用安全攻防实战与加固指南
  • 物联网设备低功耗设计:NBM7100A与TM4C123的电源管理优化

日新闻

  • 力旷智能:伺服驱动系统在制药收瓶设备中的应用解析
  • 2026 网安入门避坑指南,零基础如何避开无效学习直接上手实战
  • 揭秘CFC项目:如何通过手机摄像头实现850kbps无网络文件传输

周新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号