尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?
📅 发布时间:2026/7/31 19:41:50

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

Mage-VL是微软推出的一款高效的 codec-native 流式多模态基础模型,专为图像和视频理解而设计。其视觉编码器 Mage-ViT 完全从零开始训练,规模紧凑至 4B。它旨在解决现代 VLM 的“莫拉维克悖论”——在复杂的离线推理任务上表现出色,但在简单的实时流感知任务上却速度缓慢且计算量大。

什么是 codec-native 视觉编码器?

传统的视频理解模型通常将视频解码为均匀采样的帧,然后通过冻结的网络预训练 ViT 推送密集的补丁标记网格。而 Mage-VL 则遵循现代视频编解码器的结构:将流分离为锚定(I)帧和预测(P)帧,保留每个锚定补丁,并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种与编解码器对齐的稀疏性使得 Mage-VL 在保持高视觉质量的同时,能够显著降低计算成本和延迟。

Mage-ViT 的训练方法

Mage-ViT 是从两阶段从零开始的 ViT 预训练中提取的独立视觉编码器。这是仅 ViT 预训练的检查点:它没有经过与语言模型的联合 VLM 训练。微软通过以下关键步骤从零训练出 Mage-ViT:

  1. 数据准备:收集了大量的图像和视频数据,包括各种场景、物体和动作。这些数据经过预处理,以适应编解码器原生的输入格式。

  2. 架构设计:设计了一种与编解码器对齐的视觉编码器架构。该架构能够有效地处理锚定帧和预测帧,并提取其中的关键信息。

  3. 预训练:使用大规模的图像和视频数据对 Mage-ViT 进行预训练。预训练过程中,模型学习如何从编解码器原生的输入中提取视觉特征。

  4. 微调:在预训练的基础上,对 Mage-ViT 进行微调,以适应特定的下游任务,如图像理解、视频理解和实时流感知等。

Mage-VL 的整体架构

Mage-VL 是一个统一的模型,其中投影的视觉标记和文本标记共享一个因果 Qwen3 解码器。静态图像成为单个空间块;视频成为时间有序的编解码器窗口。在流模式下,轻量级认知门预测每个滚动窗口的p_speak = g(h_t)(通过事件保留特征提取器保持的循环流内存),并在p_speak ≥ τ时触发生成;响应由冻结的基础模型从最近编解码器段的本地滑动窗口解码,文本查询可以随时注入。

Mage-VL 的整体架构包括以下几个关键组件:

  • Mage-ViT 视觉编码器:负责从图像和视频中提取视觉特征。
  • Qwen3 语言解码器:负责处理文本输入和生成文本输出。
  • 认知门:负责控制实时流感知任务中的生成时机。
  • 事件保留特征提取器:负责保持循环流内存,以便认知门能够准确预测生成时机。

Mage-VL 的性能表现

Mage-VL 在多个视频和时间接地基准测试中表现出色。在保持 4B Qwen3 骨干网络固定且仅交换 ViT 的情况下,Mage-VL 在所有报告的视频和时间接地基准测试中均优于 Qwen3-VL-4B——在本地化繁重的任务上优势最大(+22.5 QVHighlight,+17.1 ActivityNet,+11.0 VSI-Bench,+24.5 VideoEval-Pro)。

在 SoccerNet 基准测试中,Mage-VL-4B 在响应时间方面表现出色,具有较高的 TriggerAcc、Precision、Recall、F1 和 Latency 指标。在 OVO-Bench 基准测试中,Mage-VL 在流式架构中设置了新的最先进总体得分。

如何使用 Mage-VL?

Mage-VL 提供了一个单一的检查点microsoft/Mage-VL,它同时提供图像和视频理解以及主动流门——相同的权重可以回答离线图像/视频问题并驱动事件门控评论。它涵盖了所有 Mage-VL 功能:图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频和事件门控流。该存储库捆绑了编解码器处理器、神经编解码器包和主动门权重——不需要单独的理解、NVC 或流检查点。

要使用 Mage-VL 进行图像和帧采样视频推理,只需安装transformers库,然后使用以下代码:

model_id = "microsoft/Mage-VL" model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True) processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

对于在线模式,可以与 OpenAI 兼容的 SGLang 服务器通信。首先使用 Mage-VL SGLang 分支构建并启动服务器(构建需要protobuf-compiler和 Rust 工具链):

git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL cd Mage-VL git checkout sglang cargo build --release ./target/release/sglang-server --model-path microsoft/Mage-VL

总结

Mage-ViT 是微软从零训练的 codec-native 视觉编码器,它通过与编解码器对齐的稀疏性,在保持高视觉质量的同时,显著降低了计算成本和延迟。Mage-VL 作为一个统一的模型,涵盖了图像理解、视频理解和实时流感知等多种功能,在多个基准测试中表现出色。如果你正在寻找一种高效的多模态基础模型,Mage-VL 绝对值得一试。

Mage-VL 采用 Apache-2.0 许可证发布,你可以在遵守许可证条款的前提下自由使用和修改它。

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

  • 为什么选择carefree-drawboard?Python开发者必知的5大优势
  • 旋流曝气器供应商口碑评测:技术实力与案例解析 - 精彩城市
  • BetterNCM安装器:3分钟实现网易云音乐插件自动化部署的高效方案

最新新闻

  • Codex多任务改代码会冲突吗?用Worktree隔离并行任务
  • 2026年寄快递哪个最便宜?大件行李、重货避坑指南,这样寄省一半 - 快递物流资讯
  • 为什么你的AI音效卖不出去?——深度拆解Top 1%创作者的元数据标签策略、BPM匹配逻辑与平台冷启动权重公式
  • 2026大兴区包包回收:香奈儿19回收价稳,成色好7.5折 - 生活时报
  • 北京产业园哪家能挂靠注册地址:【博亚信诚】地址合规 - 18002239949
  • 如何快速部署RustDesk Server Demo?5分钟启动远程连接中继服务

日新闻

  • 7步掌握KMS智能激活工具:Windows和Office永久激活完整方案
  • 如何在Windows上运行iOS应用:ipasim跨平台模拟器终极指南
  • 2026年重庆工伤赔偿律师口碑推荐:洪家木律师用专业赢得信赖 - 本地品牌推荐

周新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号