
第一部分论文基本收录情况项目内容论文全名QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models中文译名《QuantVLA面向视觉-语言-动作模型的尺度校准后训练量化》正式会议IEEE/CVF Conference on Computer Vision and Pattern Recognition会议简称CVPR 2026正式收录是论文页码39539–39549会议论文时间2026 年 6 月作者Jingxuan Zhang、Yunta Hsieh、Zhongwei Wan、Haokun Lin、Xin Wang、Ziqi Wang、Yingtie Lei、Mi Zhang主要单位Ohio State University、University of Michigan、City University of Hong Kong核心方向VLA、Post-Training Quantization、Diffusion Transformer、模型压缩与机器人部署第二部分解决的问题随着 π0.5、GR00T N1.5 等 VLA 开始采用Language Backbone DiT Action Head的结构推理成本不仅来自视觉和语言模块连续动作生成的 DiT 也成为重要的计算和显存开销来源。现有 TinyVLA、SmolVLA、EfficientVLA、VLA-Cache 等方法主要通过缩小模型、剪层、缓存或跳层来降低成本但通常不会直接对DiT Action Head 进行低比特量化因此动作生成部分的压缩潜力仍没有被充分利用。最直接的想法是把 SmoothQuant、DuQuant 等已有 PTQ训练后量化 方法直接用于 VLA但问题在于现代 VLA 的Language Backbone 与 DiT Action Head 是强耦合的前面的语言模块一旦量化输入 DiT 的特征尺度就会发生偏移这种扰动进入 DiT 后又会造成两类关键数值漂移——Attention Temperature Drift即 QKT 的尺度变化使注意力分布变得过尖或过平以及Residual Energy Drift即 Attention 输出经过 Wo 后能量发生变化破坏残差连接和 LayerNorm 的工作状态。这些误差还会沿着多层 DiT 持续累积最终影响连续动作生成。因此 QuantVLA 真正要解决的问题可以压缩成一句话如何在不重新训练、也不改变原有 VLA 架构的情况下同时低比特压缩 Language Backbone 和 DiT Action Head并抑制跨模块量化造成的数值尺度漂移使连续动作生成仍然稳定。Figure 1主要用于说明QuantVLA在现有VLA高效化研究中的定位。TinyVLA、EfficientVLA、VLA-Cache和MoLe-VLA分别通过小模型、剪层与特征复用、缓存以及动态路由降低计算成本而QuantVLA采用另一条路线不改变原有VLA结构也无需重新训练而是通过PTQ直接压缩Language和Action模块。第三部分PTQ到底是什么QuantVLA采用PTQPost-Training Quantization训练后量化即在 π0.5、GR00T N1.5 等 VLA 已经训练完成后不再更新模型参数而是利用少量无标签 Calibration Buffer统计量化所需的数值尺度再将原本 FP16/BF16 的权重和激活转换为更低精度表示。论文主要采用W4A8设置其中 W4 表示 Weight 使用 4-bitA8 表示 Activation 使用 8-bit相较于 FP164-bit 权重理论上只需约四分之一的权重存储空间。QuantVLA 的关键特点是无需重新训练、不改变原有 VLA 架构只通过少量校准数据完成 Language Backbone 与 DiT Action Path 的低比特部署。第四部分QuantVLA 的整体方法1论文研究的VLA基本结构及量化过程论文主要针对这样一种VLA其中视觉输入语言指令机器人本体状态融合后的Vision-Language特征Diffusion Transformer Action Head动作序列。DiT迭代更新动作动作表示经过次迭代最后得到机器人可执行动作。QuantVLA 的量化发生在模型部署前的 PTQ 阶段。原始 FP16/BF16 权重会先被转换为 INT4、INT8 等低比特整数并同时保存对应的量化 Scale从而显著降低模型权重的显存占用。真正推理时模型并不是等到最终输出 Action 才“反量化”而是在每一层进行低比特计算时根据保存的 Scale 将整数值恢复到正确的数值尺度后参与矩阵运算2量化敏感性DiT Attention 是主要瓶颈Table 1比较了不同模块在 W4A8 下的量化敏感性。以 π0.5 为例全精度模型平均成功率为97.1%只量化 LLM 时仍有96.5%但量化整个 DiT 后骤降至71.6%同时量化 LLM 和完整 DiT 也只有76.3%其中 LIBERO-Long 更从93.5% 降至 50.0%。相比之下如果只量化LLM DiT MLP、保留 DiT Attention 中的为浮点平均成功率可以恢复到95.4%。Query 投影Key 投影Value 投影Output Projection输出投影DiT 并非整体都不能量化真正敏感的是 Attention Path尤其在长时程控制中量化误差更容易累积因此 QuantVLA 最终选择量化 DiT 的 MLP而保护Attention Projection。因此 QuantVLA 最终采用选择性量化LLM量化所有 Linear LayersDiT只量化 MLP Linear Layers而 DiT Attention 中的仍保持浮点精度不进行低比特量化。论文后续实验都固定采用这一配置。3量化后的两个关键尺度漂移根本误差来源QuantVLA 发现DiT 难以直接低比特量化的根本原因并不是单纯的“数值精度下降”而是量化会改变进入 Attention 和 Residual Path 的特征尺度并形成两类误差。论文将它们归纳为Attention Temperature Drift和Residual Energy Drift。第一种Attention Temperature Drift 注意力温度漂移注意力分数 Attention Logits为然后虽然 QuantVLA 最终将 DiT 的 保持浮点但上游 LLM 和 DiT MLP 被量化后输入 Attention 的 Hidden State 已经发生尺度偏移因此、以及的整体尺度也会改变使 Softmax 分布变得过尖或过平。这里所谓“Temperature Drift”本质上就是Attention Logits 的有效尺度发生了变化。第二种Residual Energy Drift 残差能量漂移多个 Attention Head 分别提取不同信息 ↓ Head 1看物体 Head 2看位置 Head 3看语言指令 Head 4看动作上下文 ↓ Concat 拼在一起 ↓ Output Projection ↓ 把这些信息重新混合成统一表示Attention不是算完softmax之后就结束了Attention 输出还需要经过 Output Projection量化以后的整体幅度可能和原始的全精度模型不一样。这意味着送入residual connection的“能量”发生变化。结果进一步改变Residual Injection Strength残差注入强度指 Attention / MLP 的输出通过残差连接加回主干特征时这部分新信息被“注入”进去的强弱程度。例如x Z如果量化后 Z 的幅值变大或变小那么加回去的力度也会变化。LayerNorm 工作点层归一化工作状态指 LayerNorm 当前所接收到的输入数值范围、均值和方差状态。如果前面的 Residual Output 能量发生变化LayerNorm 接收到的数据分布也会变导致它工作的数值状态偏离全精度模型。Input Distribution of Subsequent Transformer Layers后续 Transformer 层的输入分布指后面 Transformer 层接收到的特征其数值大小、均值、方差等统计分布。如果前一层输出已经因为量化发生漂移那么这种漂移会继续传到下一层。因此Attention温度漂移Residual能量漂移会沿着深层DiT不断累积。这其实就是整篇QuantVLA的理论核心。4QuantVLA完整流程作者最终不是提出一个特别复杂的新网络而是三个组合方法解决的问题Selective Quantization哪些层该量化哪些不能乱量化ATMAttention logits尺度漂移OHBAttention输出/Residual能量漂移Selective Quantization负责“少破坏”ATM和OHB负责“破坏以后把关键尺度校回来”。而且三个模块都建立在已有训练好的VLA之上不会重新训练也不重新设计VLA architecture.Figure 2 展示了 QuantVLA 从多模态输入到低比特动作生成的完整流程。①图像首先经过 Vision Encoder 得到 Vision Tokens②并与文本指令共同进入 Language Backbone 形成视觉语言特征③QuantVLA对 LLM 中的全部线性层进行低比特量化Quant Full Linear Layers随后将特征送入 DiT Action Head。由于实验发现 DiT Attention 对量化最敏感④因此 DiT 中只量化 MLP/FFN 线性层而 (Q、K、V、O) 保持浮点精度。与此同时使用 FP16 Teacher Model 作为参考ATM 根据全精度与量化模型 Attention Logits 的标准差计算每个 Head 的校准系数修正Attention Temperature DriftOHB 根据 Attention 输出的 RMS均方根 计算每层校准系数修正 Residual Energy Drift。最终和被折叠进量化/反量化 Scale缩放尺度 中因此无需重新训练也不改变原有网络结构和推理流程经过校准后的 DiT 继续迭代生成动作表示并由 Action Decoder 输出连续动作序列。5ATM校准 Attention Logits 的尺度漂移量化 LLM 和 DiT MLP 后即使 DiT 的 Q/K 投影仍保持浮点输入 Attention 的特征分布也已经发生变化因此的整体尺度可能偏离原来的 FP16 模型使 Softmax 变得过尖或过平。ATMAttention Temperature Matching就是用原始 FP16 模型作为 Teacher、量化后的模型作为 Quantized Model在同一批 Calibration Data 上分别计算每个 Attention Head 的 Logits分数并比较二者的标准差其中就是尺度校准系数如果量化模型的 Logits 幅度过大则将其缩小如果幅度过小则将其放大从而使量化模型的 Attention Temperature 重新接近 FP16 模型。为避免过度修正论文还对进行范围限制并设置 neutrality band如果两者原本已经很接近就直接令不做额外调整。最终会折叠进反量化 Scale因此不需要重新训练也不会额外增加一层计算。这个的目的就是让低比特模型Attention logits的尺度重新接近FP16教师模型。6OHB校准 Attention 输出能量漂移ATM 修正的是 Attention 计算前半段的Logits 尺度但即使 Attention 分布已经校准Attention 最终经过 Value 聚合和 Output Projection 后得到的输出仍可能因为前面量化带来的误差而与原始 FP16 模型存在尺度差异。这个随后会进入 Residual Connection因此如果它整体过大或过小误差还会继续传到后面的 DiT 层。OHBOutput Head Balancing因此比较FP16 Teacher 与量化模型每一层 Attention 输出的 RMS其中就是第层的输出尺度校准系数。如果量化模型输出能量过大则把输出缩小如果输出能量过小则把输出放大使其重新接近 FP16 Teacher。与 ATM 一样也会经过 裁剪和限制幅度避免不必要或过大的修正并最终合并进量化 Scale不额外增加推理层。7ATM和OHB的总结和效果展示ATM 和 OHB 的共同逻辑都是拿同一批 Calibration Data同时跑 FP16 Teacher 和 Quantized Model比较两者在某个关键位置的“尺度差距”再算一个比例系数把量化模型校准回来。区别只在于它们比较的位置和统计量不同。ATM 比较的是每个 Attention Head 的 logits 尺度用的是标准差因为它关心的是 Attention logits 到底变得太尖还是太平。OHB 比较的是 Attention 输出的能量用的是 RMS均方根因为它关心的是进入 residual stream 的输出到底太强还是太弱。igure 3验证了ATM和OHB对两类尺度漂移的校准效果。左图比较GR00T N1.5各个Attention Block的Logits标准差不使用ATM时量化模型与FP16 Teacher的平均尺度比例仅为 90.6%加入ATM后提高到 99.5%说明Attention Logits的尺度基本被恢复右图比较Output Projection后的Attention Output RMS不使用OHB时与Teacher的平均比例为91.2%加入OHB后提升至 98.6%表明进入Residual Stream的输出能量也得到有效校准。因此该实验直接说明QuantVLA中的ATM主要修正Attention Temperature Drift而OHB主要修正Residual Energy Drift两者共同抑制低比特量化误差在深层DiT中的传播。8为什么它仍然属于“Training-Free”整个过程只需少量无标签 Calibration Data 估计量化 Scale 及 ATM/OHB 的校准系数不进行反向传播或参数更新α 和 β 最终可合并到原有反量化 Scale 中因此部署时无需新增网络结构或额外 GEMM仍属于 Training-Free PTQ。第五部分实验效果1基本实验设置QuantVLA 主要用了两个 VLAOpenPI π0.5采用DiT-based Action Head基于 DiT 的动作头GR00T N1.5同样采用DiT-based Action Head并以LIBERO-Spatial、Object、Goal 和 Long四类任务作为主要 Benchmark覆盖空间操作、物体交互、目标执行和长时序控制。主实验采用W4A8量化设置在NVIDIA A100上测试ATM/OHB 校准时使用少量 Calibration Data并设置 neutrality band ϵ0.03 以避免对本已接近 FP16 模型的尺度进行不必要调整。2主实验结果性能保持与显存压缩Table 2 是 QuantVLA 最核心的主实验。在 π0.5 上FP16 模型平均成功率为97.1%、LLMDiT 显存为4.27 GB直接使用 DuQuant 将 LLM 和 DiT 做 W4A8 量化后显存虽然降至 1.17 GB但成功率骤降至76.3%。QuantVLA 同样采用 W4A8却保持97.6%的平均成功率同时将显存降至1.28 GB节省70.0%。在 GR00T N1.5 上也呈现相同趋势FP16 为86.5% / 2.02 GBDuQuant 量化后下降至70.0%而 QuantVLA 达到88.0% / 0.91 GB显存节省55.0%。因此该表真正证明的是VLA 并非不能进行激进低比特量化关键在于通过 Selective Quantization、ATM 和 OHB 控制 DiT 中的尺度漂移从而在大幅降低显存的同时基本保持全精度控制性能。其中量化后的成功率略高于 FP16 应理解为实验波动范围内的性能保持而不是量化本身提升了模型能力。Figure 4 只是进一步可视化上述显存收益π0.5 从 4.27 GB 降至 1.28 GB约为3.34× 内存压缩GR00T N1.5 从 2.02 GB 降至 0.91 GB约为2.22× 内存压缩。因此不需要再单独展开一大段。3进一步压缩与推理鲁棒性Table 3考察更激进的低比特设置。在 π0.5 上FP16平均成功率为97.1%QuantVLA采用W4A8时为97.6%进一步将Activation从8 bit压到4 bit即采用W4A4后仍达到95.3%。其中Long任务由FP16的93.5%下降到90.5%说明更激进的Activation量化开始带来一定性能损失但并未出现普通量化那种明显崩溃。因此W4A4证明QuantVLA具有进一步压缩的能力而W4A8则提供了更稳妥的性能—效率平衡。Table 4进一步测试不同DiT去噪步数下的稳定性。GR00T N1.5原始8步推理平均成功率为86.5%QuantVLA在相同8步下达到88.0%增加到16步后仍保持88.5%。虽然各子任务并非都随着步数增加而提高但整体性能保持稳定说明QuantVLA的尺度校准并不是只针对某个固定的Denoising Steps配置而对不同动作生成迭代次数具有一定鲁棒性。第六部分论文真正的创新、局限与最终应该记住什么1QuantVLA 的核心创新创新点1面向 VLA 的选择性低比特量化。QuantVLA 不再简单照搬 LLM 的“全模型统一量化”而是根据 VLA 各模块的敏感程度选择量化位置LLM 的 Linear Layers 和 DiT 的 MLP 进行低比特量化而 DiT Attention 中敏感的 Q/K/V/O Projection 保持浮点精度从而在压缩模型的同时避免动作生成性能直接崩溃。创新点2发现并校准两类 DiT Scale Drift。作者发现上游 LLM 和 DiT MLP 量化后即使 Attention Projection 本身保持浮点量化误差仍会改变 DiT 内部数值尺度表现为Attention Temperature Drift和Residual Energy Drift。因此分别提出ATM通过 α 匹配 FP16 与量化模型的 Attention Logits 标准差以及OHB通过 β 匹配 Attention Output 的 RMS从而抑制量化误差在深层 DiT 中继续传播。创新点3实现 Training-Free 的 DiT-VLA 部署压缩。QuantVLA 属于 PTQ不需要重新训练 VLA只利用少量 Calibration Data 计算量化 Scale 以及 α/β 校准系数并将这些校准系数合并进原有 Scale。因此它能够在基本保持原模型结构和推理流程的情况下将已经训练完成的 VLA 转换为更低显存的部署模型。2QuantVLA 的局限QuantVLA 解决的是已有 VLA 如何更便宜地部署但仍有几个明显边界验证范围仍以 DiT-based VLA 为主。论文的核心实验集中在 π0.5、GR00T N1.5 和 LIBERO因此可以说明这种 PTQ 路线对现代DiT Action Head有效但还不能据此认为所有 VLA 架构、机器人平台和真实世界长时序任务都已经得到充分验证。并不是所有部分都能激进低比特化。DiT 的 Q/K/V/O Attention Projection 仍需要保留浮点而当 Activation 进一步从 8 bit 压到 4 bit 时π0.5 的平均成功率由 97.6% 降至 95.3%说明更激进压缩仍会逐渐触及性能边界。它只是让这个已经训练好的 Policy 运行得更省显存、更适合部署并没有解决模型在测试时如何显式预测“执行某个动作以后世界会发生什么”。3从 QuantVLA 引出 DINO-WM世界模型论文从“压缩策略”走向“预测世界”到 QuantVLA 为止我们一直在研究怎样让已经学好的 VLA Policy 更高效地产生 Action但这仍然是一种典型的Policy-centric以策略为中心思路模型看到当前观测后直接输出动作。DINO-WM 提出的下一步问题则完全不同机器人一定要在训练阶段把“遇到什么情况该做什么动作”全部学进 Policy 吗能不能只学习“世界如何随动作变化”然后在测试时针对当前目标现场规划DINO-WM 指出许多已经训练好的 Policy 在部署时基本以 feed-forward 方式从 Observation 映射到 Action不再针对新任务进行额外优化因此要泛化到新场景往往要求训练阶段已经覆盖相似情况但现实中不可能提前学习所有潜在任务。因此 DINO-WM 把研究对象从Observation→Policy→Action转向Observation Candidate Action→World Model→Predicted Future它利用冻结的DINOv2 Patch Features表示视觉状态再学习一个 ViT Transition Model根据过去的视觉 latent 和动作预测未来 latent训练完成后不需要针对每个新任务重新训练 Policy而是在测试阶段把目标图像编码为目标 latent通过 MPC/CEM 直接优化一段 Action Sequence使预测的未来状态逐渐接近目标。QuantVLA解决的是“如何让一个训练好的机器人策略更便宜地运行”而DINO-WM进一步追问“机器人是否一定要直接学习策略”它从Action Policy转向World Model通过预测不同动作造成的未来状态在测试阶段针对新目标进行规划。