ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

(论文速读)扩散变压器的区域自适应采样

(论文速读)扩散变压器的区域自适应采样 论文题目Region-Adaptive Sampling for Diffusion Transformers扩散变压器的区域自适应采样会议CVPR 2026摘要扩散模型(DM)在不同的生成性任务中取得了最先进的性能但它们对顺序正向传递的依赖从根本上限制了实时效率。现有的加速方法主要集中在减少采样步数或重用中间特征上。利用扩散转换器(DIT)在处理可变令牌计数方面的固有灵活性我们引入了RAS这是一种无需训练的采样策略它基于模型注意力动态调整图像区域的更新率。我们的关键见解是DITS逐渐聚焦于语义上有意义的区域并且这种聚焦的区域在连续的步骤之间表现出很强的时间连续性。在此观察的基础上RAS只更新这些聚焦区域同时利用从上一步的输出推断出的焦点图在其他地方重复使用缓存的噪音。稳定扩散3和Lumina-Next-T2I的实验分别显示了高达2.36倍和2.51倍的加速比而质量降级可以忽略不计-突出了一条实现实时扩散变压器生成的实用途径。让扩散模型因地制宜Region-Adaptive Sampling (RAS) 详解1. 背景扩散模型为什么慢现有加速方案有什么缺陷扩散模型Diffusion Models, DMs在图像生成、超分辨率、图像编辑、视频合成乃至3D生成等领域取得了令人瞩目的成果。然而它们天生的推理瓶颈始终是一块心病——生成一张图需要反复进行数十次串行前向传播远达不到实时应用的要求。为了解决这一问题学界提出了两大类加速思路训练型方法需要额外训练渐进式蒸馏Progressive Distillation将多步采样器蒸馏为少步版本。一致性模型Consistency Models直接预测干净图像大幅减少迭代次数。整流流Rectified Flow学习从噪声到数据分布的直线ODE轨迹Stable Diffusion 3即采用此方案。无训练型方法DPM-Solver快速ODE求解器约10步内完成采样。DeepCache对U-Net模型缓存并复用中间层特征跳过冗余的上下采样计算。Delta-DiT面向DiT的层级缓存加速。这些方法虽然各有成效但它们有一个共同的根本局限对图像所有区域一视同仁无论是语义丰富的主体前景还是平滑单调的背景都消耗相同数量的计算步骤。这显然是一种浪费。Figure 1论文原图展示主体区域与背景区域在RAS中被分配不同更新频率的可视化效果每个色块代表一个patchified latent token颜色深浅对应被刷新的步数多少。2. 核心洞察扩散模型天然具有注意力时空连续性论文作者在深入分析DiTDiffusion Transformer的推理过程后发现了两个关键规律规律一模型在每一步都优先聚焦于语义有意义的区域。可视化各采样步骤的预测噪声输出后可以清晰看到——DiT每一步都主要关注图像的主体部分如图中的小车、人物而背景区域的噪声变化非常微小。这就像一位画家在画布上不断用细腻笔触打磨主体而背景只需粗刷几下即可。规律二相邻步骤之间焦点区域具有极强的时序连续性。作者使用归一化折损累积增益NDCG指标量化了相邻步骤之间焦点Token排名的相似度。结果表明整个扩散过程中NDCG始终保持在极高水平接近1.0说明哪些区域重要这一判断在相邻步骤之间具有高度稳定性。Figure 3NDCG折线图横轴为采样步数纵轴为相邻步骤间焦点Token排名的NDCG值曲线高企说明时序连续性显著。Figure 4预测噪声可视化展示t0到t27各步骤DiT预测噪声的热力图清晰呈现模型焦点从弥散到集中的演变过程以及相邻步骤间的空间连续性。这两个规律共同揭示了一个极具价值的冗余在某一步骤中未被聚焦的区域完全可以沿用上一步的缓存噪声而无需重新计算。3. 方法RASRegion-Adaptive Sampling基于上述洞察论文提出了RAS——第一个面向扩散Transformer的区域自适应采样策略。RAS是完全无需训练training-free的可以直接插入现有DiT推理流程。Figure 5RAS框架总览图展示每个扩散步骤中Fast Region经过DiT前向计算、Slow Region复用缓存噪声、最终Merge得到下一步输入的完整流程。3.1 整体流程在每个扩散步骤 t 中RAS将图像的patchified latent tokens划分为两类快更新区域Fast-Update Regions模型当前主要关注的区域送入DiT进行完整的去噪计算。慢更新区域Slow-Update Regions当前被忽视的区域直接复用上一步的缓存噪声跳过本轮计算。两部分的噪声合并后构成下一步的输入其中是本步计算所得噪声是上一步缓存的噪声。3.2 区域识别Output-Noise Metric如何判断哪些区域是快更新区域论文提出了一个简洁而有效的指标——预测噪声的标准差。实验发现主体前景区域语义密集区的预测噪声标准差明显低于背景区域语义稀疏区。这反映了Gaussian噪声叠加后不同区域信息密度的差异。标准差越低的区域当前时步的关注度越高应被优先更新。由于DiT处理的是patch级别的token最终指标在patch层面取均值其中是该patch被跳过的累积次数k 是控制补偿力度的缩放系数。这个设计确保了长时间被忽略的背景patch也会被周期性重新激活详见3.4节饥饿预防。3.3 注意力KV缓存单纯跳过慢更新区域的前向计算会带来一个问题Transformer自注意力需要所有token的Key和Value来计算上下文关系。若直接剔除慢更新区域的KV会导致活跃token的注意力分布严重失真。为此RAS引入KV缓存机制在每个步骤中完整的Key和Value张量被缓存下来下一步仅更新快更新区域对应的部分。活跃token的注意力输出计算为其中是慢更新区域上一步缓存的Key和Value。由于相邻步骤之间token embedding演变平滑缓存值仍然是对真实值的良好近似从而以极小的质量代价保留了完整的跨token上下文信息。3.4 调度优化RAS还配套设计了三个精细化调度策略① 动态采样率调度Dynamic Sampling Ratio扩散过程早期前4步相邻步骤之间的注意力相关性较弱图3中NDCG在早期略低直接跳过区域可能破坏图像的全局结构。因此RAS的前几步如28步总计划中的前4步强制使用100%全量采样随后才逐步降低采样率实现先稳后快的策略。② 累积误差重置Accumulated Error Resetting慢更新区域长期不更新会积累去噪方向误差导致生成轨迹偏移。为此RAS在采样计划中定期插入全量更新步dense steps强制所有区域重新计算一次。例如在30步计划第4步开始选择性采样中将第12步和第20步设为dense步。③ 饥饿预防Starvation Prevention如果某些背景区域长期被跳过会导致最终输出出现模糊或噪声堆积。通过在重要性指标中引入因子被跳过次数越多的patch其重要性得分会被提升保证它们被周期性纳入更新维持全局一致性。3.5 工程实现Kernel Fusing在GPU实现层面RAS利用PITPermutation Invariant Transformation原则将活跃token的scatter操作融合进前序GeMM矩阵乘法的epilogue阶段避免额外的内存拷贝和同步开销进一步降低实际延迟。4. 实验结果4.1 实验设置模型Stable Diffusion 3SD3、Lumina-Next-T2I数据集MS-COCO 2017随机采样10,000条caption-image对评估指标FID整体图像真实性、sFID局部感知质量、CLIP Score文本-图像语义一致性、ImageReward、PickScore、HPSv2人类偏好对齐基线多种Rectified Flow / Flow Matching加速方法硬件4台服务器各配8块NVIDIA A100 (40GB)延迟/吞吐量测试在单块A100 (80GB)上进行4.2 主要加速结果RAS在两个模型上均实现了显著的推理加速Figure 2(a)(b)展示Lumina-Next-T2I30步和SD328步在使用RAS后的生成图像对比上方为原始1×速度结果下方为2.51×和2.36×加速后的RAS结果。Figure 2(c)(d)FID与CLIP Score vs. 推理时间曲线横轴为每张图片耗时秒纵轴分别为FID和CLIP Score展示RAS在不同配置下优于等时间预算的Rectified Flow基线。关键数据摘要模型配置加速比代价Lumina-Next-T2IRAS-25%30步2.25×FID 22.12%sFID 26.22%CLIP -0.065%SD3RAS-12.5%28步2.44×详见Table 3Lumina-Next-T2IRAS-12.5%30步2.70×详见Table 3值得注意的是RAS降低采样率带来的质量损失远小于直接减少总步数带来的损失在步数少于10步的低步数场景下这一优势尤为明显。4.3 Pareto改进同等算力下更好的速度-质量权衡Table 2Pareto Improvements表格展示在相近吞吐量下RAS在FID、sFID、CLIP Score三项指标上全面优于Rectified Flow基线的对比数据。在几乎所有配置下RAS相比等算力的密集Rectified Flow推理都能同时提升FID、sFID和CLIP Score实现真正意义上的Pareto改进——即在不牺牲任何指标的前提下提升推理速度。4.4 与层级缓存方法的比较Figure 6SD3上RAS vs DeepCache vs Δ-DiT的FID与CLIP Score对比图横轴为每张图推理时间对比三种方法在不同cache interval下的质量-速度曲线。论文将RAS与针对层级特征缓存的DeepCache适配DiT版本及Δ-DiT进行了直接比较。结果显示RAS在更高加速比下仍然取得了更好的FID和CLIP Score体现了基于区域Token选择的方案相比层级缓存策略在Transformer架构上的天然优势。4.5 显存开销Table 3Memory Consumption of RAS展示RAS在SD3和Lumina上相比RFlow基线的显存增量约4–6%及对应加速比。RAS需要额外缓存中间噪声估计及注意力KV张量因此会带来一定的显存开销。实测结果显示额外显存占用仅约Stable Diffusion 36%19.21GB → 20.36GBLumina-Next-T2I4%10.30GB → 10.73GB并且这一开销不随采样率变化因为始终缓存全量激活以供复用在实际部署中完全可以接受。4.6 人类评估Figure 2(e)人类评估投票分布柱状图展示1400票中明显更好/稍好/质量相当/稍差/明显更差各类投票数量对比RAS与密集推理的感知质量差异。论文从Stable Diffusion 3和Lumina-Next-T2I的官方论文与博客中选取14个提示词各生成两张图一张密集推理、一张RAS招募18所高校及企业的100名参与者进行盲测。结果显示45.21%的投票认为两张图质量相当28.29%略微偏好密集推理结果26.50%略微偏好RAS结果这意味着在提供SD3 1.625×、Lumina 1.561×的吞吐量提升的同时人类几乎感知不到任何图像质量的下降。Table 5人类偏好指标对比表展示Lumina-Next-T2X上RAS在ImageReward、PickScore、HPSv2三项指标下与不同步数RFlow基线的全面对比。5. 消融实验Table 4消融研究汇总表含四个子表分别验证调度策略、KV缓存、误差重置周期、饥饿预防四个组件对FID/sFID/CLIP Score的独立贡献。论文在SD3上对各关键组件进行了系统消融① Token丢弃调度Table 4a动态采样率 选择性缓存 误差重置三个组件缺一不可组合使用达到最优质量。随机丢弃Token不基于重要性排序导致FID从35.81升至43.19充分验证了区域识别指标的必要性。② KV缓存Table 4b在28步采样中去除KV缓存导致FID从24.30急升至31.36说明慢更新区域的KV对活跃Token的注意力上下文至关重要。③ 误差重置周期Table 4c在14步采样中在选择性采样阶段的中点附近如步骤7或步骤11插入一个dense step可达到最优质量-效率平衡多加一个dense step带来的边际收益有限但时间开销可见。④ 饥饿预防Table 4d加入drop count惩罚项后10步采样的FID从39.87降至35.81说明周期性激活长期被忽略的Token对维持全局图像一致性有实质性作用。6. 方法对比与定位方法类型代表方法加速维度区域感知训练需求步数减少训练型Consistency Models, RFlow减少总步数❌✅步数减少无训练型DPM-Solver, AYS减少总步数❌❌层级特征缓存DeepCache, Δ-DiT减少每步计算量❌❌区域自适应采样RAS本文减少每步计算量✅❌RAS与上述方法正交可以与步数减少方法、模块级优化方法如DiTFastAttn叠加使用进一步放大加速收益。7. 总结与展望本文围绕扩散Transformer推理中的空间异质性问题揭示了模型注意力的时空连续性规律并以此为核心设计了RAS——一个训练无关的区域自适应采样框架。核心贡献总结首次提出在扩散模型中对不同图像区域分配不同有效采样步数的思路填补了这一方向的空白。提出output-noise metric用于焦点区域识别并设计配套的KV缓存、动态调度、误差重置、饥饿预防机制形成完整闭环。在SD3和Lumina-Next-T2I上实现2×以上加速显存开销仅增加4–6%人类评估几乎无感知质量损失。方法与现有加速技术正交为进一步组合优化提供了空间。随着DiT架构在视频生成、3D生成等更多领域的普及区域自适应计算分配有望成为高效生成的重要基础范式RAS为此提供了一条极具实践价值的路径。
返回列表