ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

【ICML 2025】SliM-LLM 论文解读:显著性驱动的 LLM 分组混合精度量化,2-bit 保精度|从模型压缩部署视角

【ICML 2025】SliM-LLM 论文解读:显著性驱动的 LLM 分组混合精度量化,2-bit 保精度|从模型压缩部署视角 摘要本文解读 ICML 2025 论文《SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models》。该论文提出显著性驱动的分组混合精度量化框架 SliM-LLM通过融合显著性决定的位置分配SBA与显著性加权的量化器校准SQC在权重分组粒度上按重要性分配不同位宽其特别之处在于利用重要权重呈结构化成簇分布这一观察让混合精度做到零额外存储、硬件友好。实验表明2-bit 量化 LLaMA-7B 的困惑度从 GPTQ 的 152.31 降至 14.58下降约 90%内存相比 FP16 缩减近 6 倍且保持 GPU 推理速度为低比特 LLM 部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息为什么低比特量化精度会崩坏研究主线从显著性成簇到分组混合精度核心设计SBA 管组间分配SQC 管组内保真混合精度方法全景实验设计与结果结果对比总结关键发现局限性常见问题FAQSliM-LLM 的创新模式是什么SliM-LLM 是什么SliM-LLM 为什么能做到 2-bit 保精度SliM-LLM 与 GPTQ / AWQ / OmniQuant 是什么关系SliM-LLM 的位宽分配会不会增加存储开销SliM-LLM 需要多少校准数据SliM-LLM 能用于多模态模型吗参考链接论文基本信息项目内容标题英文SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models标题中文SliM-LLM显著性驱动的 LLM 分组混合精度量化作者Wei Huang, Haotong Qin, Yangdong Liu, Yawei Li, Qinshuo Liu, Xianglong Liu, Luca Benini, Michele Magno, Shiming Zhang, Xiaojuan Qi机构香港大学 × 苏黎世联邦理工学院ETH Zurich× 北京航空航天大学会议ICML 2025arXivhttps://arxiv.org/abs/2405.14917项目网站https://github.com/Aaronhuang-778/SliM-LLM为什么低比特量化精度会崩坏大模型推理的显存与带宽瓶颈让量化成为刚需但位宽压到 2-3 bit 时统一精度量化所有权重同一位宽的精度往往断崖式下跌。SliM-LLM 指出现有路线的核心矛盾统一精度 PTQGPTQ / AWQ / OmniQuant计算高效、硬件友好但 2-bit 时语言能力明显受损——GPTQ 在 LLaMA-7B 2-bit 下困惑度高达 152.31。逐元素混合精度PB-LLM / QuIP按单个权重分配位宽精度更好但需要位图/码本索引额外存储反量化不规则GPU 推理效率受损。逐层混合精度HAWQ V2/V3用 ILP 做逐层分配粒度太粗搜索开销大。论文的关键观察是重要权重并非随机散布而是结构化成簇分布——LLaMA-7B 第 2 层的显著通道集中在第 2100、3218、3853 通道附近。既然显著性在空间上聚集混合精度就可以做到分组粒度且结构化既保住 2-bit 精度又不需要任何位图开销普通 GPU 内核AutoGPTQ直接可跑。这正好补上统一精度省事但伤精度、逐元素混合精度保精度但硬件不友好之间缺失的中间路线。图 1低比特 PTQ 现状(a) 2-bit LLaMA 现有方法 PPL 崩坏(b) 3-bit 梯度量化对比(c) C/S/G 三类量化器特征。从历史视角看附录 H混合精度量化的技术迁移脉络也印证了这一位置2019 年 HAWQ V2 提出逐层 Hessian 分析 ILP 位宽分配2023-2024 年 GPTQ/SparseGPT 让统一精度分组量化成熟、PB-LLM/QuIP 把混合精度推进到逐元素但非结构化2025 年 SliM-LLM 首次实现分组结构化混合精度——从非结构化高开销到硬件友好可部署的迁移。从论文写作的叙事结构看附录 FSliM-LLM 采用的是观察驱动开场 → 定理支撑 → 兑现闭环的经典弧线以salient weights exhibit a structured distribution的观察开场用 Theorem 1 以激活离群通道解释显著权重成簇的成因再以 intro 承诺even outperforms other element-wise mixed-precision PTQ methods、实验兑现90% decrease in perplexity收尾——数字前置的强证据框架是其被社区认可的重要原因之一。研究主线从显著性成簇到分组混合精度图 7SliM-LLM 研究主线——从显著性成簇到分组混合精度Mermaid 流程图核心设计SBA 管组间分配SQC 管组内保真SliM-LLM 是即插即用的 PTQ 框架以 GPTQ 逐层量化骨架为基础插入两个显著性驱动组件权重按 group size 128 分组。组件一SBASalience-Determined Bit Allocation——全局分组位宽分配显著性度量沿用 SparseGPT 式消除误差 $\delta_{i,j}w_{i,j}^2/[H^{-1}]_{j,j}^2$Hessian 由 128 条校准激活近似无需反向传播。KL 目标 补偿约束以输出 KL 散度最小化分配位宽并施加约束 $|\mathcal{G}{N-1}| |\mathcal{G}{N1}|$——高显著组升到 3-bit 时等量低显著组降到 1-bit平均位宽保持不变例如整体仍是 2-bit。双指针搜索搜索区间压缩到 $[0, k/2]$$k m/128$ 为组数LLaMA-7B 仅需 16 次迭代远快于 HAWQ 的 ILP 分配。组件二SQCSalience-Weighted Quantizer Calibration——局部显著性加权校准3σ 掩码用 $(\boldsymbol{w}\mu-3\sigma)\cup(\boldsymbol{w}\mu3\sigma)$ 选出组内约 1% 的离散高显著权重。τ 缩放校准显著与非显著权重共享同一量化器参数$(\tau^s, \tau^z)$$\tau$ 在 $[1-\lambda, 1\lambda]$$\lambda0.1$$n50$内线性取候选并最小化 ℓ2 重建误差——不引入任何额外参数。图 2SliM-LLM 框架SBA 全局位宽分配 SQC 局部加权校准。图 3LLaMA-7B 第 2/10 层权重显著性分布显著通道成簇出现。图 4组内局部显著性分布第 10 层 MHA 输出低显著组内仍有约 1% 离散高显著权重构成 SQC 的动机。混合精度方法全景图 8LLM 量化方法全景——混合精度从逐层到逐元素再到分组结构化Mermaid 树状图实验设计与结果评测协议权重 2/3-bitgroup size 128128 条 × 2048 tokenWikiText2校准。基线覆盖 RTN、GPTQ、AWQ、QuIP、PB-LLM、LLM-MQ、APTQ、OmniQuant、AffineQuant。模型覆盖 OPT、LLaMA-1/2/37B-70B、Gemma2-9B、Mixtral 8x7B语言基准为 WikiText2/C4 困惑度 6 项零样本任务PIQA、ARC-e/c、BoolQ、HellaSwag、Winogrande多模态扩展用 LLaVA-Next-8B 在 AI2D、ChartQA、DocVQA、MMBench 上评测。2-bit WikiText2 困惑度主表方法1-7B1-13B1-30B1-65BFP16参考5.685.094.103.53GPTQ152.3120.4413.019.51PB-LLM24.6117.7312.657.85QuIP29.7412.4811.577.83SliM-LLM14.588.877.335.902-bit 下全面领先7B 困惑度较 GPTQ 降 90%较逐元素混合精度 PB-LLM、码本 QuIP 再降 41%-51%。关键对比附录 B 更多模型与部署SBA vs ILPLLaMA-7B 2-bit 14.58 vs 17.55——输出 KL 双指针搜索优于 HAWQ 的 ILP 分配。跨架构稳定性2-bit WikiText2Gemma2-9B 上 SliM-LLM 26.30 vs GPTQ 186.77 / AWQ 217.83Mixtral 8x7B 上 7.44 vs GPTQ 16.38 / AWQ 3.2e5LLaMA-2-70B 上 6.28 vs GPTQ 8.782-bit 实际部署。SliM-LLM⁺OmniQuant 可学习量化器2-bit 13B 困惑度 7.17 vs OmniQuant 7.93零样本 Avg 51.02 vs 49.11。VLM 扩展LLaVA-Next-8B 2-bitGPTQ/AWQ 2-bit 全部输出失败SliM-LLM 正常生成AI2D 57.2、ChartQA 49.3、DocVQA 60.6、MMBench 60.93-bit 下四基准均最优如 AI2D 68.2 vs GPTQ 66.2 / AWQ 67.7。部署2-bit 7B 权重内存 2.3GFP16 的约 1/6PPL 14.58仅以轻微 token/s 下降换精度。图 5OPT 模型消融(a) 随机/头尾分配失效SBA 显著提升(b) SBA 与 SQC 各自的增益分解。图 62-bit 对话示例LLaMA-2-13B / Vicuna-13B 在 SliM-LLM 下给出合理回答而 GPTQ-2bit 出现不合逻辑输出。结果对比总结图 92-bit 量化结果对比——SliM-LLM 相对统一精度与逐元素混合精度基线的优势Mermaid 流程图关键发现显著性确实成簇LLaMA-7B 第 2 层显著通道集中在约第 2100、3218、3853 通道多模型验证了这一结构化分布Theorem 1 给出理论支撑。2-bit 大突破7B 困惑度从 GPTQ 的 152.31 降到 14.58下降约 90%超过逐元素混合精度 PB-LLM24.61与码本 QuIP29.7441%-51%。SBA 优于 ILP同样的 2-bit 目标双指针搜索14.58明显优于 HAWQ 的 ILP 分配17.55且仅需 16 次迭代。SQC 有独立增益消融实验显示 SBA 与 SQC 各有贡献随机/头尾分配位宽反而退化证明差异化分配的必要性。跨架构与跨模态稳健Gemma2-9B、Mixtral 8x7B、LLaMA-2-70B 全部显著领先VLM 上 GPTQ/AWQ 2-bit 直接失败SliM-LLM 仍可用。零额外存储结构化分组混合精度无需位图/索引AutoGPTQ 内核直接部署2-bit 7B 权重仅 2.3G。局限性推理速度略降混合精度反量化在 A800 上 token/s 较 GPTQ 降约 20%-25%。1-bit 支持弱GPU 对 1/2/3-bit 原生计算支持有限1-bit 组需额外存储/计算补偿。组粒度固定group size 128 未按模型搜索最优分组仅覆盖 weight-only 量化。部署工具链现成推理工具尚不能高效支持混合精度计算AutoGPTQ 为实验性扩展。作者自述We believe there is significant room for improvement in the hardware efficiency of mixed-precision LLMs in the future.常见问题FAQSliM-LLM 的创新模式是什么从创新模式分析附录 CResearchStudio-Idea 框架看SliM-LLM 同时命中三种模式P1 审计扭转负载假设审计统一精度量化最优的隐含假设并用 Theorem 1 证明其失效、P6 重新表述为可解对象把位宽分配表述为输出 KL 散度最小化 双指针搜索、P10 异构分解差异化处理按显著性分解权重组并差异化分配位宽——结构性洞察与可复用基础设施兼备。SliM-LLM 是什么SliM-LLM 是 ICML 2025 提出的显著性驱动分组混合精度 PTQ 框架由 SBA显著性决定的位置分配和 SQC显著性加权的量化器校准两个组件构成在权重分组粒度上按重要性分配 1/2/3-bit 位宽。SliM-LLM 为什么能做到 2-bit 保精度因为它发现重要权重呈结构化成簇分布SBA 把更多位宽分配给高显著分组平均位宽不变SQC 再用 3σ 掩码保住组内约 1% 的离散显著权重组间、组内双重保真。SliM-LLM 与 GPTQ / AWQ / OmniQuant 是什么关系SliM-LLM 以 GPTQ 逐层量化骨架为基础可即插即用地嵌入现有管线SliM-LLM⁺ 版本用 OmniQuant 的可学习权重裁剪替代 SQC进一步把 2-bit 13B 困惑度降到 7.17。SliM-LLM 的位宽分配会不会增加存储开销不会。它做的是分组结构化混合精度反量化与统一精度同构无需位图/码本索引零额外存储AutoGPTQ 内核可直接部署。SliM-LLM 需要多少校准数据仅需 128 条 WikiText2 校准样本每条 2048 token且无需反向传播单张 A800 即可完成量化。SliM-LLM 能用于多模态模型吗可以。LLaVA-Next-8B 在 2-bit 下仍能正常生成GPTQ/AWQ 2-bit 全部失败AI2D 57.2、ChartQA 49.3、DocVQA 60.6、MMBench 60.93-bit 下四基准均最优。参考链接arXiv 论文https://arxiv.org/abs/2405.14917官方代码https://github.com/Aaronhuang-778/SliM-LLMGPTQICLR 2023https://arxiv.org/abs/2210.17323AWQMLSys 2024https://arxiv.org/abs/2306.00978OmniQuantICLR 2024https://arxiv.org/abs/2308.13137QuIPICML 2024https://arxiv.org/abs/2307.13304给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表