尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models 文章主要内容和创新点主要内容本文聚焦于大语言模型(LLMs)的后训练量化(PTQ)技术,旨在通过更精准的误差补偿提升量化模型的性能。现有基于补偿的权重校准方法(如GPTQ)通常依赖二阶泰勒展开建模量化误差,假设训练良好的全精度模型中一阶项可忽略。但研究发现,渐进式补偿过程会导致潜在权重与全精度权重之间累积一阶偏差,使得上述假设不成立。为此,本文提出FOEM(First-Order Error Matters),一种新的PTQ方法:明确纳入一阶梯度项以改进量化误差补偿;通过计算潜在权重与全精度权重的差异近似梯度,避免反向传播计算梯度的高成本和泛化限制;利用预计算的乔列斯基(Cholesky)因子实时高效恢复海森(Hessian)子矩阵的逆,确保计算效率。实验表明,FOEM在多种模型(如Llama系列)和基准测试中持续优于经典的GPTQ方法,尤其在低比特(如3比特)量化下表现显著(如Llama3-8B的困惑度降低89.6%,Llama3-70B的5-shot MMLU准确率从51.7%提升至74.9%)。此外,FOEM可与GPTAQ、SpinQuant等先进技术结合,在W4A4KV4等挑战性设置下进一步缩小与全精度模型的精度差距。创新点揭示一阶项的重要性:指出现有方法忽略一阶项的缺陷,证明渐进式补偿会导致一阶偏差累积,一阶项对量化误差的影响不可忽视;提出FO
返回列表