量化感知修复:压缩模型的恢复技术
最新研究提出了一种名为量化感知修复(QAH)的方法,用于恢复经过结构压缩和4位量化的大型语言模型。该方法通过直接从原始未压缩的模型进行知识蒸馏,使得恢复后的模型在多个基准测试中超越了其全精度版本。实验结果显示,在AA-LCR等长上下文推理任务上,采用QAH技术的4位量化模型表现优于传统的16位浮点模型。研究指出,传统的方法如量化的感知训练(QAT)和量化的感知蒸馏(QAD)在处理经过结构压缩后的模型时效果不佳,因为这些方法依赖于全精度版本作为教师模型,而实际中不存在这样的独立训练版本。相比之下,QAH直接从原始未压缩的模型进行知识蒸馏,使得量化后的学生模型能够获得更多的信息,并且提高了稳定性和准确性。
