LFM2.5 Q4_0 模型更新:量化感知蒸馏成果
今日,我们发布了 LF2.5 Q4_0 GGUF 模型文件。这些更新的 4 位检查点适用于 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B,使开发者能够在低内存和高速度下运行这些模型而不损失质量。通过量化感知蒸馏技术训练的 QAD 模型在推理、指令跟随、工具使用和代理能力等方面的表现均优于传统的后训练量化方法。实测结果显示,在不同硬件平台上,QAD 检查点比传统 Q4_0 检查点具有更高的解码吞吐量,并且能够恢复大部分因量化而损失的精度。具体而言,230M 和 350M 的 QAD Q4_0 模型在解码吞吐量上比 Q5_K_M 高出 4-33%,1.2B 和 2.6B 的模型则高出 3-14%。这些改进使得开发者能够在实际边缘硬件设备如 MacBook Pro、NucBox EVO-X2、Samsung Galaxy S26 Ultra 和 Raspberry Pi 5 上获得更好的性能表现。
