LFM2.5-DSpark发布:推理速度最高提升3.2倍
今日,我们发布了来自LFM2.5家族的三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B)的DSpark草案模型检查点。这些新版本引入了一种推测性解码路径,通过增加少量内存使用来换取显著的解码速度提升,并且不会影响输出质量。具体来说,在GPU上的推理吞吐量提高了3.18倍,而在设备端的速度提升了2.87倍。此外,DSpark还支持llama.cpp和SGLang,为LFM兼容性提供了开源集成方案。DSpark通过使用轻量级草案模型生成候选令牌,并由目标模型一次性验证所有令牌来实现速度提升,从而减少了权重加载的成本。该技术结合了DFlash风格的并行主干、轻量级顺序头以及基于信心调度的验证器,以提高接受率和减少延迟。
