人工智能 来源:VentureBeat 整理:feaOS 2026-08-22 06:57:46

NVIDIA研究发现简单线性数学可替代昂贵的AI模型切换

当代理型AI系统在小型和大型模型之间进行任务传递时,接收方需要重新计算整个对话过程,导致高昂的计算成本和延迟。NVIDIA的研究人员提出了一种跨模型KV缓存转移技术,通过直接映射源模型的预填充KV缓存到目标模型中来解决这一问题。实验表明,在兼容的模型对之间,这种线性映射过程比重新计算对话快2.7至25倍,并且能够保留高达98%的目标模型独立准确率。这项技术在多轮对话或长时程代理会话中可以显著降低计算成本和延迟。NVIDIA的研究还发现跨模型KV缓存具有明显的线性结构,可以通过简单的代数技巧进行映射而无需复杂的神经网络训练。实验结果显示,在不同大小的Qwen3、Llama 3.1和Ministral 3等模型之间进行KV缓存转移时,该技术能够保留高达98%的目标模型独立准确率,并且在大规模参数跳跃(如从Llama 3.1 8B到70B)的情况下也能保持较高的准确性。

ENTRY_ID: NEWS-13934 READ_MODE: SHORT_SIGNAL