Nvidia 发现,简单的线性数学运算可替代昂贵的 AI 模型交接
代理 AI 系统在切换不同规模的大语言模型时面临显著瓶颈,因为接收模型必须重新计算整个对话历史。这种重新计算带来了高昂的计算成本和延迟,阻碍了长周期、多 LLM 工作流的实现。Nvidia 的研究人员开发了一种跨模型 KV 缓存传输技术以解决这一问题。该方法直接将源模型预计算的键值(Key-Value)缓存映射到目标模型。此过程显著降低了企业级 AI 应用中的计算成本和延迟。实验表明,这种线性映射技术比重新计算缓存快 2.7 至 25 倍,同时在兼容的模型对上可保留目标模型独立准确性的最高 98%。该技术利用 KV 缓存的线性结构,采用简单的代数方法而非昂贵的深度学习训练,从而实现从小模型到大模型的无缝升级以提升输出质量,并通过在初始重度处理后将大模型切换为小模型来降低计算成本。虽然该技术最初专注于同家族模型间的传输,但该框架展现出更广泛应用的潜力。这一进展为扩展多模型代理系统并管理推理成本提供了关键工具。