首页/新闻/Nvidia finds that simple linear math can replace costly AI model handoffs
技术突破

Nvidia发现简单的线性数学可以取代昂贵的人工智能模型复制

venturebeat
2026年8月21日 16:33
2026年8月21日 16:33
访问原文

当代理人工智能系统将任务从小模型移交给大模型时--或者再次退出--它会支付高额税:接收模型必须从头开始重新计算整个对话,从而推高计算成本和延迟。这是企业构建长期、多LLM工作流程的主要瓶颈。 为了解决这一挑战,英伟达的研究人员推出了一种 跨型号KV缓存传输 将预填充的KV缓存从源模型直接映射到目标模型的技术。该技术与现实世界的代理应用程序保持一致,其中大上下文在许多回合中积累。 对于现实世界的人工智能应用程序来说,跨模型KV缓存传输可以降低长期运行的多LLM工作流程的计算成本和延迟,而且它可以通过简单的线性数学来实现这一目标,而不是昂贵的深度学习模型。 实验表明,在兼容的模型对上,这种线性映射过程的运行速度是重新计算对话的2.7至25倍,同时保留高达98%的目标模型独立准确性。 研究LLM如何处理内存有助于理解为什么多模型工作流程在生产中遇到性能障碍。当LLM收到提示时,它必须首先执行“预填充”阶段,这是计算所有输入令牌的键和值并填充Key-Value(KV)缓存的初始前向传递。 之后,它进入“解码”阶段,计算并生成序列中的下一个令牌。在此阶段,模型从这个KV缓存中读取以逐个预测新令牌,从而绕过了重新评估每个新令牌的整个对话历史的需要。 在多轮对话或长视野代理会议中,上下文逐渐变得更长。由于预填充阶段的计算成本直接随模型大小和输入长度而变化,因此处理这些长会话的成本将越来越高,并且如果KV缓存无效,还会带来显着的延迟。 这个残疾人

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

相关 AI 模型

新闻来源

venturebeat · 2026年8月21日 16:33

查看原文

相关新闻