Dynamo:让推理系统理解智能体会话

📌 One-Sentence Summary
NVIDIA Dynamo 引入了一个框架,通过使用会话感知标识符来管理 KV 缓存、路由和准入控制,从而优化智能体 LLM 推理。
📝 Summary
本文详细介绍了 NVIDIA Dynamo,该框架旨在处理智能体工作负载的独特流量模式。与标准单轮聊天机器人不同,智能体会话涉及大量初始预填充、重复的工具调用以及并行子代理。通过利用统一的“会话 ID”(或轨迹),Dynamo 将请求感知的基础设施转变为程序感知的基础设施。主要创新包括减少缓存抖动的会话感知调度、用于跨工作负载重复使用前缀的共享 KV 缓存索引,以及跨不同内存层(HBM 和 DRAM)的程序化缓存策略。
💡 Main Points
智能体工作负载需要会话感知的基础设施
智能体工作流与标准聊天机器人不同,因为它们包含大型系统提示和多个交错的工具调用轮次。标准路由器将每个轮次视为孤立,导致缓存抖动和冗余的预填充开销。
统一的会话 ID 作为基础
通过使用稳定的会话 ID(通常称为轨迹),Dynamo 可以将单个推理链中的多个 LLM 请求联系起来,从而允许系统在轮次之间保持 KV 缓存中上下文驻留。
会话感知调度和准入控制
Dynamo 实现了一个调度器,用于评估会话工作集,并在工具边界施加背压,以防止系统驱逐即将需要的活跃会话缓存。
跨内存层的程序化 KV 缓存
通过会话前缀索引器和 KvHint 接口,Dynamo 提供了有关 HBM 和 DRAM 之间缓存移动的策略意图,而推理引擎则负责实际执行。
💬 Key Quotes
智能体工作负载改变了推理服务器看到的流量形状。
最佳服务这种形状取决于系统保持并重复使用多少上下文,以及在满足延迟目标的同时可以同时容纳多少会话。
会话级 ID 将请求感知的基础设施变成了程序感知的基础设施。
📊 Article Meta
AI Screening: 92
Featured: Yes
Source: PyTorch
Author: Ishan Dhanani, Jamie Li, Karen Chung
Category: 人工智能
Language: 英文
Read Time: 14 min
Word Count: 3451
Tags:
AI 与智能应用 , AI Agent , LLM 推理优化 , KV Cache优化 , NVIDIA
暂无评论,快来抢沙发~