Dynamo:让推理系统理解智能体会话

溪行者AI 前沿📡 BestBlogs·AI高分精选⭐ 922026-10-09256 阅读💛 11 收藏
Dynamo:让推理系统理解智能体会话

📌 One-Sentence Summary

NVIDIA Dynamo 引入了一个框架,通过使用会话感知标识符来管理 KV 缓存、路由和准入控制,从而优化智能体 LLM 推理。

📝 Summary

本文详细介绍了 NVIDIA Dynamo,该框架旨在处理智能体工作负载的独特流量模式。与标准单轮聊天机器人不同,智能体会话涉及大量初始预填充、重复的工具调用以及并行子代理。通过利用统一的“会话 ID”(或轨迹),Dynamo 将请求感知的基础设施转变为程序感知的基础设施。主要创新包括减少缓存抖动的会话感知调度、用于跨工作负载重复使用前缀的共享 KV 缓存索引,以及跨不同内存层(HBM 和 DRAM)的程序化缓存策略。

💡 Main Points

智能体工作负载需要会话感知的基础设施

智能体工作流与标准聊天机器人不同,因为它们包含大型系统提示和多个交错的工具调用轮次。标准路由器将每个轮次视为孤立,导致缓存抖动和冗余的预填充开销。

统一的会话 ID 作为基础

通过使用稳定的会话 ID(通常称为轨迹),Dynamo 可以将单个推理链中的多个 LLM 请求联系起来,从而允许系统在轮次之间保持 KV 缓存中上下文驻留。

会话感知调度和准入控制

Dynamo 实现了一个调度器,用于评估会话工作集,并在工具边界施加背压,以防止系统驱逐即将需要的活跃会话缓存。

跨内存层的程序化 KV 缓存

通过会话前缀索引器和 KvHint 接口,Dynamo 提供了有关 HBM 和 DRAM 之间缓存移动的策略意图,而推理引擎则负责实际执行。

💬 Key Quotes

智能体工作负载改变了推理服务器看到的流量形状。

最佳服务这种形状取决于系统保持并重复使用多少上下文,以及在满足延迟目标的同时可以同时容纳多少会话。

会话级 ID 将请求感知的基础设施变成了程序感知的基础设施。

📊 Article Meta

AI Screening: 92

Featured: Yes

Source: PyTorch

Author: Ishan Dhanani, Jamie Li, Karen Chung

Category: 人工智能

Language: 英文

Read Time: 14 min

Word Count: 3451

Tags:

AI 与智能应用 , AI Agent , LLM 推理优化 , KV Cache优化 , NVIDIA

#AI 与智能应用# AI Agent# LLM 推理优化# KV Cache优化# NVIDIA

文章评论(0)

暂无评论,快来抢沙发~