Open Data · 用于 LLM 服务研究的数据集

清风徐来AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-221336 阅读💛 144 收藏
Open Data · 用于 LLM 服务研究的数据集

📌 One-Sentence Summary 本文介绍了一个包含来自 Chutes 的生产请求轨迹的大型数据集,旨在促进 LLM 服务、调度策略和用户行为的研究。 📝 Summary Chutes 工作负载数据集提供了跨越一年、涵盖近 9,000 个模型、超过 6.12 亿请求的元数据。数据包含 Token 计数、前缀缓存重用情况以及请求时延。关键发现强调了请求中的高度时间局部性、LRU 驱出策略的有效性,以及缓存感知路由在提高 Token 命中率方面的优势。 💡 Main Points 用户请求具有高时间局部性 99% 的来自同一用户、针对同一模型的重复请求发生在 15 分钟的窗口内,这表明存在巨大的优化空间。 LRU 策略极具竞争力 在这些生产场景中,最久少使用(LRU)策略的效果往往匹配或超过更复杂的缓存管理算法。 缓存感知路由的优势 基于缓存状态实施路由可以提高 Token 命中率,尽管在模拟中可能会引入 5-7% 的负载不均衡。 生产级的研究效用 该数据集允许研究人员对批处理处理进行基准测试、重构用户会话,并探索低流量模型的 GPU 利用率。 💬 Key Quotes 99% 的来自同一用户针对同一模型的重复请求在 15 分钟内到达。 LRU 往往能够或优于更复杂的缓存驱出策略。 缓存感知路由提升了 Token 命中率。 📊 Article Meta AI Screening: 86 Source: Hacker News - Newest: "LLM" Author: Harvard MadSys Lab Category: 人工智能 Language: 英文 Read Time: 1 min Word Count: 179 Tags: AI 与智能应用 , 数据科学 , LLM 推理优化 , 开源项目 , LLM 推理 Read Full Article

#AI 与智能应用# 数据科学# LLM 推理优化# 开源项目# LLM 推理

文章评论(0

暂无评论,快来抢沙发~