基于成本、速度和可靠性在推理提供商之间路由 LLM 流量 | Unblocked

📌 One-Sentence Summary
作者详细介绍了自适应 LLM 路由器的工程实现,该路由器根据实时的成本、速度和可靠性指标动态平衡各推理提供商之间的流量。
📝 Summary
本文描述了从固定顺序路由向复杂的自适应路由系统的转变,该系统用于在 Baseten、Fireworks 和 CoreWeave 等提供商之间进行 LLM 推理。系统通过测量每个“任务”的性能而非单个 API 调用的性能,以更好地契合客户体验。它利用加权评分算法(成本权重 0.7,速度权重 0.3)来选择最佳提供商。关键技术特性包括针对限流错误(429s)的熔断器机制、用于恢复的加法增大/乘法减小策略,以及在全面部署前验证逻辑的“影子模式”阶段。
💡 Main Points
指标应在“任务”层面而非 API 调用层面进行测量。
由于单个任务通常涉及多次模型调用,按任务维度测量成本和速度能更准确地反映客户实际支付的费用和等待的时间。
加权评分算法平衡了成本效率与延迟性能。
路由器使用公式(0.7 * 成本比率 + 0.3 * 速度比率),确保成本作为主要驱动因素,同时兼顾对延迟敏感的需求。
自适应路由需要强大的熔断机制来处理限流问题。
系统将 429 限流错误视为信号,立即将允许的流量速率减半,并在提供商稳定后采用加法增大策略缓慢恢复。
持续探索确保路由器反映当前市场状况。
通过将至少 5% 的流量路由到所有提供商,系统收集最新数据以检测价格或性能的变化,无需人工干预。
💬 Key Quotes
提供商现在以截然不同的价格和速度销售相同的开放权重模型。
我们想要的路由机制默认使用最便宜的提供商,考虑速度因素,当提供商返回限流错误时逐步转移流量,并且全程无需人工介入。
任务是用户付费购买并等待完成的内容。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: Hacker News - Newest: "LLM"
Author: Peter Werry
Category: 人工智能
Language: 英文
Read Time: 22 min
Word Count: 5312
Tags:
AI 与智能应用 , 大语言模型 (LLM) , LLM 推理优化 , 系统设计 , AI 工程
看完了,收获满满,期待更多更新。