GPT-6 的改进提示缓存

📌 One-Sentence Summary OpenAI 为 GPT-6 推出改进的提示缓存系统,默认提升缓存命中率,并提供仪表盘、诊断工具和显式缓存断点等控制手段,帮助持久化 Agent 更快更省地运行。 📝 Summary OpenAI 发布 GPT-6 的改进提示缓存系统,面向需要长时间运行的持久化 Agent。新系统默认提供更高的缓存命中率,对 30 分钟内复用的合格共享前缀给予缓存折扣,缓存输入 token 最高可享 90% 折扣。配套推出 Prompt Caching Dashboard 用于监控缓存命中率与输入构成,以及诊断工具用于定位缓存未命中的原因(如工具变更)。开发者还可通过显式缓存断点选择缓存内容、在不破坏缓存的情况下调整推理强度、通过追加式更新保持工具定义稳定、以及预热缓存以降低延迟。GitHub Copilot 和 Strawberry Browser 等团队提供了使用反馈,称缓存优化显著降低了成本与延迟。 💡 Main Points GPT-6 的改进提示缓存系统默认提供更高的缓存命中率,并对 30 分钟内复用的共享前缀给予最高 90% 的输入 token 折扣。 持久化 Agent 会连续发起多个基于前序上下文的 API 请求,OpenAI 缓存共享上下文以复用计算,从而降低响应时间与成本。 新增 Prompt Caching Dashboard 和诊断工具,帮助开发者监控缓存表现并定位未命中原因。 仪表盘展示缓存命中率随时间的变化和输入 token 构成;诊断工具可对比请求与近期响应,识别模型、工具、设置或输入的变化,并估算受影响 token 数。 开发者可通过显式缓存断点、追加式工具更新、动态调整推理强度等方式优化缓存。 显式断点让开发者选择要复用的前缀;保持工具定义、schema 和顺序稳定可避免缓存失效;在 GPT-6 上可在不破坏缓存的情况下调整推理强度。 预热缓存可将已知上下文的处理移出用户等待时间,从而降低延迟。 应用可在启动时预先处理共享指令、工具定义或参考材料,当用户发起请求时模型能更快开始响应。 GitHub Copilot 和 Strawberry Browser 等团队反馈缓存优化显著降低了成本与延迟。 GitHub Copilot 将需要全新处理的提示 token 比例降低了超过 50%;Strawberry Browser 通过诊断和仪表盘将缓存命中率提升几个百分点,成本降低 20%。 💬 Key Quotes OpenAI 缓存这些共享上下文以在请求间复用计算,缩短响应时间,并为开发者提供高达 90% 的缓存输入 token 折扣。 我们现在对 30 分钟窗口内复用的合格共享前缀提供缓存折扣。 OpenAI 的提示缓存诊断工具和仪表盘帮助我们将缓存命中率提升了几个百分点,成本降低 20%。 预热提前准备已知上下文,以便模型在请求到达时能更快开始响应。 在过去几个月中,与之前的基线相比,我们将发送到 OpenAI 模型的数十亿次请求中需要全新处理的提示 token 占比降低了 50% 以上。 📊 Article Meta AI Screening: 90 Source: OpenAI News Author: OpenAI Category: 人工智能 Language: 英文 Read Time: 4 min Word Count: 753 Tags: AI 与智能应用 , 性能优化 , AI 工程 , 模型训练与推理 , AI 产品与应用 Read Full Article
暂无评论,快来抢沙发~