OpenAI:按成功任务优化 AI 成本

清风徐来行业资讯📡 BestBlogs·全站精选⭐ 912026-10-091166 阅读💛 158 收藏
OpenAI:按成功任务优化 AI 成本

📌 One-Sentence Summary

OpenAI 部署工程师建议以成功完成任务的成本为目标,通过代表性评测选择模型配置,再用缓存、程序化工具调用、推理控制和延迟处理减少工作量。

📝 Summary

OpenAI 部署工程师 Mandeep 和 Sapto 解释,token 标价无法完整反映 AI 应用成本。便宜模型可能消耗更多 token、无法完成任务,或需要人工介入,因此应关注在达到准确率要求、延迟可接受时,成功完成一项任务的成本。他们建议建立代表性的评测集,将模型、运行框架与配置一起测试,在准确率与成本的 Pareto 前沿上选择合适方案,而不是假定最小模型总是最便宜。除模型选择之外,他们讨论四个杠杆:提示词缓存、程序化工具调用、推理强度,以及 Batch 或 Flex 处理。程序化工具调用将中间工具数据的协调、筛选和比较交给代码,只把有用的报告返回模型。推理强度则应独立于答案长度进行评测。缓存方面,他们建议保持提示词开头稳定,并介绍显式断点、仅显式缓存模式、保留缓存的推理强度和工具调整、缓存仪表盘,以及定位未命中的诊断工具。客户案例包括 Clio 自述减少 38% 的输入 token,以及 Blitzy 自述将缓存复用率从 24% 提升至 90%,还有其他由厂商转述的效率改善。这些数字展示可能的收益,不是受控对比基准。结尾建议追踪一项完整任务,每次只改变一个设置,保留经过验证的改进,并随应用演进持续评测。

💡 Main Points

优化成功任务成本,而不是 token 标价

小模型可能使用更多 token,或需要升级至人工处理。讨论将任务完成质量、总支出和可接受延迟作为共同优化目标。

用评测选择模型、运行框架与配置

明确任务及准确率要求,建立代表性样本,再用准确率与成本的 Pareto 前沿比较配置。小模型值得测试,但不会自动胜出。

让中间工具处理退出模型上下文

程序化工具调用让代码协调工具、汇总结果,再返回精简报告。Clio 自述在文档工作流中减少 38% 的输入 token,质量没有下降。

稳定前缀和明确缓存边界有助于复用

讲者介绍可复用指令、稳定部分之后的变化任务、显式断点和缓存诊断,也介绍在保留缓存上下文时调整推理强度与工具。

根据质量测量结果权衡推理强度和响应时间

路由任务可尝试较低推理强度,难任务可能值得投入更多计算。Batch 或 Flex 适合允许等待的工作;每种设置都应在评测后决定是否保留。

💬 Key Quotes

按每个 token 的成本计算便宜的模型,按每项任务的成本计算未必最便宜。

对于提示词缓存,我们最重要的建议是尽可能保持提示词开头一致。

我给出的建议是,每次测试一个变化、一项改进。

📊 Article Meta

AI Screening: 91

Featured: Yes

Source: OpenAI

Author: OpenAI

Category: 人工智能

Language: 英文

Read Time: 7 min

Word Count: 1581

Tags:

AI 与智能应用 , 性能优化 , 视频 , OpenAI , AI 成本优化

Play Full Video

#AI 与智能应用# 性能优化# 视频# OpenAI# AI 成本优化

文章评论(0)

暂无评论,快来抢沙发~