团队分享提升 Agent Harness Token 效率的提示词 · AIHOT

📌 One-Sentence Summary
来自一个生产级编码智能体团队的详细提示词模板,阐述了如何在不损失质量的前提下将每任务 token 成本降低约 7%,涵盖提示词精简、工具卸载、缓存布局与子智能体调优。
📝 Summary
本文提供了一套可复用的提示词,旨在帮助开发者优化 LLM 智能体 harness 的 token 效率。基于一个生产级编码智能体及其多智能体实验的经验,文章给出了一套结构化方法论:首先对 harness 进行埋点,按计费类型和缓存命中情况测量 token 用量,然后按支出占比、可压缩性和质量风险对优化机会进行优先级排序。关键技术包括:将系统提示词精简为平实的描述而非命令;将低频工具 schema 卸载到按需发现机制(在使用这些工具的会话中,工具描述 token 减少 60%,总 token 减少 46.9%);通过显式断点安排对缓存友好的请求前缀;将大型工具输出写入文件而非截断;以及调优子智能体和模型路由。该团队实现了约 7% 的整体 token 成本降低,且没有质量损失。文章还涵盖了若干陷阱,例如要求模型节省 token、截断输出,以及对字面型模型使用过度强调,并建议以每完成任务成本作为主要指标进行 A/B 测试。
💡 Main Points
优化每完成任务的 token 成本,而非每次请求的成本,并按计费类型对 token 加权。
每一轮都会重新发送前缀(工具、指令、设置、对话历史),因此缩减单次请求却增加轮数可能反而更贵。输出、未缓存输入和缓存输入的价格差异很大,因此必须按任务衡量成本并据此加权。
改变的是 harness 发送的内容,而不是模型有多努力;有能力的模型需要的是定义,而不是命令。
告诉模型「节省 token」会让它不愿承担有挑战性的任务,有时甚至直接放弃。将「不要/必须/重要」这类清单替换为对工具功能的平实描述后,系统提示词缩减了约三分之二,且在多个模型家族上都有效。
将低频工具 schema 从静态上下文卸载到按需发现机制。
除核心工具集之外,大多数工具在不到 20% 的对话中才会被用到。将它们移出静态上下文后,工具描述 token 减少了 60%;对于 MCP 服务器这类集成工具,仅在上下文中保留名称、将完整 schema 存放在按服务器划分的文件夹中,在使用这些工具的会话中总 token 减少了 46.9%。
安排请求以实现最大缓存复用,并通过写入文件来处理大型输出。
将请求顺序安排为工具 → 系统指令 → 断点 → 设置 → 断点 → 对话,保持前缀逐字节一致,并使用显式断点,可将冷缓存未命中减少 20%。大型工具输出应写入文件并返回路径、大小和尾部内容,因为截断会丢失数据,而内联则会让后续每次请求都变得臃肿。
调优子智能体、模型路由和推理连续性,以降低整棵调用树的成本。
在大型多智能体运行中,worker 至少消耗了 69% 的 token。前沿规划器搭配廉价 worker 能以约八分之一的成本达到前沿级效果,但规划器的选择会影响 worker 的 token 用量,因此必须衡量整棵调用树。回传推理项至关重要:丢弃它们会让一个推理模型在编码基准测试上损失 30%。
💬 Key Quotes
改变的是 harness 发送的内容,而不是模型有多努力。不要要求模型节省 token。
有能力的模型需要的是定义,而不是命令。
按任务衡量,而不是按请求衡量。
工具 schema 会随每个请求一起传输。除核心工具集之外,大多数工具在不到 20% 的对话中才会被用到,而将它们移出静态上下文后,工具描述 token 减少了 60%。
丢弃它们会让一个推理模型在编码基准测试上损失 30%,而且它还会消耗 token 来重建自己的计划。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: AIHOT — 精选
Author: noreply@aihot.news (X:Eric Zakariasson (@ericzakariasson))
Category: 人工智能
Language: 英文
Read Time: 22 min
Word Count: 5266
Tags:
AI 与智能应用 , AI Agent , AI 编程 , 提示工程 , Agent编排
讲解得很细致,新手也能看懂。
赞同,实践出真知。
楼主辛苦了,内容很有参考价值。
整理得太全面了,省了我不少时间。
很有价值的分享,感谢整理。
作者写得真不错,学到了不少。
刚好最近在找这方面的资料,太及时了。
实测过类似工具,作者说的基本属实。
很有价值的分享,感谢整理。
看完了,收获满满,期待更多更新。
收藏了,以后慢慢研究。
收藏了,以后慢慢研究。