TraceCompiler:通过技能引导的 LLM 智能体轨迹挖掘与编译,构建近乎确定性的工作流

📌 One-Sentence Summary
TraceCompiler 通过唯一值归属严格验证工具间的依赖关系,从嘈杂的 LLM 智能体执行轨迹中挖掘并编译出近乎确定性的工作流。
📝 Summary
本文介绍了 TraceCompiler,一个旨在将使用工具的 LLM 智能体产生的重复且嘈杂的执行轨迹转换为可执行且近乎确定性的工作流的系统。其核心创新在于严格的依赖挖掘规则:仅当消费者参数包含一个唯一可归因于先前生产者输出的值时,才承认两个工具之间存在边。这种方法过滤掉了偶然的顺序和重试,确保编译后的工作流可审计且可靠。作者在 T1 数据集上对该方法进行了评估,与基于邻接或频率的基准方法相比,在恢复生产者-消费者依赖方面实现了极高的精确率 (0.928) 和召回率 (0.943)。在 AppWorld 上的进一步验证显示,Token 边恢复的精确率接近完美。案例研究表明,对于简单意图(如 Venmo),API 调用次数显著减少;而对于具有不可逆副作用的复杂意图,系统会正确地拒绝编译以维持安全性。研究强调了灵活性与确定性之间的权衡,认为从轨迹中提取的可验证结构可以在不完全依赖执行时 LLM 推理的情况下增强智能体的可靠性。
💡 Main Points
严格的值归属规则实现了从嘈杂轨迹中可靠地挖掘依赖关系。
TraceCompiler 仅在消费者参数包含一个唯一可归因于先前生产者的值时,才承认工具间的依赖关系。该机制有效地将真实的数据流与偶然的顺序或重试区分开来,为每条硬边提供了可审计的证据元组。
编译后的工作流在保持正确性的同时,显著降低了运行时开销。
在 Venmo 资金请求意图等案例研究中,系统将观察到的 34 次 API 调用减少到 11 次运行时调用。然而,对于关键分支未被观察到或涉及不确定不可逆副作用的意图,系统会正确地拒绝编译,将安全性置于覆盖率之上。
该方法在依赖恢复准确率方面优于传统的启发式方法。
在 T1 数据集上,该机械化规则实现了 0.928 的精确率和 0.943 的召回率,显著高于基于邻接 (0.711 F1) 或频率阈值的衡量方法。在部分边的盲编译技能运行中,精确率进一步达到了 0.992。
💬 Key Quotes
「它仅在消费者参数包含一个唯一可归因于先前生产者的值时,才承认工具间的依赖关系;每条硬边都携带一个可审计的证据元组,而模糊的关系被标记为可疑,不施加顺序约束。」
「对于一个忧心忡忡的所有者来说,一个 95% 的时间很聪明但在另外 5% 的时间里自信地犯错的模型,比一个始终表现良好但平庸的表格要糟糕得多。」
「我们衡量了调用次数的减少,但没有衡量离线编译成本,因此我们不主张净效率结果。」
📊 Article Meta
AI Screening: 86
Source: Hacker News - Newest: "LLM"
Author: nlpnerd
Category: 人工智能
Language: 英文
Read Time: 2 min
Word Count: 402
Tags:
AI 与智能应用 , AI Agent , AI 工程 , LLM 推理优化 , Agent编排
收藏了,以后慢慢研究。
作者写得真不错,学到了不少。
看完了,收获满满,期待更多更新。
收藏了,以后慢慢研究。
写得挺用心的,支持一下。
实话,说的不明不白
讲解得很细致,新手也能看懂。
收藏了,以后慢慢研究。
整理得太全面了,省了我不少时间。
赞同,实践出真知。
这个观点很中肯,深有同感。
写得挺用心的,支持一下。