LangSmith Fine-Tuning 正式发布

📌 One-Sentence Summary
LangChain 推出 LangSmith Fine-Tuning 和 `smithtune` CLI,使开发者能够通过 Fireworks 或 Baseten 将智能体轨迹无缝转换为自定义微调模型。
📝 Summary
LangChain 推出了 LangSmith Fine-Tuning 及其配套的 CLI 工具 `smithtune`,旨在简化 AI 智能体监督微调(SFT)的端到端流程。该工具允许团队从 LangSmith 追踪(traces)中筛选「黄金」轨迹、准备数据集,并利用 Fireworks 或 Baseten 的托管基础设施训练模型,最后在 LangSmith 中评估结果。通过利用精确的轨迹数据(记录了模型在每一步看到的准确上下文),开发者可以创建专业化模型,这些模型在任务准确率上通常优于通用前沿模型,同时能降低延迟和运营成本。针对内部智能体(Engine 和 OpenSWE Review)的实际测试表明,任务得分和效率显著提升,例如在提高 F1 分数的同时,将模型调用次数减少了近 30%。
💡 Main Points
通过 `smithtune` CLI 实现端到端 SFT 工作流
该 CLI 集成了基于 LangSmith 轨迹的数据集创建、通过 Fireworks/Baseten 进行的托管训练以及自动化评估,消除了手动构建数据管道和管理 GPU 基础设施的需求。
基于轨迹的数据对智能体训练至关重要
与简单的消息列表不同,LangSmith 轨迹保留了每一步中准确的工具可用性和上下文,这对于 SFT 准确地教会学生模型如何模仿成功的教师行为至关重要。
通过专业化实现性能提升
内部基准测试显示,SFT 可以将性能推向超越提示词/框架工程的极限,例如 Engine 智能体(Kimi K3 + SFT 得分为 96.0,而基础 Kimi 为 90.0)。
生产环境中的效率提升
微调可以在保持或提高质量的同时降低资源消耗;对于 OpenSWE Review,SFT 将 F1 分数从 48.9% 提升至 53.7%,同时减少了约 30% 的模型和工具调用。
数据选择在后训练中的关键作用
作者强调训练集的质量是性能提升的主要驱动力,建议领域专家使用智能体来筛选并过采样高价值的追踪数据。
💬 Key Quotes
一个基于你的示例训练的模型,在特定任务上的表现通常与通用前沿模型相当甚至更好,且通常具有更低的成本和延迟。
LangSmith 的轨迹格式精确记录了模型在每一步看到的内容,因此 smithtune 可以将每个动作与其真实的上下文配对。
我们一致发现,最成功的后训练运行来自于在训练数据选择上投入时间。
📊 Article Meta
AI Screening: 86
Source: LangChain Blog
Author: Ankush Gola
Category: 人工智能
Language: 英文
Read Time: 7 min
Word Count: 1537
Tags:
AI 与智能应用 , 模型训练与推理 , 后训练 , AI 工程 , AI Agent
很有价值的分享,感谢整理。
作者写得真不错,学到了不少。
思路清晰,干货满满。