LangSmith Fine-Tuning 正式发布

山止川行AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-251187 阅读💛 206 收藏
LangSmith Fine-Tuning 正式发布

📌 One-Sentence Summary

LangChain 推出 LangSmith Fine-Tuning 和 `smithtune` CLI,使开发者能够通过 Fireworks 或 Baseten 将智能体轨迹无缝转换为自定义微调模型。

📝 Summary

LangChain 推出了 LangSmith Fine-Tuning 及其配套的 CLI 工具 `smithtune`,旨在简化 AI 智能体监督微调(SFT)的端到端流程。该工具允许团队从 LangSmith 追踪(traces)中筛选「黄金」轨迹、准备数据集,并利用 Fireworks 或 Baseten 的托管基础设施训练模型,最后在 LangSmith 中评估结果。通过利用精确的轨迹数据(记录了模型在每一步看到的准确上下文),开发者可以创建专业化模型,这些模型在任务准确率上通常优于通用前沿模型,同时能降低延迟和运营成本。针对内部智能体(Engine 和 OpenSWE Review)的实际测试表明,任务得分和效率显著提升,例如在提高 F1 分数的同时,将模型调用次数减少了近 30%。

💡 Main Points

通过 `smithtune` CLI 实现端到端 SFT 工作流

该 CLI 集成了基于 LangSmith 轨迹的数据集创建、通过 Fireworks/Baseten 进行的托管训练以及自动化评估,消除了手动构建数据管道和管理 GPU 基础设施的需求。

基于轨迹的数据对智能体训练至关重要

与简单的消息列表不同,LangSmith 轨迹保留了每一步中准确的工具可用性和上下文,这对于 SFT 准确地教会学生模型如何模仿成功的教师行为至关重要。

通过专业化实现性能提升

内部基准测试显示,SFT 可以将性能推向超越提示词/框架工程的极限,例如 Engine 智能体(Kimi K3 + SFT 得分为 96.0,而基础 Kimi 为 90.0)。

生产环境中的效率提升

微调可以在保持或提高质量的同时降低资源消耗;对于 OpenSWE Review,SFT 将 F1 分数从 48.9% 提升至 53.7%,同时减少了约 30% 的模型和工具调用。

数据选择在后训练中的关键作用

作者强调训练集的质量是性能提升的主要驱动力,建议领域专家使用智能体来筛选并过采样高价值的追踪数据。

💬 Key Quotes

一个基于你的示例训练的模型,在特定任务上的表现通常与通用前沿模型相当甚至更好,且通常具有更低的成本和延迟。

LangSmith 的轨迹格式精确记录了模型在每一步看到的内容,因此 smithtune 可以将每个动作与其真实的上下文配对。

我们一致发现,最成功的后训练运行来自于在训练数据选择上投入时间。

📊 Article Meta

AI Screening: 86

Source: LangChain Blog

Author: Ankush Gola

Category: 人工智能

Language: 英文

Read Time: 7 min

Word Count: 1537

Tags:

AI 与智能应用 , 模型训练与推理 , 后训练 , AI 工程 , AI Agent

#AI 与智能应用# 模型训练与推理# 后训练# AI 工程# AI Agent

文章评论(3)

暮拾贝40 分钟前

很有价值的分享,感谢整理。

回复
墨沐雨1 小时前

作者写得真不错,学到了不少。

回复
风倚栏1 小时前

思路清晰,干货满满。

回复