用 NVIDIA Data Designer 教智能体学会搜索:Dhruv Nathawani 的数据构建实战

清风徐来行业资讯📡 BestBlogs·全站精选⭐ 912026-10-12968 阅读💛 193 收藏
用 NVIDIA Data Designer 教智能体学会搜索:Dhruv Nathawani 的数据构建实战

📌 One-Sentence Summary

NVIDIA 研究员 Dhruv Nathawani 演示如何用图谱种子生成多跳搜索题和工具调用轨迹,将目标搜索行为转化为可复现的智能体训练数据流程。

📝 Summary

Nathawani 介绍 NVIDIA 开源的 NeMo Data Designer,示范如何把目标智能体行为变成可版本化的数据流水线。工作坊先组合种子、采样、生成和质量评判等列,构建多样的问答记录;随后通过 MCP 连接搜索工具,收集智能体的搜索轨迹。面对更难的搜索任务,团队利用 Wikidata 图谱中的多跳路径生成谜题,让答案依赖实际检索,而非模型凭记忆猜出。讲者依次展示候选问题生成、搜索执行、证据 URL 收集,以及为监督微调筛选记录的过程。他称相关训练让 BrowseComp 成绩从 0% 提升到 30%,但约 5 万个初始种子最终只留下约 7000 条高质量完整样本。数据验证占了分享的重要篇幅:图谱事实可能过期,严格字符串匹配可能误判正确答案,LLM 评判结果也应交由人工抽查。他建议优先增加策略多样性,使用成本最低且适合任务的列类型,预览样本,超量生成后严格筛选,并把流水线作为可共享代码保留。成绩提升属于讲者陈述,转录未给出完整实验控制条件。

💡 Main Points

把期望的搜索行为转化为可复现的数据流水线。

Data Designer 组合可选的种子、受控采样器、LLM 生成列和质量评判;流水线本身能像代码一样共享和管理版本。

用图谱路径设计真正需要搜索工具的任务。

Wikidata 的多跳路径提供有现实依据的实体与关系,生成难以单靠记忆作答的谜题,再通过 MCP 搜索形成工具调用轨迹。

训练前对生成轨迹进行严格筛选。

讲者称约 5 万个种子最终筛出约 7000 条完整监督微调样本,强调多样性、预览、答案核验,以及对自动评判结果的人工复核。

把过期事实和不完善的验证器视为数据风险。

图谱答案可能不再符合现实,机械匹配也可能漏掉正确答案;解释训练集质量或基准成绩前,需要结合多种检查方法。

💬 Key Quotes

多样性、多样性、多样性,这才是最重要的。

生成数据时,数据质量是最重要的。

先求多样性,再求数量。

本质上,我们是在编写能够生成数据的代码。

📊 Article Meta

AI Screening: 91

Featured: Yes

Source: AI Engineer

Author: AI Engineer

Category: 人工智能

Language: 英文

Read Time: 38 min

Word Count: 9273

Tags:

AI 与智能应用 , 合成数据 , 数据工程 , AI Agent , MCP协议

Play Full Video

#AI 与智能应用# 合成数据# 数据工程# AI Agent# MCP协议

文章评论(0)

暂无评论,快来抢沙发~