Sierra 智能体监督层校准方法:LLM 评审员先测一致性再上岗,用标注对话迭代定义直至模型稳定 agreeing
一句话结论
智能体能独立思考并采取行动,天然适合应付真实世界对话的杂乱,但同样的适应性也让它难以评估——智能体可能一秒内就回复,却漏掉客户早已提供的关键信息,或看不出对方正在变得不耐烦。
Sierra 的监控器(Monitors)是全天候评估层,用 LLM 当评审员复核每一段对话,让企业持续追踪智能体质量与客户情绪。由此引出关键问题:谁来评估这些评估者?Sierra 的答案是每个监控器都要经过一套基于人工标注对话与模型一致性的严格评估循环,达标才进生产。
可信的监控器怎么建
以零售企业的”订单在哪”(WISMO)流程监测客户挫败感为例。一段典型对话:用户问订单在哪、本该昨天到;智能体请用户确认订单号;用户说上面已经给过了;智能体再次索要订单号;用户回复”求求你直接给我退货吧”。
用户明显在失去耐心,但信号很微妙:有礼貌用语、没有脏话或明确投诉,只有讽刺和从查订单到要求退货的话题转移。捕捉这类细节很难,要求监控器被精确训练成知道该找什么、什么时候找——这就是评估循环要解决的事。

每个监控器从一份精确的行为定义起步,定义锚定在从真实对话中人工筛选的示例上。多个模型分别评估这些对话,输出与团队标注比对:出现分歧,往往暴露定义太宽、太窄或缺上下文;这些边界案例回填进训练集和评估集,直到模型持续一致,且每个标记背后的推理清晰可见。
准确性还不是全部:每段被标记的对话都会展示监控器的判定理由,让复核人员看到它抓住了什么,再决定是否采取行动。
按业务定制监控器
Sierra 内置了针对常见问题的开箱监控器:循环回复、挫败感上升、错误转接。但每个业务都有自己产品和政策特有的行为。Agent Studio 提供自然语言界面,让团队为关心的信号创建自定义监控器。

自定义监控器定义后要走与 Sierra 官方监控器相同的评估流程。实际用例:
- 一家金融服务公司标记未经授权的投资建议或引发公平放贷担忧的表述。
- 一家医疗机构确认敏感通话被路由到正确的临床路径。
- 一家旅行公司监测智能体是否总在对话的正确时机主动亮出会员权益。
智能体质量飞轮
监控器最初是 Sierra 的全天候评估层,持续复核每段对话并把需要关注的挑出来。现在它是更大的质量改进循环的一环:监控器指出智能体哪里可以改进,Explorer 帮团队理解这些行为为何出现,Ghostwriter 让依据洞察快速落地修改。三者构成”构建、观察、理解、改进”的持续飞轮。
自建 AI 客服智能体的团队可以把这套校准方法直接迁移:先用人工标注的对话样本测试评审模型的一致性,分歧样本回填迭代,评审员稳定后再接入自动化工作流持续监控——这比直接上线一个未经校准的 LLM 评审员可靠得多。
原文信息
- 作者:Colin VanLang、Darshdeep Hora(Sierra)
- 发布时间:2026-05-07
- 原文标题:Who monitors the monitors?
原文地址:
暂无评论,快来抢沙发~