Fin Apex 1.0 发布:客服专用模型的胜利——RL 把幻觉降下来,解决率提上去

清风徐来AI 前沿2026-09-181458 阅读💛 271 收藏

一句话结论

Intercom 正式发布自研客服模型 Fin CX Apex 1.0:在一个足够智能的开源权重模型上做监督微调与强化学习,目前每周处理超过一百万次 Fin 对话,在解决率、客户满意度、幻觉率和响应延迟四个维度同时超越此前的通用模型方案——这是”通用模型够用”叙事在客服领域被推翻的标志性证据。

Fin Apex 1.0 发布

路线演变:从通用模型到专用模型

Fin 负责人 Fergal Reid 与模型上线负责人 Pedro 在发布片中交代了完整路线。Fin 早期的做法是用最好的通用模型,效果长期达标。转变发生在自研检索与重排序模型上:为客服场景专门构建的 retriever 和 re-ranker 超出了他们测试过的所有同类模型,这构成了一个越来越强的证据链——要拿到最好的客服效果,必须为这个领域专门构建模型,Apex 就是这条路线的产物。

评估口径:解决率不是唯一指标

Pedro 负责所有上线前模型评估,他的口径值得直接引用:解决率是核心指标但不是唯一指标,他们同时关注 CSAT(客户满意度)、幻觉率和延迟,构成一个指标组合。Apex 的结果是在假设解决与客户正反馈确认解决两个口径上都显著提升,同时 CSAT 改善、幻觉下降、速度更快——四个维度同向改善,而不是牺牲一项换另一项。

训练方法:SFT + RL + 多个奖励模型

训练与评估细节

技术细节上,Apex 构建在一个大型开源权重模型之上(他们同时维护一套适用于多个开源权重模型的通用后训练管线,研发阶段先在较小模型上迭代,临上线前再切换放大)。训练方法为监督微调加强化学习,并为此构建和迭代了多个奖励模型,整个投入持续了大半年。

最有信息量的一条经验:幻觉率的下降是通过强化学习实现的,而这从来没有通过提示词工程达成过。客服场景对幻觉的容忍度天然低于其他领域——模型需要一点世界知识来回答问题,但错误答案的代价极高,提示词调不下去的幻觉,RL 压下去了。

混合策略:专用模型为主,Sonnet 处理难工具调用

上线后的架构不是纯自研:Apex 承担 Fin 的绝大部分流量,但需要复杂工具调用的 Fin Procedures 环节仍然用 Anthropic 的 Sonnet——因为那个环节对多步工具调用的可靠性要求极高。这个混合策略本身就是一份选型参考:按任务环节的特性分配模型,而不是整体绑定单一模型。

对选型的三点参考

百万级周对话规模验证

  1. 通用旗舰模型不再是客服 AI 的默认最优解:当你的场景有明确的对错标准、海量真实对话数据和量化指标(解决率、幻觉率)时,领域后训练的收益已经被 Apex 验证,评估自建方案时应该把”开源权重+后训练”纳入对比。
  2. 幻觉治理优先试 RL 而不是更长提示词:Intercom 的实践表明提示词工程对幻觉的压缩有天花板,如果你们的客服机器人还在靠堆约束性提示词压幻觉,这条经验可以直接改变优化路径。
  3. 指标组合比单一指标更能防止跑偏:只优化解决率会出现”为解决而解决”的作弊式回复,CSAT、幻觉、延迟与解决率同看,是客服模型评估的稳健做法。

Fin Apex 1.0 现已承载 Fin 的绝大部分流量,每周处理超一百万次支持对话。

原文信息

  • 原视频标题:Fin Apex 1.0: The best-performing model for customer service
  • 频道:Intercom
  • 讲者:Fergal Reid(Fin AI 负责人)、Pedro(Fin 核心工作流负责人)
  • 发布日期:2026-03-27
  • 视频时长:6 分 41 秒

文章评论(10

暮临风42 分钟前

赞同,实践出真知。

回复
暮临风44 分钟前

不错不错,已加入书签。

回复
风倚栏8 分钟前

看完了,收获满满,期待更多更新。

回复
星寻梦6 分钟前

支持作者,持续关注中。

回复
云逐月26 分钟前

点赞,必须点赞

回复
星寻梦11 分钟前

作者写得真不错,学到了不少。

回复
雪知秋52 分钟前

很有价值的分享,感谢整理。

回复
墨沐雨47 分钟前

作者写得真不错,学到了不少。

回复
墨沐雨25 分钟前

看完了,收获满满,期待更多更新。

回复
林观澜53 分钟前

整理得太全面了,省了我不少时间。

回复