Fin Apex 1.0 发布:客服专用模型的胜利——RL 把幻觉降下来,解决率提上去
一句话结论
Intercom 正式发布自研客服模型 Fin CX Apex 1.0:在一个足够智能的开源权重模型上做监督微调与强化学习,目前每周处理超过一百万次 Fin 对话,在解决率、客户满意度、幻觉率和响应延迟四个维度同时超越此前的通用模型方案——这是”通用模型够用”叙事在客服领域被推翻的标志性证据。

路线演变:从通用模型到专用模型
Fin 负责人 Fergal Reid 与模型上线负责人 Pedro 在发布片中交代了完整路线。Fin 早期的做法是用最好的通用模型,效果长期达标。转变发生在自研检索与重排序模型上:为客服场景专门构建的 retriever 和 re-ranker 超出了他们测试过的所有同类模型,这构成了一个越来越强的证据链——要拿到最好的客服效果,必须为这个领域专门构建模型,Apex 就是这条路线的产物。
评估口径:解决率不是唯一指标
Pedro 负责所有上线前模型评估,他的口径值得直接引用:解决率是核心指标但不是唯一指标,他们同时关注 CSAT(客户满意度)、幻觉率和延迟,构成一个指标组合。Apex 的结果是在假设解决与客户正反馈确认解决两个口径上都显著提升,同时 CSAT 改善、幻觉下降、速度更快——四个维度同向改善,而不是牺牲一项换另一项。
训练方法:SFT + RL + 多个奖励模型

技术细节上,Apex 构建在一个大型开源权重模型之上(他们同时维护一套适用于多个开源权重模型的通用后训练管线,研发阶段先在较小模型上迭代,临上线前再切换放大)。训练方法为监督微调加强化学习,并为此构建和迭代了多个奖励模型,整个投入持续了大半年。
最有信息量的一条经验:幻觉率的下降是通过强化学习实现的,而这从来没有通过提示词工程达成过。客服场景对幻觉的容忍度天然低于其他领域——模型需要一点世界知识来回答问题,但错误答案的代价极高,提示词调不下去的幻觉,RL 压下去了。
混合策略:专用模型为主,Sonnet 处理难工具调用
上线后的架构不是纯自研:Apex 承担 Fin 的绝大部分流量,但需要复杂工具调用的 Fin Procedures 环节仍然用 Anthropic 的 Sonnet——因为那个环节对多步工具调用的可靠性要求极高。这个混合策略本身就是一份选型参考:按任务环节的特性分配模型,而不是整体绑定单一模型。
对选型的三点参考

- 通用旗舰模型不再是客服 AI 的默认最优解:当你的场景有明确的对错标准、海量真实对话数据和量化指标(解决率、幻觉率)时,领域后训练的收益已经被 Apex 验证,评估自建方案时应该把”开源权重+后训练”纳入对比。
- 幻觉治理优先试 RL 而不是更长提示词:Intercom 的实践表明提示词工程对幻觉的压缩有天花板,如果你们的客服机器人还在靠堆约束性提示词压幻觉,这条经验可以直接改变优化路径。
- 指标组合比单一指标更能防止跑偏:只优化解决率会出现”为解决而解决”的作弊式回复,CSAT、幻觉、延迟与解决率同看,是客服模型评估的稳健做法。
Fin Apex 1.0 现已承载 Fin 的绝大部分流量,每周处理超一百万次支持对话。
原文信息
- 原视频标题:Fin Apex 1.0: The best-performing model for customer service
- 频道:Intercom
- 讲者:Fergal Reid(Fin AI 负责人)、Pedro(Fin 核心工作流负责人)
- 发布日期:2026-03-27
- 视频时长:6 分 41 秒
赞同,实践出真知。
不错不错,已加入书签。
看完了,收获满满,期待更多更新。
支持作者,持续关注中。
点赞,必须点赞
作者写得真不错,学到了不少。
很有价值的分享,感谢整理。
作者写得真不错,学到了不少。
看完了,收获满满,期待更多更新。
整理得太全面了,省了我不少时间。