Fin 对话 Anthropic:AI 客服的信任工程——从「不知道就说不知道」到按结果付费

AI小蝌蚪AI 前沿2026-09-18933 阅读💛 227 收藏

一句话结论

Intercom COO Jordan Neil 与 Anthropic 数字原生业务负责人 Ryan O’Halleran 在巴黎对谈,把 AI 客服的”信任”从口号拆成了可执行的工程问题:Fin 在 2023 年的最大创新是”不知道就说不知道”,商业模式上只对解决了的对话收费,产品上用程序描述、仿真测试和可观测性工具让企业逐步交出信任。Intercom 自己的客服已有 82% 由 Fin 自主完成,人力团队两年规模不变而对话量翻了三倍——信任不是氛围,是被设计出来的。

Fin x Anthropic 巴黎对谈现场

对谈背景与两位讲者

这是 Fin 在巴黎办的线下活动实录,全场约一小时,含约十五分钟观众问答。Jordan Neil 是 Intercom COO,自 2023 年 Fin 立项起深度参与产品设计、构建与上市,自称”Fin 就是我的生活”;Ryan O’Halleran 负责 Anthropic 的数字原生业务,入职一年多——他提到一个数字:这一年多的时间已经超过 Anthropic 全公司 70% 员工的司龄,可见这家公司的扩张速度。对谈围绕一个主题展开:在 AI 智能体直接面对客户的场景里,信任如何被建立、被定价、被规模化。开场的一个现场细节佐证了听众成色:举手调查里,在场多数人已经在用 Claude,Fin 的重度用户也不在少数——这场对谈讲的是前沿用户关心的真问题,不是入门科普。

信任的第一性问题:外部用户无法评估答案对错

Jordan 提出了一个区分内部与外部 AI 使用的核心框架:如果你在内部用 Claude Code 或自建智能体,用户是专家,答案稍有偏差也能识别、修正,仍然有用;但 Fin 面对的是企业终端客户——他们无法评估答案是否正确。这带来了本质上更高的标准:Fin 代表你的品牌、替你跟客户说话,出了错客户不会怪 AI,只会怪你的公司。

Ryan 从 Anthropic 一侧补充了基础层的做法:信任与安全不是营销词,而是被构建进产品的硬约束——如何限制幻觉、如何限制面向客户的风险。他举了一个信任积累的例子:Spotify 基于 Claude 构建了内部代码现代化工具,Spotify CEO 在财报电话会上说”我们从去年 12 月起没再手写过一行代码”——没有对供应商近乎完全的信任,不可能出现这种公开背书。

 constitutional AI 与信任基础

「不知道就说不知道」:Fin 2023 年的最大创新

对”怎么让 AI 客服可信”这个问题,Jordan 给出的答案出乎意料地朴素:Fin 在 2023 年初发布时,最大的创新不是多会答题,而是会说”我不知道”。当时让大模型不讨好用户、不硬编一个看似合理的答案极其困难——现场有人打趣”猜猜我的生日”,365 分之一的命中率对聊天机器人无所谓,对客服就是事故。让 Fin 在不确定时闭嘴并转人工,是信任的第一块基石。

Ryan 从销售视角补了一个共鸣:AI 出现之前他带销售团队时就常讲”你能对客户说的最有力量的一句话就是’我不知道’“——在电话上滔滔不绝假装懂、下次再找补,是最伤信任的行为。Anthropic 把这个原则做进了模型的底层:宪法 AI(Constitutional AI)让模型在生成时对照联合国人权宣言、通用信任与安全原则等基础文档自我校验,从机制上抑制”硬编答案”的倾向。

Jordan 给出的 Intercom 版本类比是:Fin 上班第一天就应该是一名有经验的客服代表——它预装了多年好客服的常识,你永远不需要告诉它”别对客户爆粗口”,你只需要把精力全部花在训练它”你们公司怎么定义好的客户体验”上。

按结果付费:把信任写进商业模式

按解决付费的商业模式

对谈中最有厚度的一段是定价与信任的关系。Fin 的收费模式是:对话被 Fin 解决才收费,没解决不收费。Jordan 交代了这个模式上线时的争议——内部觉得疯狂,行业觉得不可理喻,因为当时行业平均解决率只有 25% 上下,等于大量工作白干。

但这个模式把各方激励扭到了同一个方向:客户只为价值付费,没有传统 SaaS 按席位收费的”死收入”;销售团队被激励去帮客户真正用成功,而不是卖完就走;研发团队的目标清晰——把解决率做上去。截至目前 Fin 平均解决率约 70%,自发布起大约每月提升一个百分点,验证了当初的赌注。

Ryan 介绍了 Anthropic 侧的对应实践:API 的按用量计费降低了试验门槛——欧洲某大型银行的高管用 Lovable 一小时生成界面原型给团队演示,这种”一小时内从想法到可演示 MVP”在按席位付费时代不可能发生。Intercom 内部也做了同样选择:全员铺开 Claude Enterprise 时,他们在按席位和按 token 两种模式里选了后者——因为按席位就要纠结”这个人值不值得给一个账号”,按用量则可以全员开放,用得多付得多,没有闲置成本。

监管行业案例:处方续签里的信任边界

监管行业的人机边界

两位讲者用医疗与金融案例说明信任的”边界工程”。美国一家医疗公司用 Fin 辅助处方续签:Fin 负责所有重活——帮患者把续签请求流程变得尽可能顺畅、辅助判断这是否正确的事——但 Fin 不做是否发放的决定,而是把整理好的信息打包交给临床医生,由人做最终决定并承担责任。Fin 不给临床建议、不给金融建议,这些护栏是内置的,不是客户配置出来的。

面对”创新速度这么快,客户会不会更难信任”的提问,Ryan 的回答浓缩成一句话:安全不等于慢。他援引在 Stripe 的经历做类比——Stripe 在拿到 SOC 2 Type 2 认证之前,说服大客户规模化合作极其艰难;拿到之后它变成一个复选框。宪法 AI、信任与安全框架、推动监管的做法,本质上是在给客户内部的决策者”弹药”——让他们能在自己的组织里理直气壮地做对的决定。Jordan 侧的对应做法是把交付速度转化为客户的采用工具:Fin 是这个领域唯一有自服务产品的玩家,八千家客户里既有 Snowflake 也有两人初创,靠的是大量自助理解、采纳、信任新功能的工具——发布节奏快到销售和客户成功团队自己都跟不上,就必须让工具替人完成教育。

Ryan 补充了行业侧的观察:最前沿的监管行业公司不只在使用 AI,还在和本国监管机构一起思考如何适应这项技术;Anthropic 的领导层也在持续推动监管与安全框架。去年企业的主题是”从试点到生产”,今年的主题变成了”受监管行业里百万级客户在生产环境用我的产品,我还能睡得着觉”——这个转变本身就是信任基础设施成熟的标志。

Jordan 同时点出安全与效用的张力:最安全的做法是让 Fin 只复述帮助中心的原文,但那样效用有限;Fin 最好的体验恰恰来自它基于上下文做出的合理推断(A 对、B 对,所以 C)。信任工程的本质是在推断空间里画出精确的边界,而不是把推断整个砍掉。

信任的日常维护:程序描述与仿真测试

程序描述与仿真测试工具链

Jordan 详细展开了 Fin 交付信任的工具链,这部分对运营者最具实操价值。Fin Procedures 允许企业用自然语言描述流程(第一步到第五步),Fin 智能体化执行——能跳过它确定不需要的步骤、需要时回头澄清。难点在于人本身写不清楚流程:他给了一个类比——把你的退款流程写在纸上交给一千个聪明的人类客服,他们能一致执行吗?大概率不能。

于是 Intercom 做了”AI 套 AI”的三层工具:AI 助手帮你写程序;你可以为程序写仿真测试(“这类客户在这种场景下,必须出现这个结果”),Fin 会模拟终端用户、给出回应并自我评判,循环验证可靠性;测试失败时,另一个 AI 帮你定位是程序写错了还是测试写错了。配合可观测性工具,企业能看到 Fin 和人类各自在做什么、哪里出错、何时介入。这套东西解决的是信任的日常维护问题——上线时的信任只是起点,每次改动的信任回归才是长期成本。

规模证据:82% 自主解决率的组织样本

对谈里数据密度最高的一段是 Intercom 自身的运营。Jordan 给出:Intercom 自己的客服有 82% 由 Fin 自主完成;人类客服团队规模与两年前持平,预计一年后仍持平,而同期对话量翻了三倍;人类客服在需要出场时能给出更快、更高质量的响应,甚至有时间上电话。中位数客户在交给 Fin 的对话上看到约 70% 的解决率——还有很多对话没交给 Fin,瓶颈不是技术而是信任本身。

往 90% 解决率推进的具体计划里,最大的卡点出人意料:不是模型能力,而是工程资源——Fin 要接入企业内部系统拿数据、执行动作,需要内部 API,而工程团队自己的产品路线都排满了。两个可能的解锁方向:Claude Code 让 Intercom 自己的这条支持路线图建设大大提速;以及 computer use——直接给 Fin 一个内部工具的登录权限让它自己点按钮,绕过 API 建设。computer use 此前受限于速度、成本与可靠性,现在已经”好到可以考虑”,剩下的门槛又是信任:客服团队要说服工程团队”给我的 AI 完全的内部工具访问权限,没事的”。

企业采用的内卷与分化

一个反直觉的观察:企业规模并不决定采用速度。有狂奔的巨头,也有恐惧迟缓的中小企业;Jordan 的总结是”未来已来,只是分布不均”。企业侧的普遍路径是先内部用(Claude Code、内部数据分析),建好评估体系和追踪能力后再推向外部客户场景——L’Oreal 的对话式分析工具、SAP 给咨询师用的 Joule 都是内部先行再外化的例子。

内部提效的实证:从 L’Oreal 到 Intercom 自家团队

对谈中双方各自给出了内部 AI 提效的一手案例。Ryan 最喜欢的是 L’Oreal:作为 Anthropic 的早期采用者,他们基于 Claude 构建了对话式分析工具。这个场景戳中所有非技术岗位的痛点——销售和市场负责人拿不到数据,不是数据不存在,而是”我不会写 SQL、没权限访问数据库、得给运营团队提需求排队”。有了对话式分析,同一句话直接变成结果:“给我看我们团队过去 12 个月关了哪些单、分布在哪些行业”,Claude 自己去查数据、出结论,甚至当天就能带着漂亮的图表上会——过去这个流程要以天计。

Intercom 自己是更完整的样本。Jordan 透露工程团队用 Claude Code 在几个月内实现了产出翻倍,而且使用已经扩散到全公司:客户成功经理做工作归因、财务规划团队做分析,人人都在用。他把这种扩散总结为一个精准的框架:AI 是个人能动性的放大器——过去你有个想法,卡在”要等别人审批、等别人排期”上;现在高能动性的人自己就能把事情做完。Anthropic 侧的观察互相印证:一家欧洲银行峰会上,一位非技术出身的高管用 Lovable 一小时生成了产品界面原型拿去给团队演示——概念验证的门槛被压到了”一次尝试”的成本。

护城题问答:做足够大的端到端工作

现场关于”在模型厂商之上创业如何建立护城河”的问答值得单独记录。Jordan 的回答分两层。第一层是战略:如果要做 B2B 的 AI 业务,必须瞄准尽可能大、尽可能端到端的工作——“能做完你整个客服的产品,从根本上优于只能辅助你人类的副驾驶产品”。做得足够大、足够深,别人才无法简单复制你做的那一小块。但这带来一个危险区:问题足够大之后,你会进入 OpenAI 或 Anthropic 这类顶级掠食者的视野——它们有巨大的野心和估值,最终会来攻你的市场。所以创业公司的生存空间是”大到能活、又没大到被正面碾压”的窄带。

第二层是执行:极端聚焦在一个具体路径上。Ryan 的补充来自一线观察:他接触的 Claude Code 用户里 90% 同时也在用 Cursor——人们爱 Claude Code 的命令行专注开发者体验,Cursor 补足周边需求,通常是两三个工具并存而非一家通吃。垂直深耕的例子是法律 AI 的 Harvey:他们的销售团队有和律师打交道的独特能力、懂律所内部的销售流程,这种”非常具体”的Know-how是通用模型厂商难以复制的。Jordan 最后还披露了一个范围感数字:客服体验占全球所有知识工作的 40%–50%,专注这一个岗位已经足够大,不需要再横向扩张。

内部推广:降低首次尝试门槛与绩效挂钩

被问到”怎么说服普通员工用 AI”时,Jordan 给了两个抓手。其一是把首次体验的摩擦压到接近零:Intercom 内部做了”Claude for Data”——一个包着 Claude 的薄壳,封装好所有配置、技能和 MCP,员工直接问”我下周要跟客户做业务回顾,帮我准备”,Claude 自己去 Snowflake 拉数据、分析、给结论。任何人只要经历过一次这种”啊哈时刻”,之后自然会越问越深。其二是绩效挂钩:去年夏天开始,工程团队把”是否有效使用 AI”纳入绩效评估——先是”不用 AI 拿不到超出预期”,很快会变成”不用 AI 连符合预期都拿不到”。

他还补了一个教育视角:Intercom 的支持团队负责人在帮其他大企业理解”岗位将如何变化、组织结构如何随 AI 演化”——甚至 Anthropic 自己的客服团队都在参照 Intercom 的支持组织结构做重组。一个有趣的循环:模型厂商教会了应用厂商怎么用 AI,应用厂商反过来教模型厂商怎么组织 AI 时代的客服团队。Ryan 则介绍了 Anthropic 内嵌在 GTM 组织里的”有益部署”团队:专门在大学、发展中国家、艺术机构等不以收入为目标的场景部署 AI——把它放在 GTM 组织内而非独立公益部门,本身就是一种结构选择。

两人的共识是:推广必须自上而下与自下而上在中间相遇。高层强推会遇到执行层抵制,纯自发生长又缺少预算与授权;最理想的形态是日常使用者真心觉得有价值、同时 C 级层面把它当战略项目签单推进。

未来:销售、成功与”角色融合”的猜想

Jordan 的收尾展望信息量很大。第一,客户服务这个岗位”基本已被攻克”(技术侧),剩下的是把人带到技术面前。第二,Fin 正在获得更高风险的授权:进入销售与客户成功——直接创造收入的场景信任门槛更高,但上限也更高,Fin 正在被训练成优秀的 SDR(销售开发)、AE(客户经理)和 CSM(客户成功经理)。第三,一个组织结构层面的猜想:过去客服按邮件/电话/在线分团队、按一二三级分层的结构,本质是人类产能约束的产物——你能同时处理二十封邮件但只能接一通电话,于是就有了不同的团队、不同的管理链、不同的 KPI;AI 智能体没有这些约束,一个 Fin 同时做邮件、在线和语音反而是自然状态,销售、支持、成功之间的边界可能同样是历史偶然——客户体验的组织形态会被重新设计。他给了一个范围感:客服体验大约占全球知识工作的一半,这已经是足够大的战场,刻意专注不横向扩张本身就是战略选择。

对谈收尾:信任只会越来越重要

两位讲者对”信任是不是阶段性话题”的回答一致:信任是入场券,但重要性只增不减——Fin 承担的工作越多、赌注越高,信任的门槛就越高。这不是一个会被”解决”然后翻篇的问题,而是持续升高的水位线。

可复用的五点

  1. 让 AI 客服学会说”我不知道”:把”不确定就转人工”做成硬性行为而不是提示词期望,是所有对话式 AI 的信任第一课。
  2. 按结果付费对齐激励:无论对外采购还是对内立项,“解决了才计费/才算产出”的机制设计能把 AI 项目的各方利益拉到同一侧。
  3. 为流程写仿真测试:描述业务流程后,先写”这类输入必须出这类结果”的仿真用例循环验证,再灰度上线——这是 AI 流程自动化独有的质量保障层。
  4. 内部工具的低摩擦壳是推广关键:把配置、数据连接、技能全部封装好,让非技术员工的第一个问题就能得到端到端结果,比培训课程有效得多。
  5. 把 AI 使用纳入绩效:从”用了加分”过渡到”不用扣分”,配合自下而上的自然采用,是组织 AI 渗透率最直接的推进器。

原文信息

  • 原视频标题:Fin x Anthropic: Building Trust in AI Agents | Paris | March 2026
  • 频道:Intercom
  • 讲者:Jordan Neil(Intercom COO)、Ryan O’Halleran(Anthropic 数字原生业务负责人)
  • 发布日期:2026-04-07
  • 视频时长:63 分 54 秒

文章评论(1

暮拾贝9 分钟前

这个比较实用,已转发给同事。

回复