Fin 对话 Anthropic:AI 客服的信任工程——从「不知道就说不知道」到按结果付费

AI小蝌蚪AI 前沿2026-09-18938 阅读💛 227 收藏

一句话结论

Intercom COO Jordan Neil 与 Anthropic 数字原生业务负责人 Ryan O’Halleran 在巴黎对谈,把 AI 客服的”信任”从口号拆成了可执行的工程问题:Fin 在 2023 年的最大创新是”不知道就说不知道”,商业模式上只对解决了的对话收费,产品上用程序描述、仿真测试和可观测性工具让企业逐步交出信任。Intercom 自己的客服已有 82% 由 Fin 自主完成,人力团队两年规模不变而对话量翻了三倍——信任不是氛围,是被设计出来的。

Fin x Anthropic 巴黎对谈现场

对谈背景与两位讲者

这是 Fin 在巴黎办的线下活动实录,全场约一小时,含约十五分钟观众问答。Jordan Neil 是 Intercom COO,自 2023 年 Fin 立项起深度参与产品设计、构建与上市,自称”Fin 就是我的生活”;Ryan O’Halleran 负责 Anthropic 的数字原生业务,入职一年多——他提到一个数字:这一年多的时间已经超过 Anthropic 全公司 70% 员工的司龄,可见这家公司的扩张速度。对谈围绕一个主题展开:在 AI 智能体直接面对客户的场景里,信任如何被建立、被定价、被规模化。开场的一个现场细节佐证了听众成色:举手调查里,在场多数人已经在用 Claude,Fin 的重度用户也不在少数——这场对谈讲的是前沿用户关心的真问题,不是入门科普。

信任的第一性问题:外部用户无法评估答案对错

Jordan 提出了一个区分内部与外部 AI 使用的核心框架:如果你在内部用 Claude Code 或自建智能体,用户是专家,答案稍有偏差也能识别、修正,仍然有用;但 Fin 面对的是企业终端客户——他们无法评估答案是否正确。这带来了本质上更高的标准:Fin 代表你的品牌、替你跟客户说话,出了错客户不会怪 AI,只会怪你的公司。

Ryan 从 Anthropic 一侧补充了基础层的做法:信任与安全不是营销词,而是被构建进产品的硬约束——如何限制幻觉、如何限制面向客户的风险。他举了一个信任积累的例子:Spotify 基于 Claude 构建了内部代码现代化工具,Spotify CEO 在财报电话会上说”我们从去年 12 月起没再手写过一行代码”——没有对供应商近乎完全的信任,不可能出现这种公开背书。

 constitutional AI 与信任基础

「不知道就说不知道」:Fin 2023 年的最大创新

对”怎么让 AI 客服可信”这个问题,Jordan 给出的答案出乎意料地朴素:Fin 在 2023 年初发布时,最大的创新不是多会答题,而是会说”我不知道”。当时让大模型不讨好用户、不硬编一个看似合理的答案极其困难——现场有人打趣”猜猜我的生日”,365 分之一的命中率对聊天机器人无所谓,对客服就是事故。让 Fin 在不确定时闭嘴并转人工,是信任的第一块基石。

Ryan 从销售视角补了一个共鸣:AI 出现之前他带销售团队时就常讲”你能对客户说的最有力量的一句话就是’我不知道’“——在电话上滔滔不绝假装懂、下次再找补,是最伤信任的行为。Anthropic 把这个原则做进了模型的底层:宪法 AI(Constitutional AI)让模型在生成时对照联合国人权宣言、通用信任与安全原则等基础文档自我校验,从机制上抑制”硬编答案”的倾向。

Jordan 给出的 Intercom 版本类比是:Fin 上班第一天就应该是一名有经验的客服代表——它预装了多年好客服的常识,你永远不需要告诉它”别对客户爆粗口”,你只需要把精力全部花在训练它”你们公司怎么定义好的客户体验”上。

按结果付费:把信任写进商业模式

按解决付费的商业模式

对谈中最有厚度的一段是定价与信任的关系。Fin 的收费模式是:对话被 Fin 解决才收费,没解决不收费。Jordan 交代了这个模式上线时的争议——内部觉得疯狂,行业觉得不可理喻,因为当时行业平均解决率只有 25% 上下,等于大量工作白干。

但这个模式把各方激励扭到了同一个方向:客户只为价值付费,没有传统 SaaS 按席位收费的”死收入”;销售团队被激励去帮客户真正用成功,而不是卖完就走;研发团队的目标清晰——把解决率做上去。截至目前 Fin 平均解决率约 70%,自发布起大约每月提升一个百分点,验证了当初的赌注。

Ryan 介绍了 Anthropic 侧的对应实践:API 的按用量计费降低了试验门槛——欧洲某大型银行的高管用 Lovable 一小时生成界面原型给团队演示,这种”一小时内从想法到可演示 MVP”在按席位付费时代不可能发生。Intercom 内部也做了同样选择:全员铺开 Claude Enterprise 时,他们在按席位和按 token 两种模式里选了后者——因为按席位就要纠结”这个人值不值得给一个账号”,按用量则可以全员开放,用得多付得多,没有闲置成本。

监管行业案例:处方续签里的信任边界

监管行业的人机边界

两位讲者用医疗与金融案例说明信任的”边界工程”。美国一家医疗公司用 Fin 辅助处方续签:Fin 负责所有重活——帮患者把续签请求流程变得尽可能顺畅、辅助判断这是否正确的事——但 Fin 不做是否发放的决定,而是把整理好的信息打包交给临床医生,由人做最终决定并承担责任。Fin 不给临床建议、不给金融建议,这些护栏是内置的,不是客户配置出来的。

面对”创新速度这么快,客户会不会更难信任”的提问,Ryan 的回答浓缩成一句话:安全不等于慢。他援引在 Stripe 的经历做类比——Stripe 在拿到 SOC 2 Type 2 认证之前,说服大客户规模化合作极其艰难;拿到之后它变成一个复选框。宪法 AI、信任与安全框架、推动监管的做法,本质上是在给客户内部的决策者”弹药”——让他们能在自己的组织里理直气壮地做对的决定。Jordan 侧的对应做法是把交付速度转化为客户的采用工具:Fin 是这个领域唯一有自服务产品的玩家,八千家客户里既有 Snowflake 也有两人初创,靠的是大量自助理解、采纳、信任新功能的工具——发布节奏快到销售和客户成功团队自己都跟不上,就必须让工具替人完成教育。

Ryan 补充了行业侧的观察:最前沿的监管行业公司不只在使用 AI,还在和本国监管机构一起思考如何适应这项技术;Anthropic 的领导层也在持续推动监管与安全框架。去年企业的主题是”从试点到生产”,今年的主题变成了”受监管行业里百万级客户在生产环境用我的产品,我还能睡得着觉”——这个转变本身就是信任基础设施成熟的标志。

Jordan 同时点出安全与效用的张力:最安全的做法是让 Fin 只复述帮助中心的原文,但那样效用有限;Fin 最好的体验恰恰来自它基于上下文做出的合理推断(A 对、B 对,所以 C)。信任工程的本质是在推断空间里画出精确的边界,而不是把推断整个砍掉。

信任的日常维护:程序描述与仿真测试

程序描述与仿真测试工具链

Jordan 详细展开了 Fin 交付信任的工具链,这部分对运营者最具实操价值。Fin Procedures 允许企业用自然语言描述流程(第一步到第五步),Fin 智能体化执行——能跳过它确定不需要的步骤、需要时回头澄清。难点在于人本身写不清楚流程:他给了一个类比——把你的退款流程写在纸上交给一千个聪明的人类客服,他们能一致执行吗?大概率不能。

于是 Intercom 做了”AI 套 AI”的三层工具:AI 助手帮你写程序;你可以为程序写仿真测试(“这类客户在这种场景下,必须出现这个结果”),Fin 会模拟终端用户、给出回应并自我评判,循环验证可靠性;测试失败时,另一个 AI 帮你定位是程序写错了还是测试写错了。配合可观测性工具,企业能看到 Fin 和人类各自在做什么、哪里出错、何时介入。这套东西解决的是信任的日常维护问题——上线时的信任只是起点,每次改动的信任回归才是长期成本。

规模证据:82% 自主解决率的组织样本

对谈里数据密度最高的一段是 Intercom 自身的运营。Jordan 给出:Intercom 自己的客服有 82% 由 Fin 自主完成;人类客服团队规模与两年前持平,预计一年后仍持平,而同期对话量翻了三倍;人类客服在需要出场时能给出更快、更高质量的响应,甚至有时间上电话。中位数客户在交给 Fin 的对话上看到约 70% 的解决率——还有很多对话没交给 Fin,瓶颈不是技术而是信任本身。

往 90% 解决率推进的具体计划里,最大的卡点出人意料:不是模型能力,而是工程资源——Fin 要接入企业内部系统拿数据、执行动作,需要内部 API,而工程团队自己的产品路线都排满了。两个可能的解锁方向:Claude Code 让 Intercom 自己的这条支持路线图建设大大提速;以及 computer use——直接给 Fin 一个内部工具的登录权限让它自己点按钮,绕过 API 建设。computer use 此前受限于速度、成本与可靠性,现在已经”好到可以考虑”,剩下的门槛又是信任:客服团队要说服工程团队”给我的 AI 完全的内部工具访问权限,没事的”。

企业采用的内卷与分化

一个反直觉的观察:企业规模并不决定采用速度。有狂奔的巨头,也有恐惧迟缓的中小企业;Jordan 的总结是”未来已来,只是分布不均”。企业侧的普遍路径是先内部用(Claude Code、内部数据分析),建好评估体系和追踪能力后再推向外部客户场景——L’Oreal 的对话式分析工具、SAP 给咨询师用的 Joule 都是内部先行再外化的例子。

内部提效的实证:从 L’Oreal 到 Intercom 自家团队

对谈中双方各自给出了内部 AI 提效的一手案例。Ryan 最喜欢的是 L’Oreal:作为 Anthropic 的早期采用者,他们基于 Claude 构建了对话式分析工具。这个场景戳中所有非技术岗位的痛点——销售和市场负责人拿不到数据,不是数据不存在,而是”我不会写 SQL、没权限访问数据库、得给运营团队提需求排队”。有了对话式分析,同一句话直接变成结果:“给我看我们团队过去 12 个月关了哪些单、分布在哪些行业”,Claude 自己去查数据、出结论,甚至当天就能带着漂亮的图表上会——过去这个流程要以天计。

Intercom 自己是更完整的样本。Jordan 透露工程团队用 Claude Code 在几个月内实现了产出翻倍,而且使用已经扩散到全公司:客户成功经理做工作归因、财务规划团队做分析,人人都在用。他把这种扩散总结为一个精准的框架:AI 是个人能动性的放大器——过去你有个想法,卡在”要等别人审批、等别人排期”上;现在高能动性的人自己就能把事情做完。Anthropic 侧的观察互相印证:一家欧洲银行峰会上,一位非技术出身的高管用 Lovable 一小时生成了产品界面原型拿去给团队演示——概念验证的门槛被压到了”一次尝试”的成本。

护城题问答:做足够大的端到端工作

现场关于”在模型厂商之上创业如何建立护城河”的问答值得单独记录。Jordan 的回答分两层。第一层是战略:如果要做 B2B 的 AI 业务,必须瞄准尽可能大、尽可能端到端的工作——“能做完你整个客服的产品,从根本上优于只能辅助你人类的副驾驶产品”。做得足够大、足够深,别人才无法简单复制你做的那一小块。但这带来一个危险区:问题足够大之后,你会进入 OpenAI 或 Anthropic 这类顶级掠食者的视野——它们有巨大的野心和估值,最终会来攻你的市场。所以创业公司的生存空间是”大到能活、又没大到被正面碾压”的窄带。

第二层是执行:极端聚焦在一个具体路径上。Ryan 的补充来自一线观察:他接触的 Claude Code 用户里 90% 同时也在用 Cursor——人们爱 Claude Code 的命令行专注开发者体验,Cursor 补足周边需求,通常是两三个工具并存而非一家通吃。垂直深耕的例子是法律 AI 的 Harvey:他们的销售团队有和律师打交道的独特能力、懂律所内部的销售流程,这种”非常具体”的Know-how是通用模型厂商难以复制的。Jordan 最后还披露了一个范围感数字:客服体验占全球所有知识工作的 40%–50%,专注这一个岗位已经足够大,不需要再横向扩张。

内部推广:降低首次尝试门槛与绩效挂钩

被问到”怎么说服普通员工用 AI”时,Jordan 给了两个抓手。其一是把首次体验的摩擦压到接近零:Intercom 内部做了”Claude for Data”——一个包着 Claude 的薄壳,封装好所有配置、技能和 MCP,员工直接问”我下周要跟客户做业务回顾,帮我准备”,Claude 自己去 Snowflake 拉数据、分析、给结论。任何人只要经历过一次这种”啊哈时刻”,之后自然会越问越深。其二是绩效挂钩:去年夏天开始,工程团队把”是否有效使用 AI”纳入绩效评估——先是”不用 AI 拿不到超出预期”,很快会变成”不用 AI 连符合预期都拿不到”。

他还补了一个教育视角:Intercom 的支持团队负责人在帮其他大企业理解”岗位将如何变化、组织结构如何随 AI 演化”——甚至 Anthropic 自己的客服团队都在参照 Intercom 的支持组织结构做重组。一个有趣的循环:模型厂商教会了应用厂商怎么用 AI,应用厂商反过来教模型厂商怎么组织 AI 时代的客服团队。Ryan 则介绍了 Anthropic 内嵌在 GTM 组织里的”有益部署”团队:专门在大学、发展中国家、艺术机构等不以收入为目标的场景部署 AI——把它放在 GTM 组织内而非独立公益部门,本身就是一种结构选择。

两人的共识是:推广必须自上而下与自下而上在中间相遇。高层强推会遇到执行层抵制,纯自发生长又缺少预算与授权;最理想的形态是日常使用者真心觉得有价值、同时 C 级层面把它当战略项目签单推进。

未来:销售、成功与”角色融合”的猜想

Jordan 的收尾展望信息量很大。第一,客户服务这个岗位”基本已被攻克”(技术侧),剩下的是把人带到技术面前。第二,Fin 正在获得更高风险的授权:进入销售与客户成功——直接创造收入的场景信任门槛更高,但上限也更高,Fin 正在被训练成优秀的 SDR(销售开发)、AE(客户经理)和 CSM(客户成功经理)。第三,一个组织结构层面的猜想:过去客服按邮件/电话/在线分团队、按一二三级分层的结构,本质是人类产能约束的产物——你能同时处理二十封邮件但只能接一通电话,于是就有了不同的团队、不同的管理链、不同的 KPI;AI 智能体没有这些约束,一个 Fin 同时做邮件、在线和语音反而是自然状态,销售、支持、成功之间的边界可能同样是历史偶然——客户体验的组织形态会被重新设计。他给了一个范围感:客服体验大约占全球知识工作的一半,这已经是足够大的战场,刻意专注不横向扩张本身就是战略选择。

对谈收尾:信任只会越来越重要

两位讲者对”信任是不是阶段性话题”的回答一致:信任是入场券,但重要性只增不减——Fin 承担的工作越多、赌注越高,信任的门槛就越高。这不是一个会被”解决”然后翻篇的问题,而是持续升高的水位线。

可复用的五点

  1. 让 AI 客服学会说”我不知道”:把”不确定就转人工”做成硬性行为而不是提示词期望,是所有对话式 AI 的信任第一课。
  2. 按结果付费对齐激励:无论对外采购还是对内立项,“解决了才计费/才算产出”的机制设计能把 AI 项目的各方利益拉到同一侧。
  3. 为流程写仿真测试:描述业务流程后,先写”这类输入必须出这类结果”的仿真用例循环验证,再灰度上线——这是 AI 流程自动化独有的质量保障层。
  4. 内部工具的低摩擦壳是推广关键:把配置、数据连接、技能全部封装好,让非技术员工的第一个问题就能得到端到端结果,比培训课程有效得多。
  5. 把 AI 使用纳入绩效:从”用了加分”过渡到”不用扣分”,配合自下而上的自然采用,是组织 AI 渗透率最直接的推进器。

原文信息

  • 原视频标题:Fin x Anthropic: Building Trust in AI Agents | Paris | March 2026
  • 频道:Intercom
  • 讲者:Jordan Neil(Intercom COO)、Ryan O’Halleran(Anthropic 数字原生业务负责人)
  • 发布日期:2026-04-07
  • 视频时长:63 分 54 秒

文章评论(9

龙文博14 分钟前

路过

回复
龙文博51 分钟前

收藏了,以后慢慢研究。

回复
三分糖去冰51 分钟前

赞同,实践出真知。

回复
龙文博25 分钟前

看标题就点进来了,内容果然没让人失望。

回复
空向阳54 分钟前

整理得太全面了,省了我不少时间。

回复
星寻梦42 分钟前

路过

回复
三分糖去冰21 分钟前

这个比较实用,已转发给同事。

回复
林观澜14 分钟前

点赞,必须点赞

回复
陈皮话梅糖37 分钟前

内容翔实,正好需要,先收藏再看。

回复