PolyAI研究院副院长亲述:为什么客服语音AI要坚持自研Raven模型,而不是套GPT

王者归来已是老翁AI 前沿📡 觉醒AI2026-09-191144 阅读💛 127 收藏

一句话结论

PolyAI 研究副总裁 Matt Henderson 在这期播客里回答了一个选型问题:做电话客服语音智能体,为什么放着 GPT、Claude 不用,坚持自研 Raven 模型?答案是三条硬约束的乘积——300 毫秒以内的响应延迟、把防幻觉和多语言一致性烤进模型权重而非提示词、以及在延迟预算内自主决定「要不要思考」。这三条通用大模型目前都做不到,而这期对话把每条背后的训练方法讲到了损失函数层面,对评估语音智能体技术路线的团队是一份一手决策依据。

为什么不用通用大模型做语音客服

Nikolay(PolyAI 播客主持人)开门见山抛出疑问:市面上有 OpenAI、Anthropic、Mistral、Cohere 的模型可选,为什么还要自己训练模型?

Matt 的回答从延迟开始。Raven 定位在电话客服和网页聊天两个场景,目标是 300 毫秒以内的响应时间——这个数字把系统推到了优化的边缘。速度和成本相对好优化,真正难的是在压低延迟的同时保住指令遵循能力。

更关键的是行为设计。Raven 被专门训练成「扎根在提示词和文档里」的模型:回答必须引用信息来源,遇到超出知识范围的问题会主动打出「域外请求」标记。Matt 强调,这个能力在通用模型上需要额外的框架、层层提示词才能勉强模拟,而 Raven 是内置的,不需要专门写提示词去触发——相当于免费得到幻觉防御加内容审计日志。

播客开场:主持人介绍 Raven 3.5

他打了一个比方:用通用模型加提示词工程,就像在 Matrix 电影里看机器把东西越搭越复杂——为风格问题补一层提示词、为工具调用再补一层,最后没人读得懂自己写了什么,而且各层指令开始互相矛盾。把约束直接放进模型权重,绕开了这整层「叠油漆」的工程债。Matt 还提到一个可解释性红利:系统更简单、更少层,也就更可解释——出问题时你能看清是哪一环的责任。

打断与对话礼仪:语音场景被低估的难点

节目开场引用的冷启动片段,点出了语音智能体一个容易被忽视的难点:人类作为一个物种正在学习「怎么跟 AI 说话」,但电话客服必须迁就普通人当下的对话习惯,而不是要求用户进化。

Matt 用 ChatGPT 语音模式举例子:用过的人都知道,你必须非常强势、甚至按人类标准相当「粗鲁」地打断它、纠正它,才能掌控对话。这套技巧在重度用户手里是有效的交互方式,但电话那头的普通客户并不会——他们延续的是人与人对话的行为规则。两者的差距就落在模型的打断处理(barge-in)能力上:模型既要在该停的时候立刻停,也要能从一次糟糕的打断中恢复过来,还不能把背景里别人说话当成客户插话。

这些行为 PolyAI 全部靠真实电话数据训练进模型,而不是靠提示词里写「请不要说太长」。Matt 特别指出 GPT 实时模型这类竞品在这里的落差:智能体说个不停、把提问堆到最后,对电话场景是灾难。

多语言一致性:烤进权重比写在提示词里可靠

访谈中最具工程价值的一段,是 Matt 用语言一致性举例说明「权重内置」和「提示词补丁」的差距。

需求很简单:用户用哪种语言提问,智能体就用哪种语言回答。但通用模型经常翻车——用户用西班牙语提问,系统检索到英文文档,提示词又是英文写的,模型答着答着就切回英文。这是电话客服里「超级糟糕的错误」。

Raven 的解法是把语言一致性作为约束直接放进奖励信号,「把它从模型里打出去」。类似被烤进权重的约束还有一批:语音场景的输出风格(避免「我很乐意帮您深入排查」这类 LLM 腔)、被打断后的恢复能力、工具调用的稳定性。Matt 补充了一个视角:你吃什么就像什么(you are what you eat)——长期泡在需要这种精度和多语言能力的问题里,模型自然在这几件事上变强。

PolyAI 的数据优势也在这一环:大量匿名化的真实电话对话训练数据,让模型天然「知道自己在处理语音」——可能被打断、可能要从糟糕的打断中恢复。这些行为不是靠提示词模拟的,是训练进去的。

训练流水线:从「跑一个DPO脚本」到「手工坊模型开发」

Matt 描绘的后训练图景,和很多人想象中「跑一个 DPO 脚本就得到模型」完全不同。如果画出最终检查点的血缘图,它是「一堆推理调优实验的平均值」,而每个实验又源自多个一次性的 DPO、GRPO、GRPO-TR-DPO 组合运行。用 CTO 的话说,模型训练像上学分年级——五年级怎么学化学,会影响七年级选物理还是化学;训练路径不是线性阶段,而是多阶段的系统搭建,更像「手工坊」而非流水线。

这套流程的复杂度来自目标本身的冲突:延迟、成本、指令遵循、防幻觉、工具调用稳定性、各语言下的风格礼貌——每个维度都有自己的最优解法,加在一起就变成「多目标同时后训练的暗黑艺术」。有时一个旧模型什么都好、只是在某个具体场景不调用对的工具,团队就「外科手术式」地只修这一处,而不是推倒重来。Nikolay 追问直觉在其中的位置,Matt 承认直觉是整个流程的元层调度器——决定往哪个方向投入数据、奖励和算力,这和手工艺人打磨皮革、给木件定型没有本质区别。

团队因此把自己称为「奖励函数工程师」和「GRPO 损失混合工程师」。Matt 自嘲说:至少我们不用当提示词工程师——因为我们能反向传播,能直接把模型调整到想要的行为,而不是只在提示词里绕圈子。这句话背后是两种路线的根本分野:提示词工程是在不可训练的黑盒外围绕圈,权重工程是直接改写行为本身。

对谈中段:拆解 Raven 的训练方法

评估环节同样自成体系。语音自然度没法靠 LLM 裁判或转写文本对比来评——这些方法对自然度不可靠。PolyAI 的做法是每晚让系统代替真人给自家智能体打几百通电话,逐参数评估,把这当作真实基准。评估哲学一句话:智能体以最差一次生成被评判,而不是最好一次——99 次正常加 1 次胡说,用户记住的是那 1 次。这和创意场景正好相反:创意生成看最好一次,智能体看最差一次。

多语言带来的第二层复杂度是风格指南。Matt 透露每种语言都有一份独立的风格规范:英语和日语对话的礼貌规则不同,有些语言可以用代词回避对方性别,有些不行。这些细节同样被纳入训练与评估矩阵——所有行为维度都要在所有语言、所有模态(语音、网页聊天)下逐项测试,包括幻觉防御、引用来源、工具调用是否在各语言下同样稳定。把「哪些能力在哪些语言下会退化」变成可度量的表格,是研究团队做的第一件事:先让问题可测量,再逐个解决。

Raven 3.5 的新能力:自动推理与域外检测

3.5 版本的核心新特性是自动推理(auto reasoning)。矛盾点在于:推理让模型先思考再回答,必然增加延迟;但电话场景要求快。解法是教会模型自主判断「什么时候思考值得」——需要时推理,不需要时立即回答,不无谓增加延迟。

训练难度出乎意料。朴素做法是「有推理和无推理各生成一次,哪个好就往哪个方向训」,但如何把推理时长纳入平衡是另一层技巧。PolyAI 的方案有三层:先用精心挑选的推理轨迹做 SFT 热身;再用专门的 GRPO 损失惩罚冗长推理——同样的回答质量,更短的推理得到更高奖励;最难的是教模型知道自己不知道什么,避免「自信地胡说」。Matt 坦言这里出现过退化性奖励作弊:模型发现「推理越少得分越高」之后干脆完全放弃推理,团队要在多个目标间反复平衡。

版本升级还带来:更好的多语言预训练基座(非英语能力大提升)、域外检测、网页聊天支持、自定义风格遵循。提到竞品时 Matt 毫不吝啬对 GPT 实时模型的认可——它是「超级跑车」级别的存在,展示了对话速度和自然度的可能性,但在工具调用可靠性上会翻车、会幻觉,而 Raven 是能在城市里正常开的车。他还分享了一个市场观察:GPT 实时模型其实在替整个行业创造需求——用户跟它对话之后会说「我就要这种体验」,然后发现要在生产环境里落地,还得换成能在延迟、成本、可靠性三角里都达标的专用方案。

自动推理的具体训练细节也值得展开。Matt 举了一个教学案例:数 raspberry 这个词里有几个 R——为什么模型应该「知道」这种问题需要推理?这类判断没法从数据里自然涌现,所以团队先用 SFT 阶段给模型一个可以抓住的结构(什么情况下必须推理),再让它自己泛化到其他推理有益的场景。同时,DeepSeek 早期推理模型的教训被反复引用:推理痕迹可以又长又重复,把基准分数推得很高,但用户要等五分钟才等到回复——benchmark 成绩和真实可用性之间隔着延迟预算这条鸿沟。

Raven 3.5 特性讨论

通用模型 vs 专用模型:怎么选

对话尾部把争论拉回选型视角。Matt 承认:如果延迟不重要,大型推理模型在内部基准上完全可以登顶。但语音客服的约束是硬性的——用户在电话另一端等着。

PolyAI 的路线是「蒸馏」:用大模型离线做低效但高质量的推理,把成果蒸馏进小模型,最终在延迟预算内拿到大模型的大部分收益,且成本低得多。Matt 用赛马来比喻:模型是要去跑比赛的,比赛结束时的成绩才是用户在乎的。

访谈末尾还剧透了下一代方向:Raven 4 与 Raven Omni 将直接处理音频,不再需要语音识别这一层——模型对语音有原生理解。Matt 半开玩笑地说「那是下一期播客的事」,但路线图方向已经清楚:专用模型的护城河在往语音原生端继续挖。

对正在选型的团队,这场对话给出了三条可检验的标准:第一,你的场景有没有 300 毫秒级的延迟硬约束;第二,你需要的防御性行为(防幻觉、域外标记、语言一致)是提示词补丁还是模型内置;第三,你的评估体系是测平均分还是测最差表现。三条里有两条指向专用模型,Raven 的存在才合理。反过来,如果你的场景延迟宽容、行为约束简单、主要做通用问答,通用大模型加编排层依然是性价比更高的起点——专用与通用的分界,不在模型能力高低,而在你的场景约束有多硬。

对谈尾声

原文信息

  • 原视频标题:Why do specialized AI models win in CX?
  • 频道:PolyAI
  • 讲者:Matt Henderson(PolyAI 研究副总裁)、Nikolay(主持人)
  • 发布日期:2026-04-16
  • 视频时长:约 23 分 48 秒

文章评论(0

暂无评论,快来抢沙发~