Canto:为真实世界打造的语音模型 | Wispr Flow

空逐月行业资讯📡 BestBlogs·全站精选⭐ 902026-09-18313 阅读💛 183 收藏
Canto:为真实世界打造的语音模型 | Wispr Flow

📌 One-Sentence Summary Wispr AI Lab 推出了 Canto,这是一个针对挑战性真实口述环境优化的实时语音模型,利用监督微调(SFT)和基于 GRPO 的强化学习,在嘈杂和低音量条件下表现优于竞争对手。 📝 Summary Canto 是由 Wispr Advanced Interfaces Lab 设计的专业语音识别模型,旨在处理真实世界音频中的不可预测性,如背景噪音、低音量和短语。与在纯净、朗读语音上训练的模型不同,Canto 采用了监督微调(SFT)和基于组相对策略优化(GRPO)的强化学习相结合的后训练方法。研究人员详细介绍了一套复杂的训练管线,该管线能够从用户修正中学习,并选择性地采用上下文词汇,以在准确性与抵御「干扰」词项之间取得平衡。在真实世界的压力测试中,Canto 展现出比 Google、OpenAI 等公司模型更低的词错误率(WER),同时在公开基准测试中保持竞争力。 💡 Main Points Canto 在真实世界的「野外」口述场景中表现优于主要竞争对手。 使用 10 小时真实用户数据和 3 小时「挑战集」(包含噪音、风声、耳语)的评估显示,Canto 在实时模型中实现了最低的词错误率(WER),击败了 Google、OpenAI、AssemblyAI 和 Deepgram。 该模型采用了结合 SFT 和 GRPO 的两阶段后训练过程。 在预训练之后,Canto 首先进行监督微调以实现基础转录,随后使用组相对策略优化(GRPO)进行强化学习,以优化序列级结果和特定的失效模式。 采用「嫁接」技术将嘈杂的用户编辑转化为高质量的训练信号。 通过使用强制对齐置信度和编辑形状,系统能够区分实际的识别错误与风格化的重写,仅将修正部分嫁接到 RL 训练的参考转录文本中。 利用 RL 训练模型选择性使用上下文词汇的能力。 为了防止模型盲目遵循与音频听起来相似的词典建议(干扰项),Wispr 使用真实上下文与虚假上下文的混合数据对模型进行训练,教会模型何时应信任音频而非提供的列表。 💬 Key Quotes 「在我们测试的所有模型中,Canto 实现了最低的词错误率。」 「目标不仅仅是让模型遵循上下文,而是教会模型何时上下文值得被遵循。」 「我们构建了能够大规模生成并评分语音展开(rollouts)的基础设施,使我们能够围绕特定的行为和失效模式构建训练环境。」 📊 Article Meta AI Screening: 90 Featured: Yes Source: Hacker News Author: Hacker News Category: 人工智能 Language: 英文 Read Time: 10 min Word Count: 2421 Tags: AI 与智能应用 , 性能优化 , 系统设计 , 多模态 AI , 大语言模型 (LLM) Read Full Article

#AI 与智能应用# 性能优化# 系统设计# 多模态 AI# 大语言模型 (LLM)

文章评论(1

星寻梦3 分钟前

赞同,实践出真知。

回复