Grok Voice 登陆 LiveKit Agents:语音转文字、文字转语音、语音到语音一条基础设施跑通

一句话结论
Grok Voice 系列语音模型正式登陆 LiveKit Agents:语音转文字、文字转语音、语音到语音三类模型都能在团队已有的 LiveKit 实时音频基础设施里直接跑。两家还联合开源了一个医疗诊所前台接待智能体作为 LiveKit recipe,能挂号预约、改期、取消,还能在任务中途插答政策问题而不丢主线——建语音智能体的团队可以直接拿去换后端复用。
这次发布的是什么
Grok Voice 模型现在可以通过 LiveKit Agents 调用。对已有 LiveKit 技术栈的团队来说,不需要新增基础设施:语音转文字、文字转语音、语音到语音三类模型在现有实时音频基础设施内运行,通过 LiveKit Inference 接入。
联合示例:诊所前台接待智能体
SpaceXAI 和 LiveKit 联合构建了一个患者接待智能体,代表医疗诊所的前台,公开可试。能力清单:
- 预约挂号:完成就诊预约;
- 改期与取消:处理日程变更和取消请求;
- 中途插问:在另一项任务进行中回答政策类问题,不丢失对最终解决状态的追踪。
底层实现上,智能体在通话中触发工具调用,既不拖慢通话节奏,也不破坏对话的自然感。
两种架构选择
整个智能体以 LiveKit recipe 形式开源。LiveKit Agents 原生支持 Grok 语音到语音端到端模型;这个示例用的是级联架构(语音转文字 → 语言模型 → 文字转语音),全程走 LiveKit。两条路线都在:要端到端延迟和自然度选原生语音到语音,要每层可控和可换件选级联。
怎么复用到自己的业务
recipe 的替换边界很清楚:把示例里的假诊所换成真实的电子病历系统或排班系统,智能体其余部分不变,包括通过 SIP 走电话线路的场景。开发路径三条:查现行 API 定价;看 LiveKit 文档的集成章节;或直接从 patient-intake recipe 起步换自己的后端。
对建语音智能体团队的意义
这个案例展示的选型判断比案例本身更有参考价值:语音基础设施和模型能力解耦后,团队可以保留已有的 LiveKit 运维(房间管理、路由、SIP 电话接入),只在模型层按需组合——语音到语音要自然对话质量,级联要中间文本可审计、每层可替换。医疗前台这种「任务中途插问还要回主线」的场景,正好把两条架构的差异暴露出来,拿 recipe 实测是最直接的评估方式。
原文信息
- 作者:SpaceXAI 官方
- 来源:SpaceXAI Stories
- 原文发布日期:2026-08-21
- 试玩地址:xai.livekit.space(患者接待智能体)
- recipe 地址:LiveKit 文档 patient-intake recipe
原文地址:
这个观点很中肯,深有同感。
实测过类似工具,作者说的基本属实。
不错不错,已加入书签。