X 用 Grok Speech to Text 每天转写 31 万条视频字幕:P50 延迟 27.6 倍、词错率低 2.5 倍的迁移实录

林知秋AI 前沿2026-09-17642 阅读💛 228 收藏

X captions × Grok Speech to Text

一句话结论

X 平台把视频字幕转写从自托管 Whisper Large V3 整体迁移到 Grok Speech to Text,支撑每天约 31 万条视频的自动字幕:P50 延迟提升 27.6 倍、词错率低 2.5 倍、多语言表现更强,还附带高精度词级时间戳。对要在语音转写模型间做选型的团队,这是一份带真实生产数字的迁移对照。

业务场景与规模

X 是全球月活数亿的公共广场型平台,视频占内容消费的大头。超过最低播放量门槛的视频会自动转写生成隐藏字幕,量级约每天 31 万条。这批字幕服务两类人:听障与听力受损用户,以及静音刷视频的所有人。

迁移前后的对照

X 原先用自托管方式跑 Whisper Large V3 开源模型做转写,在延迟、词错率、多语言表现三个维度上不达标;换成 Grok Speech to Text 模型后三项全部改善,官方页面公布的核心指标如下:

指标数值
每日自动转写视频量310K 条
P50 延迟提升27.6 倍
词错率降低2.5 倍

时间戳是被低估的收益

X 团队要的不只是速度和准确率。Grok 这类 AI 转写模型能生成高精度词级时间戳,转写出的字幕文本块可以和视频口播逐段对齐,屏幕上滚动跟进时更易读。对做视频字幕、剪辑、内容检索的团队,词级时间戳决定了转写结果能不能直接进下游工作流,而不是只当一坨纯文本用。

迁移结论

X 团队已全量迁移到 Grok Speech to Text,平台字幕整体更快、更准、更易读。

给选型团队的可复用判断

这个案例可复用的是一套语音 AI 模型选型工作流:在自托管开源模型和 API 模型之间做决策时,把延迟、词错率、多语言覆盖、时间戳精度四项整理成对照表来评估,再用自己业务的真实日转写视频量估算两条路线的部署成本。X 的 31 万条/日、27.6 倍延迟差、2.5 倍词错率差是极端规模下的数字,小团队等比缩小后方向性依然成立——但 API 定价要按自己量级重算,不能直接套用平台的规模折扣。

原文信息

  • 作者:SpaceXAI 官方
  • 来源:SpaceXAI Stories
  • 原文发布日期:2026-08-20

原文地址:

文章评论(2

三分糖去冰55 分钟前

收藏了,以后慢慢研究。

回复
星寻梦35 分钟前

收藏了,以后慢慢研究。

回复