不开剪映、不录音,用AI+代码做口播短视频:完整实操教程

AI小蝌蚪AI 前沿2026-09-17729 阅读💛 60 收藏

最近把做短视频的工作流又升级了一遍,现在这条线已经比较稳定,从写稿到出成片基本不用自己动手剪。这篇把最新方案完整拆出来,你可以直接照着搭一套。

先说最终能做出什么:一条知识口播短视频,画面文字零错误、声音是本人音色、风格统一、后续可批量复用,全程不开剪辑软件、不录一句音。

先区分一个概念。这套做法不是用 AI 视频模型(Sora、可灵这类)输入一句话直接生成画面。视频模型生成的画面不可控,无法稳定呈现一句话、一组对比、一张清单,不适合知识口播。这套做法是:用 Remotion 框架以代码方式精确绘制画面,用 F5-TTS 克隆本人音色配音,写代码、配环境、渲染全部交给编程类 AI 完成。

成片示例

01 最终效果与整体流程

成片规格:1920×1080 横版、30fps、H.264 + AAC、MP4,时长由配音决定(示例片 75 秒)。

整条流程分四步:

  • 写口播文案:一句一行,存成纯文本。
  • 合成配音:F5-TTS 用本人音色逐句念出,同时生成逐句时间轴(即字幕时间轴)。
  • 制作画面:AI 用 Remotion 按文案和时间轴写代码,绘制手绘风格场景。
  • 混音渲染:ffmpeg 混入低音量背景音乐,Remotion 渲染出 MP4。

人只负责两件事:把文案写顺、审看成品并提出修改。

整体流程图

02 开始前准备

准备工作主要是两项:本机安装 F5-TTS 与 Remotion 环境,以及准备一段本人录音作为音色参考。

准备清单

F5-TTS 模型首次运行自动下载(数 GB),之后离线可用。安装步骤直接让 AI 按 F5-TTS 官方文档在本机完成,无需手动操作。

03 第一步:写口播文案(一句一行)

格式要求:全文按句子拆分,一句话占一行,保存为 script.txt(UTF-8 纯文本)。示例:

老有人问我,AI越来越强,人到底还剩什么价值
我想了挺久,答案其实就四件事
这四件你亲自做,剩下的,都可以交给AI
第一件,定义问题,你到底要解决什么

参考量:一条 75 秒的片约 350 字、拆成 18 句左右。

为什么必须拆句

  • 逐句合成时,句号、问号后能产生长短不同的停顿,听感接近真人;整段合成会变成匀速念稿。
  • 每句的起止时间直接对应一条字幕,省去后期字幕对齐。

注意事项

  • 写完通读(最好默念)一遍,拗口、不像口语的句子直接改,稿顺音频才顺。
  • 每行控制在 20 字以内更适合字幕显示,长句在标点处断成两行。

产出:script.txt。

04 第二步:合成配音,顺带得到字幕时间轴

工具:F5-TTS(开源、本地、免费,录音不上传)。

原理:提供一段本人录音 + 该录音的文字(参考音频),模型记住音色;再逐句输入新文案,即用该音色念出新内容。

操作:让 AI 调用批量合成脚本,输入参考音频、参考音频文字、script.txt,输出整段配音和逐句时间轴。命令形态(参数由 AI 按实际环境填):

python f5_batch.py <参考音频.wav> "<参考音频对应文字>" script.txt voice.wav voice_segments.json mps 0.9 32

关键参数:

  • speed=0.9:语速。
  • nfe=32:音质档,固定用 32,不要为提速降到 16。

两个必须盯的点

  • 参考音频必须是一句完整的话,不能截在半句;其文字要和录音一字不差。截在半句会导致新音频开头带出参考录音的残字。有底噪可先让 AI 做降噪和响度归一化。
  • 语速按数字调,不要凭感觉。知识口播真人语速约 200–230 字/分钟(取 210 上下)。用「句字数 ÷ 合成秒数 × 60」反算每分钟字数,超出区间就调 speed,一次即可定准。

产出两个文件

  • voice.wav:整段配音。
  • voice_segments.json:逐句时间轴,每条形如:
{ "text": "我想了挺久,答案其实就四件事", "start": 4.51, "end": 7.43 }

字幕为何自动对齐:声音逐句合成,每句真实时长在合成时即被精确测量,因此字幕的文字(来自原稿,天然正确)和进度(来自时间轴,天然对齐)同时就绪,无需再用语音识别转写和改错字。

例外:若改用真人整段录音,则没有逐句时长,仍需用 Whisper 等语音识别生成时间轴。

05 第三步:用 Remotion 绘制画面

这一步是和「AI 一键生成视频」差别最大的环节,也是知识口播画面质量的关键。

原理:Remotion 把视频当网页(React 组件)渲染。标题、卡片、图标、柱状图、对勾叉号全部是代码绘制的矢量图形,放大不糊、位置精确、可逐帧控制。你不需要学 Remotion,由 AI 写组件。

5.1 规划场景

把文案按内容分组,每组对应一屏,并写一份场景标题清单 titles.txt,一行一个标题(第一行是封面标题)。示例片 350 字分 6 屏,封面 1 屏 + 内容 5 屏。

人只做这四件事,其他交给AI
定义问题,并且自己拍板
定好标准,AI才有章法

把每屏要呈现的内容用大白话描述给 AI,格式建议:屏幕标题 + 左侧放什么 + 右侧放什么 + 底部压一句什么。例如「左边放四条待办清单逐条点亮,右边一张蓝色说明卡,底部一句结论」。

5.2 画面规则(直接要求 AI 照做)

手绘质感分两层实现

  • 图形层:套一个很轻的 SVG 扭曲滤镜(feTurbulence + feDisplacementMap,scale 约 2.4),让方框和线条边缘轻微抖动,呈手绘感。
  • 文字层:不套该滤镜。中文一旦跟随扭曲会发虚、看似缺笔画。

手绘质感效果

字体:中文用开源免费可商用的「霞鹜文楷(LXGW WenKai Screen)」,英文数字配手写体(如 Chalkboard SE)。字体文件需内联打包,避免无头渲染时缺字。

信息密度要求:每屏必须实际承载「说明、对比、案例」中至少一类,标准摆法是「主概念 + 若干具体例子 + 一句判断」。禁止无标签的小人头、空括号、纯图标无文字等占位元素。

封面即第一帧:开场做一张完整封面,主标题作钩子,停留 2.6 秒再进正文。平台抓首帧即得封面,无需另做。

字幕:底部居中,每行不超过十几个字,超长按标点拆两行,按时间轴进出,不加花哨特效。

5.3 静帧质检(必做,省返工)

整片渲染前,先让 AI 把每一屏渲染成静态图(renderStill),像翻 PPT 一样逐屏检查,专找三类问题:

  • 文字与文字、文字与图形重叠;
  • 图形压住标题;
  • 元素拥挤、间距不足。

示例片在这一步查出并修掉三处:清单末条被底部卡片压住、柱状图顶到标题、封面装饰线与气泡贴连。静帧改完再渲整片,避免渲完才发现问题。

产出:通过质检的 Remotion 场景组件与场景时间配置。

06 第四步:混入背景音乐并渲染成片

背景音乐处理(ffmpeg):音乐从头到尾循环贯穿,音量压到比人声低约 15dB(约 -30dB 电平),只垫节奏不抢话;首尾各加淡入淡出;人声出现时轻微压低 BGM。

给 AI 混音时明确两个坑:

  • 多轨混合默认会做音量归一化、把人声响度砍半,必须关闭归一化。
  • BGM 闪避要轻(压缩比约 3、阈值 0.12)。压太狠会把整段话期间的 BGM 全压没,留下不自然的空档。

渲染:Remotion 用无头浏览器逐帧渲染,输出 1920×1080、30fps、H.264 视频 + AAC 音频的 MP4。75 秒成片渲染约 2–3 分钟。

产出:最终 MP4。

07 验收清单

成片出来后逐项检查:

  • 封面在第一帧即完整、干净,无元素叠压;
  • 字幕与配音逐句对齐,无错字;
  • 背景音乐全程存在但不盖人声;
  • 画面文字清晰不发虚、无重叠、无占位空图形;
  • 视频参数为 1920×1080、30fps、H.264 + AAC。

建议从最终 MP4 抽几帧复核(封面帧、信息最密的一屏、结尾帧),因为改动封面需要整片重渲。

08 适用范围与成本

适合:需要持续产出知识口播、要求画面信息准确、不想手动剪辑的人。模板一旦做好,后续每条片复用同一套画面代码,改文案即可,改一句配音只重新合成那一句。

不适合:需要炫酷运镜、真人特效、电影感画面的内容(应用专业剪辑或视频模型);完全不想使用编程类 AI 的用户(直接用剪映更省事)。

首次成本:主要是安装环境和把画面模板调到满意,需要一次性投入。之后每条片约为写文案 + 合成配音(数分钟,后台运行)+ 渲染(2–3 分钟)。

09 核心结论

AI 做视频不等于只能靠视频模型一键生成。把 AI 当作会写代码、会执行流程的助手,跑通一套自己可控的技术方案,得到的是稳定、可复用、风格统一的成片。

新手建议从最短的稿子起步:先让 AI 跑通「配音 + 一屏画面」,再补齐其余场景和混音,最后连成完整流程。

原文信息

作者:xiaoluv12o(@xiaoluv12o) 原文地址:

文章评论(8

漾漾其华41 分钟前

这个比较实用,已转发给同事。

回复
墨沐雨46 分钟前

看标题就点进来了,内容果然没让人失望。

回复
风倚栏35 分钟前

这篇文章分析得很透彻,收藏了!

回复
山问津26 分钟前

支持作者,持续关注中。

回复
星寻梦40 分钟前

这篇文章分析得很透彻,收藏了!

回复
空向阳29 分钟前

这个比较实用,已转发给同事。

回复
雪影30 分钟前

作者写得真不错,学到了不少。

回复
逐光而行30 分钟前

写得挺用心的,支持一下。

回复