不会剪辑也能用 Codex 加 Remotion 做出完整视频:六步六层任务书全流程
这条视频基本是AI自己跑的,自己真正动手的部分很少。

我准备好文案、配音、人物图片和录屏,再把素材文件夹交给 Codex。
它会自己听懂音频、划分时间轴、匹配画面、写 Remotion 代码,再把样片渲染出来。
我需要做的,是判断画面好不好看,并用时间码告诉它哪里要改。
这套方法不要求你会剪映、Premiere,也不要求你会写 React。只要能整理文件、描述需求、看懂视频,你就可以照着完成第一条。
下面不讲复杂原理,直接从零开始。
先看结果:你只需要完成 6 个动作
整个流程里,用户只做这六件事:
- 写好最终文案。
- 用 MiniMax 生成一条完整配音。
- 准备人物图片和必要的录屏、截图。
- 按任务书结构把文件夹地址和要求发给 Codex。
- 查看关键帧和短样片,按时间码反馈。
- 确认方向后,让 Codex 导出完整视频。
语音识别、时间轴、画面编排、动效代码、字幕同步和视频渲染,都由 Codex 完成。
你是在做导演和审核,不是在学习每一个剪辑按钮。
第一步:准备一份已经定稿的文案
先把口播文案改到可以直接朗读的状态。
不要一边生成视频,一边大幅修改文案。因为配音一旦变化,字幕时间、画面切换和动效节点都要跟着调整。
适合自动剪辑的知识讲解文案,最好具备三个特点:
- 一句话只讲一个意思。
- 有清楚的顺序,例如“第一、第二、第三”。
- 抽象观点后面带一个具体例子或操作场景。
例如:
开头用大字抓注意力。解释概念时,用图形和关键词拆解。提到工具,就展示操作界面。输出结论时,再回到人物画面。
这样的句子很容易被 Codex 转换成大字、图形、录屏和人物四种镜头。
第二步:用 MiniMax 生成完整配音
把定稿文案一次性生成一条 MP3,不要切成很多零散音频,也可以真实配音。
一条完整配音更容易成为整支视频的“时间标尺”。后面什么时候出字幕、什么时候换镜头、一个动效持续多久,都会跟着这条音频走。
生成后先完整听一遍,重点检查:
- 有没有错字、多音字或奇怪停顿。
- 数字、英文和产品名是否读对。
- 语速是否适合短视频。
- 中间有没有过长的静音。
确认音频没问题后,再交给 Codex。不要用视频画面去迁就一条读错的配音。
第三步:准备人物和演示素材
你不需要把每句话都配好画面,只准备不可替代的素材。
建议至少有:
- 4 至 6 张风格统一的人物图片。
- 1 张正面近景,适合开头和结论。
- 1 至 2 张半身动作图,适合指向标题或工具界面。
- 与文案对应的软件录屏、网页录屏或截图。
人物图片最好服装、发型、背景色和光线一致。动作可以变化,但不要有夸张手势或失真的大脸。
录屏不需要提前剪好。只要内容完整,Codex 可以根据口播长度裁剪、变速和局部放大。
把素材按使用顺序编号,文件夹可以这样整理:
textAI视频项目/ ├── 文案.txt ├── 配音.mp3 ├── 人物/ │ ├── 01-正面近景.png │ ├── 02-半身指向右侧.png │ ├── 03-思考动作.png │ └── 04-结尾动作.png ├── 录屏/ │ ├── 01-工具首页.mp4 │ └── 02-操作过程.mp4 ├── 截图/ │ └── 01-结果页.png └── 输出/
文件名不用专业,能让 Codex 看懂即可。然后复制这个文件夹的绝对路径,例如:
text/Users/你的名字/Downloads/AI视频项目
A-roll 和 B-roll 到底怎么分
做知识视频时,最容易误解的一点,是把真人当成装饰,把素材当成填空。
A-roll 是主要叙事画面。在这套流程里,它通常是你的真人口播、数字人视频,或者已经统一好形象的人物图。它负责建立信任、传递态度,让观众知道“是谁在讲”。
B-roll 是辅助说明画面,包括录屏、产品界面、案例截图、实拍素材和概念配图。它负责证明、解释或展示 A-roll 正在说的内容。
两者不是固定画中画。A-roll 可以全屏、半屏,也可以缩进角落;B-roll 可以短暂覆盖主画面,也可以与人物并排。画面大小取决于这一刻谁更重要。
用三个问题判断该看谁
处理每句话时,依次问三个问题:
- 这句话的价值主要来自说话人的态度和判断吗?
- 句子里有没有一个观众需要亲眼看到的对象或操作?
- 准备使用的素材能不能提供新的信息?
如果第一题是“是”,优先让 A-roll 做主画面。开场、个人经历、强观点、转折和结论都适合看真人。
如果第二题是“是”,B-roll 应该成为主画面。讲到软件按钮、网页流程、前后效果和真实案例时,只看人脸会浪费画面。
如果第三题是“否”,就不要为了热闹强行插素材。与台词没有关系的画面只会分散注意力。
一句话也可以完成一次 A/B 切换
不必等一整段说完才换镜头。一句话通常可以拆成三拍:
- 先用 A-roll 说出判断。
- 说到具体名词或操作时切到 B-roll。
- 句尾回到 A-roll,或者用一句大字落下结论。
例如“我会提前做好人物出镜、重点大字和工具演示等模板”。开头可以先看人物;念到几个模板名称时,依次展示对应画面;句尾再用一张汇总图完成收束。
再比如“提到工具,就展示操作界面”。这句话中的“工具”是切换信号。人物缩小,真实录屏放大,镜头推近到正在讲解的区域。此时录屏是信息主体,人物只保留陪伴感。
先做一张 A/B-roll 映射表
不需要用户逐帧排时间线。只要在任务书里写清每段的内容功能,Codex 就能根据语音识别结果补齐时间码。
文案功能A-roll 状态B-roll 状态画面目的开场钩子全屏或大近景暂不出现先建立人物和主题个人判断主画面只作轻量辅助保留情绪和可信度概念解释缩成半身或小窗图形、物件放大降低理解成本工具操作小窗或暂时退出录屏成为主画面让观众看清操作案例证据保留小窗截图或视频完整展示证明观点总结结论回到全屏逐步退出把注意力交还给人
这张表还有一个空间原则:一个主体变小,另一个就要变大。人物缩到角落后,B-roll 应该真正占据视觉中心,而不是让两边都很小,中间留下一块空白。
字幕是第三个固定层。无论 A-roll 还是 B-roll 成为主画面,都要提前留出字幕安全区,避免人物、按钮和重点文字互相遮挡。
没有配图怎么办:让 AI 生成粘土风素材
抽象概念往往没有现成录屏,例如“声音素材”“剪辑规则”“自动工作流”。这种内容可以使用 Image Gen 生成统一风格的粘土物件。
你不用会建模,也不用自己一张张画。在任务书的素材规则里,允许 Codex 调用 Image Gen 即可。
适合生成的物件包括:脚本文稿、声波、字幕模块、视频画框、剪辑机器、自动化传送带和工作流入口。
描述这类生成素材时,按“对象、材质、视角、色彩、交付形式”五个维度填写。
对象回答要表现什么概念,例如脚本文稿或剪辑机器;材质决定粘土、金属还是玻璃;视角统一使用正面或 3/4 视角;色彩跟随整条视频的视觉系统;交付形式则明确独立主体、干净背景、便于抠图。
最后再补充禁用项,例如不要文字、Logo、水印和复杂背景。这样换成纸雕、毛毡或微缩模型风格时,方法仍然成立。
这些图只负责帮助观众理解概念。标题、数字、字幕和重要中文仍然由 Remotion 排版,避免图片里的文字出错,也方便后期修改。
用 video-shotcraft 建立动效词汇
只告诉 Codex“多加一点动效”,通常会得到更多淡入、上移和缩放。原因不是 Remotion 做不到,而是需求里没有说明这段内容需要哪一种运动关系。
video-shotcraft 提供了一套镜头配方库,里面包含 152 张镜头卡和对应的动态样片。它更像一本可以播放的镜头词典:先看到效果,再决定它适合表达什么。
对知识口播视频,不建议直接套用完整产品宣传片模板。更合适的用法是“单镜头/单动效”:从画廊中选择少量镜头卡,让 Codex 读取配方和经过调校的示例代码,再适配到当前 Remotion 项目。
先安装,再看动态样片
读者可以把 GitHub 仓库地址交给 Codex,让它安装这个 Skill;也可以在终端运行:
bashnpx skills add Vincentwei1021/video-shotcraft
安装完成后,先打开 动态镜头画廊。
画廊可以按开场、字体、数据、镜头运动、转场和界面入场等类型筛选。看到合适的效果后,记下镜头卡名称。不要凭静态截图判断,重点观察它如何进入、在哪里停住、又怎样离开。
先从内容功能找动效
不要先挑一个很酷的效果,再强行寻找可以使用它的句子。先判断这段内容正在做什么:
内容功能可参考的镜头卡适合表达重点句逐字出现typewriter-moves、type-rhythm-sync结论、关键词、口号多个要素组成系统bezier-source-converge-merge素材汇聚、流程合并多个人物或 IP 形象avatar-grid-radial-build-colorize人物矩阵、角色资产展示工具界面cursor-flyover、product-card-progressive-assemble操作路径、产品功能扫描和锁定重点scanline-annotate-focus、scan-bracket-sweep查找、分析、强调局部流程向前推进timeline-travel、line-carry-transition步骤、交接、时间线前后结果对照before-after-slider-scrub改造、优化、效果比较结论落定spotlight-hero-card、outline-word-fill核心观点、最终答案
卡名不是提示词,也不是成片。它只是告诉 Codex 应该读取哪套运动语法和参考实现。视频的字体、人物、配色和材质仍然沿用自己的视觉系统。
用户只需要决定三个变量
使用一张镜头卡前,只需要决定:
- 它对应哪一句话。
- 这一刻谁是视觉主角。
- 动作结束后,画面需要停留多久。
如果不知道选哪张卡,可以先让 Codex 根据“句子功能、画面主体、情绪强度”给出镜头映射表。用户看过动态样片后,再确认使用哪些卡。
已经在画廊里选好效果时,直接提供准确卡名。Codex 会读取本地配方卡和对应示例代码,而不是仅凭卡名重新猜一个相似动画。
不要把镜头库变成动效大杂烩
每个镜头只让一种动效成为主角。路径汇聚时就不要再叠扫描、翻页和剧烈推拉;关键信息落定后,要给观众留出阅读时间。
一支知识视频可以有丰富的运动变化,但相邻镜头需要共享一个线索。例如上一镜的线条继续延伸到下一镜,人物缩小后录屏沿同一方向放大,或者关键词变成下一张信息图的标题。
这种“动作接力”比单独堆很多入场动画更连贯。
video-shotcraft 还带有分类音效。点击、扫描、纸张、机械和转场等声音可以配合画面动作,但人声始终优先。一个重要动作配一个清楚的声音反馈就够了,不需要每个文字都发声。
第四步:用“六层任务书”描述视频
很多人使用 Codex 时,会直接说:“参考这个视频,帮我剪一个一样的。”
问题在于,“一样”没有提供可执行标准。Codex 只能猜:它不知道哪条音频是主时间轴,不知道人物什么时候出现,也不知道你喜欢的是配色、构图还是动效。
更稳定的方法,是把一次视频需求写成六层任务书。
第一层:先定义成片边界
这一层只回答四个问题:
- 做横屏还是竖屏?
- 成片跟随哪一条音频?
- 口播能不能删减、改速?
- 这一轮做到关键帧、短样片,还是完整成片?
边界越清楚,Codex 越不容易提前渲染、误删口播或做错比例。
第二层:告诉它素材是什么,不替它剪素材
提供素材文件夹的绝对路径,并说明每类素材的角色。
例如,人物图片负责建立 IP 识别,录屏负责解释工具操作,截图负责展示结果。至于录屏从第几秒开始、需要加速多少,让 Codex 根据配音去判断。
用户提供的是素材含义,不是逐帧剪辑表。
第三层:先规定内容与画面的对应关系
不要一上来罗列十几种动效。先确定什么内容应该用什么画面:
文案类型优先画面开头钩子、强观点人物近景或全屏大字概念解释关键词、图形关系、粘土物件步骤和方法流程、序号、路径推进工具和操作真实录屏、局部放大案例和结果截图、前后对比总结和判断人物回归或一句结论
这张对应表才是自动剪辑的核心。Codex 先理解一句话承担什么功能,再决定调用哪种视觉组件。
第四层:把审美写成规则
“高级一点”依然太模糊。审美需要被拆成可以检查的变量:
- 背景色、主强调色和辅助色分别是什么。
- 标题、正文、注释之间有多大的字号层级。
- 人物是全身、半身还是近景。
- 卡片是编辑式排版,还是常见的居中白卡。
- 字幕放在哪个安全区。
- 哪些元素绝对不能同时出现。
还要写清空间规则。例如人物缩小时,信息主体要同步放大;人物、字幕和录屏各有自己的区域;重要内容不能贴近画面边缘。
有了这些规则,“好不好看”才会变成可以复查的问题。
第五层:按语义选择动效
动效不是越多越好,而是每一种动作都要表达关系。
打字出现适合关键结论;扫描适合寻找和分析;路径连接适合流程;交接适合从文案传到素材;汇聚适合多个要素组成一个系统;遮罩揭示适合公布结果;镜头推拉适合改变注意力层级。
同时设置反向约束:不能连续使用同一种淡入上移,不能用闪烁强调,不能让动效盖住真实素材。
至于 Remotion 的帧动画、局部时间和组件代码,让 Codex 自己实现。普通用户不需要把技术 API 写进每次需求。
第六层:设置分阶段交付
最后规定工作顺序:
- 先检查素材和识别配音。
- 再给出内容分段与画面方案。
- 接着渲染 4 至 6 张关键帧。
- 静态方向确认后做 15 至 25 秒样片。
- 样片通过后才导出完整视频。
这六层组合起来,就是一份完整的视频任务书。每次更换主题时,主要修改素材路径、内容对应关系和视觉要求,整个方法不需要推倒重来。
提交后,你不需要自己做语音识别,也不用计算每个画面位于哪一帧。先让 Codex 把素材和配音分析完。
Codex 会在后台自动做什么
等待期间,Codex 会依次完成:
text检查素材 → 识别配音 → 建立句子级时间轴 → 判断人物、信息图或录屏镜头 → 生成缺少的粘土配图 → 编写 Remotion 场景和动效 → 渲染关键帧
这些是 AI 的工作,不是读者需要照着学习的软件操作。
你只需要看它给出的时间轴有没有听错,以及关键帧是否符合自己的审美。
第五步:先看关键帧,不满意就别渲染
关键帧相当于视频的静态设计稿。它能最快暴露字体太小、人物难看、画面太空和元素重叠等问题。
审核时只看六件事:
- 人脸是否像本人,动作是否自然。
- 主标题是否一眼能读懂。
- 字号在手机上是否足够大。
- 人物、标题和素材有没有重叠。
- 工具界面是否看得清。
- 粘土素材是否帮助理解,而不是纯装饰。
修改关键帧时,使用“对象 + 问题 + 目标状态”三个要素。
比如:第 2 张的人物是对象,“大脸特写显得不自然”是问题,“换成正面半身图”是目标状态。
一次只处理已经看见的问题,并划定不需要变化的部分。这样可以减少一次修改牵动整套版式。
第六步:看 15 至 25 秒样片
静态画面确认后,让 Codex 先渲染一段短样片。
这一轮主要检查动态问题:
- 字幕是否跟着声音出现。
- 重点动效是否踩在对应词语上。
- 人物缩小时,另一侧内容是否同步放大。
- 镜头切换是否连贯。
- 有没有一闪而过的素材、黑帧或突然定格。
- 背景音乐和素材原声是否压住人声。
不要只说“这里不好看”。动态反馈使用“时间码 + 当前问题 + 期望变化 + 保持项”四个要素。
比如在 00:28 至 00:35,当前问题是六张人物图与旧标题重叠;期望变化是旧标题先退出,人物按 3×2 排列并整体上移;保持项是字体、配色和其他镜头不变。
音画不同步时,也不要凭感觉说“慢一点”。指出哪一个词说出口时应该出现哪一个画面,Codex 就能重新对齐视觉节点。
这一步不要求你懂帧数。播放器显示的分钟和秒就够用了。
最后:带着验收标准导出成片
短样片通过后,先锁定已经确认的版式,再进入完整渲染。
导出需求不要只写“给我完整视频”,还要附上验收标准:
- 开头、中段、结尾没有黑帧或意外定格。
- 人声完整,字幕和画面跟随真实语音。
- 文字、人物、录屏和配图之间没有重叠。
- 文字没有溢出安全区,手机上可以看清。
- 录屏只在对应场景播放,没有闪帧和残留声音。
- 输出成片路径,并抽取开头、中段、结尾画面复查。
拿到成片后,至少完整播放一遍。自动检查可以发现技术问题,但“这个动作好不好看”“这张人像像不像自己”,仍然需要你来判断。
这套方法适合什么,不适合什么
它很适合知识讲解、工具教程、产品拆解、课程内容和个人 IP 视频。它们都有明确文案,也能把画面拆成人物、信息、录屏和案例几类。
它不太适合依赖大量真实机位、复杂表演、强叙事和精细调色的广告短片。Codex 和 Remotion 可以完成编排与动效,但无法替代现场拍摄,也不能自动修复严重失焦、爆音或错误口型。
第一次尝试时,建议先做 30 至 60 秒。你会更快建立自己的字体、人物、配色和动效标准。等这套规则稳定,再扩展到三五分钟的视频。
真正需要积累的,是你的判断
完成第一条之后,把满意的开头、人物构图、字幕位置、信息图和转场留下来。下一条只更换文案、配音和案例素材,继续沿用已经确认的规则。
这样做几期后,你会得到一套属于自己的视频工作流。
它不是让每个人都变成剪辑师,而是让普通人也能把审美和内容要求准确交给 AI,再通过几轮审核得到稳定成片。
准备一段 30 秒文案,按上面的目录放好素材,再用六层任务书描述需求,先让 Codex 跑出你的第一组关键帧。
原文信息
作者:DZhao(@dzhao63405),AI 视频创作与 WorkBuddy 实操博主 原文地址: 发布时间:2026-09-03
整理得太全面了,省了我不少时间。
写得挺用心的,支持一下。
这个比较实用,已转发给同事。
看标题就点进来了,内容果然没让人失望。