用 Codex 一键从选题开始做视频:7 步搭好适合自己的工作流
伯岩 · AI 工作流 / 实作指南7 个步骤 · 6 类能力 · 从资料走到完整成片

正式公开我的一个工作流,他可以复杂的执行一个完整的制作视频流程,给 Codex 一个选题,让它搜集资料、撰写文案、准备分镜、生成视频,再把配音、字幕和剪辑串联起来,最终输出一条能直接播放的成片。
这条制作链路目前已经可以搭建运行,但是因为链路非常长,所以中间很多关键节点都需要把控方向,但是出了确认和给出一些修改意见,基本上我自己的这个工作流已经完全无人值守自动化了。只不过为了把成片质量做扎实,就需要把“哪些内容值得讲、画面怎样配合文案推进、哪些节点必须人工核验”这些具体标准,同样写进整套工序里。
我把现有的视频制作流程梳理成了 7 个步骤。下面以“旁白+故事场景+解释信息”构成的短视频为例展开说明;做知识科普、产品介绍或读书分享时,可以根据自身内容按需调整。
理清这套流程后,你通常可以明确三件事:先从哪里着手搭建,每个环节具体要交付什么,以及不同工具之间如何顺畅交接工作。

图 01 · 先把流程搭清楚,日常任务才能用一句话启动。
STEP 01 / 搭建基础第一步,把你想做的视频写成具体要求。
制作的第一件事是选定一种准备持续更新的内容类型,把成片的验收标准明确下来。
例如:针对初次接触某个话题的观众,制作一条 60 至 90 秒的竖屏视频。开头直接点明核心主题,中间借助一个具体场景或推导过程把问题讲透,结尾给观众留一个明确的判断。整条视频的人物和场景风格保持一致,旁白咬字清晰,字幕在手机屏幕上易于辨认。
这里的时长仅作为起步参考。产品演示往往需要调取录屏,历史故事通常需要更多环境分镜,知识阐释则更倚重图表信息;内容形态发生变化,后续配合的工具组合也会随之调整。
在实际操作中,可以先让 Codex 整理一份单页的“账号制作规范”,逐项写明目标受众、题材边界、常规时长、画幅比例、文案口吻、视觉取向、配音风格、成本预算,以及具体的完工判定条件。
几条底线规则要在文档中固定下来:所有引文与数据必须附带出处,真实商品图片必须保持原貌,定稿文案不得擅自变更,成片导出后由指定负责人确认发布。
随后在 Codex 中建立专属的项目文件夹,规划独立的子目录分别归档原始素材、脚本初稿、图片资源、视频片段、音频文件、剪辑工程以及最终成品。账号维度的长期规范统一写在项目全局说明中,单条视频则依循各自的任务清单执行。
确立这份规范的实际作用,是让 Codex 在后续挑选工具、编排镜头和评估结果时,始终对照同一套客观依据。

图 02 · 把长期标准与本次任务分开记录,每个环节都有判断依据。
STEP 02 / 搭建基础第二步,接通 6 类能力,再做一次小测试。
在配置具体工具前,先厘清插件、Skill 与外部应用的分工,能避免很多操作层面的困扰。
Skill 是一套能被反复调用的结构化工作指引,里面可以打包提示词模板、参考资料以及辅助执行的脚本程序。插件则是分发载体,能够把 Skill 和连接外部服务的工具封装在一起集中安装。至于 Midjourney、Gemini、Flow 等独立产品,是在后台真正承担生成计算的外部应用。OpenAI 的插件说明〔1〕对这些组成部分的定位也作了类似界定。
按照这套视频制作链路,通常可以按如下方式对应配置:

图 03 · 按职责接通六类能力,同类工具先选择一套能稳定使用的方案。
在安装环节,通常需要配置的是 Chrome 插件以及 HyperFrames 的插件或 Skill 包。Midjourney 与各类视频生成平台属于需要单独调用的外部服务,部分高质量配音模型则可能需要在本地部署,它们并不是在插件市场点击一下就能全部自动就绪的组件。
通用插件通常可以直接在客户端的插件入口搜索安装,并按引导完成账号授权;HyperFrames 也提供了专门的官方 Skill 安装方式〔2〕。建议先让 Codex 扫描当前系统的运行环境,摸清已有的配置,再定向补充缺失的依赖项。
本地剪辑与合成往往依赖底层的运行环境与媒体处理工具,例如 Node.js 和 FFmpeg。你可以把配置交给 Codex,但需要它做完实际验证。FFmpeg〔3〕在这里主要承担视频编码、格式转码与音视频流封装等底层处理。
完成所有接口与环境对接后,用一段真实的测试素材把流程完整走通一次:确认系统能否顺利读取本地文件、能否从外部工具取回生成的片段、能否合成一段试听旁白,以及最终能否合成并导出一段几秒钟的样本视频。涉及账号登录或服务授权的节点,都在这一步提前完成验证。
工具出现在列表里,和整条生产链路完全畅通,是两个完全不同的完成状态。
网页和 API 也要分开理解。网页路线通过浏览器操作,API 路线通过接口调用;两者的接入、功能和费用可能不同。你有某个应用的账号,并不意味着 Codex 已经能调用它。
刚开始搭建时,尽量保持最小工具集:选用一个生图工具、一个视频工具、一套配音,搭配本地剪辑工具即可。等到某一类镜头的质感确实无法满足表达时,再去针对性扩充对应的能力模块。
STEP 03 / 搭建基础第三步,把制作方法写成 Skill,明确每一步交什么。
工具接好之后,还要让 Codex 明白具体怎么调度它们,才能把整条片子做出来。
我的配置里包含内容研究、视频总控、图像路由、视频路由和后期制作等技能。其中一部分是我自己在本地维护的 Skill,你完全可以按相同的职责,建立适合自己的版本。

把反复有效的方法收进制作规范,每一次交接就有了依据。
刚起步时,用“一个总控 Skill 搭配几份专项说明”最容易上手:
**内容研究:**交付参考来源、确认可用的事实、故事材料,以及还没定论的疑点。**文案与分镜:**交付完整旁白、屏幕字样、每个镜头的用途和大致视觉方向。**图片与视频路由:**说明每类素材为什么选这个工具、生成时具体输入什么。**配音与剪辑:**把前面敲定的文字和生成好的素材,理顺并放进同一条时间线。**质量检查:**逐项核对内容、画面、声音和最终导出的文件是否合格。
**这些职责可以交给同一个 Codex 按顺序往下走。**前期先把规则分别写进几个文件,流程跑顺之后,再把经常复用的操作拆成独立 Skill。
写每份说明时,重点讲清五件事:什么时候用它、先看哪些材料、具体做什么操作、最后交出什么文件,以及遇到什么问题必须停下来交给你拿主意。

图 04 · 先按职责写清交接内容,再把反复有效的方法固定为 Skill。
比如镜头生成失败时,就让它记下镜头编号、原始提示词、失败原因,以及下一版打算怎么调。只有把这些记清楚,换到下一个环节时,接手的人才知道该往哪改。
图像和视频的路由规则也可以写得很具体:这个镜头到底是要保人物长相一致,还是要做大幅度动作?画面里有没有不能变形的商品?需不需要指定最后一帧收尾?目前哪个模型或入口能接这些活?把每次选工具的理由写下来,后面复盘时心里才有数。
你可以直接在 Codex 中调用 $skill-creator,把这套分工讲给它听,让它自动生成 Skill。官方的技能创建说明〔4〕也介绍了这种做法:每个 Skill 都以一个 SKILL.md 作为总入口,根据需要,旁边还能再挂辅助脚本和参考样例。
不过,在把某个方法固定成规则之前,最好先在具体项目里多跑几遍。某一次碰巧跑通的效果,存下来当个参考案例就好,还不能直接当成放之四海皆准的标准套路。
STEP 04 / 开始生产第四步,先把资料、文案和画面方向一起确认。
正式做第一条视频时,先花精力把内容本身立住,别急着铺开做素材。
以讲书类视频为例,先核准书名和具体印本,再分清哪些是原书写的、哪些是读者的反馈、哪些是你自己的推论。评论区能帮你找到大家最关心的问题,但只要涉及书里的具体观点和故事,就必须老老实实回去翻原文核对。
做产品视频就核对产品资料,做知识科普就核对原始研究或可靠说明。把所有关键信息的出处整齐记在资料表里,后续修改文案时随时能找到依据。
写文案时,叙事线尽量直接:开头抛出一个值得看下去的实际问题,中间一步步讲清缘由、过程或当事人的抉择,结尾兑现前面的承诺,并顺手交代清楚适用场景和后续动作。
初稿写出来后,建议把画面先放一边,单读这篇旁白。只靠听,能不能听明白谁在做什么、事情的前后逻辑顺不顺、听完能带走什么?要是离开画面辅助就听得云里雾里,说明文案还得再磨。
读顺之后,让 Codex 把完整文案和大致的视觉风格一起交出来:定下来是走写实风还是插画风,场景大概怎么切,哪些段落得靠图表辅助拆解。拿不准的时候,让它先做一张风格预览图,直观比对一下再定。
这个阶段的目标,是把“讲什么”和“全片看起来大概什么气质”固定下来。这两点稳住了,再去细化镜头、生成大批素材,就能省掉大把推翻重来的功夫。

图 05 · 把文案和大致画面方向一起确认,再投入正式素材制作。
落实到每个分镜时,至少把这几样列明白:对应哪一句台词、想让观众看懂什么、画面里具体演什么动作、大概占几秒。把这些写清楚,后面配素材时,每一镜才能稳稳卡在点上。
STEP 05 / 开始生产第五步,先定人物和场景,再做首帧和动作。
这一步直接影响整条视频在视觉上是否连贯。
如果同一个角色在片中多次出场,应当先确定人物参考;同一个室内空间或核心道具反复出现,也先把环境结构与物件样式定下来。画面中的时代特征、服饰细节、道具形制与用光基调,都要始终服务于当前内容,避免中途出现不合时宜的偏差。
制作中通常会用到三类参考图,各自承担不同的分工:风格参考负责圈定画面的整体调性与质感,人物或物件参考负责交代主体的具体长相与特征,而逐镜首帧则用来明确具体镜头的构图、景别与起笔状态。
在这套方案里,正式画面的首帧默认使用 Midjourney 来完成,确认无误后再交付给视频生成工具。实际搭建自己的制作流程时,完全可以根据手头掌握的素材和任务特点,选择其他适合的生图工具。
需要留意的是,Midjourney 处理参考图的机制会随版本演进而调整。例如官方在文档中,将 V7 的 Omni Reference 与 V8 系列的 Edit Model 做了区分说明。因此在具体执行时,重点是掌握“借助参考资产维持视觉一致”的基本方法,并让 Codex 或相关助手核对当前版本的最新接口与规则,不必机械套用已经过时的旧参数。Midjourney 参考功能说明〔5〕
具体的推进顺序,是先做出单张最具代表性的关键画面,确认构图比例、主体状态与整体气氛;如果涉及多次出场的角色,再补充建立必要的身份参考图;确认基础稳固后,再批量铺开各个镜头的画面,并妥善记录每张图片对应的角色归属与镜头编号。

图 06 · 风格、主体身份、镜头起点各管一件事,再用明确动作驱动视频。
进入动态生成阶段后,提示词要尽量用具体的物理动作来表述。写出“人物拿起杯子,停顿一下,又放回桌面”,远比写“情绪复杂,充满电影感”更容易让模型理解,也更方便人工验收。提示词还应说明哪些东西保持不变,镜头怎么移动,声音允许出现什么。
在工具选择层面,Gemini 具备结合文本、静态图像及视频进行综合生成与编辑的能力;Flow 则提供了基于首尾帧与参考素材的生成控制,实际支持的功能以当前选定模式为准,这些特性都可以作为挑选生产工具的依据。Gemini 视频说明〔6〕、Flow 视频说明〔7〕
Grok Imagine 同样是一条值得测试的视频生成路径。其官方 API 文档〔8〕给出了图生视频的具体能力说明;如果在网页端操作,需要对照网页当前开放的输入项与调节范围,不能直接把 API 的参数配置硬套过来。
实际生成时,建议先拿最容易出问题的镜头做测试。生成结果合格后,将其归入正式素材库,再继续推进其余镜头。只要画面的核心动作交代清楚、日常观看节奏自然,就可以留用,片头片尾多余的几帧完全可以留到后期剪辑裁掉;核心动作做反、人物严重变样,才需要重新生成。

图 07 · 动作是否服务文意,比逐帧追求没有瑕疵更适合作为实际取舍依据。
这套场景型流程通常把原生 AI 视频覆盖目标定在全片的 85%—100%,让核心故事尽量在连续的动态镜头中展开。这是一种制作风格上的取舍,如果是制作软件录屏、教学演示或图表解析类视频,根据具体的信息传达需求设定比例即可。
真实书封、Logo、价格和精确文字,则保留原始素材,在后期叠加。它们需要逐字、逐像素正确。
STEP 06 / 开始生产第六步,固定声音,再把所有素材接到同一条时间线。
配音这件事最好单独当成一件事来管,因为它既决定了整个账号听起来的辨识度,也定下了整条视频的剪辑节奏。
一开始就要选定一个合适的声音,把声音样本和调试好的参数存好。往后换新文案时继续用这套声音,再根据具体内容微调语句间的停顿、重音和语气起伏。
这里可以使用 Qwen3-TTS〔9〕这类语音模型;要是确实需要更细致地调整音色,再去配置 OpenVoice〔10〕。在刚起步的阶段,找到一套用着顺手的配音方案就够用了,本地部署还需要考虑电脑硬件能不能带得动,以及后续维护的麻烦。
生成配音时,先跑一小段试听,重点听专有名词、地名、数字和长句子念得准不准。听着没问题了,再把整篇文案导完。涉及用到的声音素材,也要确保用的是自己拥有的或者拿到合法授权的版本。
旁白定下来之后,再对照实际音频的节奏做出字幕的时间轴,跟着声音一句一句去排镜头。要是后来重新录了一版配音,字幕轴和画面时长也得跟着同步改过去。
到了这一步,由 HyperFrames 接手做后期。它可以让 Codex 直接通过 HTML、CSS 和 JavaScript 来搭建视频工程,再打包渲染成视频成片;要是想改动画面,用大白话提要求,让 Codex 去动工程文件就行。HyperFrames 官方介绍〔11〕

让画面、旁白和字幕在时间线上对齐,再用手机完整看一遍。
在合成环节,真正需要花心思打磨的是“辅助理解的信息”。讲到复杂的人物关系,就让人物线索随着旁白的节奏一点点展开;讲到某个执行过程,就让前后步骤按因果顺序逐个跳出来;出现核心数字时,把数字放到观众能看清的位置。
举个例子:旁白提到两个人的关系发生了变化,背景里的视频负责交代角色的神情动作,前景则用简单的名字和连线变化帮观众理清走向。字幕、解释信息和故事画面,各自承担一个作用。
画面里自带的环境音可以留着,但混音时要把音量压低,一律给旁白让路。普通观众用正常音量听,不需要费劲猜台词,这就是最实在的验收标准。

图 08 · 时间线为关系示意,不代表固定秒数;实际安排跟随确认后的旁白。
等镜头和声音凑得差不多了,**尽量早点导出一版能从头放到尾的粗剪片。**只有完整看一遍,才能看出通篇节奏拖不拖、关键信息密不密,以及镜头之间切得顺不顺。
**STEP 07 / 检查与复用第七步,检查实际成片,把修改方法和恢复位置留下来。
**
视频导出之后,最后还要做一次完整把关。
先让 Codex 检查文件能不能正常解码、时长和画面尺寸对不对、有没有漏掉素材;接着你自己按正常速度从头看到尾,重点看事情有没有讲清楚、人物前后连不连贯、画面动作配不配合文意、字幕读着费不费力、声音听起来自不自然。
机器检查通过,只能证明对应的检查项通过。成片是否顺畅,还需要实际观看。
提修改意见时,尽量指出具体的时间点:“第 18 秒,字幕挡住了人物的手”“第 32 秒,旁白还没讲到结论,画面提前跑出来了”。具体到这一步,Codex 才能照着改准确。
同时,在项目文件夹里留一份清晰的进度记录:文案用的是哪一版、哪些素材定稿了、哪些还需要重做、最新能看的成片存在哪、下一步该干嘛。要是碰到任务中途卡住,先查清楚那个生成的镜头到底完成了没有,再决定要不要重新跑。
把这些记录留好,哪天任务停下来,Codex 随时能接着往下干。改了一句配音,就顺着调整对应的字幕和时间线;换了一个镜头,就回过头查一遍前后衔接顺不顺。
最后交付的文件,可以包含 MP4 成片、单独的字幕文件、封面图、发布文案、剪辑工程文件,以及一份素材来源清单。成片确认后,再执行你明确要求的发布动作。
等跑过几条视频之后,把碰到的共性问题整理一下:什么样的镜头容易出错、语句间留多长空白最舒服、哪种排版在手机上显得太满。等确认这些做法确实好用,再把它们补进自己的 Skill 里。

图 09 · 自动检查、实际观看、修改记录各自负责一件事,组合起来才形成闭环。
如果你准备开始搭,可以把下面这段话交给 Codex,替换方括号里的内容:
第一次搭建:把要求交代清楚请帮我搭建一个用于[内容类型]的视频制作工作流,观众是[目标人群],常用画幅和时长是[要求]。先检查我已经具备的插件、生成应用和本地运行环境,按总控、资料处理、图片、视频、配音、剪辑和检查列出缺项。优先使用我已有的工具。在指定项目文件夹内,建立制作要求、素材目录、进度记录和项目专用 Skill。每个步骤写清输入、操作、输出文件、检查标准,以及失败后怎样继续。用[第一条视频的主题和资料]走通一次。**先交付来源、完整文案和大致画面方向,确认后再制作正式素材。**画面需要固定人物和场景参考;精确文字与真实商品素材放在后期处理。先做关键样本,再按镜头计划生成;在[预算与生成上限]内执行,超出范围前告知我。最后交付能正常播放的完整视频、字幕、封面和可编辑工程,并留下下一次能复用的流程。
等这套流程跑通,下一条任务就可以缩短成:
流程跑通后:一句话启动按项目里已经确认的视频制作流程,做一条关于[主题]的视频。沿用现有声音和质量标准,先给我文案与画面方向,再推进到完整成片。
整套事情里最值得你花心思的,是把“话怎样才算讲透、画面怎样才算顺眼、哪几个关键点必须自己点头”交代具体。
往后即便各种生成工具升级换代,只要你的标准不变,依然能拿这套规矩快速搭起新的工作流。
不妨先挑一个打算长期做的方向,踏踏实实走一遍从搜集资料到输出成片的全流程。 思路大于skill,我相信能把这个工作流自己搭建完成,其实很多日常工作的流程,只要目前工具可以支持,都是异曲同工。
编者提示一:这篇内容对普通读者最直接的用法,是把它当作一次可以照着跑的 AI 工作流示范。建议先挑文中提到的一款工具(如 ChatGPT、Claude、Grok Bot 或对应的开源模型),把作者演示的输入、配置和调用步骤在自己的写作、编程或日常办公任务上小规模复现一遍,再评估生成结果与投入时间的性价比。
编者提示二:如果你正在用 AI 提升效率或探索第二收入,读这篇时建议带着三个问题:作者具体输入了什么材料、做了哪些设置与测试、最终输出了什么可交付的成果。把这三点套用到自己的场景,能快速判断这套方法是否值得迁移。
原文信息
作者:伯岩(@yvchengshanren)
原文地址:
暂无评论,快来抢沙发~