Codex 第 47 课:用 Codex + Hypit 复刻抖音爆款视频,留下可编辑工程

林知秋AI 前沿2026-09-171202 阅读💛 88 收藏

一句话结论

用 Codex 加开源项目 Hypit 复刻抖音爆款视频:把参考视频、人物图片和需求交给 Agent,它自动组织素材生成、剪辑、字幕和画中画,最后留下可编辑工程。本文收录于《Codex 从入门到精通》专题(课程编号 47),原文由 @Pluvio9yte 发布于 X。

Hypit 是什么?

Hypit 是一个让 AI Agent 制作视频的开源项目。你把参考视频、人物图片和要求交给 Codex,Agent 就可以借助 Hypit 组织素材生成、剪辑、字幕和画中画,最后导出视频。

它还会留下可编辑的工程。以后想改字幕或调整画中画,可以复用已经生成的素材,继续修改。

**开源地址:**hypit-ai/hypit

先看成品,左边是超哥说车的原视频,右侧是我拿“韩立”复刻的视频

图片

这个是用我自己的 Minimax H3 API 做的,如果走官方 API 或者用 SeedDance,效果会更好

**下面我们从安装开始,完整走一遍操作。**模型配置分两条路线:有 Hypit 额度用内置服务,没有额度就接自己的 API。 本例实际走的是自有 API 路线。

  • 明确分工:Hypit、Codex 与生成模型各自负责什么?

我们需要先厘清流水线中各项工具的具体职责,避免出现定位混乱:

  • Codex 的工作:作为代码与工程执行助手,Codex 负责解析用户的自然语言需求、检查并配置本机开发环境、读取并拆解参考视频的分镜结构、生成和修改工程源文件,并组织调用底层引擎完成自动化流水线。
  • 图像与视频模型的工作:专门负责生成静态视觉资产与动态画面。在本例中,图像模型负责生成古装男子在现代直播间中的首帧图像,视频模型则负责把首帧驱动为说话中的主播动态,并依据提示词生成穿插使用的外部车流空镜。
  • Hypit 引擎的工作:作为核心编排中心,Hypit 记录所有生成的资产依赖,规定镜头序列与切换时钟,控制字幕展示时机与外观样式,管理画中画的位置、层级与圆角遮罩,并在素材齐备后调用底层渲染器合成最终成片。

为了兼顾不同读者的实际条件,本教程将生成模型配置明确拆分为两条独立路线:

  • 路线 A:Hypit 账户内拥有可用额度,直接通过官方 HypiHub 服务调用内置托管模型。
  • 路线 B:没有 Hypit 平台额度,明确配置并接入属于你自己的第三方 API 接口。

你只需在路线 A 和路线 B 中挑选符合自身条件的一条完成配置,随后即可汇入共同的制作与编排流程。

  • 准备工作与素材规范

在开始操作前,需要准备好 Codex 、一条清晰的参考视频,以及一张希望替换进去的目标人物参考图。

人物参考图应尽量选择五官立体、光照均匀、衣饰结构与发型细节清晰的单人照片。由于参考图本身不包含运动信息,仅凭一张静态图不能假定模型会自动做出与原片主播相同的耸肩、摊手或手势动作。

如果你打算将成品公开发布,且不希望使用原视频主播的原声,应在正式制作前录制好替换用的台词干音。更换配音音频会导致发音停顿与段落时长改变,届时需要重新比对调整切镜与字幕出现的时间节点。

  1. 安装

执行官方 Skill 全局安装命令:

npx skills add hypit-ai/hypit -g

相关项目的安装入口可参考 Hypit 仓库地址,具体流程细节可参考 官方 Quickstart 手册。

路线 A:有 Hypit 额度,使用内置服务

有额度的话,可以直接让 Codex 使用 Hypit 内置服务,不需要另外配置自己的 API。

请使用 Hypit 内置服务,帮我完成登录,检查可用模型和额度。先告诉我预计消耗多少,再开始生成。

路线 B:没有 Hypit 额度,使用自己的 API

这次我走的是自有 API 路线:用 Google 生成图片,用 ZenMux 的 MiniMax H3 Max 生成视频。

我先让 Codex 配置接口,确认模型能够调用,再继续制作。

生图使用 Google API,视频使用 ZenMux 的 MiniMax H3 Max。请帮我完成配置并检查是否可用,需要付费测试时先说明费用。

图片

把原视频和韩立图片交给 Codex

接下来,我把超哥说车的视频链接和韩立图片一起发给 Codex,明确只复刻开头 20 秒。

请复刻这条视频的前 20 秒,人物替换成我提供的韩立。保留原片构图、切镜节奏、字幕和画中画,声音沿用原声。所有操作在同一个 Hypit 工程里完成。

这里要说清楚复刻范围,否则原片十几分钟,Codex 可能按整条视频规划。

图片

先看首帧,再生成视频

我让 Codex 先拆解镜头,生成四张首帧:直播间里的韩立、夕阳城市车流、白色奔驰隧道和日间街头车流。

这一步主要看人物像不像、服装对不对、场景有没有跑偏。首帧不满意,就先修改,再继续生成动态视频。

请先展示四个场景的首帧。保留韩立的面孔、长发和蓝金衣袍,汽车画面不要带原主播、字幕或画中画,后面统一由 Hypit 添加。

【这里放韩立直播间首帧】

让 Codex 分段生成,再用 Hypit 合成

首帧确认后,我让 Codex 生成了四段主播镜头和三段汽车画面,每段请求 5 秒,再由 Hypit 合成最终的 20 秒。

模型负责生成画面,Hypit 负责切镜、字幕和画中画。

请按照确认的首帧和预算生成动态素材,再按原片节奏合成 20 秒视频。汽车镜头出现时,把韩立放在下方居中的画中画里,配上原声和字幕。已经生成的素材直接复用,不要重复生成。

图片

这次从参考视频到韩立版成片,我主要做的就是给 Codex 提要求、看结果,再告诉它哪里需要调整。

Hypit 留下的不只是一条视频,还有一份可以继续修改的工程。下次想换人物、改字幕或调整画中画,就可以从这份工程继续做。

当然,目前的动作和口型还没达到一比一复刻,使用更好的模型比如Seedance系列会好很多。大家感兴趣的话,可以先找一条十几秒的短视频试试,看看它能帮你省下哪些步骤。

项目地址:hypit-ai/hypit。如果觉得有用,也可以给项目点个 Star。

原文信息

作者:Pluvio(@Pluvio9yte),AI 视频工作流实践者

原文地址:

文章评论(8

星寻梦37 分钟前

楼主辛苦了,内容很有参考价值。

回复
一叶知秋4 分钟前

整理得太全面了,省了我不少时间。

回复
雪影19 分钟前

支持作者,持续关注中。

回复
林观澜51 分钟前

很有价值的分享,感谢整理。

回复
山问津47 分钟前

这个比较实用,已转发给同事。

回复
雪影59 分钟前

思路清晰,干货满满。

回复
林观澜19 分钟前

整理得太全面了,省了我不少时间。

回复
陈皮话梅糖46 分钟前

看完了,收获满满,期待更多更新。

回复