本地部署开源视频模型 MiniMax H3:3060 显卡也能跑,附 ComfyUI 完整教程
最近,MiniMax 开源了他们的 H3 视频模型。
实力接近 Seedance 2.0。就拿即梦举例,生成一个 10 秒 720P 的视频,需要耗费 230 左右的积分。
199 元每月的会员套餐,也就生成 10 个视频不到,根本做不出来任何内容。

而这次 H3 甚至能在 3060、12G 显存的显卡上运行,真的算是普通用户的福利了。
我也在自己的 4090 上运行了一下,效果很不错,只需要考虑电费就可以了。

而且本地模型不像云端模型有那么多限制,有些奇奇怪怪的想法也是可以跑通的。
今天就手把手教大家如何在本机部署一个视频模型。学会之后,你就能部署其他的更开放一点的模型了。
1. 安装 ComfyUI
我们使用大名鼎鼎的 ComfyUI 来部署 MiniMax H3 模型。
ComfyUI 是一个基于节点的 AI 图像与视频生成工具。
我们打开 ComfyUI 官网(comfy.org/download),下载桌面端。经测试,国内网络下载速度也很快。

首次运行,我们选择本地 → 启用中国镜像 → 跳过并安装。
这里的意思就是只安装一些基础的工具,而不安装具体的模型,大概 10 分钟左右就能完成,不过具体还是看你的网速。

ComfyUI 首次安装步骤。
ComfyUI 现在已经安装完成了,我们需要去 Hugging Face 下载 H3 开源模型文件。
2. 下载开源模型文件
Hugging Face:目前全球最主要的 AI 模型和数据集分享平台(模型页:huggingface.co/Comfy-Org/MiniMax-H3)。
魔搭社区:国内版的 Hugging Face(modelscope.cn/models/Comfy-Org/MiniMax-H3)。
这里主要使用 Hugging Face 来演示,如果你网速比较慢的话,那就使用魔搭社区进行下载。
文件内容都是一致的,只不过 Hugging Face 上有更多更开放的模型。
然后我们来到模型介绍页面,这里简单介绍一下文件的含义:
- fl2va:文生视频 / 图生视频用
- ref2va:参考生成用,需要图片/视频/音频作为参考
- text_encoders:文本编码器,负责理解你的提示词
- vae:解码器,把数据转换成视频、声音
- bf16、pruned_bf16、int8、pruned_int8、pruned_fp8:这里代表模型的精度,从高到低。你的配置越差,那就选择精度越低的模型

这里简单理解各个文件的作用之后,我们就在 Files 页面下载。

diffusion_models 这里我们需要根据自己显存的大小来选择对应精度的模型。

我这里是 4090、24G 显存,下载的就是这个精度的模型 fl2va_pruned_int8。
下方带有 ref2va 的是图生视频模型,如果你能用到,就一同下载。

text_encoders 这个文件夹的文件,我们依旧根据显存大小进行下载。
vae 这里面的两个文件,大家都需要下载。

OK,这就是我最终下载到本机上所需要的文件,总计 50.3G。
如果你在 Hugging Face 下载非常慢的话,这是非常正常的,毕竟是国外的网站,在魔搭社区找到对应的文件下载就行。

3. 安装运行模型
前面我们已经将模型下载到本机了,现在就教你怎么使用这些模型。
在 ComfyUI 设置中点击存储,然后打开共享模型文件夹。

这个文件夹下方也有 diffusion_models、text_encoders、vae 这 3 个文件夹,我们把刚才下载的文件分别放在对应的文件夹下即可。
按照图中的结构,minimax_h3_fl2va_pruned_int8_convrot 就应该放在 diffusion_models 文件夹下,其他的大家自行放置,就不再一一截图了。

这是我下载的文件最终放置的文件结构。

然后我们重启 ComfyUI 桌面端,点击新建实例:名称随便填写,安装位置修改为我们模型存放的文件夹,如图所示。

依旧点击安装并跳过。安装完成之后,就会打开这样的画布。在画布中,我们点击左侧的模板。
目前 MiniMax H3 非常火,所以 ComfyUI 也内置了它的模板,然后选择文生视频。

然后就来到了节点工作台。我第一次使用就报错了,说我们缺失模型。
这是因为我们没有下载这个精度的模型,而是下载了更高精度的,所以在节点参数中替换就可以了。
这里替换完成之后,就不再报错了。

如果你还有报错,可以更新一下版本,很有可能是版本太低导致的报错。
也强烈建议你把报错信息发给 AI,这样就能针对性地修复了。毕竟大家的系统都不太一样,我不可能全部照顾到,所以也需要自己有一些解决错误的能力。
然后针对这个面板,简单说一下基础的操作,更加进阶的,大家可以在 B 站找个视频学习一下。
分辨率选择器:这里可以调节你想要的分辨率,最高支持 2K。
具体可以参考它下方提供的表格。

然后第二个节点是输入提示词以及控制视频生成的时长。H3 模型最多生成 15 秒的内容,所以不要超过 15,第一次生成 5 秒就可以了。

最后就是生成的视频,可以预览,也能直接下载。

4. 随便说点
经过以上步骤,你应该就能生成对应的视频片段了。
操作过程中可能会遇到图文中没有出现的各种小问题,这里就需要自己把报错发给 AI,然后针对性地解决一下。解决的问题多了,遇到下一个类似的问题,也就知道该怎么解决了。

原文信息
作者:小宇Boi(@xiaoyuboi)
原文地址:
讲解得很细致,新手也能看懂。
赞同,实践出真知。
写得挺用心的,支持一下。
收藏了,以后慢慢研究。
有没有更详细的教程,期待后续。
点赞,必须点赞
不错不错,已加入书签。
很有价值的分享,感谢整理。
很有价值的分享,感谢整理。
写得挺用心的,支持一下。