本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
MiniMax H3 是 MiniMax 于 2025 年 7 月开源的首款通用多模态生成模型,支持 2K 分辨率直出、单段 4–15 秒、24fps 的音画同步视频,人声、音效、音乐在单次生成中原生合成。它最突出的三个能力是:长文本指令遵循(几百词的详细分镜提示词能一条条执行到位)、画面内文字与品牌信息渲染准确、以及基于多模态参考的角色/风格锁定。本地部署门槛为:显卡 12GB 显存起步(3060 可跑)、内存 32GB、硬盘 60GB 空闲;推荐 24GB 显存 + 64GB 内存 + SSD。软件上需要 ComfyUI 0.30.0 及以上版本,模型文件约 40GB,国内用户可通过 hf-mirror 镜像或 ModelScope 合规下载。配合社区 Turbo LoRA 插件可把采样步数从 20 步压到 4~8 步,提速约 5 倍。想看完整拆解,往下翻。
一、先搞清楚:H3 到底是什么,为什么值得本地装
大概从去年年中开始,视频生成这块的节奏明显变了。各家要么在卷时长,要么在卷分辨率,卷到最后用户发现真正卡脖子的其实是"听不听话"——你让它拍的镜头它拍不拍得出来。MiniMax H3 就是在这个节点上出来的:2025 年 7 月 31 日,MiniMax 正式发布并开源了这款通用多模态生成模型。它不是那种只能"文生视频"的单任务模型,而是把文本、图片、视频、音频四种模态塞进同一个上下文里统一理解,再一次性吐出带原生立体声音轨的视频。我自己折腾下来,最大的感受是:这玩意儿不是"又一个大模型",而是把视频生成从"抽卡"往"执行拍摄脚本"推了一大步。
先说几个硬指标,方便你有个直观印象:
|
指标 |
参数 |
|
输出分辨率 |
最高 2K 直出(无需二次放大) |
|
单段时长 |
4–15 秒,24fps |
|
音频 |
原生立体声,人声/音效/音乐一次建模,非后期叠加 |
|
输入模态 |
文本、图片、视频、音频可混合输入 |
|
开源情况 |
开放权重,支持本地部署 |
|
运行载体 |
ComfyUI 原生支持(0.30.0+) |
为啥说"原生立体声"这件事很关键?市面上一大堆视频模型生成的是无声片段,声音要么靠后期软件配音,要么靠另一套音频模型"贴"上去,贴出来的音画对不上节奏是常态。H3 是把声音当成和画面一起生成的一体化输出,画面里有人敲杯子,杯子的声音就在那个时间点出现,鼓点一响画面里的动作也跟着律动。这一点在生成 MV、广告、短剧镜头的时候优势特别明显。
再说多模态上下文。用大白话讲,H3 允许你在一句话里同时引用图片、视频片段和音频:"参考图片 1 里的这个人物造型,让她跟着音频 1 的节奏跳舞,镜头风格参考视频 2"。它把参考素材当"上下文"来理解,而不是简单地把图片"垫"进去。这也是它后面能玩出角色锁定、风格迁移、动作迁移这些花活的基础。
graph TD
A[多模态输入] --> B[文本提示词]
A --> C[参考图片]
A --> D[参考视频]
A --> E[参考音频]
B --> F[MiniMax H3 统一理解]
C --> F
D --> F
E --> F
F --> G[文生视频 T2V]
F --> H[首尾帧图生视频 I2V]
F --> I[参考模式 R2V / Ref2VA]
G --> J[2K 视频 + 原生立体声音频]
H --> J
I --> J
本地部署 vs 云端 API,怎么选
H3 官方也提供云端 API,按秒计费。但本地部署的价值不在"便宜"这两个字,而在三件事上:一是隐私可控,素材不用传出去,商业项目、未发布内容都可以放心跑;二是试错自由,提示词改一版跑一版,不用盯着计费表,可以放开手反复磨镜头;三是完全可控,量化精度、采样步数、分辨率、插件加速全在自己手里,想怎么调怎么调。我个人的建议是:预算和显卡条件允许就本地装一套,云端 API 可以作为出差、赶稿时的补充手段,两边搭配着用。
这几个月里,词元二号站后台也收到不少读者问 H3 的事,问得最多的就是"我的电脑能不能跑"和"装完到底怎么用"。这篇就把我从零装机到跑通三条工作流的完整过程写下来,硬件、软件、模型、提示词、排障一条线走完,照着做基本都能跑起来。
和同期的开源视频模型比,H3 的位置在哪
2025 年下半年开始,国内开源视频模型陆续登场,除了 H3 还有阿里通义万相(Wan)、腾讯混元视频、以及 LTX 这类轻量模型。简单横向对比一下,方便你判断自己该选谁:
|
模型 |
原生音频 |
多模态参考 |
指令遵循 |
本地门槛 |
一句话定位 |
|
MiniMax H3 |
支持(立体声) |
强(图/视频/音频混合) |
强 |
12GB 显存起 |
全能型,广告/MV/短剧通吃 |
|
通义万相 Wan |
部分支持 |
中 |
中 |
门槛接近 |
通用型,生态成熟 |
|
混元视频 |
不支持(后配音) |
中 |
中 |
门槛接近 |
通用型,中文友好 |
|
LTX 等轻量模型 |
不支持 |
弱 |
弱 |
8GB 可试 |
尝鲜型,速度快但能力有限 |
这个对比不是要分高下——不同模型擅长的领域不一样,很多人是几个模型混着用:H3 负责需要音画同步、角色锁定、文字渲染的镜头,其他模型负责风格更独特的镜头。但如果你想"一个模型解决大部分需求",H3 是目前开源阵营里综合能力最均衡的选择之一,这也是我把它作为本地主力的原因。
二、部署前的体检:硬件与软件门槛一览
装机之前先别急着下东西,花十分钟对着下面的表核一遍自己的机器。H3 全家桶(主模型 + 文本编码器 + 两个 VAE)加起来约 40GB,生成时显存和内存的占用都不小,硬件不达标不是不能跑,但体验会差很多。
|
项目 |
最低配置 |
推荐配置 |
说明 |
|
显卡 |
12GB 显存(如 RTX 3060) |
24GB 显存及以上 |
显存不够也能跑,但要降分辨率、用量化版 |
|
内存 |
32GB |
64GB |
H3 会借系统内存分担显存压力,内存越大越稳 |
|
硬盘 |
60GB 空闲 |
150GB 以上(建议 SSD) |
模型文件约 40GB,加上生成产物和缓存 |
|
系统 |
Windows 10/11、Linux |
同左 |
基本无特殊要求 |
|
软件 |
ComfyUI 0.30.0+ |
最新版 |
版本低于 0.30.0 没有 H3 原生节点 |
|
网络 |
能稳定访问模型下载源 |
宽带 |
首次下载约 40GB,建议走国内镜像 |
显存不够怎么办?三条降级路线
先说结论:12GB 显存是下限,但 12GB 不代表不能玩。我自己最开始就是用一张 12GB 的卡跑的,体验下来有三条降级路线可以组合使用:
- 用量化版模型。官方仓库提供了
pruned_int8这类剪枝量化版本,主模型体积从 30 多 GB 压到 19.5GB 左右,显存占用明显下降,画质损失在可接受范围内。 - 开 Turbo LoRA 的低显存模式。社区加速插件带了 low_vram 选项,能在显存和速度之间做权衡(后面第五章细讲)。
- 先降分辨率验证流程。第一次跑别贪 2K,用 608×352 这种小分辨率把整条链路跑通,确认没问题再往上加。小分辨率单段 5 秒的生成时间会短很多,适合用来调提示词。
不同显存档位分别能跑什么
很多人纠结"我 12GB 到底行不行、16GB 要不要换卡"。下面这张表是我根据社区实测和自己的体验整理的参考方案,按显存档位对号入座:
|
显存档位 |
建议运行方案 |
能跑出什么 |
|
8GB |
基本不推荐;如一定要试,需 int8 量化 + 超低分辨率 + 大量 offload |
极短测试片段,体验较差 |
|
12GB(3060 级别) |
pruned_int8 量化模型 + Turbo LoRA low_vram + 608×352 起步 |
5~8 秒短片,1080P 需要耐心等待 |
|
16GB |
量化模型 + Turbo LoRA,720P 可流畅试跑 |
10 秒内镜头,调提示词够用 |
|
24GB(推荐) |
量化模型正常跑,1080P 压力不大 |
15 秒镜头、参考模式都能玩 |
|
48GB+ |
可以挑战 fp16 原版 + 2K 直出 |
全功能体验,速度也快得多 |
为什么 H3 这么吃内存
很多第一次跑大模型的用户会困惑:明明显存 12GB 够了,为什么还要求 32GB 内存?原因是 H3 这类大模型在推理时会把一部分权重"卸载"到系统内存里,显存放不下的层临时借内存来放,用到的时候再换回来。这个机制让它能在小显存上跑起来,代价就是内存占用高、速度变慢。所以内存 32GB 是底线,64GB 会更从容——内存不够时,轻则生成极慢,重则直接报错中断。
Windows 用户建议顺手把虚拟内存调大,给模型"借内存"留足余地:
1. 右键"此电脑" → 属性 → 高级系统设置
2. 性能 → 设置 → 高级 → 虚拟内存 → 更改
3. 取消"自动管理",自定义大小:初始 16GB,最大 32GB
4. 点"设置"保存,重启电脑生效
装机前的自检清单
- 显卡驱动更新到最新(N 卡用户去官网下 Game Ready / Studio 驱动)
- 确认显存容量(任务管理器 → 性能 → GPU → 专用 GPU 内存)
- 确认系统内存 ≥ 32GB,若只有 16GB 建议先加内存再跑
- 确认 C 盘或模型所在盘空闲 ≥ 60GB
- Windows 用户建议在系统设置里把虚拟内存调大(16GB 以上),H3 借内存时更稳
- 记录一下自己显卡型号和显存,后面选模型版本用得上
这一章核完,机器够格就往下走;不够格也别灰心,先按上面三条降级路线把心态摆正,后面的章节里我会在每个环节标注"低显存怎么处理"。
三、搭好 ComfyUI:版本是硬门槛
H3 在 ComfyUI 里的原生支持是从 0.30.0 版本开始加入的。这句话一定要先划重点:你的 ComfyUI 版本低于 0.30.0,后面装再多模型也白搭,因为界面上根本没有 H3 专用的节点。我见过太多人卡在这一步——模型下了 40GB,打开工作流却提示节点缺失,最后发现是版本太老。
装 ComfyUI 之前:先确认显卡驱动和 CUDA
正式安装前,建议花两分钟确认显卡驱动状态。很多"装上就跑不起来"的问题,根子其实在驱动上,而不是 ComfyUI 本身:
|
检查项 |
怎么做 |
出问题怎么办 |
|
显卡驱动版本 |
N 卡去官网查最新驱动,任务管理器 → 性能 → GPU 看型号 |
更新到最新 Game Ready / Studio 驱动 |
|
驱动是否生效 |
设备管理器 → 显示适配器,看显卡是否正常显示 |
有感叹号说明驱动异常,重装驱动 |
|
CUDA 环境 |
ComfyUI 桌面版自带 CUDA 依赖,无需手动装 |
手动部署用户参考官方文档配置 |
有个新手常见误区:以为要先手动安装 CUDA Toolkit 才能跑 ComfyUI。桌面版安装包其实已经把 Python、PyTorch、CUDA 相关依赖全部打包好了,你只需要保证显卡驱动是新的就行——驱动负责让系统和显卡"对话",CUDA 库则由 ComfyUI 自带。驱动太老,模型加载时容易报各种看不懂的错误,先更新驱动往往能解决一半问题。
新装:桌面版一条龙
如果你电脑上还没有 ComfyUI,直接去官网下载桌面版安装包。桌面版的好处是把 Python、PyTorch、CUDA 这些底层依赖全部打包好了,双击安装、一路默认设置就行,不用自己配环境变量,对新手最友好。
安装流程(桌面版):
1. 官网下载 ComfyUI 桌面版安装包(Windows 选 .exe)
2. 双击运行,选择安装目录(默认 C 盘,建议改到空间大的盘)
3. 等待安装器自动处理 Python / PyTorch / CUDA 依赖
4. 安装完成后启动,等待首次初始化
5. 浏览器打开 http://127.0.0.1:8188,看到节点编辑界面即成功
已有 ComfyUI:先查版本再决定动不动
老用户别急着重装,先看版本号:启动 ComfyUI 后,点左下角齿轮(设置)→ 关于,里面会显示版本号。如果低于 0.30.0,再走升级:
- 桌面版用户:在应用菜单里找"检查更新",点一下等它自动完成;
- 手动部署(git 方式)用户:在 ComfyUI 根目录执行
git pull拉取最新代码,再重启。
# 手动部署用户升级(在 ComfyUI 根目录执行)
git pull
# 如果之前有自定义节点,顺带更新一下 Manager
最容易翻车的坑:报错"缺少 MiniMaxH3 节点"
启动后如果加载工作流时报错提示 "缺少 MiniMaxH3ImageToVideo 节点" 之类,99% 是版本太低,别急着重装系统、别怀疑模型没放对,先回设置里确认版本号。版本达标还报缺节点,再检查是不是自定义节点管理器(ComfyUI Manager)没装,或者启动时部分节点导入失败——去 ComfyUI 控制台窗口看启动日志,会明确列出哪个节点加载失败。
验证成功的标志很简单:浏览器打开 http://127.0.0.1:8188,能看到深色节点画布、左侧有节点面板,就说明 ComfyUI 本体已经跑起来了。到这里,软件地基算打完了。
ComfyUI 新手操作速览
第一次进 ComfyUI 的人,面对满屏的节点和连线多少会发怵。其实核心操作就几件事,先记住这四个就够用了:
|
操作 |
怎么触发 |
用途 |
|
拖动节点 |
左键按住节点标题栏拖动 |
调整画布布局 |
|
连线 |
从节点右侧输出点拖到另一节点左侧输入点 |
建立数据流 |
|
删除节点 |
选中节点按 Delete,或右键 → 删除 |
清理多余节点 |
|
运行 |
右上角 Queue Prompt 按钮 |
执行整个工作流 |
几个实用小习惯:滚轮缩放画布(找不到节点时缩小找);右键空白处弹出菜单(可以快速搜索添加节点);加载模板后先别乱动连线,官方工作流的节点链路是验证过的,新手直接改参数就行,动了连线容易把自己绕进去。想装自定义节点,先确认左下角有 Manager 图标,没有就通过安装器补装 ComfyUI Manager——后面装 Turbo LoRA 也要用到它。
四、模型文件下载与摆放:一张表讲清楚
H3 跑起来需要四类文件配合,缺一不可:主模型、文本编码器、视频 VAE、音频 VAE。很多人只下了主模型就开跑,结果生成出来没声音(少了音频 VAE),或者提示词理解乱七八糟(少了文本编码器)。下面这张表把每一类文件讲清楚。
四类文件都是干嘛的
|
文件类别 |
具体文件 |
体积 |
作用 |
|
主模型(二选一或都下) |
FL2VA(文生视频 / 首尾帧生视频) |
19.5GB(int8 剪枝版) |
视频画面的核心生成引擎 |
|
主模型(可选) |
Ref2VA(全能参考模式) |
19.5GB(int8 剪枝版) |
多图/多视频/音频混合参考,角色锁定 |
|
文本编码器 |
Qwen3-VL-32B(nvfp4 量化版) |
14.6GB |
把提示词"翻译"成模型能懂的向量,本身是 32B 大模型 |
|
视频 VAE |
video VAE(fp16) |
4.8GB |
把潜空间数据解码成可见画面 |
|
音频 VAE |
audio VAE(fp32) |
577MB |
把潜空间数据解码成声音,少了下就没声音 |
主模型的两个变体怎么选?简单说:FL2VA 是主力,纯文字驱动生成视频、或者给一张起始帧让它接着动,都用它;Ref2VA 是进阶,支持多张参考图、多段参考视频、音频混着输入,做风格迁移、角色锁定、MV 这类活才需要它。两个都下也行,加起来约 40GB,硬盘够就全下。
文本编码器那个 32B 的 Qwen3-VL 系列,本身比主模型还大,所以官方仓库里提供了 nvfp4 量化版,只有 14.6GB,显存压力小很多,效果损失基本感知不到——果断选量化版,别下满血版给自己找麻烦。
下载清单与摆放目录
下载完成后,文件的摆放位置有严格规定,放错目录 ComfyUI 就"找不到模型"。对照下面的清单检查:
ComfyUI/models/diffusion_models/ ← 放主模型
minimax_h3_fl2va_pruned_int8_convrot.safetensors (19.5GB,FL2VA,推荐先下)
minimax_h3_ref2va_pruned_int8_convrot.safetensors (19.5GB,玩参考模式时加下)
ComfyUI/models/text_encoders/ ← 放文本编码器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (14.6GB)
ComfyUI/models/vae/ ← 放两个 VAE
minimax_h3_video_vae_fp16.safetensors 

