本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
2026年7月31日,MiniMax 发布通用全模态生成模型 H3:文本、图像、视频、声音统一理解,原生双声道音视频,最高 15 秒 2K 直出,官方定价 2K 分辨率 0.8元/秒,只有同类旗舰的三分之一;8月3日模型正式开源,24小时内上百家厂商完成适配。紧接着,秘塔AI(metaso.cn)上线 H3 视频生成,给出 2K 0.29元/秒、768P 0.19元/秒的明码标价,把AI视频的单价打到了两毛钱以内。 本文我会把这件事从里到外拆一遍:H3 的架构到底先进在哪、价格为什么能这么低、开源之后普通人有哪些玩法,然后重点讲我自己的实操——在秘塔AI里怎么一步步生成视频、多参考模式怎么用、提示词怎么写才出片、怎么把 H3 接进 ComfyUI 工作流,最后算一笔明明白白的成本账,再聊聊自建部署和平台方案该怎么选。想看完整拆解,往下翻。
先说结论:对普通创作者来说,2026年的AI视频,卡脖子的已经不是模型能力,而是"价格、效果、门槛"这三件事。H3 这一波"发布即开源、上线即打折",算是把这三件事同时往前推了一大步。技术负责降低门槛,真正决定上限的,依然是人的创意——这句话我放在开头,也放在结尾。
第一章 2026年的AI视频,卷到了什么程度
在聊 H3 之前,先花点篇幅把 2026 年 AI 视频这个赛道的"天气"说一说,不然你很难理解为什么 H3 一发布,整个圈子反应这么大。
我自己从 2024 年开始玩 AI 视频,见证过很多"发布即巅峰"的模型,也见证了价格从"按条计费"一路卷到"按秒计费、按分计费"。到 2026 年,这个行业有几个很明显的信号。
第一个信号是产量爆炸。有统计数据显示,2026 年第一季度,AI 剧上新量超过 10 万部,全年市场规模预计能到 240 亿元左右。AI 漫剧、拟真人剧、广告素材、电商短视频,这些内容形态已经不只是"玩一玩",而是实打实地在生产线上跑。产量上去了,成本就成了所有团队最敏感的那根神经。
第二个信号是监管在收紧。2026 年 4 月起,AI 内容备案新规正式实施,行业一度传出数万部作品下架的说法。这对行业是好事——粗制滥造的产能被清出去,认真做内容的团队反而有了更大的空间。我在词元二号站上写过多篇关于 AI 内容合规的文章,核心观点一直没变:AI 是生产工具,内容质量和合规底线才是护城河。
第三个信号是价格战进入深水区。2026 年各家模型的价格一路走低,我整理了当时主流模型的大致价格区间,大家可以感受一下这个"卷"的程度:
|
模型/平台 |
价格档位 |
说明 |
|
Vidu Q3 |
1080P 约 0.2元/秒 |
主打速度与性价比,一度被很多短剧团队选用 |
|
可灵 AI |
按积分计费,长视频友好 |
快手生态,最长可生成较长的镜头段落 |
|
即梦 AI |
会员/积分制 |
与剪映深度集成,抖音创作者用得多 |
|
海外头部模型 |
折算每 10 秒约 1 美元上下 |
访问与支付门槛高,普通用户用得少 |
|
MiniMax H3(官方) |
2K 0.8元/秒 |
发布即把旗舰价格砍到三分之一 |
这里我得插一句:上面这些价格都是 2026 年年中的行情,模型定价变动很快,具体以各家官网为准。但趋势很清楚——AI 视频的单价,正在从"秒杀价"变成"白菜价"。前两年大家讨论 AI 视频,聊得最多的是"这个模型生成的人物手部会不会崩""运动是不是流畅";到了 2026 年,主流模型的画质差距已经没那么大,大家比的变成了谁更便宜、谁更稳定、谁更好用。
也正是在这个节骨眼上,MiniMax H3 发布了。7 月 31 日发布,8 月 3 日开源,紧接着秘塔AI 上线接入、价格打到两毛钱以内。这一连串动作,等于在已经很卷的赛道上又踩了一脚油门。
那 H3 到底凭什么?它的技术底座和别的模型有什么不一样?接着往下看。
第二章 MiniMax H3 到底强在哪:技术原理白话拆解
这一章写给非技术背景的朋友,我会尽量把 H3 的原理讲成人话,但干货密度不会降。如果你本来就在做 AI 视频,这一章能帮你理解为什么 H3 的"可控性"这么强。
2.1 一个关键转变:从"单项生成"到"全模态统一理解"
先看 H3 的官方定位:通用全模态生成模型。这句话拆开看有三个词——通用、全模态、生成。
"全模态"的意思是,它不只吃文字、不只吃图片,而是把文本、图像、视频、声音放在同一个上下文里统一理解。你给它一张参考图、一段参考视频、一段参考音频,再配一段文字指令,它能同时理解这些素材之间的关系,以及它们和"你想要的输出"之间的关系,然后一次性生成带声音的视频。
这和前两代模型(海螺系列前代产品)的思路完全不一样。前两代更像"单项特长生":文生视频是文生视频,图生视频是图生视频,各干各的。H3 则是把任务统一了,模型在预训练阶段就见过大量"多模态输入 + 多模态输出"的组合,所以它能听懂非常复杂的指令组合。
举一个我最常拿来解释的例子。你给 H3 这样一段输入:
输入素材:
- 参考图1:一个穿红色外套的角色立绘
- 参考视频:一段角色挥手的动作片段
- 参考音频:一段欢快的背景音乐
- 文字指令:让角色在雪地里向镜头挥手,背景音乐保持,镜头缓缓推进,生成10秒视频
对传统模型来说,这是四份互不相干的输入,得靠工作流里一堆节点去"拼装"。对 H3 来说,这就是一份多模态上下文,它直接在内部把这些素材"揉"在一起理解,再生成结果。这也是为什么 H3 的指令遵循能力这么强——它在 Artificial Analysis 的视频编辑能力榜单上排全球第一,靠的正是这种统一理解能力。
2.2 三段式架构:H3 不是"一个模型",是"一套系统"
MiniMax 官方把 H3 拆成了三个部分,这一点很关键,因为它们决定了你能在本地跑什么、必须在云端调什么。我画一张结构图,再用大白话解释:
flowchart LR
A[多模态输入<br/>文本/图/视频/音频] --> B[H3-Context-IR<br/>多模态指令理解与预处理<br/>未开源]
B --> C[H3-Base<br/>核心生成模块<br/>已开源]
C --> D[768p 音视频]
D --> E[H3-Regenerate-2K<br/>基于上下文的2K画面再生<br/>未开源]
E --> F[2K 视频输出]
三个部分的分工是这样的:
|
组件 |
作用 |
是否开源 |
通俗理解 |
|
H3-Context-IR |
整理多模态输入,理解创作意图 |
未开源 |
"理解层",相当于导演看剧本 |
|
H3-Base |
完成基础音视频生成,输出 768p |
已开源 |
"执行层",相当于拍摄现场 |
|
H3-Regenerate-2K |
基于上下文把画面重生成到 2K |
未开源 |
"精修层",相当于后期升格 |
这里有个细节很多人没注意到:完整的 2K 输出,其实是一条混合链路——先用 H3-Context-IR 整理输入,再用本地 H3-Base 生成 768p,最后调 H3-Regenerate-2K 的云端 API 把画面重生成到 2K。所以哪怕你本地部署了开源权重,想要 2K 画质,最后一步还是得走官方服务。这个"本地 + 云端"的混合方案,我在第十章讲自建部署的时候还会细说。
顺便解释一下 H3-Regenerate-2K 的巧妙之处:它没有用传统的"超分辨率模块"(就是那种把低清图放大加细节的做法),而是让 H3 自己基于上下文对生成结果"重新生成"一遍。好处是画面细节和原生成内容天然一致,不会出现放大后糊成一片或者细节乱编的问题。
2.3 两种任务模式:FL2VA 与 Ref2VA
H3 提供两种核心任务模式,这也是你上手后首先要分清的:
- FL2VA(First/Last Frame to Video with Audio):文生音视频,以及首尾帧生成。你给第一帧和最后一帧两张图,模型自动补出中间的运动过程,还带声音。做镜头过渡、转场动画非常好用。
- Ref2VA(Reference to Video with Audio):全模态参考生成。给参考图、参考视频、参考音频,模型按照参考素材的风格和内容生成新视频。这就是"多参考模式"背后的能力。
两种模式都支持原生双声道音频输出——人声、音效、音乐是建模在一起、一次前向推理直接生成的,而不是后期叠加音轨。这一点对做短视频的人来说太重要了:以前文生视频生成完,还得另找工具配音、配乐、对齐口型,现在一步到位。
2.4 输出规格:原生 768 画布,上限 2K、15 秒
最后把输出规格列清楚,方便你做分辨率规划:
- 原生画布:短边 768px,上限约 768×1344(即 16:9 下的 1344×768)
- 最高分辨率:2K 直出(通过 Regenerate-2K 链路)
- 最长时长:15 秒
- 帧率网格:24fps 下每块 17 帧(17k+5),时长会自动吸附到这个网格上
- 音频:原生双声道立体声,32kHz 采样率
这一串参数意味着什么?意味着H3 从设计之初就是奔着"可直接商用的生产素材"去的——15 秒刚好覆盖短视频平台的单镜头极限,2K 足够上大屏,原生音频省掉了后期音轨的工序。它不是一个"生成个好玩的小视频"的玩具,而是一个冲着生产线去的工具。
第三章 0.8元/秒的底气:H3 凭什么把价格打下来
上一章说 H3 很强,但强模型不稀奇,稀奇的是强还便宜。H3 官方定价 2K 分辨率 0.8元/秒、768P 不到主流旗舰的一半,这价格在 2026 年已经算刺穿行业底线了。更夸张的是,模型一开源,第三方平台立刻跟进——秘塔AI 直接给出 2K 0.29元/秒、768P 0.19元/秒,2K 价相当于官网价(0.8元/秒)的 3.6 折。
那问题来了:凭什么 H3 能把成本压到这么低?我查了不少资料,归纳下来主要是四个层面的系统级优化。这不是什么黑科技魔法,而是实打实的工程取舍。
3.1 高压缩 Tokenizer:视频生成的"省油"核心
先说最核心的一招:高压缩 Tokenizer。
Tokenizer 你可以理解成"翻译器",把视频画面翻译成模型能处理的 Token(可以理解为"单词")。同样的画面,Token 用得越少,模型处理起来就越省算力,成本就越低。H3 通过专门训练的视频 Tokenizer,把视频画面压缩得特别狠——同样一段视频,H3 需要的 Token 数量比常规方案少得多。
打个比方:别人传一张 100MB 的照片,H3 只需要传 20MB 的"压缩包",处理起来自然又快又省。这一步是从源头把成本降下来的关键,也是 H3 敢把定价打到三分之一的最大底气。
3.2 理解与生成分离的异构训练
第二个层面在训练阶段。视频生成有个天然矛盾:理解任务(看懂画面)和生成任务(画出画面)对计算资源的需求差别很大。H3 采用了理解与生成异构训练架构,把两套负载分开优化,训练吞吐提升了近 30%。
什么意思呢?就好比一个团队里,有人专门研究剧本(理解),有人专门负责拍摄(生成),各干各的擅长的,整体效率自然比"一个人又写剧本又拍片"高。训练效率上去了,均摊到每个用户的推理成本自然就下来了。
3.3 原生稀疏注意力:长序列不再"烧钱"
第三个层面在推理阶段。视频是长序列数据,一帧帧画面拼起来,序列长度非常可观。H3 在训练的最后阶段引入了原生稀疏注意力机制——简单说,模型不再"每帧都盯着所有帧看",而是聪明地只关注真正相关的部分,大幅降低长序列的计算开销。
这里有个细节要提醒大家:H3 的稀疏注意力实现没有包含在首个开源版本里,官方说会在后续更新中单独发布。所以如果你想本地部署,初期版本跑起来的效率可能没有官方服务那么高——这个差距就是我反复强调"自己部署不一定省钱"的原因之一,后面细说。
3.4 全链路工程调优:把每一分算力用在刀刃上
除了上面三点,还有一堆"看不见的优化":针对视频长度、分辨率、多模态负载差异大的特点,在异构训练、负载均衡、GPU 利用效率等方面做了大量调优。这些都不性感,但每一分优化最终都会变成价格表上的一分钱。
我把这套降本逻辑整理成一张表,方便你对照着理解:
|
降本手段 |
作用环节 |
通俗比喻 |
省的是什么 |
|
高压缩 Tokenizer |
输入处理 |
照片压缩包 |
算力/Token 数量 |
|
异构训练架构 |
模型训练 |
专人专岗 |
训练成本 |
|
原生稀疏注意力 |
推理生成 |
只看重点 |
长序列计算量 |
|
负载均衡与效率调优 |
全链路 |
流水线管理 |
闲置算力浪费 |
3.5 从"价格战"到"成本结构战"
把这套逻辑看完,你会发现 2026 年的价格战已经和以前不一样了。以前是"烧钱补贴换用户"——先亏本把用户圈进来再说;现在是成本结构上的碾压——模型本身就能以更低的成本产出同等质量的视频,降价是顺理成章的事,而不是割肉。
这也是为什么 H3 敢开源:反正我的成本结构够优,开源不但不会把自己卷死,反而能让生态里的伙伴(云厂商、API 平台、芯片厂商)一起把价格打到接近成本价,最终受益的是所有创作者。
第四章 开源之后:H3 的生态与三种玩法
8 月 3 日,MiniMax 正式把 H3 的核心生成模块(H3-Base)权重开源,这在圈内被形容为"重磅炸弹"。为什么这么说?因为视频生成模型开源,和语言模型开源是完全两码事——语言模型开源后,普通电脑也能跑个小参数版本;视频模型开源后,光是把权重下载下来、把环境配起来,就已经劝退绝大多数人了。
但开源这件事的意义,从来不在于"人人都能跑",而在于它打开了一整条生态链。
4.1 24小时百家适配:开源释放的连锁反应
H3 开源后的 24 小时内,就有超过一百家国内外合作伙伴完成了首日适配和接入。这里面包括好几类角色:
- 云厂商与算力平台:硅基流动这类大模型云服务平台,把 H3 做成"开箱即用"的 API,用户不用碰任何部署细节;
- 芯片厂商:英特尔锐炫 Pro B70 在第一时间完成 Day 0 适配,给出了基于多卡 GPU 的部署方案;华为昇腾、摩尔线程、沐曦、海光等国产芯片厂商也都加入了适配行列;
- 工具生态:ComfyUI 官方发布了 H3 的 API 节点,社区也贡献了"导演台"之类的一键工作流;
- 内容平台:秘塔AI 这类面向普通用户的平台,直接把 H3 包装成网页端一个按钮就能用的视频生成功能。
这一串连锁反应,本质上是在复制当年语言模型开源走过的路:从"模型能力比拼"转向"生态能力竞争"。谁能最快被部署、被接入、被用起来,谁就是赢家。H3 在 Hugging Face 开源社区的热度一度冲到第一名,超过了不少语言模型,就是这个逻辑的体现。
4.2 普通人的三种玩法
对创作者来说,开源带来的不是"自己动手",而是选择权。我把 H3 的玩法归纳成三种,你可以根据自己的情况对号入座:
|
玩法 |
适合谁 |
成本水平 |
上手难度 |
效果天花板 |
|
官方 API(海螺等官方渠道) |
追求稳定、需要 2K 输出的专业用户 |
2K 0.8元/秒 |
中(需写代码或接工具) |
最高(含完整 2K 链路) |
|
第三方平台(如秘塔AI) |
绝大多数普通创作者 |
低至 0.19元/秒 |
低(网页操作) |
高(通常含 2K 选项) |
|
本地部署 H3-Base |
技术玩家、企业私有化 |
硬件成本高 |
高(需配环境) |
中(本地仅 768p,2K 需再调官方 API) |
三种玩法的关系不是替代,而是互补。我的建议很直白:普通用户先玩第三方平台,专业用户再考虑官方 API,至于本地部署——除非你本来就有显卡和折腾的意愿,否则别碰。
4.3 为什么"模型开源了"你反而该用平台
这是很多人的第一反应:模型都开源了,为什么还要花钱用平台?我自己也一度这么想过,直到认真算了一笔账才想明白。
H3 毕竟是复杂的多模态视频生成模型,大多数家用显卡很难流畅运行。就算勉强跑起来,生成一段 10 秒的视频可能也要等很久;如果租云 GPU,按配置和平台不同,每小时可能要几十元甚至上百元,而且你还得自己调参数、排查故障、盯着模型更新。算下来,一次性的硬件投入 + 持续的时间成本,远超按秒计费的平台费用。
再加上大多数普通用户并不是高频使用,自己部署往往更不划算。这就好比:你偶尔想喝杯咖啡,没必要在自己家开一间咖啡馆。
想通了这一层,后面的实操就好办了——接下来进入正题,在秘塔AI里从 0 到 1 生成你的第一条 H3 视频。
第五章 秘塔AI上手实操:从0到1生成第一条视频
这一章是全文的重头戏。我会按自己实际操作时的顺序,把秘塔AI里用 H3 生成视频的完整流程走一遍。所有步骤我都亲手点过,写出来的都是能直接照着做的。
5.1 准备工作:一个账号就够了
秘塔AI(官网 metaso.cn)的视频生成功能不需要额外安装任何软件,打开浏览器就能用。你需要准备的只有三样东西:
- 一个秘塔AI账号(手机号就能注册);
- 一点平台积分(后面细说怎么充);
- 一条想生成的视频创意(提示词后面专门有一章讲)。
我用下来最大的感受是:这个功能把"上手门槛"压缩到了极致——不需要懂部署、不需要配环境、不需要下载模型,比装个修图软件还简单。
5.2 找到视频生成入口
登录后,在秘塔AI的主页就能看到新增的"视频生成"入口(一般在首页功能卡片或创作工具区)。点进去就进入了视频生成页面,界面逻辑很直观:
- 中间是提示词输入框;
- 下方是分辨率、时长等参数选择;
- 左侧或上方是参考素材上传区(多参考模式,下一章细讲)。
我第一次点进去的时候,心里只有一个想法:这也太清爽了。没有密密麻麻的参数,没有环境变量,就是"写词—选参—生成"三步。
5.3 五步生成第一条视频
下面是我整理的标准操作流程,照着做就行:
第1步:在输入框写好提示词(描述画面内容、镜头运动、声音)
第2步:(可选)上传参考图/视频/音频,并在提示词里用 @ 引用它们
第3步:选择分辨率(2K 或 768P)
第4步:选择视频时长(平台按需提供若干档位)
第5步:点击生成,等待出片
|
步骤 |
操作 |
注意事项 |
|
1 |
写提示词 |
描述要具体:场景、人物动作、镜头、声音 |
|
2 |
上传参考素材 |
用 @图片名 的方式让模型知道素材怎么用 |
|
3 |
选分辨率 |
2K 更清晰但单价更高;768P 性价比最高 |
|
4 |
选时长 |
单镜头建议 5-10 秒,太长容易出废片 |
|
5 |
生成 |
等待时间受排队影响,高峰期稍慢 |
5.4 价格与积分:把钱花明白
秘塔AI 目前的计费方式很透明,直接明码标价写在页面上,没有复杂的会员套路。我整理了一张表:
|
分辨率 |
单价 |
换算说明 |
|
2K |
0.29元/秒 |
约为 MiniMax 官网 2K 价(0.8元/秒)的 3.6 折 |
|
768P |
0.19元/秒 |
不到两毛钱,生成 5 秒视频不到一块钱 |
积分是"随用随充"模式,充值后有效期一年,可以囤着慢慢用,不用怕一次充太多用不完过期。平台有时会做折扣活动(比如刚上线 H3 时的首发优惠价),有明确需求的话可以趁活动按需充值,但我不建议大家为了"怕涨价"而囤太多——AI 视频是个需要不断试错的活儿,不是充了钱就一定能出好作品,先用小额度试出感觉再追加,更踏实。
这里我要多说一句:价格便宜不代表可以随便浪费。我自己实测,出片是有废片率的,同样的提示词,有时一次就中,有时要抽两三遍。所以真正拉低单条有效成本的方式,不是比谁充得多,而是比谁的提示词写得准——这也是我花一整章讲提示词的原因。
5.5 我的第一条测试视频
为了验证效果,我做了个最朴素的测试:提示词就写"清晨的山间公路,一辆白色小车从远处驶来,镜头缓缓跟随,画面有薄雾",768P、5 秒。生成结果出来,画面的运动连贯性、薄雾的层次感都超出我的预期,最关键的是——它自带环境音,引擎声、风声都对齐了画面,不用我再另配音轨。
那一刻我意识到,2026年的 AI 视频,真的到了一个"打开网页就能做出能用的素材"的阶段了。当然,这只是最简单的文生视频,真正好玩的,是后面要讲的多参考模式——让 H3 听懂你的素材。
第六章 多参考模式:让AI听懂你的素材
如果说文生视频是"H3 的入门玩法",那多参考模式就是"H3 真正值钱的地方"。这一章我把它讲透。
6.1 什么是多参考模式
多参考模式,简单说就是给 H3 喂多份参考素材,让它按照这些素材的理解去生成视频。秘塔AI 目前支持最多 9 张图片、3 个视频、3 段音频作为参考输入,提示词最多可以写 7000 字,整体输入限制和官方旗舰模型的水平基本一致。
这个模式对应的是 H3 的 Ref2VA 能力——模型不是"看图说话",而是把图片、视频、音频和文字指令放在同一个上下文里统一理解,再输出结果。它的价值在于可控性:你要它生成的角色、风格、动作,都有一份"标准答案"可以参考,而不是全靠提示词猜。
6.2 参数上限一览
先给一张参数表,方便你规划素材:
|
参考项 |
数量上限 |
说明 |
|
参考图片 |
9 张 |
角色设定、风格参考、场景参考 |
|
参考视频 |
3 段 |
动作参考、运镜参考 |
|
参考音频 |
3 段 |
背景音乐、人声、音效 |
|
提示词 |
7000 字 |
足够写一篇完整的分镜脚本 |
6.3 关键技巧:用 @ 引用素材
多参考模式最容易被忽略、也最关键的技巧是:在提示词里用 @ 引用对应的素材。比如你上传了一张角色图,在提示词里就得写"@角色图 让这个角色从画面右侧走进来",模型才知道这张图要用在哪里、怎么用。不 @ 的话,模型会"看到"素材,但不一定知道你的意图,生成结果就容易跑偏。
我自己总结的参考模式提示词公式是这样的:
@素材名1 描述这个素材要用在哪、怎么动
@素材名2 描述这个素材的角色/风格/场景
+ 整体画面描述(光线、氛围、镜头)
+ 声音描述(背景音乐、环境音、人声)
6.4 实操案例一:给潮玩人偶做动态海报
先看一个我现在做内容时经常用的场景——潮玩行业的人偶动态海报。这几年盲盒、手办品牌很喜欢用动态海报做宣传:人偶在画面里微微转动、飘点粒子、背景流光。传统做法要建模、绑定、渲染,门槛不低;用 AI 生成,流程短得离谱。
我的做法是:上传一张人偶的产品图,然后在提示词里写"@产品图 让人偶在画面中央缓缓转动,衣摆轻微飘动,背景粒子光效缓缓流动,镜头缓慢推近,配轻快的背景音乐"。分辨率选 2K,时长 5 秒,一次生成,出来的动态海报人偶和原图保持高度一致——对品牌方来说,这个一致性是商业应用里最看重的东西,产品形象不能跑偏。
6.5 实操案例二:真人角色的一致性
再试一个更难的需求:真人角色的一致性。我上传一张人物照片,让 H3 把这个人物"放进"一个热闹的体育赛事现场,坐在观众席里感受现场氛围。生成结果里,人物的表情比较自然,周围的环境氛围也到位,还自动配上了对应的现场解说声。第一眼看过去,不太容易察觉这是 AI 生成的——不是因为它完美无瑕,而是因为它把"人脸一致性"和"环境合理性"这两件最难的事,都处理得比较到位了。
当然,我也要如实说:真人视频的一致性是所有视频模型的难点,H3 也不是每次都稳。出问题的时候,我的处理办法是换提示词里的光线描述、换参考图的拍摄角度,多抽几次。AI 视频从来不是"一次定生死",而是"调出来的"。
6.6 多参考模式适合做什么
把话说回来,多参考模式最实用的场景,我总结成这几个:
- 角色一致性:先出角色设定图,再让角色在各种场景里"演戏";
- 风格迁移:给一张参考图定风格,生成内容全部按这个风格走;
- 动作参考:给一段动作视频,让新角色"模仿"这套动作;
- 音画同步:给一段音频,让画面内容跟着音乐的节奏走。
用一句话总结:多参考模式解决的是"AI 听不懂人话"的问题——素材越多、指令越具体,模型就越懂你要什么。接下来,我们专门聊聊提示词这门"手艺"。
第七章 提示词怎么写才出片:场景-镜头拆解法
做了这么多 AI 视频,我最深的体会是:同样的模型、同样的参数,提示词写得好不好,出片质量能差出一大截。这一章把我自己验证过的一套提示词方法论分享出来,你拿去就能用。
7.1 先想明白:H3 是怎么"读"提示词的
H3 是"全模态"模型,它读提示词的方式和纯文生视频模型不太一样。它能同时理解画面、镜头、声音,所以你在提示词里写的声音信息,它真的会去生成。很多人写提示词只写画面,把"声音"这个维度浪费掉了——这太可惜了,因为声音是 H3 免费送的强项。
7.2 场景-镜头拆解法
我给这套方法起了个名字叫"场景-镜头拆解法",核心就三步:
第一步:先描述整体场景。 地点、时间、人物、正在发生什么事,一句话交代清楚。比如"黄昏的海边码头,一个穿黄色雨衣的小女孩在等船"。
第二步:按时间把场景拆成镜头。 H3 一次生成 5-15 秒,你没法让它讲一个完整故事,但可以让它演好"一个镜头"——人物从哪出现、做什么动作、画面怎么结束,想清楚这三点。
第三步:把镜头、相机、音频写进同一个提示词块。 镜头运动(推、拉、摇、移)、相机角度(俯拍、平视、特写)、伴随的声音(对话、环境音、音乐),一起写进去。H3 会把它们统一理解、统一生成。
我把这套方法的结构画成一张流程图:
flowchart TD
A[先写场景<br/>地点+时间+人物+事件] --> B[再拆镜头<br/>入画动作+过程+出画]
B --> C[最后补三件套<br/>镜头运动+相机角度+声音]
C --> D[输出完整提示词]
7.3 两段可以直接抄的提示词
下面是我实测过、效果比较稳定的提示词,你可以直接拿去改。第一段是文生视频:
黄昏的江南古镇,石板路上刚下过小雨,水面泛着暖黄色的灯光。
一个穿白色汉服的女孩撑着油纸伞,从画面左侧缓缓走来,裙摆轻轻晃动,
路过桥洞时停下抬头看灯笼。
镜头从正面平视缓慢推进,景深渐浅,背景虚化。
配悠扬的笛声和淅沥的雨声,画面色调偏暖。
第二段是带参考素材的(配合多参考模式用):
@角色图 让这个角色坐在窗边看书,偶尔抬头看向窗外。
@窗外景 窗外是飘着雪的城市夜景,车流灯光缓缓流动。
镜头从侧面缓慢环绕半圈,最终停在角色侧脸特写。
环境音:壁炉轻微的噼啪声,窗外若有若无的车流声。
注意第二段里的 @引用——这是多参考模式的"接线",不写清楚,素材就白传了。
7.4 三个让出片更稳的细节
除了结构,还有三个细节是我踩过坑之后总结出来的:
- 别让主体"凭空出现":提示词里最好写清人物的入画方式("从画面左侧走来"),否则模型容易让主体瞬移出现,看起来很怪。
- 时长和动作量要匹配:5 秒的镜头别塞"跑过三条街"这种大动作,动作太多,模型来不及演完,容易崩。15 秒可以演一个完整的小情节,5 秒就老老实实演好一个动作。
- 声音单独写一行:把声音信息单独成句放在提示词末尾,模型对声音的理解会更明确,音画对齐的几率更高。
7.5 提示词是"调"出来的
最后说点掏心窝的话:没有一稿就完美的提示词。我写提示词的习惯是"先粗后细"——第一版只写场景和动作,看模型理解得对不对;第二版再补镜头和声音;第三版才调细节。每次生成都是免费的老师,多看几遍出片,你自然就知道模型"吃"哪一套描述。
到这一步,你已经能在网页端稳定出片了。但如果你是个追求效率的创作者,接下来要讲的内容你一定会感兴趣——把 H3 接进你的工作流,让生成不再是"一次一操作"。
第八章 把H3接进你的工作流:API与ComfyUI
网页端生成适合偶尔用用,但如果你每天都做视频、或者有一整套固定的制作流程,那就得考虑把 H3 接进自己的工作流。这一章讲两条路:一条是 API 调用,一条是 ComfyUI 工作流。
8.1 秘塔AI 的 API:Agent 都能接
先说一个很多人不知道的点:秘塔AI 里购买的视频生成积分,不只能在平台网页内使用,秘塔AI 还开放了 API。也就是说,你可以在支持 API 接入的智能体工具或 AI 应用里,直接调



