本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
这篇文章把"AI 编导 + AI 分镜师 + AI 拍剪师"这套三段式视频工作流拆开讲清楚。核心方法是:用 Gemini 充当 AI 编导出脚本和 JSON 分镜提示词,用 Nano Banana Pro 在 Google Flow 里出九宫格分镜图,再用即梦平台上的 Seedance 2.0 把分镜图动起来剪成成片。整套流程的关键不在工具本身,而在于"三层提示词结构"——身份设定 + 任务拆分 + 输出模板锁定——这三层把 AI 的随机性约束住,让它能稳定输出可以批量复用的结果。
一句话结论:把视频创作拆成"脚本 → 分镜 → 成片"三个标准动作,每一步都让一个专门的 AI 角色去完成,配合结构化提示词,普通人也能跑出商业可用的短片素材。
想看完整拆解、想拿走我整理的提示词模板、想知道每一步具体怎么操作,往下翻。
本文适合谁:想用 AI 工具做带货短视频、品牌广告、概念短片,但又不想被零散教程牵着走的内容创作者;想把"AI 视频生成"从"碰运气"变成"流程化"的小团队;以及任何对结构化提示词感兴趣的同学。文章里所有方法都来自我自己反复跑通的实操体验,可以直接套用。
一、为什么传统广告片越来越难拍,AI 视频工作流为什么值得搭
广告片是一件听起来光鲜、做起来非常磨人的事。我自己之前折腾过几次短片项目,最头疼的就是一支冰淇淋的广告:得控制融化的速度、得挖出几乎完美的球形、得在有限的预算里把质感顶上去,灯光、道具、演员、棚租,每一项都是钱和时间在烧。这种"看似一分钟、其实要折腾一整周"的体验,做过的人都懂。
实拍这件事,本质上是把脑子里的画面落到物理世界里,而物理世界从来都不会按你的提示词来。模特表情不在状态、产品融化得比预想快、临时改创意要重新搭景,这些问题不是花更多钱就能完美解决的,更多时候靠的是经验和运气。
AI 视频这两年的变化让这件事开始松动了。过去的 AI 视频,画面糊、人脸跳、动作飘,做做创意短片可以,真正商用还差一截。但到了 2026 年,情况已经不一样:图像端有 Nano Banana Pro 这种能保持人物和产品一致性的高精度模型,视频端有 Seedance 2.0 这种支持多模态参考、能跑出 15 秒带音画同步的工业级模型,再加上 Gemini 3 这种推理能力够强、能写得出像样脚本的多模态大模型,整个链路终于被串了起来。
但工具好不等于结果好。我观察身边在玩 AI 视频的朋友,最普遍的误区就是"押宝单一工具"——盯着一个新模型出来就反复抽卡,抽到合适的画面就开心,抽不到就抱怨工具不行。这种玩法天花板很低,做单条创意视频还行,一旦涉及到批量生产、品牌一致性、商业交付,立刻就会塌房。
辛梓煜在词元二号站上聊 AI 工具的时候,反复强调一个观点:单个工具是肌肉,工作流才是骨架。骨架不搭好,肌肉再发达也站不稳。所以这篇文章不是要给你推荐一个"神奇工具",而是把一套已经跑通的、可以复用的 AI 视频生产链路拆给你看。看完之后你能拿走的,不只是会用三个工具,而是一个能套到任何品类视频里去复用的方法论。
为了让讲解不悬空,下面我用一条"猫粮带货短片"作为贯穿全文的实操案例,把每一步都跑一遍。学会这一条,从猫粮到水果、从美妆到家居,本质上是同一套打法。
二、像做汉堡一样拆视频:脚本 → 分镜 → 成片 三段式工作流总览
为了让"AI 视频工作流"这个听起来挺虚的概念落地,我习惯用一个特别接地气的比方:做视频就像做汉堡。
做一只像样的汉堡分三步:先把面包烤好,再把肉煎到位,最后把蔬菜、酱料、肉饼按顺序码进去组装。每一步都做到位,汉堡就稳稳出炉;任何一步偷懒,整个口感就崩。AI 视频生成也是一样的逻辑——你不可能指望一句话把电影级成片直接吐出来,必须把它拆成三个标准动作。
2.1 三段式拆解:脚本、分镜、成片
第一段叫"脚本",对应汉堡里的面包。它是底座,决定整支视频要讲什么、镜头怎么走、节奏在哪里。脚本写得糙,后面再怎么折腾都是在化妆。
第二段叫"分镜",对应汉堡里的肉饼。它是核心,每一帧画面长什么样、产品在画面里怎么摆、人物表情和动作要什么样,都靠分镜把它定下来。
第三段叫"成片",对应汉堡的组装。把分镜动起来、连起来、配上节奏,最终输出可以发布的视频。
这套拆法不是我拍脑袋想的,行业里做商业 AI 视频的团队基本都是这个套路。我在词元二号站观察了几十个 AI 漫剧、AI 广告短片的工作流,几乎都遵循"剧本 → 角色/场景设计 → 分镜图 → 视频片段 → 成片"这条流水线。
2.2 三个 AI 角色:编导、分镜师、拍剪师
把三段拆好之后,每一段都需要一个专门的 AI 角色来扛。我把它们分别叫:
- AI 编导:消化产品信息、用户痛点和视觉参考,产出一份分镜脚本和对应的提示词代码。这里我用 Gemini,因为它的逻辑推理能力在 2026 年的大模型梯队里非常稳,特别适合做"先想清楚再写下来"的工作。
- AI 分镜师:拿到脚本和提示词代码,输出每个镜头的画面图,并且保持产品、角色、场景在不同镜头之间的一致性。这里我用 Nano Banana Pro,它是基于 Gemini 3 Pro 的高精度图像模型,多图融合和一致性保持能力非常强。
- AI 拍剪师:把分镜图变成有镜头运动、有音画同步的视频片段,并按顺序剪辑成片。这里我用 Seedance 2.0,它支持图片、视频、音频、文字四模态混合输入,特别擅长把静帧"动起来"。
下面是这三个角色的能力对比表,方便你心里有数:
|
角色 |
推荐工具 |
核心能力 |
输入 |
输出 |
|
AI 编导 |
Gemini 3 Pro |
脚本结构化、镜头语言推理、JSON 输出 |
产品图、卖点、人群 |
中文分镜脚本 + JSON 提示词 |
|
AI 分镜师 |
Nano Banana Pro |
多图融合、角色与产品一致性、文本渲染 |
JSON 提示词 + 产品参考图 |
九宫格分镜图 |
|
AI 拍剪师 |
Seedance 2.0 |
多模态参考、音画同步、15 秒成片 |
分镜图 + 产品参考图 + 文字脚本 |
视频片段 |
2.3 工作流的流程图
把上面这套用一张 Mermaid 图画出来,会更清楚地看到信息怎么流转:
flowchart LR
A[产品图<br/>卖点<br/>目标人群] --> B[AI 编导<br/>Gemini]
B --> C[中文分镜脚本]
B --> D[JSON 提示词]
C -.确认.-> B
D --> E[AI 分镜师<br/>Nano Banana Pro]
A --> E
E --> F[九宫格分镜图]
F --> G[AI 拍剪师<br/>Seedance 2.0]
C --> G
A --> G
G --> H[视频片段]
H --> I[剪辑成片]
辛梓煜在词元二号站上之前写过一句话我蛮认同的:当你能把一件事画成一张流程图,AI 才真的能帮你。流程图意味着你心里已经有了清晰的标准动作,AI 只是在每一个环节上替你执行。
2.4 为什么这三个工具是"黄金组合"
在落到具体讲解之前,多说一句这套工具组合的取舍逻辑,方便你之后想替换工具时心里有数。
Gemini 用来做编导,是因为它的逻辑推理在 2026 年这一代模型里足够稳。脚本不是写文章,它需要的是"结构感"——五个字段、九个分镜、节奏曲线,这种结构化任务对推理能力要求高。换成纯创意型模型,输出会偏发散;换成轻量模型,结构容易乱。Gemini 3 Pro 在这件事上是甜区。
Nano Banana Pro 用来做分镜师,是因为它的"一致性"是当下最强的方向之一。视频是连续画面,最怕的就是镜头之间产品跳变、人物变形。Nano Banana Pro 多图融合保持 5 个角色一致性的能力,加上 2K 高分辨率输出,刚好踩在带货视频的需求点上。
Seedance 2.0 用来做拍剪师,是因为它把"音画同步"从后期工序前移到了生成阶段。带货短视频的咀嚼声、倾倒声、开盖声,这些细节最能拉感染力,过去都要靠剪辑师手动对位,现在 Seedance 2.0 在生成视频的同时就把双声道音频一并产出。
当然这三个不是唯一答案。你也可以把 Gemini 换成其他推理模型,把视频模型换成 Veo 3.1 或者其他主流模型,但思路是一样的:编导、分镜师、拍剪师,每个角色挑当下最强的那一个。
接下来三节,我会把这三个角色一个一个拆开讲。先从最关键的"AI 编导"开始。
三、AI 编导:用 Gemini 写一份能直接落地的分镜脚本
整套工作流里最容易被低估、又最影响最终效果的环节,就是脚本。我观察过很多人玩 AI 视频,常见的做法是直接给视频模型扔一句话——"一只猫在吃猫粮,画面好看一点",然后开始疯狂抽卡。这种玩法之所以稳定不了,是因为你没有给 AI 一个清晰的镜头语言体系。
AI 编导这个角色要做的事情,本质上是把一个产品需求翻译成一份"摄影机能执行的指令清单"。
3.1 喂给 Gemini 的三类信息
要让 Gemini 替你写出能用的脚本,至少要给它三类信息:
第一是产品本身。把产品图直接发给 Gemini,让它看到外观、包装、标签上的字。如果是食品类,告诉它质地(湿粮、干粮、罐头);如果是数码类,告诉它型号和外观特征。Gemini 3 Pro 的多模态识图能力很强,看得懂照片里的视觉细节。
第二是核心卖点。这一步要克制,不要把品牌的所有卖点都堆上去,挑两三个最能戳人的就够。比如猫粮的"高肉含量、适口性强",比方水果的"现摘现发、口感清甜"。卖点太多,AI 反而抓不住重点。
第三是目标人群与场景。你的视频是给谁看的?25 岁城市单身女性养的爱宠猫,还是中老年人想给孙辈买零食?人群不同,镜头的节奏感、画面的色调、文案的语气都会差很多。
如果有视觉参考图就更好——比如你看到过一个同行的广告片觉得风格刚好,截一张关键帧丢给它做参考,它能模仿那种调性。
3.2 脚本里必须有的字段
我让 Gemini 输出脚本的时候,会要求它每一个分镜至少包含五个字段。这五个字段对应着镜头语言里最基础也最关键的几个维度:
|
字段 |
含义 |
示例 |
|
景别 |
镜头与主体的距离 |
特写 / 中景 / 全景 |
|
运镜 |
摄影机的移动方式 |
缓慢推进 / 横向平移 / 静止锁定 |
|
主体 |
画面中心的对象 |
产品 / 人物 / 场景细节 |
|
动态 |
画面里发生的动作 |
倾倒、咀嚼、转头、伸手 |
|
画面 |
整段视觉的描述 |
一句话把画面讲清 |
为什么这五个字段缺一不可?因为它们对应了观众看视频时大脑的处理顺序——先感知距离感(景别)、再感知运动感(运镜)、再聚焦到主体上、然后通过动态把注意力拉满、最后形成对整个画面的印象。少了任何一个维度,画面就会"哪里怪怪的"。
3.3 不要的描述:以"静止锁定"为例
我第一次让 Gemini 写猫粮分镜的时候,它在某一个分镜里给我加了"静止锁定"。静止锁定是没问题的镜头语言,但放在一支以"适口性"为卖点的食品广告里就有问题——食品广告需要画面有动态张力,让观众感觉到食物在动、在冒油、在被咀嚼,静态镜头会让节奏一下子掉下去。
这时候我会直接告诉 Gemini:"这一段不要用静止锁定,换成缓慢推进或者轻微的镜头浮动。"它就会马上换一版。这个细节告诉我们一件事:AI 编导不是终点,是一个可以来回讨论的合作者。第一版稿子很少能完美,关键是你心里要有一杆秤,知道哪里不对、哪里要改。
3.4 中文脚本 + 英文 JSON 双输出
到这一步还没完。中文脚本是给你看的,方便你判断逻辑通不通顺;但要喂给 Nano Banana Pro 这种图像模型,最好用英文 JSON 格式。因为 JSON 是结构化的,模型能精准识别每一个字段;英文是因为大部分主流图像模型在英文提示词下的表现要更稳。
所以我会让 Gemini 在你确认中文脚本之后,自动转一版英文的 JSON 提示词,封装成可以直接复制粘贴到图像模型里的代码格式。
这一套"中文确认 → 英文 JSON 输出"的双步走流程,是整个工作流里最容易被新手忽略,但又最能拉开质量差距的设计。
四、提示词三层结构:让 AI 编导稳定输出的核心心法
上面讲了"该给 Gemini 喂什么",这一节讲"该怎么喂"。这是整个工作流的灵魂。
我把这套方法叫做"提示词三层结构",分别是:身份层、任务层、输出层。三层从上到下依次约束,每一层都比上一层更具体。
4.1 第一层:身份层——给 AI 一个明确的角色
直接让 Gemini "帮我写一个猫粮广告脚本",和让 Gemini "你是一位资深短视频编导,专门服务于宠物食品类目,擅长用 5 个分镜在 15 秒内打动养宠人群的购买欲",得到的结果差距非常大。
原因很简单:大模型的能力是被它"扮演的角色"激活的。当你只给它一个动词,它会调用最通用的能力;当你给它一个具体身份,它会调动这个身份背后的所有专业知识。这跟你找一个万能助理和找一个垂直专家做事的效果差异是一样的。
身份层至少要包含三个要素:
角色定位 + 行业经验 + 擅长领域
比如:
你是一位拥有 8 年经验的短视频编导,
长期服务消费品类目,
擅长把产品卖点拆解成镜头语言,
并以分镜脚本的方式呈现。
注意一点:不要给它"AI"、"模型"这类标签。你越是把它当人,它越能给你输出像人写的东西。
4.2 第二层:任务层——把任务拆成清晰的步骤
身份定好之后,下一步是把任务拆开。如果你直接说"帮我写脚本",它会一次性输出一坨,你想改某个地方就要重写。但如果你把任务拆成"第一步做 A,第二步做 B",它会按顺序来,每一步你都可以介入。
我对猫粮项目的任务拆分是这样的:
第一步:根据产品图、核心卖点、目标人群,
输出一版中文分镜脚本,
包含景别、运镜、主体、动态、画面五个字段。
第二步:等用户确认中文脚本没问题后,
将每个分镜转换为英文 JSON 提示词,
封装成一段标准 JSON 代码。
这样拆开有三个好处:
第一,留出确认环节。中文脚本写完,你可以一条一条看,发现问题立刻调,避免到了图像生成阶段才发现脚本不对。
第二,降低模型负担。一次只让模型干一件事,比一次让它干三件事的稳定性高得多。
第三,方便复用。等中文脚本确认了,JSON 转换这一步是机械操作,可以反复跑。
4.3 第三层:输出层——锁定输出模板
最后一层是最具体的:告诉 AI 你想要的输出长什么样。
很多人写提示词写到任务层就停了,结果 AI 输出的格式五花八门,今天给你 Markdown 表格、明天给你段落叙述、后天又给你 YAML,导致下一环节没法接。锁定输出层的关键是把格式细节写死:
中文脚本输出格式:
- 用 Markdown 表格输出
- 表格列:序号、景别、运镜、主体、动态、画面
- 每个分镜单独一行
- 分镜数量控制在 6 到 9 个之间
- 单个分镜对应的视频时长不超过 2 秒
JSON 提示词输出格式:
- 每个分镜一个 JSON 对象
- 字段使用英文 key
- 包含 shot_id, shot_type, camera_motion, subject, action, scene
- 所有 value 使用英文
- 最外层用一个 array 包裹
- 用代码块包起来方便复制
这套输出层的写法之所以重要,是因为它把"模糊的需求"翻译成了"机器可执行的标准"。AI 编导输出的 JSON 直接就能复制粘贴到下一个工具里,整个工作流不会卡壳。
4.4 一份可以直接复用的提示词框架
下面是我自己整理的一套提示词框架,三层结构都包含进去了,你可以根据产品改改具体字段直接用:
【身份层】
你是一位资深的短视频编导,拥有 8 年以上消费品类目的内容经验,
擅长将产品卖点拆解成 6 到 9 个有节奏感的分镜,
最终以镜头语言的方式呈现,
具备带货短视频的画面构建能力和产品视觉挖掘能力。
【任务层】
我会向你提供:
1. 产品图片
2. 核心卖点(不超过 3 条)
3. 目标人群描述
4. 视觉参考(可选)
请你分两步完成:
第一步:
基于以上信息,输出中文分镜脚本。
每个分镜包含五个字段:景别、运镜、主体、动态、画面。
我会确认这一版脚本没有问题之后,再让你进行第二步。
第二步:
将每个分镜转换为英文 JSON 提示词,
封装成一段标准 JSON 代码,方便复制粘贴。
【输出层】
中文脚本:Markdown 表格,六列,每个分镜单独一行。
JSON 提示词:数组形式,每个对象包含
shot_id、shot_type、camera_motion、subject、action、scene 六个字段,
所有 value 用英文,放在 ```json 代码块里。
把这套框架存进你的提示词库里,下次做任何一支产品视频,把产品图和卖点换一下,半小时就能跑出一份可用的分镜脚本。
辛梓煜@词元二号站 反复强调一句话:提示词不是越长越好,而是越结构化越好。结构化的本质是把你的需求变成模型可以稳定执行的标准动作。
五、AI 分镜师:用 Nano Banana Pro 出一组一致性极强的九宫格
脚本和 JSON 提示词都准备好之后,下一步就是出图。这一步的目标只有一个:把脚本里描述的每一帧画面都画出来,并且保证产品、场景、主体在所有分镜里高度一致。
为什么要做一致性?因为一支广告片如果第 3 个镜头里的猫粮罐头标签是橙色的、第 7 个镜头里突然变成黄色的,观众会立刻出戏。
5.1 为什么选 Nano Banana Pro
Nano Banana Pro 是 Google DeepMind 在 2025 年底基于 Gemini 3 Pro 推出的高精度图像生成模型。它和上一代 Nano Banana 比起来,在三个方向上有明显提升:
- 多图融合能力:最多可以一次性融合 14 张输入图,并保持最多 5 个角色或主体的身份一致性。这对带货视频是刚需,因为产品、模特、场景往往是分散在不同输入里的。
- 文本渲染能力:能在生成的图里直接写清晰可读的多语言文字。这意味着产品包装上的字、海报标语、店招都能跑出来,不会糊成一团乱码。
- 联网搜索能力:能够实时调用网络上的真实信息生成图像。这对做需要事实准确性的内容(比如产品规格图、信息图)特别有用。
更具体一点,Nano Banana Pro 在 Google Flow 这个面向创作者和视频团队的平台里有专门的接入,订阅了 Google AI Ultra 计划的用户可以直接在 Flow 里调用 Pro 版本来生成镜头与场景图。
5.2 在 Flow 上的具体操作
具体怎么操作?这里把我自己跑通的步骤说明白:
- 打开 Flow 平台,点击"新建项目"。
- 把上一步从 Gemini 拿到的 JSON 提示词,整段复制进提示词输入框。
- 上传产品参考图——这一步非常关键,是保证生成的产品与实物一致的关键。如果有多个参考素材(产品图 + 风格参考图),可以分别上传。
- 在"生成设置"里,模型选择 Nano Banana Pro。新出的 Nano Banana 2 也可以试,但 Pro 在复杂提示词理解上更精准一些,特别是 JSON 这种结构化输入。
- 选择长宽比。带货短视频通常用 9:16(竖屏),如果是公众号封面或长视频,可以选 16:9 或 1:1。
- 点击生成。
几秒钟之后,就会得到一张九宫格分镜图——9 个分镜的画面被排在一张图里。如果对结果不满意,可以再多抽几次,每次结果都会有微小变化。
5.3 九宫格分镜的优势
为什么是九宫格,而不是一张一张分别生成?这里面有个很巧妙的设计。
九宫格让一致性变得更容易。当你让模型一次性生成 9 个相互关联的画面时,它会自动在这 9 张画面之间寻找视觉连贯性——产品的外观、灯光的色温、场景的氛围都会被它当成一个整体来处理。如果你一张一张分开生成,每次都是独立调用模型,画面之间的差异会大很多。
九宫格让效率成倍提升。一次抽卡得到 9 张图,相当于一次完成一支视频的所有分镜。即便其中两三张不满意,重新抽一两次就够了,比逐张生成快得多。
九宫格让逻辑可视化。9 个分镜按从左到右、从上到下的顺序排列,整支视频的镜头逻辑一眼就能看完。如果某一帧的逻辑接不上前后,立刻能发现。
下面这张表是我自己整理的"九宫格 vs 单张生成"对比,给你一个直观感受:
|
维度 |
单张生成 |
九宫格生成 |
|
一致性 |
容易跳变 |
整体协调性更强 |
|
效率 |
慢,需要 9 次调用 |
1 次调用 |
|
逻辑感 |
难以整体把控 |
一目了然 |
|
调整成本 |
改一张要重抽 |
改某一格相对容易 |
5.4 不满意怎么办
抽卡免不了不满意。我的处理方式是分两层:
第一层是再抽。如果只是某一帧画面不够理想(比如某个分镜的光线没那么柔和),先重新生成一两次再看。Nano Banana Pro 是有随机性的,多抽几次往往能拿到更合适的版本。
第二层是回调脚本。如果连抽好几次都不满意,说明问题可能不在图像模型,而在脚本——比如某个分镜的描述太抽象、太模糊。这时候回到 Gemini,把那个分镜的画面描述写得更具体一点,再重新生成 JSON 提示词,再回 Flow 里抽。
这里有一个小经验:画面描述要尽可能"可视化"。不要写"温馨的家庭氛围",要写"客厅木质地板上,暖黄色灯光从右上方斜射下来,茶几上放着一只灰色陶瓷碗"。前者是抽象概念,后者是可执行的画面指令。
5.5 产品一致性的额外保险
如果你对产品的一致性要求特别高(比如包装上的某个标签必须一字不差),可以在 Flow 里同时上传两张产品图——一张正面图、一张侧面图——并在提示词里明确写:"请确保所有分镜中的产品包装与参考图完全一致,包括 logo 的位置、颜色、字体。"
辛梓煜在词元二号站之前测过一次,用这种"双图参考 + 显式提示"的组合,产品一致性的稳定度可以从大约六成提升到接近九成。这种细节,是工作流跑得稳的关键。
六、AI 拍剪师:用 Seedance 2.0 把静帧动起来
九宫格分镜图出来之后,下一步是让画面动起来。这一步在整个工作流里是最直观的——你能立刻看到一张静态的图被赋予了运动、节奏、声音。
6.1 Seedance 2.0 是个什么样的工具
Seedance 2.0 是字节跳动在 2026 年 2 月推出的新一代多模态 AI 视频生成模型,已经上线即梦 AI、豆包 App 等平台。它和上一代视频模型相比,有三个让人眼前一亮的地方:
- 多模态参考:支持文本、图片、视频、音频四种模态混合输入,最多可以上传 12 个素材(图片最多 9 张,视频和音频各最多 3 个,总时长不超过 15 秒)。
- 指令响应精准:通过"@素材编号"的方式可以精准引用某一个具体的输入素材,让模型清楚地知道"用 @图片1 的角色 + @视频1 的运镜 + @音频1 的节奏"。
- 原生音画同步:在生成视频的同时直接输出双声道音频,口型同步、环境音效、背景音乐都是同步生成的,不需要后期再单独配音。
这对带货短视频是一个质变。过去要让一支 AI 视频带音效,得在视频生成完之后再单独跑一遍音频模型、再用剪辑软件对齐,工序复杂、容易脱节。Seedance 2.0 把这一步合并了。
6.2 在即梦里跑一遍
具体怎么操作?我把流程拆开来:
- 打开即梦 AI,进入视频生成入口。
- 模型选择 Seedance 2.0,并开启"全能参考"模式(也有叫做"能参考"的入口)。
- 上传素材:
- 第一张:上一步在 Flow 里生成的九宫格分镜图,作为镜头参考。
- 第二张:产品参考图,确保产品在视频中一致。
- 把 Gemini 之前生成的中文分镜脚本直接粘贴到提示词输入框。
- 在提示词里明确告诉模型:"按照 @图1(分镜图)从 1 到 9 的顺序,依次生成连贯的视频;产品的外观参考 @图2,请确保所有镜头中产品保持一致。"
- 选择视频尺寸(带货短片一般用 9:16)和时长(建议 10 到 15 秒)。
- 点击生成。
如果排队等待时间太长,可以试一下 Seedance 2.0 Fast 版本,速度快一些,使用的人也比较少。
6.3 @ 引用语法的妙用
Seedance 2.0 最让我惊喜的设计是"@ 引用"。你在提示词里写 @图1、@视频1、@音频1,模型会非常精准地知道你在指代哪一个素材。这一点听起来简单,但它解决了多素材输入时最常见的痛点——AI 搞不清楚哪个素材该用在哪里。
举几个实操中常用的写法:
角色形象参考 @图1,
背景与运镜参考 @视频1,
口型与节奏对齐 @音频1,
保持产品包装与 @图2 完全一致。
这种写法把不同素材的"职责"分配得清清楚楚。模型不需要再猜,照着执行就行。
对于带货场景,最常用的引用组合是:
|
素材编号 |
内容 |
作用 |
|
@图1 |
九宫格分镜图 |
镜头序列与画面构图参考 |
|
@图2 |
产品正面图 |
产品一致性锁定 |
|
@图3(可选) |
风格参考图 |
调色与质感参考 |
|
@视频1(可选) |
同类商品参考视频 |
运镜节奏参考 |
6.4 视频参数怎么设
视频生成的参数也有讲究。我的常用配置:
- 尺寸:带货短视频选 9:16(竖屏),长视频可选 16:9。
- 时长:单段建议 10 到 15 秒。Seedance 2.0 单次最长支持 15 秒,超过的话需要用"视频延长"功能拼接。
- 画质:能选 1080P 就选 1080P,2K 输出在某些场景下有,可以测一下。
- 种子(Seed):如果对某一版结果比较满意,记下种子号,下次微调提示词的时候用同样的种子可以保持画面基调。
6.5 不满意时的迭代策略
视频生成的迭代成本比图像高,所以我会先把"小批量测试"做透再放量生成。
具体做法是:先用 5 秒时长跑一版,看看运镜、节奏、产品一致性这几个核心指标过不过关。如果都过关,再扩展到 10 秒、15 秒;如果不过关,回去改提示词,而不是直接堆时长。
辛梓煜@词元二号站 之前也写过一篇关于 Seedance 2.0 视频延长的文章,那里面提到一个重要细节:延长视频时,"生成时长"要选的是新增部分的时长,而不是总时长。比如你想把原来 8 秒的视频延长到 15 秒,那么生成时长选 7 秒。这个细节官方手册里有,但很多人第一次用都会搞错。
6.6 用一支猫粮广告片走完全流程
把上面这些拼起来,一支猫粮带货短片就跑完了。最终效果上你能看到:
- 整个画面有非常强的产品质感,灯光柔和、产品标签清晰。
- 猫咪吃猫粮的动作连贯自然,没有传统拍摄里"演员不配合"的问题。
- 配套的音效非常生动——食物倾倒的声音、咀嚼的声音、罐头开启的声音都对得上画面。
这就是传统拍摄当中最难解决的痛点之一——演员、宠物、食物本身的配合度。AI 视频工作流把这三个变量都收编了。
6.7 关于"全能参考"模式的进阶用法
Seedance 2.0 在即梦里有一个非常关键的入口,叫"全能参考"。它跟普通的图生视频不一样的地方是:你可以一次性上传图、视频、音频三类素材,模型会综合参考这些素材生成视频。
举个具体的例子。我做一支居家场景的氛围广告时,是这么用的:
- 图1:一张产品的高清近照,用来锁定产品外观。
- 图2:一张参考的家居场景图,用来定调子(米白色墙面、原木地板、暖光)。
- 视频1:一段我喜欢的同类广告片段,用来参考运镜的节奏。
- 音频1:一段我从素材库里挑的轻音乐,用来参考整体音乐风格。
提示词写:"参考 @图1 的产品外观,@图2 的场景调性,@视频1 的运镜节奏,@音频1 的音乐风格,生成一支 10 秒的居家氛围短片,强调产品的质感和家居的温暖感。"
这种"四模态混合输入"的玩法,是 Seedance 2.0 最有威力也最被低估的功能。它让你不需要把所有信息都用文字描述出来——很多东西用一段视频参考一下,比写十句话都更准。
6.8 把多个 15 秒片段拼成长视频
Seedance 2.0 单次最长支持 15 秒。但带货视频经常需要 30 秒、60 秒,怎么办?
官方有一个"视频延长"的功能,可以基于已生成的视频继续往下生成。具体玩法:
将 @视频1 延长 15 秒,
角色继续动作,
保持角色外观、背景、光线与前段完全一致,
镜头保持稳定不变。
通过这种方式,理论上可以无限延长。但实际操作中,我建议拼接不超过 3 段(也就是 45 秒以内),因为延长的次数越多,画面漂移的可能性越大。
另一种思路是用剪辑工具拼接。把 9 个分镜分别用 Seedance 2.0 生成 1.5 秒到 2 秒的短视频,再用剪映或者其他剪辑软件按顺序拼起来,加上转场和配乐,就是一支完整的成片。这种方式的好处是每个分镜都可以单独调整、单独重做,不影响其他部分。
七、JSON 结构化提示词:让脚本到分镜的衔接不脱节
这一节单独把 JSON 提示词的事儿讲透,因为这是整个工作流里最容易被低估的"粘合剂"。
7.1 为什么不直接用大白话喂图
很多人用图像模型的时候,习惯用一段大白话描述:"一只橘猫在木地板上吃猫粮,画面温馨,光线柔和。"这种写法在 Midjourney、Stable Diffusion 时代是主流,因为那时候的图像模型对自然语言的理解还没那么深。
但到了 Nano Banana Pro、Gemini 3 Pro Image 这一代,自然语言能力已经够强,反过来"结构化输入"成了更优解。原因有三个:
第一,结构化输入消除歧义。"画面温馨"这种描述在不同人理解里差异很大,但 mood: warm, lighting: sof