📍 词元二号站 开源解码 三步搭一套可复用的 AI 视频工作流:用 Gemini、Nano Banana Pro 与 Seedance 2.0 把一条带货短片做出来

三步搭一套可复用的 AI 视频工作流:用 Gemini、Nano Banana Pro 与 Seedance 2.0 把一条带货短片做出来

摘要:从脚本到分镜再到成片,一篇讲透 AI 视频工作流的三段式拆解,包含可复用的三层提示词结构、JSON 结构化提示词模板、九宫格分镜出图方法、Seedance 2.0 视频生成参数设置,以及把流程横向迁移到水果、美妆、品牌片的实操要点。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

这篇文章把"AI 编导 + AI 分镜师 + AI 拍剪师"这套三段式视频工作流拆开讲清楚。核心方法是:用 Gemini 充当 AI 编导出脚本和 JSON 分镜提示词,用 Nano Banana Pro 在 Google Flow 里出九宫格分镜图,再用即梦平台上的 Seedance 2.0 把分镜图动起来剪成成片。整套流程的关键不在工具本身,而在于"三层提示词结构"——身份设定 + 任务拆分 + 输出模板锁定——这三层把 AI 的随机性约束住,让它能稳定输出可以批量复用的结果。

一句话结论:把视频创作拆成"脚本 → 分镜 → 成片"三个标准动作,每一步都让一个专门的 AI 角色去完成,配合结构化提示词,普通人也能跑出商业可用的短片素材。

想看完整拆解、想拿走我整理的提示词模板、想知道每一步具体怎么操作,往下翻。

本文适合谁:想用 AI 工具做带货短视频、品牌广告、概念短片,但又不想被零散教程牵着走的内容创作者;想把"AI 视频生成"从"碰运气"变成"流程化"的小团队;以及任何对结构化提示词感兴趣的同学。文章里所有方法都来自我自己反复跑通的实操体验,可以直接套用。

一、为什么传统广告片越来越难拍,AI 视频工作流为什么值得搭

广告片是一件听起来光鲜、做起来非常磨人的事。我自己之前折腾过几次短片项目,最头疼的就是一支冰淇淋的广告:得控制融化的速度、得挖出几乎完美的球形、得在有限的预算里把质感顶上去,灯光、道具、演员、棚租,每一项都是钱和时间在烧。这种"看似一分钟、其实要折腾一整周"的体验,做过的人都懂。

实拍这件事,本质上是把脑子里的画面落到物理世界里,而物理世界从来都不会按你的提示词来。模特表情不在状态、产品融化得比预想快、临时改创意要重新搭景,这些问题不是花更多钱就能完美解决的,更多时候靠的是经验和运气。

AI 视频这两年的变化让这件事开始松动了。过去的 AI 视频,画面糊、人脸跳、动作飘,做做创意短片可以,真正商用还差一截。但到了 2026 年,情况已经不一样:图像端有 Nano Banana Pro 这种能保持人物和产品一致性的高精度模型,视频端有 Seedance 2.0 这种支持多模态参考、能跑出 15 秒带音画同步的工业级模型,再加上 Gemini 3 这种推理能力够强、能写得出像样脚本的多模态大模型,整个链路终于被串了起来。

但工具好不等于结果好。我观察身边在玩 AI 视频的朋友,最普遍的误区就是"押宝单一工具"——盯着一个新模型出来就反复抽卡,抽到合适的画面就开心,抽不到就抱怨工具不行。这种玩法天花板很低,做单条创意视频还行,一旦涉及到批量生产、品牌一致性、商业交付,立刻就会塌房。

辛梓煜在词元二号站上聊 AI 工具的时候,反复强调一个观点:单个工具是肌肉,工作流才是骨架。骨架不搭好,肌肉再发达也站不稳。所以这篇文章不是要给你推荐一个"神奇工具",而是把一套已经跑通的、可以复用的 AI 视频生产链路拆给你看。看完之后你能拿走的,不只是会用三个工具,而是一个能套到任何品类视频里去复用的方法论。

为了让讲解不悬空,下面我用一条"猫粮带货短片"作为贯穿全文的实操案例,把每一步都跑一遍。学会这一条,从猫粮到水果、从美妆到家居,本质上是同一套打法。


二、像做汉堡一样拆视频:脚本 → 分镜 → 成片 三段式工作流总览

为了让"AI 视频工作流"这个听起来挺虚的概念落地,我习惯用一个特别接地气的比方:做视频就像做汉堡

做一只像样的汉堡分三步:先把面包烤好,再把肉煎到位,最后把蔬菜、酱料、肉饼按顺序码进去组装。每一步都做到位,汉堡就稳稳出炉;任何一步偷懒,整个口感就崩。AI 视频生成也是一样的逻辑——你不可能指望一句话把电影级成片直接吐出来,必须把它拆成三个标准动作。

2.1 三段式拆解:脚本、分镜、成片

第一段叫"脚本",对应汉堡里的面包。它是底座,决定整支视频要讲什么、镜头怎么走、节奏在哪里。脚本写得糙,后面再怎么折腾都是在化妆。

第二段叫"分镜",对应汉堡里的肉饼。它是核心,每一帧画面长什么样、产品在画面里怎么摆、人物表情和动作要什么样,都靠分镜把它定下来。

第三段叫"成片",对应汉堡的组装。把分镜动起来、连起来、配上节奏,最终输出可以发布的视频。

这套拆法不是我拍脑袋想的,行业里做商业 AI 视频的团队基本都是这个套路。我在词元二号站观察了几十个 AI 漫剧、AI 广告短片的工作流,几乎都遵循"剧本 → 角色/场景设计 → 分镜图 → 视频片段 → 成片"这条流水线。

2.2 三个 AI 角色:编导、分镜师、拍剪师

把三段拆好之后,每一段都需要一个专门的 AI 角色来扛。我把它们分别叫:

  • AI 编导:消化产品信息、用户痛点和视觉参考,产出一份分镜脚本和对应的提示词代码。这里我用 Gemini,因为它的逻辑推理能力在 2026 年的大模型梯队里非常稳,特别适合做"先想清楚再写下来"的工作。
  • AI 分镜师:拿到脚本和提示词代码,输出每个镜头的画面图,并且保持产品、角色、场景在不同镜头之间的一致性。这里我用 Nano Banana Pro,它是基于 Gemini 3 Pro 的高精度图像模型,多图融合和一致性保持能力非常强。
  • AI 拍剪师:把分镜图变成有镜头运动、有音画同步的视频片段,并按顺序剪辑成片。这里我用 Seedance 2.0,它支持图片、视频、音频、文字四模态混合输入,特别擅长把静帧"动起来"。

下面是这三个角色的能力对比表,方便你心里有数:

角色

推荐工具

核心能力

输入

输出

AI 编导

Gemini 3 Pro

脚本结构化、镜头语言推理、JSON 输出

产品图、卖点、人群

中文分镜脚本 + JSON 提示词

AI 分镜师

Nano Banana Pro

多图融合、角色与产品一致性、文本渲染

JSON 提示词 + 产品参考图

九宫格分镜图

AI 拍剪师

Seedance 2.0

多模态参考、音画同步、15 秒成片

分镜图 + 产品参考图 + 文字脚本

视频片段

2.3 工作流的流程图

把上面这套用一张 Mermaid 图画出来,会更清楚地看到信息怎么流转:

flowchart LR
    A[产品图<br/>卖点<br/>目标人群] --> B[AI 编导<br/>Gemini]
    B --> C[中文分镜脚本]
    B --> D[JSON 提示词]
    C -.确认.-> B
    D --> E[AI 分镜师<br/>Nano Banana Pro]
    A --> E
    E --> F[九宫格分镜图]
    F --> G[AI 拍剪师<br/>Seedance 2.0]
    C --> G
    A --> G
    G --> H[视频片段]
    H --> I[剪辑成片]

辛梓煜在词元二号站上之前写过一句话我蛮认同的:当你能把一件事画成一张流程图,AI 才真的能帮你。流程图意味着你心里已经有了清晰的标准动作,AI 只是在每一个环节上替你执行。

2.4 为什么这三个工具是"黄金组合"

在落到具体讲解之前,多说一句这套工具组合的取舍逻辑,方便你之后想替换工具时心里有数。

Gemini 用来做编导,是因为它的逻辑推理在 2026 年这一代模型里足够稳。脚本不是写文章,它需要的是"结构感"——五个字段、九个分镜、节奏曲线,这种结构化任务对推理能力要求高。换成纯创意型模型,输出会偏发散;换成轻量模型,结构容易乱。Gemini 3 Pro 在这件事上是甜区。

Nano Banana Pro 用来做分镜师,是因为它的"一致性"是当下最强的方向之一。视频是连续画面,最怕的就是镜头之间产品跳变、人物变形。Nano Banana Pro 多图融合保持 5 个角色一致性的能力,加上 2K 高分辨率输出,刚好踩在带货视频的需求点上。

Seedance 2.0 用来做拍剪师,是因为它把"音画同步"从后期工序前移到了生成阶段。带货短视频的咀嚼声、倾倒声、开盖声,这些细节最能拉感染力,过去都要靠剪辑师手动对位,现在 Seedance 2.0 在生成视频的同时就把双声道音频一并产出。

当然这三个不是唯一答案。你也可以把 Gemini 换成其他推理模型,把视频模型换成 Veo 3.1 或者其他主流模型,但思路是一样的:编导、分镜师、拍剪师,每个角色挑当下最强的那一个

接下来三节,我会把这三个角色一个一个拆开讲。先从最关键的"AI 编导"开始。


三、AI 编导:用 Gemini 写一份能直接落地的分镜脚本

整套工作流里最容易被低估、又最影响最终效果的环节,就是脚本。我观察过很多人玩 AI 视频,常见的做法是直接给视频模型扔一句话——"一只猫在吃猫粮,画面好看一点",然后开始疯狂抽卡。这种玩法之所以稳定不了,是因为你没有给 AI 一个清晰的镜头语言体系。

AI 编导这个角色要做的事情,本质上是把一个产品需求翻译成一份"摄影机能执行的指令清单"。

3.1 喂给 Gemini 的三类信息

要让 Gemini 替你写出能用的脚本,至少要给它三类信息:

第一是产品本身。把产品图直接发给 Gemini,让它看到外观、包装、标签上的字。如果是食品类,告诉它质地(湿粮、干粮、罐头);如果是数码类,告诉它型号和外观特征。Gemini 3 Pro 的多模态识图能力很强,看得懂照片里的视觉细节。

第二是核心卖点。这一步要克制,不要把品牌的所有卖点都堆上去,挑两三个最能戳人的就够。比如猫粮的"高肉含量、适口性强",比方水果的"现摘现发、口感清甜"。卖点太多,AI 反而抓不住重点。

第三是目标人群与场景。你的视频是给谁看的?25 岁城市单身女性养的爱宠猫,还是中老年人想给孙辈买零食?人群不同,镜头的节奏感、画面的色调、文案的语气都会差很多。

如果有视觉参考图就更好——比如你看到过一个同行的广告片觉得风格刚好,截一张关键帧丢给它做参考,它能模仿那种调性。

3.2 脚本里必须有的字段

我让 Gemini 输出脚本的时候,会要求它每一个分镜至少包含五个字段。这五个字段对应着镜头语言里最基础也最关键的几个维度:

字段

含义

示例

景别

镜头与主体的距离

特写 / 中景 / 全景

运镜

摄影机的移动方式

缓慢推进 / 横向平移 / 静止锁定

主体

画面中心的对象

产品 / 人物 / 场景细节

动态

画面里发生的动作

倾倒、咀嚼、转头、伸手

画面

整段视觉的描述

一句话把画面讲清

为什么这五个字段缺一不可?因为它们对应了观众看视频时大脑的处理顺序——先感知距离感(景别)、再感知运动感(运镜)、再聚焦到主体上、然后通过动态把注意力拉满、最后形成对整个画面的印象。少了任何一个维度,画面就会"哪里怪怪的"。

3.3 不要的描述:以"静止锁定"为例

我第一次让 Gemini 写猫粮分镜的时候,它在某一个分镜里给我加了"静止锁定"。静止锁定是没问题的镜头语言,但放在一支以"适口性"为卖点的食品广告里就有问题——食品广告需要画面有动态张力,让观众感觉到食物在动、在冒油、在被咀嚼,静态镜头会让节奏一下子掉下去。

这时候我会直接告诉 Gemini:"这一段不要用静止锁定,换成缓慢推进或者轻微的镜头浮动。"它就会马上换一版。这个细节告诉我们一件事:AI 编导不是终点,是一个可以来回讨论的合作者。第一版稿子很少能完美,关键是你心里要有一杆秤,知道哪里不对、哪里要改。

3.4 中文脚本 + 英文 JSON 双输出

到这一步还没完。中文脚本是给你看的,方便你判断逻辑通不通顺;但要喂给 Nano Banana Pro 这种图像模型,最好用英文 JSON 格式。因为 JSON 是结构化的,模型能精准识别每一个字段;英文是因为大部分主流图像模型在英文提示词下的表现要更稳。

所以我会让 Gemini 在你确认中文脚本之后,自动转一版英文的 JSON 提示词,封装成可以直接复制粘贴到图像模型里的代码格式。

这一套"中文确认 → 英文 JSON 输出"的双步走流程,是整个工作流里最容易被新手忽略,但又最能拉开质量差距的设计。


四、提示词三层结构:让 AI 编导稳定输出的核心心法

上面讲了"该给 Gemini 喂什么",这一节讲"该怎么喂"。这是整个工作流的灵魂。

我把这套方法叫做"提示词三层结构",分别是:身份层、任务层、输出层。三层从上到下依次约束,每一层都比上一层更具体。

4.1 第一层:身份层——给 AI 一个明确的角色

直接让 Gemini "帮我写一个猫粮广告脚本",和让 Gemini "你是一位资深短视频编导,专门服务于宠物食品类目,擅长用 5 个分镜在 15 秒内打动养宠人群的购买欲",得到的结果差距非常大。

原因很简单:大模型的能力是被它"扮演的角色"激活的。当你只给它一个动词,它会调用最通用的能力;当你给它一个具体身份,它会调动这个身份背后的所有专业知识。这跟你找一个万能助理和找一个垂直专家做事的效果差异是一样的。

身份层至少要包含三个要素:

角色定位 + 行业经验 + 擅长领域

比如:

你是一位拥有 8 年经验的短视频编导,
长期服务消费品类目,
擅长把产品卖点拆解成镜头语言,
并以分镜脚本的方式呈现。

注意一点:不要给它"AI"、"模型"这类标签。你越是把它当人,它越能给你输出像人写的东西。

4.2 第二层:任务层——把任务拆成清晰的步骤

身份定好之后,下一步是把任务拆开。如果你直接说"帮我写脚本",它会一次性输出一坨,你想改某个地方就要重写。但如果你把任务拆成"第一步做 A,第二步做 B",它会按顺序来,每一步你都可以介入。

我对猫粮项目的任务拆分是这样的:

第一步:根据产品图、核心卖点、目标人群,
        输出一版中文分镜脚本,
        包含景别、运镜、主体、动态、画面五个字段。

第二步:等用户确认中文脚本没问题后,
        将每个分镜转换为英文 JSON 提示词,
        封装成一段标准 JSON 代码。

这样拆开有三个好处:

第一,留出确认环节。中文脚本写完,你可以一条一条看,发现问题立刻调,避免到了图像生成阶段才发现脚本不对。

第二,降低模型负担。一次只让模型干一件事,比一次让它干三件事的稳定性高得多。

第三,方便复用。等中文脚本确认了,JSON 转换这一步是机械操作,可以反复跑。

4.3 第三层:输出层——锁定输出模板

最后一层是最具体的:告诉 AI 你想要的输出长什么样

很多人写提示词写到任务层就停了,结果 AI 输出的格式五花八门,今天给你 Markdown 表格、明天给你段落叙述、后天又给你 YAML,导致下一环节没法接。锁定输出层的关键是把格式细节写死:

中文脚本输出格式:
- 用 Markdown 表格输出
- 表格列:序号、景别、运镜、主体、动态、画面
- 每个分镜单独一行
- 分镜数量控制在 6 到 9 个之间
- 单个分镜对应的视频时长不超过 2 秒

JSON 提示词输出格式:
- 每个分镜一个 JSON 对象
- 字段使用英文 key
- 包含 shot_id, shot_type, camera_motion, subject, action, scene
- 所有 value 使用英文
- 最外层用一个 array 包裹
- 用代码块包起来方便复制

这套输出层的写法之所以重要,是因为它把"模糊的需求"翻译成了"机器可执行的标准"。AI 编导输出的 JSON 直接就能复制粘贴到下一个工具里,整个工作流不会卡壳。

4.4 一份可以直接复用的提示词框架

下面是我自己整理的一套提示词框架,三层结构都包含进去了,你可以根据产品改改具体字段直接用:

【身份层】
你是一位资深的短视频编导,拥有 8 年以上消费品类目的内容经验,
擅长将产品卖点拆解成 6 到 9 个有节奏感的分镜,
最终以镜头语言的方式呈现,
具备带货短视频的画面构建能力和产品视觉挖掘能力。

【任务层】
我会向你提供:
1. 产品图片
2. 核心卖点(不超过 3 条)
3. 目标人群描述
4. 视觉参考(可选)

请你分两步完成:

第一步:
基于以上信息,输出中文分镜脚本。
每个分镜包含五个字段:景别、运镜、主体、动态、画面。
我会确认这一版脚本没有问题之后,再让你进行第二步。

第二步:
将每个分镜转换为英文 JSON 提示词,
封装成一段标准 JSON 代码,方便复制粘贴。

【输出层】
中文脚本:Markdown 表格,六列,每个分镜单独一行。
JSON 提示词:数组形式,每个对象包含
shot_id、shot_type、camera_motion、subject、action、scene 六个字段,
所有 value 用英文,放在 ```json 代码块里。

把这套框架存进你的提示词库里,下次做任何一支产品视频,把产品图和卖点换一下,半小时就能跑出一份可用的分镜脚本。

辛梓煜@词元二号站 反复强调一句话:提示词不是越长越好,而是越结构化越好。结构化的本质是把你的需求变成模型可以稳定执行的标准动作。


五、AI 分镜师:用 Nano Banana Pro 出一组一致性极强的九宫格

脚本和 JSON 提示词都准备好之后,下一步就是出图。这一步的目标只有一个:把脚本里描述的每一帧画面都画出来,并且保证产品、场景、主体在所有分镜里高度一致

为什么要做一致性?因为一支广告片如果第 3 个镜头里的猫粮罐头标签是橙色的、第 7 个镜头里突然变成黄色的,观众会立刻出戏。

5.1 为什么选 Nano Banana Pro

Nano Banana Pro 是 Google DeepMind 在 2025 年底基于 Gemini 3 Pro 推出的高精度图像生成模型。它和上一代 Nano Banana 比起来,在三个方向上有明显提升:

  • 多图融合能力:最多可以一次性融合 14 张输入图,并保持最多 5 个角色或主体的身份一致性。这对带货视频是刚需,因为产品、模特、场景往往是分散在不同输入里的。
  • 文本渲染能力:能在生成的图里直接写清晰可读的多语言文字。这意味着产品包装上的字、海报标语、店招都能跑出来,不会糊成一团乱码。
  • 联网搜索能力:能够实时调用网络上的真实信息生成图像。这对做需要事实准确性的内容(比如产品规格图、信息图)特别有用。

更具体一点,Nano Banana Pro 在 Google Flow 这个面向创作者和视频团队的平台里有专门的接入,订阅了 Google AI Ultra 计划的用户可以直接在 Flow 里调用 Pro 版本来生成镜头与场景图。

5.2 在 Flow 上的具体操作

具体怎么操作?这里把我自己跑通的步骤说明白:

  1. 打开 Flow 平台,点击"新建项目"。
  2. 把上一步从 Gemini 拿到的 JSON 提示词,整段复制进提示词输入框。
  3. 上传产品参考图——这一步非常关键,是保证生成的产品与实物一致的关键。如果有多个参考素材(产品图 + 风格参考图),可以分别上传。
  4. 在"生成设置"里,模型选择 Nano Banana Pro。新出的 Nano Banana 2 也可以试,但 Pro 在复杂提示词理解上更精准一些,特别是 JSON 这种结构化输入。
  5. 选择长宽比。带货短视频通常用 9:16(竖屏),如果是公众号封面或长视频,可以选 16:9 或 1:1。
  6. 点击生成。

几秒钟之后,就会得到一张九宫格分镜图——9 个分镜的画面被排在一张图里。如果对结果不满意,可以再多抽几次,每次结果都会有微小变化。

5.3 九宫格分镜的优势

为什么是九宫格,而不是一张一张分别生成?这里面有个很巧妙的设计。

九宫格让一致性变得更容易。当你让模型一次性生成 9 个相互关联的画面时,它会自动在这 9 张画面之间寻找视觉连贯性——产品的外观、灯光的色温、场景的氛围都会被它当成一个整体来处理。如果你一张一张分开生成,每次都是独立调用模型,画面之间的差异会大很多。

九宫格让效率成倍提升。一次抽卡得到 9 张图,相当于一次完成一支视频的所有分镜。即便其中两三张不满意,重新抽一两次就够了,比逐张生成快得多。

九宫格让逻辑可视化。9 个分镜按从左到右、从上到下的顺序排列,整支视频的镜头逻辑一眼就能看完。如果某一帧的逻辑接不上前后,立刻能发现。

下面这张表是我自己整理的"九宫格 vs 单张生成"对比,给你一个直观感受:

维度

单张生成

九宫格生成

一致性

容易跳变

整体协调性更强

效率

慢,需要 9 次调用

1 次调用

逻辑感

难以整体把控

一目了然

调整成本

改一张要重抽

改某一格相对容易

5.4 不满意怎么办

抽卡免不了不满意。我的处理方式是分两层:

第一层是再抽。如果只是某一帧画面不够理想(比如某个分镜的光线没那么柔和),先重新生成一两次再看。Nano Banana Pro 是有随机性的,多抽几次往往能拿到更合适的版本。

第二层是回调脚本。如果连抽好几次都不满意,说明问题可能不在图像模型,而在脚本——比如某个分镜的描述太抽象、太模糊。这时候回到 Gemini,把那个分镜的画面描述写得更具体一点,再重新生成 JSON 提示词,再回 Flow 里抽。

这里有一个小经验:画面描述要尽可能"可视化"。不要写"温馨的家庭氛围",要写"客厅木质地板上,暖黄色灯光从右上方斜射下来,茶几上放着一只灰色陶瓷碗"。前者是抽象概念,后者是可执行的画面指令。

5.5 产品一致性的额外保险

如果你对产品的一致性要求特别高(比如包装上的某个标签必须一字不差),可以在 Flow 里同时上传两张产品图——一张正面图、一张侧面图——并在提示词里明确写:"请确保所有分镜中的产品包装与参考图完全一致,包括 logo 的位置、颜色、字体。"

辛梓煜在词元二号站之前测过一次,用这种"双图参考 + 显式提示"的组合,产品一致性的稳定度可以从大约六成提升到接近九成。这种细节,是工作流跑得稳的关键。


六、AI 拍剪师:用 Seedance 2.0 把静帧动起来

九宫格分镜图出来之后,下一步是让画面动起来。这一步在整个工作流里是最直观的——你能立刻看到一张静态的图被赋予了运动、节奏、声音。

6.1 Seedance 2.0 是个什么样的工具

Seedance 2.0 是字节跳动在 2026 年 2 月推出的新一代多模态 AI 视频生成模型,已经上线即梦 AI、豆包 App 等平台。它和上一代视频模型相比,有三个让人眼前一亮的地方:

  • 多模态参考:支持文本、图片、视频、音频四种模态混合输入,最多可以上传 12 个素材(图片最多 9 张,视频和音频各最多 3 个,总时长不超过 15 秒)。
  • 指令响应精准:通过"@素材编号"的方式可以精准引用某一个具体的输入素材,让模型清楚地知道"用 @图片1 的角色 + @视频1 的运镜 + @音频1 的节奏"。
  • 原生音画同步:在生成视频的同时直接输出双声道音频,口型同步、环境音效、背景音乐都是同步生成的,不需要后期再单独配音。

这对带货短视频是一个质变。过去要让一支 AI 视频带音效,得在视频生成完之后再单独跑一遍音频模型、再用剪辑软件对齐,工序复杂、容易脱节。Seedance 2.0 把这一步合并了。

6.2 在即梦里跑一遍

具体怎么操作?我把流程拆开来:

  1. 打开即梦 AI,进入视频生成入口。
  2. 模型选择 Seedance 2.0,并开启"全能参考"模式(也有叫做"能参考"的入口)。
  3. 上传素材:
    • 第一张:上一步在 Flow 里生成的九宫格分镜图,作为镜头参考。
    • 第二张:产品参考图,确保产品在视频中一致。
  4. 把 Gemini 之前生成的中文分镜脚本直接粘贴到提示词输入框。
  5. 在提示词里明确告诉模型:"按照 @图1(分镜图)从 1 到 9 的顺序,依次生成连贯的视频;产品的外观参考 @图2,请确保所有镜头中产品保持一致。"
  6. 选择视频尺寸(带货短片一般用 9:16)和时长(建议 10 到 15 秒)。
  7. 点击生成。

如果排队等待时间太长,可以试一下 Seedance 2.0 Fast 版本,速度快一些,使用的人也比较少。

6.3 @ 引用语法的妙用

Seedance 2.0 最让我惊喜的设计是"@ 引用"。你在提示词里写 @图1@视频1@音频1,模型会非常精准地知道你在指代哪一个素材。这一点听起来简单,但它解决了多素材输入时最常见的痛点——AI 搞不清楚哪个素材该用在哪里。

举几个实操中常用的写法:

角色形象参考 @图1,
背景与运镜参考 @视频1,
口型与节奏对齐 @音频1,
保持产品包装与 @图2 完全一致。

这种写法把不同素材的"职责"分配得清清楚楚。模型不需要再猜,照着执行就行。

对于带货场景,最常用的引用组合是:

素材编号

内容

作用

@图1

九宫格分镜图

镜头序列与画面构图参考

@图2

产品正面图

产品一致性锁定

@图3(可选)

风格参考图

调色与质感参考

@视频1(可选)

同类商品参考视频

运镜节奏参考

6.4 视频参数怎么设

视频生成的参数也有讲究。我的常用配置:

  • 尺寸:带货短视频选 9:16(竖屏),长视频可选 16:9。
  • 时长:单段建议 10 到 15 秒。Seedance 2.0 单次最长支持 15 秒,超过的话需要用"视频延长"功能拼接。
  • 画质:能选 1080P 就选 1080P,2K 输出在某些场景下有,可以测一下。
  • 种子(Seed):如果对某一版结果比较满意,记下种子号,下次微调提示词的时候用同样的种子可以保持画面基调。

6.5 不满意时的迭代策略

视频生成的迭代成本比图像高,所以我会先把"小批量测试"做透再放量生成。

具体做法是:先用 5 秒时长跑一版,看看运镜、节奏、产品一致性这几个核心指标过不过关。如果都过关,再扩展到 10 秒、15 秒;如果不过关,回去改提示词,而不是直接堆时长。

辛梓煜@词元二号站 之前也写过一篇关于 Seedance 2.0 视频延长的文章,那里面提到一个重要细节:延长视频时,"生成时长"要选的是新增部分的时长,而不是总时长。比如你想把原来 8 秒的视频延长到 15 秒,那么生成时长选 7 秒。这个细节官方手册里有,但很多人第一次用都会搞错。

6.6 用一支猫粮广告片走完全流程

把上面这些拼起来,一支猫粮带货短片就跑完了。最终效果上你能看到:

  • 整个画面有非常强的产品质感,灯光柔和、产品标签清晰。
  • 猫咪吃猫粮的动作连贯自然,没有传统拍摄里"演员不配合"的问题。
  • 配套的音效非常生动——食物倾倒的声音、咀嚼的声音、罐头开启的声音都对得上画面。

这就是传统拍摄当中最难解决的痛点之一——演员、宠物、食物本身的配合度。AI 视频工作流把这三个变量都收编了。

6.7 关于"全能参考"模式的进阶用法

Seedance 2.0 在即梦里有一个非常关键的入口,叫"全能参考"。它跟普通的图生视频不一样的地方是:你可以一次性上传图、视频、音频三类素材,模型会综合参考这些素材生成视频。

举个具体的例子。我做一支居家场景的氛围广告时,是这么用的:

  • 图1:一张产品的高清近照,用来锁定产品外观。
  • 图2:一张参考的家居场景图,用来定调子(米白色墙面、原木地板、暖光)。
  • 视频1:一段我喜欢的同类广告片段,用来参考运镜的节奏。
  • 音频1:一段我从素材库里挑的轻音乐,用来参考整体音乐风格。

提示词写:"参考 @图1 的产品外观,@图2 的场景调性,@视频1 的运镜节奏,@音频1 的音乐风格,生成一支 10 秒的居家氛围短片,强调产品的质感和家居的温暖感。"

这种"四模态混合输入"的玩法,是 Seedance 2.0 最有威力也最被低估的功能。它让你不需要把所有信息都用文字描述出来——很多东西用一段视频参考一下,比写十句话都更准。

6.8 把多个 15 秒片段拼成长视频

Seedance 2.0 单次最长支持 15 秒。但带货视频经常需要 30 秒、60 秒,怎么办?

官方有一个"视频延长"的功能,可以基于已生成的视频继续往下生成。具体玩法:

将 @视频1 延长 15 秒,
角色继续动作,
保持角色外观、背景、光线与前段完全一致,
镜头保持稳定不变。

通过这种方式,理论上可以无限延长。但实际操作中,我建议拼接不超过 3 段(也就是 45 秒以内),因为延长的次数越多,画面漂移的可能性越大。

另一种思路是用剪辑工具拼接。把 9 个分镜分别用 Seedance 2.0 生成 1.5 秒到 2 秒的短视频,再用剪映或者其他剪辑软件按顺序拼起来,加上转场和配乐,就是一支完整的成片。这种方式的好处是每个分镜都可以单独调整、单独重做,不影响其他部分。


七、JSON 结构化提示词:让脚本到分镜的衔接不脱节

这一节单独把 JSON 提示词的事儿讲透,因为这是整个工作流里最容易被低估的"粘合剂"。

7.1 为什么不直接用大白话喂图

很多人用图像模型的时候,习惯用一段大白话描述:"一只橘猫在木地板上吃猫粮,画面温馨,光线柔和。"这种写法在 Midjourney、Stable Diffusion 时代是主流,因为那时候的图像模型对自然语言的理解还没那么深。

但到了 Nano Banana Pro、Gemini 3 Pro Image 这一代,自然语言能力已经够强,反过来"结构化输入"成了更优解。原因有三个:

第一,结构化输入消除歧义。"画面温馨"这种描述在不同人理解里差异很大,但 mood: warm, lighting: sof

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布4 篇
文章总数106 篇
昨日发布3 篇
本月发布14 篇
建站时间37 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码