本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
这一波 AI 视频工具的天花板,已经被「Agent + Skill + Seedance 2.0」这一组合捅穿了。过去做一支像样的短片,要在七八个工具之间反复横跳:写脚本一个 AI、生成主角一个 AI、出分镜一个 AI、跑视频又是一个 AI,中间还得自己拼提示词、对一致性、修运镜。现在的实际情况是,你只需要把一张参考图和一句话扔进去,Agent 会自动调度 Skill 把分镜、角色三视图、关键帧、视频生成、音画同步、剪辑轨道全部跑完,中途随时可以暂停、修改、调换分镜顺序,跑完之后还能把整条流程封装成「下次一句话就出片」的 Skill。
这篇文章会做四件事:第一,把这套范式背后的原理讲透;第二,把 Seedance 2.0 这块「视频模型底座」的能力盘点清楚;第三,把从「开局一张图」到「成片导出」的全流程拆成可照做的步骤;第四,把我自己实操下来踩过的几个典型坑和应对方法摊开来。
如果你只想要核心结论:AI 视频创作的门槛已经从「会写提示词」降到了「能描述一个故事」,但能不能稳定出片的关键,不再是某一个模型,而是你身后那条工作流和它的可复用程度。想看完整拆解,往下翻。
一、AI 视频创作的"假繁荣"和真痛点
打开任何一个短视频平台,搜「AI 做视频」,推到你眼前的多半是这种调调:十秒上手、零基础出片、一键替代剪辑师。看完很心动,自己一上手,十有八九两小时后还在跟提示词较劲。
我自己拍了十几年片子,对镜头和叙事有自己的一套审美。过去这一年里,我也跟着大家一起体验过几乎全部主流 AI 视频工具。说一句客观点的话:外面那些教程展示的成品,和你按相同步骤跑出来的东西,中间隔着一整本制作手册。
H1 第一个错觉:提示词越短越好
短视频平台上最爱拿出来炫耀的,就是「我只输入一句话,它就出了这个」。但你真要做出符合你自己审美和叙事节奏的东西,那个提示词长得跟论文摘要一样——景别、运镜、光位、节奏、情绪、参考、风格、长宽比、时长、音乐节拍、镜头切换方式……每一项都不能漏。
更难受的是,你写了几百字的提示词,生成出来的东西经常还是「差一点意思」。AI 视频模型的「理解力」本质上是飘忽的,同一段提示词,这一次和下一次的产出就像在拆盲盒。这也是为什么过去整整一年,我看到圈里很多创作者一边大喊「AI 取代视频行业」,一边背地里疯狂抽卡到深夜。
H2 第二个错觉:一个 AI 就能干所有事
很多人以为现在的 AI 视频是这样的流程:打开一个工具,输入想法,出片。实际情况是这样的:
想做一支 30 秒短片,你大概率要经历:
1. 用一个 AI 写脚本/拆分镜
2. 用第二个 AI 生成角色形象
3. 用第三个 AI 生成角色三视图保证一致性
4. 用第四个 AI 把分镜画面跑出来当关键帧
5. 用第五个 AI(视频模型)做关键帧之间的运镜
6. 用第六个 AI 生成 BGM 或音效
7. 自己手动在剪辑软件里拼成片
七步流程,七个账号,七套提示词逻辑,七种计费规则,七处可能崩掉的环节。这套流程跑通过一次之后,你大概率会得出一个朴素的结论:这玩意儿真不是给普通创作者准备的,这是给团队工业化生产准备的。
H3 第三个错觉:换最新模型就能解决问题
很多人对 AI 视频生成有一个非常致命的认知误区:只要我用上最新的模型,就能出好片。
这种思路在 2023 年还能用,因为那时模型本身的差距就是天和地的差距。但到了 2026 年,主流视频模型在「画质」「时长」「物理合理性」这些底层能力上已经迅速拉平,真正决定一支片子成色的,不再是单点模型,而是把模型、参数、参考素材、提示词、剪辑这些环节串起来的工作流。
而且模型这东西吧,我个人的看法是这样的——今天它最强,明天它更强。如果你每出一支新模型就要重新学一套提示词、重新配一遍 API、重新调一遍流程,那这条路是走不通的。真正可持续的做法,是把"流程"沉淀下来,而不是去追"模型"。
H1 第四个真痛点:等待焦虑
跑过 AI 视频的都体验过这种感觉:点了生成按钮,转圈圈,然后看着进度条度日如年。一支 15 秒的视频跑七八分钟,中间换一个参数,又是七八分钟。你想做的事情和你能做的事情之间,横着一条「排队队列」。
特别是某些热门平台,免费用户被甩在队伍最后,付费会员往前挪一点,旗舰模式还要再等。一晚上下来,真正能用的成片可能就只有两三条。
辛梓煜@词元二号站这边给到大家一个朴素的判断标准:评价一个 AI 视频平台的好坏,除了模型,排队速度和模型新鲜度这两个指标必须看。前者决定你今晚能不能干完活,后者决定你三个月后还要不要换平台。
H2 痛点小结
简单总结一下,过去一年里 AI 视频工具堆给普通创作者的痛点,基本就是这五个:
|
痛点 |
表现 |
|
提示词太长 |
一段提示词写得跟论文一样长,普通人写不动 |
|
工具太多 |
一支片子要在七八个平台之间反复横跳 |
|
一致性崩溃 |
角色脸跑、场景跳戏、镜头切换违和 |
|
等待焦虑 |
排队 + 跑模型,一晚上跑不出几条能用的 |
|
模型更替焦虑 |
学了一套提示词,下个版本全得重学 |
这些痛点在 Agent + Skill + Seedance 2.0 这一套范式出现之后,有一半是被直接解决掉的,另一半是被结构性改善的。下面我会一层层把它讲清楚。
二、为什么 Agent + Skill 是这一代视频生成的破局点
先把两个概念铺平。术语第一次出现,我用白话讲一遍。
H1 Agent 是什么:一个会自己干活的"AI 同事"
**Agent(智能体)**这个词最近在 AI 圈被用烂了,但落到视频生成里,它的含义其实非常具体——它是一个能根据你的目标,自主拆解任务、调用工具、产出成品的程序。
打个比方:你以前用 AI,像是在和一个「翻译机」对话——你说一句,它回一句,中间所有的中转、判断、执行都得你自己来。Agent 则像一个真的有手有脚的同事,你给它一个目标(「做一支小猫一天的 vlog」),它会自己去想分几步、每步用什么工具、按什么顺序跑、跑完之后怎么交付,中间不需要你一直盯着。
放到视频创作场景里,Agent 至少要具备五种能力,缺一不可:
1. 语言能力:听得懂你说的"小猫一天的 vlog"是个什么需求
2. 规划能力:把这个模糊需求拆成具体的分镜任务
3. 图像能力:能生成主角形象和分镜关键帧
4. 视频能力:能把关键帧串成有运镜的视频
5. 编排能力:能在中间反复调度、纠错、迭代
过去这五种能力分散在五个平台,五个 API Key、五套计费规则、五种稳定性问题。光是配账号和对账就够折腾半天,更别说真的跑业务了。这也是为什么过去一年想做 AI 视频的人,不少最后都倒在了「配环境」这一步。
H2 Skill 是什么:一份写给 Agent 的"工作手册"
光有 Agent 还不够。Agent 是一个通用执行者,你让它做视频,它得知道「视频应该怎么做」。这份「应该怎么做」的标准化说明书,就是 Skill。
更直观的解释是这样的:
- Agent 是新来的全能助理,啥都会,但不知道你公司的规矩。
- Skill 是公司发的员工手册,告诉助理具体每个流程怎么走。
- 助理 + 手册,才是一个能独立交付的「员工」。
Skill 一般以 Markdown 文件的形式存在,里面写清楚:遇到什么样的任务,应该怎么拆解、用哪些工具、按什么顺序调用、产出物长什么样。Agent 拿到 Skill,就像新员工拿到 SOP,一上来就知道该干嘛。
放到视频生成场景里,一个典型的 Skill 大致长这样:
flowchart TD
A[用户输入: 一张图 + 一句话] --> B{选择模式}
B -->|故事驱动| C1[Agent 自由发挥剧情]
B -->|剧本驱动| C2[Agent 严格按剧本走]
C1 --> D[生成主角三视图]
C2 --> D
D --> E[逐镜分镜脚本]
E --> F[关键帧图像生成]
F --> G[Seedance 调用 视频片段生成]
G --> H[音效 / BGM 匹配]
H --> I[剪辑轨道自动拼接]
I --> J[成片输出]
这张图里,每一个环节都对应一个 Agent 内部的工具调用,而把整条链路串起来的「先做什么、再做什么、出错怎么办、用户怎么干预」这套规则,就是 Skill 的内容。
H3 这套范式真正改变了什么
讲到这一步,你应该能感觉到这件事的分量了——它不是给 AI 视频「加一个新功能」,它是把整条视频生产流水线从手工作坊推到了工业化阶段。
过去你做一支片子,本质上是「手动操作几十次工具调用,自己当那个调度器」。现在则是,你把调度器这一层交给 Agent,把流程标准这一层固化为 Skill,自己只需要负责创意输入和最终审片。
而且,Skill 是可以沉淀、共享、复用的。这意味着什么?意味着:
- 你今天调好的「卡通 vlog 风格」Skill,明天可以直接拿来跑下一支视频。
- 别人调好的「电影解说」「商业广告」「漫剧短片」Skill,可以一键拿来用。
- 你的审美和创作经验,第一次可以作为「可复利的资产」沉淀下来,而不是每次都从零开始。
辛梓煜@词元二号站这边在内测中跑了不下二十条短片,真正让我觉得「AI 视频范式变了」的不是某个模型有多强,而是 Skill 这个机制把"我自己的工作方法"从脑子里搬到了文件里。
H1 为什么是现在?
可能你会问:Agent 和 Skill 这些概念早就有了,为什么直到 2026 年初这套范式才真正可用?
原因有三个,我个人观察下来:
- 视频模型本身够好用了:像 Seedance 2.0 这种支持多模态输入、多镜头叙事、音画同步的模型,把单点能力推到了「能用」的阈值之上。
- Skill 标准化了:Anthropic 在 Claude Code 里推出了一种叫 Skills 的扩展机制,本质上是写给 Agent 的说明书。主流 Agent 平台(Claude Code、OpenClaw、Cursor 等)都迅速接入,Skill 的规范统一了,跨平台复用第一次成为可能。
- 平台层做了集成:像 Flowith 这样的平台开始把「Agent + Skill + 主流视频模型」打包成一个工作台,新模型一发布就接进来,不用切换、不用排队。从「一堆工具的集合」变成了「一个能干活的工作台」。
三件事赶到一起,这个范式才真正成立。
三、Seedance 2.0 的能力底座到底强在哪
光有工作流不够,底层视频模型的天花板决定了你的成品天花板。这一节我把 Seedance 2.0 的能力底座盘一遍,重点不是吹模型,而是让你知道它到底能做到什么、做不到什么。
H1 它能接受的输入,比上一代多得多
Seedance 2.0 是字节跳动推出的多模态 AI 视频生成模型,支持文本、图像、视频、音频四种模态输入。这意味着你不再被「写一段描述,等模型抽卡」这一种交互方式锁死,而是可以:
- 图像输入:给一张参考图,锁定主角形象。
- 视频输入:给一段参考视频,复刻里面的运镜风格。
- 音频输入:给一段音乐节拍,让画面卡点。
- 文本输入:给一段剧本或描述,提供叙事骨架。
实测最多可接入 12 个参考文件(图片不超过 9 张、视频不超过 3 段、音频不超过 3 段)。这个量级意味着,你已经可以把一支专业短片需要的「素材库」喂给模型,然后让它自己组合。
H2 它的"杀手锏":多镜头叙事一致性
讲一个我特别在意的点。过去一年,AI 视频圈最大的痛点不是画质,而是「角色脸跑」。一段 10 秒钟的视频,你的主角可能从第一个镜头到第三个镜头就换了一张脸,从第三个镜头到第五个镜头连衣服都换了。这对叙事是毁灭性的。
Seedance 2.0 的做法是引入了「角色-环境感知编码」技术,把角色的面部特征、服装纹理、微表情,以及场景的风格、光影、色调固化下来。你给它一张主角全身照,后面几个镜头的角色都能保持稳定,甚至跨视频系列也能保持一致性。
实测下来,多角色场景下,Seedance 2.0 能同时维持 5 个以上不同角色的形象不漂移。这是过去同类模型几乎做不到的。
H3 自主运镜:你不用再背"推、拉、摇、移"
以前用 AI 生成视频,你得非常精确地告诉模型「镜头从左向右平移」「先给一个全景再推到特写」。稍微复杂一点的运镜描述,模型就开始犯迷糊。
Seedance 2.0 内置了智能运镜引擎,可以根据你描述的情节自动规划分镜和运镜。你只需要告诉它故事是什么,它自己决定怎么拍。
举个例子,你说:「一只小猫在窗台上看着雨,慢慢转头看向镜头,然后跳下窗台跑向门口。」过去你得指定:
[0-2 秒] 广角,猫坐在窗台,雨声 BGM
[2-4 秒] 推近镜头,聚焦猫的侧脸
[4-5 秒] 特写,猫的眼睛
[5-7 秒] 转头,镜头跟随
[7-9 秒] 中景,猫跳下窗台
[9-12 秒] 跟拍,猫跑向门口
现在你只需要把那一句中文描述丢给它,它自己会拆出这套分镜逻辑,并且按合理的节奏组合起来。
H1 音画同出:不再是"生成完再配音"
Seedance 2.0 采用双分支扩散变换器架构,可以在生成视频画面的同时,生成匹配的音效和配乐。这听起来像是个小改动,但对实际创作意义巨大:
- 口型同步:角色说话的时候,嘴型是对的。
- 环境音匹配:雨声、撞击声、脚步声,能精准卡到画面上。
- 情绪适配:画面节奏快的时候,BGM 也会同步加快。
过去你做一支有人物对话的短片,得在视频生成之后,再花一两个小时单独配音、对口型、调音效,经常对不上还得返工。现在这一步并到了视频生成里,成片可用率从过去的不到 20% 直接跑到了 90% 以上。
H2 物理规律的极致模拟
很多人忽视了这一点。物理合理性是 AI 视频最容易翻车的地方:水泼出来不对、东西碎得不对、人物动作的力度不对。
Seedance 2.0 在物理模拟上做了大量训练,无论是流体泼溅、碰撞破碎,还是格斗场景里复杂的动作衔接,画面不再有早期 AI 视频那种"果冻感"。这对做特效片、动作戏、产品广告的创作者来说,是一个质变。
H3 能力盘点总表
我把 Seedance 2.0 相对上一代的能力跃迁整理成下面这张表,方便你一眼看完:
|
能力维度 |
上一代 |
Seedance 2.0 |
|
输入模态 |
主要靠文本 + 图像 |
文本/图像/视频/音频四模态 |
|
参考素材容量 |
一般 1-3 个 |
最多 12 个 |
|
视频时长 |
5-8 秒 |
最长 15 秒 |
|
角色一致性 |
1 个角色经常崩 |
同时稳住 5+ 角色 |
|
运镜规划 |
需要手动指定 |
自动规划分镜 |
|
音画同步 |
需要后期配音 |
同步生成口型 + 音效 |
|
物理合理性 |
"果冻感"明显 |
流体/碰撞接近实拍 |
|
成片可用率 |
<20% |
>90% |
需要强调一句:这些数字是行业平均测试结果,不同题材表现会有差距。但即便打个对折,这一代模型相对上一代的提升也是结构性的,不是单点的小修小补。
H1 它不能做什么:也要说清楚
吹完优点,辛梓煜@词元二号站这边也要把劣势说出来,这样你才不会上手后被「实际效果」反复打脸。
- 超过 15 秒的连贯叙事还是难题:模型本身的时长上限就在 15 秒左右,要做更长的片子,得靠分段生成 + 剪辑拼接。
- 复杂手部动作仍然会崩:特别是手指数量、握持姿势,在多镜头切换中容易出问题。
- 特定中文文字渲染仍不稳定:画面里要出现长串中文字,模型很容易拼错或者糊掉。
- 超写实人物特写存在恐怖谷效应:近距离的真人脸部特写,有时候会有微表情错位的违和感。
知道这些边界,才能合理地把它用在它擅长的地方。
四、一句话出片工作流的完整拆解
讲完原理和模型底座,这一章是全文最核心的部分——「一张图 + 一句话」到底是怎么变成一支完整短片的。我把这条工作流拆成八个阶段,逐个讲清楚。
H1 阶段一:输入素材定基调
工作流的起点非常简单:一张参考图 + 一句话需求。
- 参考图可以是主角的人物形象、一张表情包、一个场景照片,甚至是一张草图。它的作用是给 Agent 一个「视觉锚点」,让后面的所有分镜围绕这个锚点展开。
- 一句话需求是你的核心诉求。比如「做一支贯穿小猫一天的 vlog」「做一支咖啡店主理人的开店日常」「做一支古风武侠的对决片段」。
辛梓煜@词元二号站这边的实测经验是:一句话的描述,反而比一大段提示词效果更好。一段太长的提示词,模型容易在内部权重上打架,最后什么都没抓住。简短、明确、有画面感的一句话,反而能让 Agent 抓到核心意图。
H2 阶段二:选模式——故事驱动 vs 剧本驱动
输入完素材,Agent 会问你一个关键问题:「你这次是故事驱动还是剧本驱动?」
这两个模式的差别很大,选错了后面整套流程就跑偏了。
故事驱动型(Story-Driven):
- 适合 vlog、生活短片、品牌情绪片、概念短片
- 没有具体台词和分镜,只有一个大方向
- Agent 自由发挥剧情,擅长情绪铺陈和氛围塑造
- 适合「我想做一支感觉怎样怎样的片子」
剧本驱动型(Script-Driven):
- 适合短剧、漫剧、电影解说、产品演示
- 有明确的台词、分镜、人物动作
- Agent 严格按剧本走,擅长还原既定结构
- 适合「我有一份完整剧本,你帮我拍出来」
这两个模式背后,对应的是两种完全不同的 Skill 工作流。故事驱动的 Skill 会先让 Agent 推演一份故事大纲,然后再拆分镜;剧本驱动的 Skill 会直接拿你的剧本作为输入,跳过推演阶段。
对于做 AI 漫剧、AI 短剧的专业作者来说,剧本驱动模式简直就是命脉——把小说原文丢进去,选剧本驱动,Agent 直接帮你跑出整条片子。
H3 阶段三:Agent 自动编排工作流
选完模式之后,Skill 会自动接管,把后面的工作全部安排好。这个阶段你能看到的,大概是这样一份编排清单:
[Stage 1] 故事架构与时间轴设计
[Stage 2] 主角角色设计(三视图)
[Stage 3] 分镜脚本(精细到秒)
[Stage 4] 关键帧 storyboard 生成
[Stage 5] 分镜视频生成(调用 Seedance 2.0)
[Stage 6] 配乐与音效匹配
[Stage 7] 字幕与文案生成
[Stage 8] 时间线拼接与剪辑
每一个阶段背后,都是 Agent 内部的工具调用。比如 Stage 2 调用的是图像生成模型,Stage 5 调用的是 Seedance 2.0,Stage 7 调用的是文本生成模型。整条链路对你来说是透明的——你看着 Agent 在跑,但你不需要自己去操作任何一个底层工具。
这一步特别爽的地方在于:Skill 会把所有用到的提示词和镜头逻辑都分解出来,你能看到「Agent 是怎么想的」。我个人觉得 Agent 拆分的逻辑大多数时候已经很专业了,但如果你觉得哪里不合理,可以直接介入。
H1 阶段四:故事板与分镜的人机协作
这是这套工作流最反直觉的一点——Agent 在跑,你可以同时改。
具体来说,Agent 把分镜脚本和故事板生成出来之后,会以编辑区的形式呈现在屏幕左侧。你可以:
- 直接删除某个分镜:觉得这一段多余,点删除。
- 调换分镜顺序:觉得节奏不对,拖拽顺序。
- 修改分镜内容:点开某个分镜,直接改它的提示词、景别、运镜。
- 以聊天的方式给反馈:「这一段我希望镜头再低一点,情绪再冷一点」——Agent 听得懂。
最让我惊喜的设计是:这套人机协作支持随时暂停。
你以前用 AI 视频工具,点了生成就只能等。Seedance 2.0 加 Agent 工作流不一样,你随时可以点暂停,改主意,然后继续。它不再是"发送即撤不回"的单向流程,而是真正的双向协作。
辛梓煜@词元二号站这边做了一组对比:
|
维度 |
传统 AI 视频 |
Agent 协作工作流 |
|
修改时机 |
跑完才能改 |
随时打断 |
|
改动单位 |
重新跑一遍 |
单个分镜 |
|
上下文保留 |
重置 |
完整保留 |
|
试错成本 |
高 |
低 |
H2 阶段五:逐分镜确认 + 关键帧生成
进入到具体执行阶段,Agent 会一个分镜一个分镜地走,每一步都需要你点确认才会开始下一步。
这个设计的意义在于:让你随时可以介入,而不是跑了一半才发现方向错了。每生成一个分镜的关键帧,你可以在屏幕上看到这一帧的画面,如果觉得不对,可以:
- 在评论区告诉 Agent 哪里不合适。
- 点击手动编辑,改提示词。
- 让 Agent 重新生成几个版本,你挑一个。
我自己跑下来的体感是,每个分镜大概需要 1-2 次微调就能定稿,整体试错成本比传统流程低一个数量级。
H3 阶段六:Seedance 2.0 调用 + 视频片段生成
关键帧定稿之后,Agent 调用 Seedance 2.0,把每个分镜的关键帧转成视频片段。这一步是整条流程里最耗时的一环——一段 15 秒的视频片段,大概要跑 3-5 分钟。
但是有两个细节让这件事变得能忍:
- 不需要排队——主流平台对这个模型做了集成,点完就开始跑,不用像传统平台那样在队列里等半小时。
- 可以并行跑——多个分镜同时生成,整体时长比串行跑快得多。
跑完之后,所有分镜片段会自动汇总到一个时间线上。
H1 阶段七:剪辑轨道集成
讲到这里,可能有人要问:那剪辑呢?难道还要导出之后再去剪辑软件里拼?
不用。这套工作流最让我惊讶的是,Agent 平台内置了剪辑轨道。生成完所有分镜之后,你可以直接看到 AI 给你剪好的整条时间线。如果需要微调:
- 点击某一段素材,可以打开手动编辑面板。
- 调整片段的顺序、时长、转场。
- 替换某一段素材的内容(重新生成或上传)。
- 以评论的方式告诉 AI:「这里换一种呈现方式」。
剪辑这一步过去是 AI 视频工作流的「最后一公里」,大家做完素材都得导出到 PR、剪映或者 CapCut 里去手动拼。剪辑轨道内置之后,这一公里也被吃进了工作流里。
H2 阶段八:封装成 Skill,下次一句话再出片
最后一步,也是最具复利价值的一步——把这次跑通的工作流,保存成一个 Skill。
这一步的本质是:把你这次的审美决策、修改习惯、风格偏好,全部沉淀到 Skill 文件里。下次你做类似的片子,直接调用这个 Skill,AI 会按照你上次的偏好来做事,不需要你从头讲一遍。
这套机制的威力是这样的——你今天做一支「卡通宠物 vlog」,明天可以直接说「按昨天的 Skill,做一支金毛的 vlog」。AI 会自动复用所有的运镜偏好、色调倾向、节奏控制,你只需要换一张参考图和一句话核心需求。
H3 整条工作流的可视化
把这八个阶段串起来,整条工作流大致是这个样子:
flowchart LR
A[一张图 + 一句话] --> B[选模式]
B --> C[Agent 编排]
C --> D[人机协作分镜]
D --> E[逐镜确认 + 关键帧]
E --> F[Seedance 2.0 跑视频]
F --> G[内置剪辑轨道]
G --> H[导出成片]
H -.沉淀.-> I[保存为 Skill]
I -.下次直接复用.-> A
这条工作流的特点是:有起点、有出口、有反馈环。你不是在跑一次性的脚本,你是在搭建一条可以反复跑、越跑越懂你的生产线。
五、保姆级实操步骤拆解
把原理讲完,这一章我把从打开平台到导出成片的具体操作,拆成可照做的步骤。读完这一章,你可以拿一张参考图,跟着做一遍。
H1 步骤 1:打开平台,进入 Agent 模式
进入支持这套工作流的 AI 创作平台之后,第一件事是切到 Agent 模式。这个模式和传统的「对话模式」「图片生成模式」「视频生成模式」是并列的,选择 Agent 模式之后,你输入的所有内容都会被理解为一个可被拆解的任务,而不是一条单点指令。
H2 步骤 2:上传参考图 + 输入一句话
把你的参考图(主角、场景、风格图都行)拖进对话框,然后输入你的一句话需求。比如:
我想做一支贯穿小猫一天的 vlog。
这里有几个实操要点,新手特别容易踩坑:
- 图片不要太复杂:背景越简单越好,主角越突出越好。一张干净的主角全身照,效果最好。
- 一句话要有画面感:不要写「我想做一支感人的视频」,要写「我想做一支小猫雨天找妈妈的故事」。
- 不要堆形容词:不要堆「电影级、史诗感、好莱坞质感」这种修饰词,Agent 自己会处理风格。
- 指定时长是个好习惯:可以加上「时长 30 秒」「分 8 个镜头」这种结构化信息。
H3 步骤 3:选择故事驱动还是剧本驱动
发送之后,Agent 会问你选哪种模式。新手默认建议选故事驱动——它会自动帮你推演剧情、分镜,你不需要自己写剧本。
只有你已经有一份完整文本(小说节选、剧本、广告分镜表)的时候,才选剧本驱动。
H1 步骤 4:观察 Agent 拆分的任务清单
模式选好之后,Agent 会立刻给你一份它打算执行的任务清单。这一步非常关键——这是你纠偏的最后机会。
清单大致长这样:
我打算这样做:
1. 主角设计:基于你的参考图,生成小猫的三视图
2. 故事架构:小猫一天 24 小时,分 6 个时间段
3. 分镜脚本:每段 5 秒,合计 30 秒,具体到秒
4. 关键帧生成:6 张 storyboard
5. 视频生成:Seedance 2.0,15s 模式,音画同步
6. 配乐:轻松温暖的钢琴 BGM
7. 字幕:中文,底部白色描边
8. 剪辑:按时间顺序拼接,加快节奏转场
确认要这么做吗?有需要调整的告诉我。
这个时候你的任务是:通读一遍,看哪里不对就立刻指出来。比如「BGM 不要钢琴,要轻快的电子」「字幕用日系细体,不要描边」。改在这一步,后面就不用返工。
H2 步骤 5:观察故事板生成 + 实时介入
确认任务之后,Agent 开始干活。你会看到屏幕左侧出现一个故事板编辑区,每个分镜以卡片的形式排列。
[Shot 1] 0:00-0:05 清晨,猫被阳光叫醒,伸懒腰
[Shot 2] 0:05-0:10 早餐时间,猫吃罐头,镜头跟随
[Shot 3] 0:10-0:15 午前,猫在窗台看鸟,慢推近
[Shot 4] 0:15-0:20 午后,猫睡觉,光影变化
[Shot 5] 0:20-0:25 傍晚,猫等主人回家,镜头在门口
[Shot 6] 0:25-0:30 夜晚,猫蜷在沙发上,镜头拉远
辛梓煜@词元二号站这边的实操建议:这一步至少花 5 分钟仔细看一遍。这是整条工作流里你「智力投入」最值钱的环节——你的审美在这里影响最终成片。
发现哪里不对,处理方式有四种:
- 删除分镜:直接点 X。
- 调换顺序:拖拽。
- 修改内容:点开分镜卡片,改提示词。
- 聊天反馈:在对话框里说「Shot 4 我想要更梦幻一点的感觉」。
H3 步骤 6:三视图生成 + 角色一致性锁定
分镜确认之后,Agent 会先生成主角的三视图(正面、侧面、背面)。这一步是为了给后面所有分镜提供角色一致性的参考。
三视图生成完,你会看到三张图。这三张图至关重要——它定义了主角在所有后续分镜里的形象。如果三视图不对(比如颜色不对、毛发质感不对),一定要在这一步改掉,不要带着错误的三视图往下跑。
修改方式:在对话框里告诉 Agent「猫的毛色再深一点」「眼睛改成琥珀色」,它会重新生成。
H1 步骤 7:关键帧 storyboard 生成
三视图锁定之后,Agent 开始生成每个分镜的关键帧(也就是 storyboard 大场景图)。这一步会按照分镜数量生成 6-10 张图,每张对应一个镜头的「画面感」。
实操建议:
- 逐张确认:每张图都点开看一遍。
- 遇到「不对」立刻改:不要等所有图都生成完才改,Agent 会按你的反馈实时迭代。
- 重点关注一致性:主角在所有图里的形象、服装、场景的色调是否统一。
H2 步骤 8:Seedance 2.0 调用,跑视频片段
关键帧定稿之后,Agent 调用 Seedance 2.0,把每个关键帧扩展成对应的视频片段。
这一步对你来说,基本就是**「点确认 → 等几分钟 → 看结果」**。但有一个动作不要忘记——在视频跑完之后,逐段播放确认一遍。如果某段视频效果不理想:
- 可以重新跑:点重新生成,Agent 会用同一个关键帧再跑一次,出来的会是不同的版本。
- 可以微调:在对话框里说「Shot 3 这段镜头推进太快了,慢一点」。
- 可以替换关键帧:让 Agent 用别的关键帧重新跑。
H3 步骤 9:剪辑轨道微调
所有视频片段跑完之后,Agent 会把它们汇总到一个剪辑轨道里。这个轨道是真实可编辑的,不是只能看不能动的预览。
在剪辑轨道上你可以做的事:
- 调整每段的入出点(剪掉前后多余的部分)