📍 词元二号站 开源解码 一张图加一句话就能出片:Agent + Skill + Seedance 2.0 视频生成工作流的完整拆解与上手指南

一张图加一句话就能出片:Agent + Skill + Seedance 2.0 视频生成工作流的完整拆解与上手指南

摘要:本文从原理、模型能力、完整工作流、保姆级操作、避坑要点五个维度,全面拆解如何用 Agent + Skill + Seedance 2.0 这一组合实现一句话出片的 AI 视频创作。覆盖故事驱动与剧本驱动模式选择、分镜人机协作、角色一致性、Skill 沉淀复用等关键环节,适合内容创作者、自媒体作者和 AI 视频爱好者参考实践。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

这一波 AI 视频工具的天花板,已经被「Agent + Skill + Seedance 2.0」这一组合捅穿了。过去做一支像样的短片,要在七八个工具之间反复横跳:写脚本一个 AI、生成主角一个 AI、出分镜一个 AI、跑视频又是一个 AI,中间还得自己拼提示词、对一致性、修运镜。现在的实际情况是,你只需要把一张参考图和一句话扔进去,Agent 会自动调度 Skill 把分镜、角色三视图、关键帧、视频生成、音画同步、剪辑轨道全部跑完,中途随时可以暂停、修改、调换分镜顺序,跑完之后还能把整条流程封装成「下次一句话就出片」的 Skill。

这篇文章会做四件事:第一,把这套范式背后的原理讲透;第二,把 Seedance 2.0 这块「视频模型底座」的能力盘点清楚;第三,把从「开局一张图」到「成片导出」的全流程拆成可照做的步骤;第四,把我自己实操下来踩过的几个典型坑和应对方法摊开来。

如果你只想要核心结论:AI 视频创作的门槛已经从「会写提示词」降到了「能描述一个故事」,但能不能稳定出片的关键,不再是某一个模型,而是你身后那条工作流和它的可复用程度。想看完整拆解,往下翻。


一、AI 视频创作的"假繁荣"和真痛点

打开任何一个短视频平台,搜「AI 做视频」,推到你眼前的多半是这种调调:十秒上手、零基础出片、一键替代剪辑师。看完很心动,自己一上手,十有八九两小时后还在跟提示词较劲。

我自己拍了十几年片子,对镜头和叙事有自己的一套审美。过去这一年里,我也跟着大家一起体验过几乎全部主流 AI 视频工具。说一句客观点的话:外面那些教程展示的成品,和你按相同步骤跑出来的东西,中间隔着一整本制作手册

H1 第一个错觉:提示词越短越好

短视频平台上最爱拿出来炫耀的,就是「我只输入一句话,它就出了这个」。但你真要做出符合你自己审美和叙事节奏的东西,那个提示词长得跟论文摘要一样——景别、运镜、光位、节奏、情绪、参考、风格、长宽比、时长、音乐节拍、镜头切换方式……每一项都不能漏。

更难受的是,你写了几百字的提示词,生成出来的东西经常还是「差一点意思」。AI 视频模型的「理解力」本质上是飘忽的,同一段提示词,这一次和下一次的产出就像在拆盲盒。这也是为什么过去整整一年,我看到圈里很多创作者一边大喊「AI 取代视频行业」,一边背地里疯狂抽卡到深夜。

H2 第二个错觉:一个 AI 就能干所有事

很多人以为现在的 AI 视频是这样的流程:打开一个工具,输入想法,出片。实际情况是这样的:

想做一支 30 秒短片,你大概率要经历:
1. 用一个 AI 写脚本/拆分镜
2. 用第二个 AI 生成角色形象
3. 用第三个 AI 生成角色三视图保证一致性
4. 用第四个 AI 把分镜画面跑出来当关键帧
5. 用第五个 AI(视频模型)做关键帧之间的运镜
6. 用第六个 AI 生成 BGM 或音效
7. 自己手动在剪辑软件里拼成片

七步流程,七个账号,七套提示词逻辑,七种计费规则,七处可能崩掉的环节。这套流程跑通过一次之后,你大概率会得出一个朴素的结论:这玩意儿真不是给普通创作者准备的,这是给团队工业化生产准备的

H3 第三个错觉:换最新模型就能解决问题

很多人对 AI 视频生成有一个非常致命的认知误区:只要我用上最新的模型,就能出好片

这种思路在 2023 年还能用,因为那时模型本身的差距就是天和地的差距。但到了 2026 年,主流视频模型在「画质」「时长」「物理合理性」这些底层能力上已经迅速拉平,真正决定一支片子成色的,不再是单点模型,而是把模型、参数、参考素材、提示词、剪辑这些环节串起来的工作流

而且模型这东西吧,我个人的看法是这样的——今天它最强,明天它更强。如果你每出一支新模型就要重新学一套提示词、重新配一遍 API、重新调一遍流程,那这条路是走不通的。真正可持续的做法,是把"流程"沉淀下来,而不是去追"模型"

H1 第四个真痛点:等待焦虑

跑过 AI 视频的都体验过这种感觉:点了生成按钮,转圈圈,然后看着进度条度日如年。一支 15 秒的视频跑七八分钟,中间换一个参数,又是七八分钟。你想做的事情和你能做的事情之间,横着一条「排队队列」。

特别是某些热门平台,免费用户被甩在队伍最后,付费会员往前挪一点,旗舰模式还要再等。一晚上下来,真正能用的成片可能就只有两三条。

辛梓煜@词元二号站这边给到大家一个朴素的判断标准:评价一个 AI 视频平台的好坏,除了模型,排队速度和模型新鲜度这两个指标必须看。前者决定你今晚能不能干完活,后者决定你三个月后还要不要换平台。

H2 痛点小结

简单总结一下,过去一年里 AI 视频工具堆给普通创作者的痛点,基本就是这五个:

痛点

表现

提示词太长

一段提示词写得跟论文一样长,普通人写不动

工具太多

一支片子要在七八个平台之间反复横跳

一致性崩溃

角色脸跑、场景跳戏、镜头切换违和

等待焦虑

排队 + 跑模型,一晚上跑不出几条能用的

模型更替焦虑

学了一套提示词,下个版本全得重学

这些痛点在 Agent + Skill + Seedance 2.0 这一套范式出现之后,有一半是被直接解决掉的,另一半是被结构性改善的。下面我会一层层把它讲清楚。


二、为什么 Agent + Skill 是这一代视频生成的破局点

先把两个概念铺平。术语第一次出现,我用白话讲一遍。

H1 Agent 是什么:一个会自己干活的"AI 同事"

**Agent(智能体)**这个词最近在 AI 圈被用烂了,但落到视频生成里,它的含义其实非常具体——它是一个能根据你的目标,自主拆解任务、调用工具、产出成品的程序

打个比方:你以前用 AI,像是在和一个「翻译机」对话——你说一句,它回一句,中间所有的中转、判断、执行都得你自己来。Agent 则像一个真的有手有脚的同事,你给它一个目标(「做一支小猫一天的 vlog」),它会自己去想分几步、每步用什么工具、按什么顺序跑、跑完之后怎么交付,中间不需要你一直盯着。

放到视频创作场景里,Agent 至少要具备五种能力,缺一不可:

1. 语言能力:听得懂你说的"小猫一天的 vlog"是个什么需求
2. 规划能力:把这个模糊需求拆成具体的分镜任务
3. 图像能力:能生成主角形象和分镜关键帧
4. 视频能力:能把关键帧串成有运镜的视频
5. 编排能力:能在中间反复调度、纠错、迭代

过去这五种能力分散在五个平台,五个 API Key、五套计费规则、五种稳定性问题。光是配账号和对账就够折腾半天,更别说真的跑业务了。这也是为什么过去一年想做 AI 视频的人,不少最后都倒在了「配环境」这一步。

H2 Skill 是什么:一份写给 Agent 的"工作手册"

光有 Agent 还不够。Agent 是一个通用执行者,你让它做视频,它得知道「视频应该怎么做」。这份「应该怎么做」的标准化说明书,就是 Skill

更直观的解释是这样的:

  • Agent 是新来的全能助理,啥都会,但不知道你公司的规矩。
  • Skill 是公司发的员工手册,告诉助理具体每个流程怎么走。
  • 助理 + 手册,才是一个能独立交付的「员工」。

Skill 一般以 Markdown 文件的形式存在,里面写清楚:遇到什么样的任务,应该怎么拆解、用哪些工具、按什么顺序调用、产出物长什么样。Agent 拿到 Skill,就像新员工拿到 SOP,一上来就知道该干嘛。

放到视频生成场景里,一个典型的 Skill 大致长这样:

flowchart TD
    A[用户输入: 一张图 + 一句话] --> B{选择模式}
    B -->|故事驱动| C1[Agent 自由发挥剧情]
    B -->|剧本驱动| C2[Agent 严格按剧本走]
    C1 --> D[生成主角三视图]
    C2 --> D
    D --> E[逐镜分镜脚本]
    E --> F[关键帧图像生成]
    F --> G[Seedance 调用 视频片段生成]
    G --> H[音效 / BGM 匹配]
    H --> I[剪辑轨道自动拼接]
    I --> J[成片输出]

这张图里,每一个环节都对应一个 Agent 内部的工具调用,而把整条链路串起来的「先做什么、再做什么、出错怎么办、用户怎么干预」这套规则,就是 Skill 的内容

H3 这套范式真正改变了什么

讲到这一步,你应该能感觉到这件事的分量了——它不是给 AI 视频「加一个新功能」,它是把整条视频生产流水线从手工作坊推到了工业化阶段

过去你做一支片子,本质上是「手动操作几十次工具调用,自己当那个调度器」。现在则是,你把调度器这一层交给 Agent,把流程标准这一层固化为 Skill,自己只需要负责创意输入和最终审片。

而且,Skill 是可以沉淀、共享、复用的。这意味着什么?意味着:

  • 你今天调好的「卡通 vlog 风格」Skill,明天可以直接拿来跑下一支视频。
  • 别人调好的「电影解说」「商业广告」「漫剧短片」Skill,可以一键拿来用。
  • 你的审美和创作经验,第一次可以作为「可复利的资产」沉淀下来,而不是每次都从零开始。

辛梓煜@词元二号站这边在内测中跑了不下二十条短片,真正让我觉得「AI 视频范式变了」的不是某个模型有多强,而是 Skill 这个机制把"我自己的工作方法"从脑子里搬到了文件里

H1 为什么是现在?

可能你会问:Agent 和 Skill 这些概念早就有了,为什么直到 2026 年初这套范式才真正可用?

原因有三个,我个人观察下来:

  1. 视频模型本身够好用了:像 Seedance 2.0 这种支持多模态输入、多镜头叙事、音画同步的模型,把单点能力推到了「能用」的阈值之上。
  2. Skill 标准化了:Anthropic 在 Claude Code 里推出了一种叫 Skills 的扩展机制,本质上是写给 Agent 的说明书。主流 Agent 平台(Claude Code、OpenClaw、Cursor 等)都迅速接入,Skill 的规范统一了,跨平台复用第一次成为可能。
  3. 平台层做了集成:像 Flowith 这样的平台开始把「Agent + Skill + 主流视频模型」打包成一个工作台,新模型一发布就接进来,不用切换、不用排队。从「一堆工具的集合」变成了「一个能干活的工作台」。

三件事赶到一起,这个范式才真正成立。


三、Seedance 2.0 的能力底座到底强在哪

光有工作流不够,底层视频模型的天花板决定了你的成品天花板。这一节我把 Seedance 2.0 的能力底座盘一遍,重点不是吹模型,而是让你知道它到底能做到什么、做不到什么

H1 它能接受的输入,比上一代多得多

Seedance 2.0 是字节跳动推出的多模态 AI 视频生成模型,支持文本、图像、视频、音频四种模态输入。这意味着你不再被「写一段描述,等模型抽卡」这一种交互方式锁死,而是可以:

  • 图像输入:给一张参考图,锁定主角形象。
  • 视频输入:给一段参考视频,复刻里面的运镜风格。
  • 音频输入:给一段音乐节拍,让画面卡点。
  • 文本输入:给一段剧本或描述,提供叙事骨架。

实测最多可接入 12 个参考文件(图片不超过 9 张、视频不超过 3 段、音频不超过 3 段)。这个量级意味着,你已经可以把一支专业短片需要的「素材库」喂给模型,然后让它自己组合

H2 它的"杀手锏":多镜头叙事一致性

讲一个我特别在意的点。过去一年,AI 视频圈最大的痛点不是画质,而是「角色脸跑」。一段 10 秒钟的视频,你的主角可能从第一个镜头到第三个镜头就换了一张脸,从第三个镜头到第五个镜头连衣服都换了。这对叙事是毁灭性的。

Seedance 2.0 的做法是引入了「角色-环境感知编码」技术,把角色的面部特征、服装纹理、微表情,以及场景的风格、光影、色调固化下来。你给它一张主角全身照,后面几个镜头的角色都能保持稳定,甚至跨视频系列也能保持一致性。

实测下来,多角色场景下,Seedance 2.0 能同时维持 5 个以上不同角色的形象不漂移。这是过去同类模型几乎做不到的。

H3 自主运镜:你不用再背"推、拉、摇、移"

以前用 AI 生成视频,你得非常精确地告诉模型「镜头从左向右平移」「先给一个全景再推到特写」。稍微复杂一点的运镜描述,模型就开始犯迷糊。

Seedance 2.0 内置了智能运镜引擎,可以根据你描述的情节自动规划分镜和运镜。你只需要告诉它故事是什么,它自己决定怎么拍。

举个例子,你说:「一只小猫在窗台上看着雨,慢慢转头看向镜头,然后跳下窗台跑向门口。」过去你得指定:

[0-2 秒]  广角,猫坐在窗台,雨声 BGM
[2-4 秒]  推近镜头,聚焦猫的侧脸
[4-5 秒]  特写,猫的眼睛
[5-7 秒]  转头,镜头跟随
[7-9 秒]  中景,猫跳下窗台
[9-12 秒] 跟拍,猫跑向门口

现在你只需要把那一句中文描述丢给它,它自己会拆出这套分镜逻辑,并且按合理的节奏组合起来。

H1 音画同出:不再是"生成完再配音"

Seedance 2.0 采用双分支扩散变换器架构,可以在生成视频画面的同时,生成匹配的音效和配乐。这听起来像是个小改动,但对实际创作意义巨大:

  • 口型同步:角色说话的时候,嘴型是对的。
  • 环境音匹配:雨声、撞击声、脚步声,能精准卡到画面上。
  • 情绪适配:画面节奏快的时候,BGM 也会同步加快。

过去你做一支有人物对话的短片,得在视频生成之后,再花一两个小时单独配音、对口型、调音效,经常对不上还得返工。现在这一步并到了视频生成里,成片可用率从过去的不到 20% 直接跑到了 90% 以上

H2 物理规律的极致模拟

很多人忽视了这一点。物理合理性是 AI 视频最容易翻车的地方:水泼出来不对、东西碎得不对、人物动作的力度不对。

Seedance 2.0 在物理模拟上做了大量训练,无论是流体泼溅、碰撞破碎,还是格斗场景里复杂的动作衔接,画面不再有早期 AI 视频那种"果冻感"。这对做特效片、动作戏、产品广告的创作者来说,是一个质变。

H3 能力盘点总表

我把 Seedance 2.0 相对上一代的能力跃迁整理成下面这张表,方便你一眼看完:

能力维度

上一代

Seedance 2.0

输入模态

主要靠文本 + 图像

文本/图像/视频/音频四模态

参考素材容量

一般 1-3 个

最多 12 个

视频时长

5-8 秒

最长 15 秒

角色一致性

1 个角色经常崩

同时稳住 5+ 角色

运镜规划

需要手动指定

自动规划分镜

音画同步

需要后期配音

同步生成口型 + 音效

物理合理性

"果冻感"明显

流体/碰撞接近实拍

成片可用率

<20%

>90%

需要强调一句:这些数字是行业平均测试结果,不同题材表现会有差距。但即便打个对折,这一代模型相对上一代的提升也是结构性的,不是单点的小修小补。

H1 它不能做什么:也要说清楚

吹完优点,辛梓煜@词元二号站这边也要把劣势说出来,这样你才不会上手后被「实际效果」反复打脸。

  • 超过 15 秒的连贯叙事还是难题:模型本身的时长上限就在 15 秒左右,要做更长的片子,得靠分段生成 + 剪辑拼接。
  • 复杂手部动作仍然会崩:特别是手指数量、握持姿势,在多镜头切换中容易出问题。
  • 特定中文文字渲染仍不稳定:画面里要出现长串中文字,模型很容易拼错或者糊掉。
  • 超写实人物特写存在恐怖谷效应:近距离的真人脸部特写,有时候会有微表情错位的违和感。

知道这些边界,才能合理地把它用在它擅长的地方。


四、一句话出片工作流的完整拆解

讲完原理和模型底座,这一章是全文最核心的部分——「一张图 + 一句话」到底是怎么变成一支完整短片的。我把这条工作流拆成八个阶段,逐个讲清楚。

H1 阶段一:输入素材定基调

工作流的起点非常简单:一张参考图 + 一句话需求

  • 参考图可以是主角的人物形象、一张表情包、一个场景照片,甚至是一张草图。它的作用是给 Agent 一个「视觉锚点」,让后面的所有分镜围绕这个锚点展开。
  • 一句话需求是你的核心诉求。比如「做一支贯穿小猫一天的 vlog」「做一支咖啡店主理人的开店日常」「做一支古风武侠的对决片段」。

辛梓煜@词元二号站这边的实测经验是:一句话的描述,反而比一大段提示词效果更好。一段太长的提示词,模型容易在内部权重上打架,最后什么都没抓住。简短、明确、有画面感的一句话,反而能让 Agent 抓到核心意图。

H2 阶段二:选模式——故事驱动 vs 剧本驱动

输入完素材,Agent 会问你一个关键问题:「你这次是故事驱动还是剧本驱动?」

这两个模式的差别很大,选错了后面整套流程就跑偏了。

故事驱动型(Story-Driven):
- 适合 vlog、生活短片、品牌情绪片、概念短片
- 没有具体台词和分镜,只有一个大方向
- Agent 自由发挥剧情,擅长情绪铺陈和氛围塑造
- 适合「我想做一支感觉怎样怎样的片子」

剧本驱动型(Script-Driven):
- 适合短剧、漫剧、电影解说、产品演示
- 有明确的台词、分镜、人物动作
- Agent 严格按剧本走,擅长还原既定结构
- 适合「我有一份完整剧本,你帮我拍出来」

这两个模式背后,对应的是两种完全不同的 Skill 工作流。故事驱动的 Skill 会先让 Agent 推演一份故事大纲,然后再拆分镜;剧本驱动的 Skill 会直接拿你的剧本作为输入,跳过推演阶段。

对于做 AI 漫剧、AI 短剧的专业作者来说,剧本驱动模式简直就是命脉——把小说原文丢进去,选剧本驱动,Agent 直接帮你跑出整条片子。

H3 阶段三:Agent 自动编排工作流

选完模式之后,Skill 会自动接管,把后面的工作全部安排好。这个阶段你能看到的,大概是这样一份编排清单:

[Stage 1] 故事架构与时间轴设计
[Stage 2] 主角角色设计(三视图)
[Stage 3] 分镜脚本(精细到秒)
[Stage 4] 关键帧 storyboard 生成
[Stage 5] 分镜视频生成(调用 Seedance 2.0)
[Stage 6] 配乐与音效匹配
[Stage 7] 字幕与文案生成
[Stage 8] 时间线拼接与剪辑

每一个阶段背后,都是 Agent 内部的工具调用。比如 Stage 2 调用的是图像生成模型,Stage 5 调用的是 Seedance 2.0,Stage 7 调用的是文本生成模型。整条链路对你来说是透明的——你看着 Agent 在跑,但你不需要自己去操作任何一个底层工具

这一步特别爽的地方在于:Skill 会把所有用到的提示词和镜头逻辑都分解出来,你能看到「Agent 是怎么想的」。我个人觉得 Agent 拆分的逻辑大多数时候已经很专业了,但如果你觉得哪里不合理,可以直接介入。

H1 阶段四:故事板与分镜的人机协作

这是这套工作流最反直觉的一点——Agent 在跑,你可以同时改

具体来说,Agent 把分镜脚本和故事板生成出来之后,会以编辑区的形式呈现在屏幕左侧。你可以:

  • 直接删除某个分镜:觉得这一段多余,点删除。
  • 调换分镜顺序:觉得节奏不对,拖拽顺序。
  • 修改分镜内容:点开某个分镜,直接改它的提示词、景别、运镜。
  • 以聊天的方式给反馈:「这一段我希望镜头再低一点,情绪再冷一点」——Agent 听得懂。

最让我惊喜的设计是:这套人机协作支持随时暂停

你以前用 AI 视频工具,点了生成就只能等。Seedance 2.0 加 Agent 工作流不一样,你随时可以点暂停,改主意,然后继续。它不再是"发送即撤不回"的单向流程,而是真正的双向协作

辛梓煜@词元二号站这边做了一组对比:

维度

传统 AI 视频

Agent 协作工作流

修改时机

跑完才能改

随时打断

改动单位

重新跑一遍

单个分镜

上下文保留

重置

完整保留

试错成本

H2 阶段五:逐分镜确认 + 关键帧生成

进入到具体执行阶段,Agent 会一个分镜一个分镜地走,每一步都需要你点确认才会开始下一步。

这个设计的意义在于:让你随时可以介入,而不是跑了一半才发现方向错了。每生成一个分镜的关键帧,你可以在屏幕上看到这一帧的画面,如果觉得不对,可以:

  • 在评论区告诉 Agent 哪里不合适。
  • 点击手动编辑,改提示词。
  • 让 Agent 重新生成几个版本,你挑一个。

我自己跑下来的体感是,每个分镜大概需要 1-2 次微调就能定稿,整体试错成本比传统流程低一个数量级。

H3 阶段六:Seedance 2.0 调用 + 视频片段生成

关键帧定稿之后,Agent 调用 Seedance 2.0,把每个分镜的关键帧转成视频片段。这一步是整条流程里最耗时的一环——一段 15 秒的视频片段,大概要跑 3-5 分钟。

但是有两个细节让这件事变得能忍:

  1. 不需要排队——主流平台对这个模型做了集成,点完就开始跑,不用像传统平台那样在队列里等半小时。
  2. 可以并行跑——多个分镜同时生成,整体时长比串行跑快得多。

跑完之后,所有分镜片段会自动汇总到一个时间线上。

H1 阶段七:剪辑轨道集成

讲到这里,可能有人要问:那剪辑呢?难道还要导出之后再去剪辑软件里拼?

不用。这套工作流最让我惊讶的是,Agent 平台内置了剪辑轨道。生成完所有分镜之后,你可以直接看到 AI 给你剪好的整条时间线。如果需要微调:

  • 点击某一段素材,可以打开手动编辑面板。
  • 调整片段的顺序、时长、转场。
  • 替换某一段素材的内容(重新生成或上传)。
  • 以评论的方式告诉 AI:「这里换一种呈现方式」。

剪辑这一步过去是 AI 视频工作流的「最后一公里」,大家做完素材都得导出到 PR、剪映或者 CapCut 里去手动拼。剪辑轨道内置之后,这一公里也被吃进了工作流里

H2 阶段八:封装成 Skill,下次一句话再出片

最后一步,也是最具复利价值的一步——把这次跑通的工作流,保存成一个 Skill

这一步的本质是:把你这次的审美决策、修改习惯、风格偏好,全部沉淀到 Skill 文件里。下次你做类似的片子,直接调用这个 Skill,AI 会按照你上次的偏好来做事,不需要你从头讲一遍。

这套机制的威力是这样的——你今天做一支「卡通宠物 vlog」,明天可以直接说「按昨天的 Skill,做一支金毛的 vlog」。AI 会自动复用所有的运镜偏好、色调倾向、节奏控制,你只需要换一张参考图和一句话核心需求

H3 整条工作流的可视化

把这八个阶段串起来,整条工作流大致是这个样子:

flowchart LR
    A[一张图 + 一句话] --> B[选模式]
    B --> C[Agent 编排]
    C --> D[人机协作分镜]
    D --> E[逐镜确认 + 关键帧]
    E --> F[Seedance 2.0 跑视频]
    F --> G[内置剪辑轨道]
    G --> H[导出成片]
    H -.沉淀.-> I[保存为 Skill]
    I -.下次直接复用.-> A

这条工作流的特点是:有起点、有出口、有反馈环。你不是在跑一次性的脚本,你是在搭建一条可以反复跑、越跑越懂你的生产线。


五、保姆级实操步骤拆解

把原理讲完,这一章我把从打开平台到导出成片的具体操作,拆成可照做的步骤。读完这一章,你可以拿一张参考图,跟着做一遍。

H1 步骤 1:打开平台,进入 Agent 模式

进入支持这套工作流的 AI 创作平台之后,第一件事是切到 Agent 模式。这个模式和传统的「对话模式」「图片生成模式」「视频生成模式」是并列的,选择 Agent 模式之后,你输入的所有内容都会被理解为一个可被拆解的任务,而不是一条单点指令。

H2 步骤 2:上传参考图 + 输入一句话

把你的参考图(主角、场景、风格图都行)拖进对话框,然后输入你的一句话需求。比如:

我想做一支贯穿小猫一天的 vlog。

这里有几个实操要点,新手特别容易踩坑:

  • 图片不要太复杂:背景越简单越好,主角越突出越好。一张干净的主角全身照,效果最好。
  • 一句话要有画面感:不要写「我想做一支感人的视频」,要写「我想做一支小猫雨天找妈妈的故事」。
  • 不要堆形容词:不要堆「电影级、史诗感、好莱坞质感」这种修饰词,Agent 自己会处理风格。
  • 指定时长是个好习惯:可以加上「时长 30 秒」「分 8 个镜头」这种结构化信息。

H3 步骤 3:选择故事驱动还是剧本驱动

发送之后,Agent 会问你选哪种模式。新手默认建议选故事驱动——它会自动帮你推演剧情、分镜,你不需要自己写剧本。

只有你已经有一份完整文本(小说节选、剧本、广告分镜表)的时候,才选剧本驱动。

H1 步骤 4:观察 Agent 拆分的任务清单

模式选好之后,Agent 会立刻给你一份它打算执行的任务清单。这一步非常关键——这是你纠偏的最后机会。

清单大致长这样:

我打算这样做:
1. 主角设计:基于你的参考图,生成小猫的三视图
2. 故事架构:小猫一天 24 小时,分 6 个时间段
3. 分镜脚本:每段 5 秒,合计 30 秒,具体到秒
4. 关键帧生成:6 张 storyboard
5. 视频生成:Seedance 2.0,15s 模式,音画同步
6. 配乐:轻松温暖的钢琴 BGM
7. 字幕:中文,底部白色描边
8. 剪辑:按时间顺序拼接,加快节奏转场

确认要这么做吗?有需要调整的告诉我。

这个时候你的任务是:通读一遍,看哪里不对就立刻指出来。比如「BGM 不要钢琴,要轻快的电子」「字幕用日系细体,不要描边」。改在这一步,后面就不用返工

H2 步骤 5:观察故事板生成 + 实时介入

确认任务之后,Agent 开始干活。你会看到屏幕左侧出现一个故事板编辑区,每个分镜以卡片的形式排列。

[Shot 1] 0:00-0:05  清晨,猫被阳光叫醒,伸懒腰
[Shot 2] 0:05-0:10  早餐时间,猫吃罐头,镜头跟随
[Shot 3] 0:10-0:15  午前,猫在窗台看鸟,慢推近
[Shot 4] 0:15-0:20  午后,猫睡觉,光影变化
[Shot 5] 0:20-0:25  傍晚,猫等主人回家,镜头在门口
[Shot 6] 0:25-0:30  夜晚,猫蜷在沙发上,镜头拉远

辛梓煜@词元二号站这边的实操建议:这一步至少花 5 分钟仔细看一遍。这是整条工作流里你「智力投入」最值钱的环节——你的审美在这里影响最终成片。

发现哪里不对,处理方式有四种:

  1. 删除分镜:直接点 X。
  2. 调换顺序:拖拽。
  3. 修改内容:点开分镜卡片,改提示词。
  4. 聊天反馈:在对话框里说「Shot 4 我想要更梦幻一点的感觉」。

H3 步骤 6:三视图生成 + 角色一致性锁定

分镜确认之后,Agent 会先生成主角的三视图(正面、侧面、背面)。这一步是为了给后面所有分镜提供角色一致性的参考

三视图生成完,你会看到三张图。这三张图至关重要——它定义了主角在所有后续分镜里的形象。如果三视图不对(比如颜色不对、毛发质感不对),一定要在这一步改掉,不要带着错误的三视图往下跑。

修改方式:在对话框里告诉 Agent「猫的毛色再深一点」「眼睛改成琥珀色」,它会重新生成。

H1 步骤 7:关键帧 storyboard 生成

三视图锁定之后,Agent 开始生成每个分镜的关键帧(也就是 storyboard 大场景图)。这一步会按照分镜数量生成 6-10 张图,每张对应一个镜头的「画面感」。

实操建议:

  • 逐张确认:每张图都点开看一遍。
  • 遇到「不对」立刻改:不要等所有图都生成完才改,Agent 会按你的反馈实时迭代。
  • 重点关注一致性:主角在所有图里的形象、服装、场景的色调是否统一。

H2 步骤 8:Seedance 2.0 调用,跑视频片段

关键帧定稿之后,Agent 调用 Seedance 2.0,把每个关键帧扩展成对应的视频片段。

这一步对你来说,基本就是**「点确认 → 等几分钟 → 看结果」**。但有一个动作不要忘记——在视频跑完之后,逐段播放确认一遍。如果某段视频效果不理想:

  • 可以重新跑:点重新生成,Agent 会用同一个关键帧再跑一次,出来的会是不同的版本。
  • 可以微调:在对话框里说「Shot 3 这段镜头推进太快了,慢一点」。
  • 可以替换关键帧:让 Agent 用别的关键帧重新跑。

H3 步骤 9:剪辑轨道微调

所有视频片段跑完之后,Agent 会把它们汇总到一个剪辑轨道里。这个轨道是真实可编辑的,不是只能看不能动的预览。

在剪辑轨道上你可以做的事:

- 调整每段的入出点(剪掉前后多余的部分)
🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数106 篇
昨日发布4 篇
本月发布14 篇
建站时间38 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码