本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
如果你只想要一个结论:AI 视频创作现在的分水岭,已经不是"哪个模型画得好看",而是"谁能把一整套拍法封装成可以反复调用的流程"。本文以 LiblibAI 旗下的 AI 视频创作产品 LibTV(www.liblib.tv)为例,把这条流程从头到尾拆一遍。所谓 Skill,本质上就是一份写给 AI 的拍摄方法说明书——它把风格定义、素材清单、分镜规范、输出标准全部固化下来,你选中它,Agent 就按这套规矩往下跑,从故事大纲、角色三视图、场景图、分镜表,一直做到多段视频、背景音乐、字幕和最终合成。它真正解决的不是"一键生成"这四个字,而是把过去分散在十几个工具、几十轮抽卡里的重复劳动,收进了同一块画布。全自动模式适合快速出片,手动模式适合把自己的想法塞进每一个环节,而当现成 Skill 满足不了你的风格时,你可以自己建一个——填名称、写简介、说清任务、执行方式和输出内容,五分钟就能拥有一位听你话的专属 AI 导演。
这篇文章我会把整条链路拆开讲透:概念是什么、Agent 在画布里到底做了哪几步、全自动和手动分别怎么操作、Skill 广场怎么挑、专属 Skill 怎么从零搭出来、锚点和分镜为什么是长视频不崩的关键,以及我自己折腾下来踩过的那些坑。
想看完整拆解,往下翻。
一、15 秒这道坎,到底卡住了什么
玩过 AI 视频的人,大概都对"15 秒"这个数字有心理阴影。
不是模型不行。单段画面的质感这两年进步得非常凶,随便挑个主流模型,出一段光影漂亮、运镜利落的片段并不难。难的是第 16 秒。你要让第二段的人脸和第一段是同一张脸,衣服是同一件衣服,房间的灯光色温不能突然从冷白跳到暖黄,镜头的情绪还得接得上。这些事,模型本身不负责。
于是过去的做法是这样的:先在一个工具里写剧本,再换一个工具生成人物参考图,还要单独做场景参考图,然后回到视频工具里一个节点一个节点地连线,把参考图喂进去,逐段生成,逐段抽卡。抽到满意的,下载下来,导进剪辑软件,配字幕、配音乐、切节奏。中间任何一步不满意,就得往回倒。
我自己最狼狈的一次,是同时开了六七个标签页,脚本还没写完,浏览器先卡了。那种感觉不是"创作受阻",是"行政工作太多"——真正属于创意的部分可能只占两成,剩下八成全是搬运、连线、复制粘贴、等待。
1.1 问题的根不在模型,在流程
把这件事拆细一点会更清楚。做一支有剧情、有镜头、有节奏的完整短片,中间至少要经过这么几层:
- 创意层:主题、故事大纲、情绪基调、视觉风格;
- 资产层:角色形象、服装造型、场景影调、道具、背景音乐;
- 结构层:分镜表、每一镜的时长、景别、机位、台词;
- 生成层:逐段出画面,逐段校验一致性;
- 后期层:剪辑、转场、字幕、混音、合成。
传统工具的分工是:模型只管"生成层"那一格。剩下四层,全是人肉在跑。而人肉跑这四层最大的成本,不是脑力,是上下文的反复搬运——你在 A 工具里定好的风格,到了 B 工具要重新用提示词描述一遍;你在 C 工具里选定的人脸,到了 D 工具要重新上传一遍。
信息每搬一次家,就漂一次。漂到最后,成片就散了。
1.2 Agent 进画布,改的是什么
真正的变化,是 Agent 被塞进了画布本身。
以前的画布是给人用的:你自己创建节点,自己连线,自己填提示词。现在画布右侧直接挂一个对话框,你用大白话说需求,节点的创建、连线、参数填写、资产调用、最终合成,全部由 Agent 在同一块画布上接着做。你从"操作员"变成了"发号施令的人"。
我第一次遇到这种交互的时候,其实是懵的。习惯性地想去画布上找"新建节点"的按钮,找了半天没找着,反应过来:不用找了,直接说就行。说完之后眼睁睁看着画布上自己长出一堆节点、自己连上线、自己开始跑——那种感觉挺难形容的,像是从"自己搬砖"变成了"站在旁边看施工队干活",而你要做的只是在关键的地方指一句"这堵墙往左挪半米"。
这个转变听起来像是省了几次点击,其实省掉的是整个上下文搬运的过程。所有资产都躺在同一张画布上,Agent 随时能引用,风格自然就不容易漂。这也是我认为这一波更新里最有价值的一点——它不是给你多加了一个功能按钮,是把工作台整个换了。
二、先把黑话翻译成人话:画布、节点、Agent、Skill
新手最容易在这几个词上卡住,我用最白的话过一遍。
在开始之前,先把主角交代清楚,免得后面读着犯迷糊:本文实操用的工具叫 LibTV,是 LiblibAI(哩布哩布) 在 2026 年 3 月推出的 AI 视频创作产品,官网 www.liblib.tv。LiblibAI 这个名字,玩过 AI 绘画的人应该都不陌生,它早年是国内做得比较大的模型社区,后来把能力延伸到了视频这一侧。LibTV 就是这条线上的产物——一块无限画布,加一个能干活的 Agent,再加一套 Skill 体系。
下面所有的概念和操作,都以 LibTV 为例。但要说明的是,这套"画布+Agent+Skill"的思路并不是它独有的,同类产品也在往这个方向走。所以你真正要理解的是这套方法论本身,工具只是载体——看懂了逻辑,换个平台你照样能上手。
2.1 画布(Canvas)
画布就是一张无限大的白纸,你所有的素材和生成结果都摆在上面。 它跟传统剪辑软件的时间轴不一样,时间轴是一条线,画布是一个平面——你可以把人物图放左上角,场景图放右上角,分镜表贴中间,视频片段排下面,彼此之间用线连起来表示"谁引用了谁"。
用过节点式创作工具的人会秒懂;没用过也不用怕,因为现在你可以完全不碰它,让 Agent 去画。
2.2 节点(Node)
节点就是画布上的一个个小方块,每一个方块代表一份素材或者一次生成动作。 常见的节点类型有文本、图片、视频、音频、脚本几种。一个"图生视频"的节点,往上连着一张参考图,往下吐出一段视频,逻辑关系一眼可见。
节点最大的好处是可追溯。哪一镜出了问题,你不用把整条片子重跑,找到对应的节点,单独重生成就行。
2.3 Agent(智能体)
Agent 就是画布右边那个会干活的对话框。 它跟普通聊天机器人的区别在于:普通机器人只会说,Agent 会动手。你说"帮我做一支复古风格的青春短片",它不会给你回一段文案,它会真的去创建节点、生成图、调模型、合成视频。
更关键的是它会反问。任务信息不全的时候,它不会硬着头皮瞎猜,而是停下来问你:多长?什么画幅?哪种语言的字幕?要不要旁白?我第一次用的时候还挺不适应,因为习惯了 AI 工具"你给什么它做什么",突然被反问,反倒觉得踏实——它是真的在对齐需求,而不是在赌概率。
2.4 Skill(技能)
这是整篇文章的核心。
Skill 就是一份写给 Agent 看的"拍法说明书"。 它里面写清楚了:这种风格的片子长什么样、需要准备哪些素材、分镜按什么节奏排、画面用什么影调、最后交付什么格式。你选中一个 Skill,等于给这次创作请了一位有明确方法论的导演。
打个比方可能更好懂:模型是摄影机,Agent 是能听懂人话的执行团队,而 Skill 是导演手里的那本分镜脚本加拍摄规范。同样一台摄影机,交给不同的导演,出来的东西天差地别——差的就是这本规范。
|
概念 |
白话解释 |
类比 |
你需要动手吗 |
|
画布 |
摆放所有素材和结果的无限白纸 |
剧组的置景棚 |
可以不碰 |
|
节点 |
画布上的单个素材或生成动作 |
一个镜头的原始素材 |
需要精修时才碰 |
|
Agent |
会真的动手干活的对话框 |
执行导演+剪辑师 |
只需要说话 |
|
Skill |
封装好的一整套拍法与规范 |
导演的分镜脚本+风格手册 |
选一个,或自己写 |
|
模型 |
底层负责出画面的引擎 |
摄影机 |
一般由 Agent 自动选 |
辛梓煜@词元2号站 在这里多提醒一句:很多人一上来就纠结"该用哪个模型",其实在这套体系下,模型的选择权大部分时候可以交给 Agent。你真正要花心思的是 Skill 的挑选和定制,那才是决定成片调性的地方。
三、Skill 的运行逻辑:一套被封装起来的方法论
搞清楚 Skill 里到底装了什么,你才知道为什么它能扛住长片。
3.1 一个 Skill 的详情页里有什么
正经的 Skill,详情页会把这几件事写明白:
- 风格介绍:这套拍法追求什么样的视觉与叙事气质;
- 适用时长:它擅长的片长区间,有的擅长 15 秒短平快,有的能撑到几十秒的剧情段落;
- 使用场景:适合拍什么题材,不适合拍什么;
- 需要的素材:要不要你提供产品图、人脸参考、音乐;
- 输出内容:最后交付人物三视图、场景图、分镜提示词、BGM、完整成片中的哪几样。
有的 Skill 还带一个"创作详情"入口,点进去能看到官方样片背后的完整画布——角色图、场景图、分段视频、BGM、字幕、合成节点全都摊开给你看。这个功能我强烈建议每次调用前都点一下,因为它等于让你在下单前先看清楚这位导演的工作方式。
3.2 Agent 拿到 Skill 之后,实际跑了哪几步
不管是哪种题材,跑起来的骨架基本是一致的:
用户意图(一句话 / 一段大纲 / 一张参考图)
↓
Agent 反问补全(时长 / 模式 / 画幅 / 语言 / 核心元素 / 大纲来源)
↓
风格基调锚定(moodboard,定死整片的色彩与影调)
↓
资产层生成(角色三视图 → 服装造型 → 场景影调图 → 道具)
↓
结构层落盘(锚点清单 + 分镜表,写成文件存进画布)
↓
分段视频生成(按分镜表逐镜或并行出画)
↓
音频层(BGM / 旁白 / 对白)
↓
合成节点(拼接 + 转场 + 字幕 → 成片)
用流程图看会更直观:
graph TD
A[一句话需求] --> B{信息够吗}
B -- 不够 --> C[Agent 反问补全]
C --> D[生成风格基调图]
B -- 够 --> D
D --> E[角色三视图 / 场景影调图]
E --> F[锚点清单]
E --> G[分镜表]
F --> H[分段视频生成]
G --> H
H --> I{效果满意吗}
I -- 否 --> J[定点返修单个节点]
J --> H
I -- 是 --> K[BGM + 字幕]
K --> L[合成节点输出成片]
注意 F 和 G 那两个框——锚点清单和分镜表。这是整套机制里最容易被忽略、但恰恰最要命的两样东西,我在第八节会专门展开讲。
3.3 为什么 Skill 不是"一段更长的提示词"
这一点我特意想澄清一下,因为很多人第一反应是:"这不就是把提示词写长一点存起来吗?"
不是。差别在三个地方:
第一,Skill 是带流程的。提示词是一次性的输入,Skill 是一条有先后顺序、有分支判断的执行路径——先定基调,再出资产,资产确认后才动视频,顺序错了效果就散。
第二,Skill 是带交互点的。它规定了哪些环节必须停下来等你确认。角色造型给你四套让你选,场景影调给你四张让你挑,这些"停顿"是写在方法论里的,不是随机的。
第三,Skill 是长在具体框架里的。它要由 Agent 来理解意图、选择模型、调度工具。同样一份 Skill 文本复制到另一套系统里,离开了原来的模型组合和调度方式,也很难复现出一样的结果。所以它更像一套"方法+环境"的组合,而不是一段可以随便搬走的文本。
3.4 顺便说说:为什么视频 Agent 这么难做
聊到这儿,可以回答一个很多人心里的疑问:文字类的 Agent 早就遍地都是了,为什么视频 Agent 拖到现在才有像样的东西?
我的理解是,卡点在于"交付"这两个字的门槛太高。
写文章的 Agent,输出一段文字,好不好你一眼就能判断,不满意重写的成本几乎为零。视频不一样。一支片子要算"能交付",至少得同时满足两个条件:
一是结构完整。 它得是一支可以直接放到内容平台上被消费的作品——该有的片头片尾、字幕、音乐都在,音画同步,不需要再进任何后期软件就能发出去。缺一样,它就只是"素材",不是"作品"。
二是过程可控。 观众不会因为你是 AI 做的就降低标准。人脸漂了、影调跳了、节奏散了,一样出戏。而这些问题,恰恰是链路越长越容易出。
这两个条件叠在一起,意味着视频 Agent 不能只做"生成"这一格,它必须把创意、资产、结构、生成、后期五层全部串起来,还得在每一层都不掉链子。链路上任何一个环节偷懒,最后交付的都不是成片。
想明白这一点,你就理解了为什么锚点、分镜表、合成节点这些看起来很"工程"的东西会被摆在这么重要的位置——它们不是花架子,是把一条长链路撑住的骨头。
3.5 三种角色,谁负责什么
我用一张表把整套体系里的分工再捋一遍,看懂这张表,后面的所有操作都会变得很自然:
|
层级 |
谁负责 |
具体做什么 |
出问题的表现 |
|
意图层 |
你 |
提供故事、判断方向、拍板选择 |
片子平庸、没有个人特点 |
|
方法层 |
Skill |
规定风格、流程、交付标准 |
风格不统一、节奏乱 |
|
调度层 |
Agent |
理解意图、选模型、建节点、跑流程 |
步骤跳步、一致性崩 |
|
执行层 |
模型 |
出画面、出声音 |
画质差、物理不合理 |
看这张表最大的价值在于:当片子不好看的时候,你能定位到是哪一层的问题。 是故事本身没意思(意图层),还是方法不对(方法层),还是执行有瑕疵(执行层)?新手最常见的误判,是把意图层的问题甩锅给执行层——故事本身乏味,怪模型画得不够炫,那再换十个模型也救不回来。
四、实操一:全自动模式,从零跑通一条短片
理论讲完,上手。我先用最省事的路径演示一遍,全程不碰画布。
4.1 入口在哪
新建一个空白画布,右侧就是 Agent 对话框。对话框下方有 Skill 入口,点开是官方已经准备好的 Skill 列表,点右上角的"全部",进入完整的 Skill 广场。
这里有个细节值得说:Skill 的部署非常轻,看中哪个,点一下"使用"或者"添加 Skill"就挂上了,不需要任何配置。
4.2 逐项拆解 Agent 的提问
选好 Skill、说一句话之后,Agent 不会立刻开跑,而是先把不确定的信息问一遍。我把这些选项逐个拆开,因为每一项都直接影响成片:
第一步:视频时长。 一般给你 15 秒以内、30 到 60 秒、自定义三档。新手第一次跑,我建议直接选最短那档。不是因为长的做不出来,而是短的能让你在最短时间内看完一整条链路,知道这套流程长什么样。
第二步:执行模式。 全自动模式是 Agent 一路往后推,不需要你每步确认;手动模式则会在关键节点停下来等你拍板。这一步是整个流程里最重要的选择,我第五节专门讲手动模式。
第三步:画幅。 这个选项对成片气质的影响,比很多人以为的大得多:
|
画幅 |
视觉感受 |
适合的题材 |
|
4:3 |
方正、复古、有胶片年代感 |
怀旧短片、复古美学、老电影质感 |
|
16:9 |
最通用,横屏观感标准 |
绝大多数常规内容、广告、MV |
|
宽银幕(如 2.35:1) |
上下留黑边,电影感最强 |
剧情片段、专业影视风格 |
|
9:16 |
竖屏 |
移动端优先的内容 |
我的做法是:拿不准就选 16:9,它的容错率最高。想要"高级感"三个字,宽银幕几乎是最省力的捷径——同样的画面,加上那两条黑边,气质立刻不一样。
第四步:对白与字幕语言。 中文内容我一般直接选简体中文。这里要留意的是,字幕语言和对白语言可以是两回事,做商业内容时双语字幕是个很实用的选项。
第五步:核心场景元素。 Agent 会让你挑几个题材相关的元素。比如做青春题材,透视感的长廊、麦田、教室、走廊这类元素就很对味。这一步别贪多,选两三个就够——元素越多,风格越容易被稀释。
第六步:故事来源。 通常两个选项:自己提供故事大纲,或者让它根据前面的选择自动生成一条完整短片。第一次跑,选自动生成,看看它的理解力;正式做内容时,我基本都会自己给大纲,因为故事是唯一不该外包的东西。
4.3 它自己跑起来之后
点击开始,就可以去干别的了。Agent 的执行顺序大致是:
- 先出一张风格基调图(moodboard),把整条片子的色彩、光线、质感先定死;
- 顺着基调图生成道具图、场景图、人物参考图;
- 把这些资产写进锚点清单和分镜表;
- 按分镜表逐段生成视频;
- 自动生成背景音乐;
- 创建合成节点,把所有片段剪在一起,加上字幕,发布到画布上。
就是刷会儿短视频的功夫,回来一看,画布上已经密密麻麻全是节点和素材了,而这些没有一个是我手动创建的。最后拿到的,是一条远超 15 秒、音画同步、带字幕和 BGM 的完整片子——不需要再进任何后期软件,可以直接发。
这里插一句我自己的判断标准:一条片子算不算"成片",看两件事——结构完不完整(片头、片尾、字幕、音乐齐不齐,音画同不同步),以及能不能直接发布不用返工。 达不到这两条的,都只能算素材。
4.4 全自动模式适合谁
说句实话,全自动模式的成片质量,比我预期高,但它不是万能的。
它适合:验证一个创意值不值得做、快速批量出内容、给客户看方向、自己练手熟悉流程。
它不适合:你心里已经有非常具体的画面。因为全自动意味着你把审美判断权整个交出去了,Agent 的每一次选择都是它认为的最优解,不是你的最优解。想要成片长成你脑子里那个样,得往下看第五节。
五、实操二:手动模式做 TVC,把控制权拿回来
全自动是"我信你",手动是"我盯着你"。这一节我用一支高端质感的 TVC 广告来演示,其他题材的 Skill 操作方式是一样的。
5.1 为什么商业内容必须用手动
道理很简单:自娱自乐的片子,效果好就行;商业内容有明确的诉求——产品的哪个细节必须出现、品牌的调性不能跑偏、节奏卡在第几秒必须给到 logo。这些东西 Agent 猜不出来,只能你说。
所以我的原则是:练手用全自动,交付用手动。
5.2 一步一步来
进入 Skill 之后,它先问产品。 选一个奢华质感的 TVC Skill 进去,第一个问题通常是:要为哪一类产品做广告?我这次做的是跑车。这一步别只写"跑车"两个字,把产品的定位、目标人群、想强调的卖点一句话带上,后面能省掉很多来回。
完成基础选项后,它给场景方案。 我这次拿到了四个不同的场景方案,让我手动选。四个方案的差异不是换个背景那么简单,是整片的叙事空间——城市夜景、盘山公路、极简摄影棚、荒漠公路,选哪个基本决定了这支片子的性格。我挑了第三个。
根据选定的场景,生成分镜方案。 这时候有两条路:直接生成,或者点击"修改分镜"。
修改分镜这里设计得挺聪明——它既给你几套系统提供的修改方案让你直接点,也允许你自己输入想法。我当时觉得第三个镜头太空,就提了一句:这个镜头增加一些产品细节的特写。
改完继续生成,它会接着出后半段的分镜方案。 长片是分段推进的,不是一口气全出。每一段出来,你都可以继续改,也可以直接确认。我觉得整体节奏没问题,就直接放行了。
成片验收。 关键点在于:我选的那个场景,和我后来要求补的产品细节特写,都真的出现在了最终成片里。这句话听着平淡,但它意味着这不是一次"祈祷式生成"——你的每一个决定都被兑现了。
5.3 手动模式的真正价值
我把两种模式的差别整理成一张表,方便你对号入座:
|
维度 |
全自动模式 |
手动模式 |
|
你要做的事 |
回答几个问题,然后等 |
每个关键节点做判断 |
|
耗时 |
短,基本是纯等待 |
长,取决于你改几轮 |
|
成片可控性 |
低,结果是 Agent 的审美 |
高,结果是你的审美 |
|
适用场景 |
试方向、练手、批量铺量 |
商业交付、有明确画面预期 |
|
翻车成本 |
低,不满意重跑一遍 |
低,但你已经花了时间 |
|
我的建议 |
第一条片子用它 |
之后全部用它 |
有意思的是,手动模式并没有让流程变复杂,它只是在原本自动往下跑的路径上,插了几个"停一下"。Agent 该做的脏活还是它做——你只负责在岔路口指个方向。
我自己折腾下来的体会是:能把自己的想法塞进去、控制住创作的方向,才是这套工具最爽的地方。 一键出片当然省事,但省到最后,出来的东西谁都能做,那就没意思了。
5.4 出片之后,继续用嘴改
还有个容易被忽略的环节:成片出来之后的返修。
以前的习惯是把片子下载下来,导进剪辑软件,一帧一帧修。现在这一步也可以留在画布里。画布通常有两套视图,切换着用:
- 故事板视图:负责创意、镜头、整体节奏。文本、图片、视频分区摆好,锚点、分镜、角色参考和最终成片能集中查看,单个资产可以直接重新生成或者用工具编辑。
- 节点式工作流视图:负责精细化调整。要定位是哪一段、哪张图出了问题,回到这里最快。
基础的剪辑能力也塞进来了——分割、字幕、选区、转场这些都有,字体、字号、预设样式可以自定义。我实际用下来,做常规调整已经够了,没必要再切出去。
更省事的是,很多修改根本不需要动手。第一版出来我发现 BGM 和旁白音量打架,直接用大白话说了一句"背景音乐压低一点,让旁白清楚些",Agent 就自己去返工了。结尾定格镜头有点拖沓,也是一句话的事。
这里有个很实用的经验:做长流程视频,最有效的做法不是一开始就把每个镜头抠到完美,而是先让 Agent 按 Skill 把完整结构跑通,拿到一版能看的成片,再针对衔接、动作和节奏做定点返修。 一开始就死抠第一镜,等你抠完,后面的节奏可能全不对。
六、Skill 广场里都有什么,以及怎么挑
Skill 广场是这套体系的弹药库。目前积累的优质 Skill 已经超过一百个,覆盖面相当宽。
6.1 主要分类
官方按创作场景做了分类,大致是这么几个方向:
|
分类 |
覆盖的内容 |
典型用途 |
|
专业影视 |
各类导演的电影美学风格 |
剧情短片、概念片、氛围片 |
|
商业广告 |
高奢感 TVC、喜剧风、动画风 |
产品广告、品牌片、宣传片 |
|
短剧漫剧 |
女频、男频、手办动画 |
竖屏短剧、连载漫剧 |
|
动漫游戏 |
各类动画风格、游戏 PV |
二次元内容、游戏宣发 |
|
音乐 MV |
流行 MV、梦核美学等 |
给一首歌配一支片子 |
|
自媒体创作 |
带货视频、口播、图文转视频 |
日常内容生产 |
我随手翻了翻,从欧洲文艺片导演的构图美学,到皮克斯式的动画质感,再到无厘头喜剧,颗粒度比我想象中细。这也是它敢叫"Skill Hub"的底气——一百多个 Skill,等于一百多位随叫随到的专业导演。
6.2 我挑 Skill 的三条标准
翻得多了,我总结出三个判断维度:
第一,先看输出内容清单,别看样片。 样片是挑最好的放上来的,参考价值有限。真正有用的是"输出内容"那一栏——它到底给你人物三视图、场景图、BGM、分镜提示词、完整成片里的哪几样。输出越完整的 Skill,说明它封装的流程越全,你后期要补的活越少。
第二,看适用时长是否匹配。 这一点我吃过亏。有的 Skill 天生是为短平快设计的,你硬要它撑一分钟的剧情,节奏就垮了。反过来,用一个擅长剧情段落的 Skill 去做十五秒的产品展示,会显得又慢又拖。
第三,点开"创作详情"看它的实际画布。 这是最诚实的一栏。样片背后的角色图、场景图、分段视频、BGM、字幕、合成节点全摊在那儿,你能清清楚楚看到这位"导演"的工作方法是不是你想要的。
6.3 进阶:Skill 还能被"外面"调用
这是一个很多人没注意到、但想象空间很大的点。
这套体系其实是同时面向两类使用者设计的:人可以操作,AI 助手也可以操作,两者还能协作。 除了网页端的画布,LibTV 官方还开源了一套面向 AI 助手的技能包,你在账号里生成一个 API 密钥,把开源地址交给你日常在用的那个 AI 助手,它就能调用这边的生图、生视频能力——创建会话、发送创作指令、查询进度、拿回结果,一整套都能跑。
这意味着什么?意味着视频生产可以被塞进你自己的自动化流程里。
举个通用化的场景:你让日常用的 AI 助手在夜里帮你把某个主题的资料整理好,写成脚本,然后直接调用这边的能力做成视频,第二天早上起来直接看结果。整个过程你连网页都不用打开。
代码层面也不复杂,大致就是这个意思:
# 把技能包装进你的项目
npx skills add <开源技能仓库>
# 之后由你的 AI 助手负责:
# 1. 创建会话
# 2. 发送创作指令(自然语言即可,比如"生成一支动漫短片")
# 3. 轮询查询生成进展
# 4. 批量下载最终结果
需要说明的是,这条路对新手来说没必要着急碰。它的价值在于:当你已经把创作流程跑顺了,它能帮你把这条流程接到别的流程上去。 属于第二阶段的事,先把画布玩明白再说。
6.4 一个容易忽略的细节:模型
调用 Skill 生成视频时,通常会默认走某个主力视频模型。如果你想切换成别的模型,一般需要在对话里明确指定。
这套体系把市面上主流的图像和视频模型基本都集成进来了,而且更新非常快——新模型发布没几天,画布里就能选到。对我们创作者来说,最实际的好处是:不用为了一个模型单独注册一个平台、单独充一次值,也不用在几个网页之间来回倒素材。
不过我的建议是,新手前期别折腾模型。 Skill 里默认的模型组合,是设计这套流程的人反复调过的,大概率比你瞎换效果好。等你对成片有了明确的不满意点,再去针对性地换。
七、实操三:从零创建你的个人专属 Skill
前面两节都是用别人整理好的拍法。这一节讲怎么把你自己的方法装进去——这也是我认为整套体系里最有价值的部分。
7.1 什么时候需要自建
答案很简单:当广场里找不到你想要的那种感觉的时候。
一百多个 Skill 听着多,但创作这件事从来不按套路出牌。你可能想复刻某部电影里那种特定年代的画面美学,可能想做一种只有你自己审美体系里才存在的混搭风格,也可能只是有一套自己用惯了的分镜方法,想让 AI 也照着来。这些需求,现成的 Skill 覆盖不了。
我自己是因为想做一种 Q 版动画风格的短片,翻遍广场没找到完全对味的,就动手建了一个。
7.2 创建流程
操作比我想象中简单,整个过程不需要碰任何代码:
第一步:找到创建入口。 在 Agent 对话窗口点击 Skill,再点右上角的创建按钮,进入自定义 Skill 的创建页。
第二步:填名称和简介。 名称要简单介绍它的能力。这里有个很实际的坑:Skill 名称有长度限制,大约十二个字。 所以别用一长串英文名,直接写中文名,短、准、好认,后面在库里调用和查找也方便。
第三步:填 Skill 的具体内容。 这是核心,也是唯一需要花点心思的地方。你可以准备一份结构化的模板,交给 AI 工具按模板填写,生成之后直接复制到内容栏里。填完还可以点右上角,让 AI 再帮你优化一轮。
第四步:填使用场景。 说清楚这套方法适合拍什么。
第五步:填"如何使用"。 也就是这个 Skill 期望用户提供什么。我一般设置成:让用户输入一个故事大纲。
第六步:填输出内容。 明确交付物。比如我希望它最终生成一条三十秒的 Q 版动画视频,那就写清楚。
第七步:保存。 存好之后它会出现在"我的 Skill"里。回到项目画布,点开 Agent 的 Skill 入口,在"我的"分类下就能找到它,选中,点击生成,就开始调用了。
7.3 Skill 内容该怎么写
这是决定专属 Skill 好不好用的关键。我把自己用顺手的结构贴出来,你可以直接拿去改:
# 技能名称:<十二字以内的中文名>
## 一句话定位
这套方法用来拍什么类型、什么气质的片子。
## 视觉风格
- 色彩:主色调、辅助色、饱和度倾向
- 光线:光比、光位、色温、是否要硬阴影
- 质感:胶片颗粒 / 干净数字感 / 手绘 / 3D 渲染
- 构图:常用景别、机位高度、留白习惯
## 叙事规范
- 结构:开场如何抓人、中段如何推进、结尾如何收
- 节奏:平均每镜时长、快慢切换的节点
- 台词:有无对白、有无旁白、语气风格
## 必需素材
用户必须提供:<故事大纲 / 产品图 / 人脸参考 / 音乐 ...>
用户可选提供:<...>
## 执行步骤
1. 先确认:时长、画幅、字幕语言
2. 生成风格基调图,等待用户确认
3. 生成角色三视图 / 场景影调图,每项给出多个方案供选择
4. 写入锚点清单与分镜表
5. 分段生成视频
6. 生成 BGM 与字幕
7. 合成输出
## 交付物
- 角色设定图
- 场景图
- 分镜表
- 背景音乐
- 最终成片:<时长>、<分辨率>、<画幅>
## 禁止项
明确写出这套风格里绝不能出现的东西。
最后那个"禁止项"是我后来加的,效果出奇地好。告诉 AI 不要什么,往往比告诉它要什么更有效——因为"要什么"它可以有一百种理解,"不要什么"只有一种。
7.4 实测效果
Skill 建好,当然得拉出来遛遛。
我直接调用自己做的这个,选中它,把剧情、比例、时长和风格一次性写清楚,然后让它跑。出来的片子,风格是我想要的那个风格,节奏是我定的那个节奏。
那一刻的感受挺微妙的:以后我再想做这类短片,不需要每次重新写提示词,不需要重新搭一遍流程,直接调用就行。这条已经跑通的工作流被存下来了,变成了一个可以反复调用的东西。
说白了,你拥有的不再是一堆散落的提示词,而是一个属于你自己的方法库。
7.5 顺手的两个进阶玩法
一是把对话过程直接转成 Skill。 有时候你不是先设计好方法再去拍,而是拍着拍着摸出了一套好用的路子。这时候可以把这段对话过程直接沉淀成一个 Skill,下次复用。
二是把 Agent 分析视频的能力用起来。 你在网上刷到一支很有创意的片子,想用 AI 仿着拍,可以让 Agent 去分析这条视频,提炼成一套新的方法。当然,这里要提醒一句:参考风格和照搬他人作品是两回事,学的是手法,不是内容,这条线自己心里得有数。
辛梓煜@词元2号站 这里补一句实践心得:自建 Skill 最好的时机,不是你刚上手的时候,而是你已经用现成 Skill 跑过三五条片子、清楚地知道自己"不满意什么"的时候。带着具体的不满意去写规范,比凭空想象要准得多。
八、锚点与分镜:长视频不崩的真正关键
这一节稍微硬一点,但我认为是全文最有价值的部分。因为前面所有的操作,成败都取决于这两样东西。
8.1 什么是锚点
锚点,就是在整条片子里必须保持一致、不能漂移的那些东西。
具体来说,就是主角的脸和造型、每个场景的影调、关键道具的样子。Agent 在正式生成视频之前,会先把这些东西钉死:给主角出几套造型让你选,选定之后生成三视图(正面、侧面、背面),这张三视图就成了后续所有镜头里这个人的"身份证"。场景也一样,先出影调图,定死这个空间的灯光色温和质感。
然后它会把这些写成一份锚点清单,记录每个主体对应的资产节点,存进画布。
这一步为什么重要?因为长视频崩掉,九成不是崩在画质上,是崩在一致性上。 第一镜的女主是齐耳短发灰毛衣,第五镜变成了长发白衬衫——观众立刻出戏。锚点机制的作用,就是在生成任何视频之前,先把这些容易漂的东西钉住。
我见过的反面案例,都是急着看效果,跳过资产确认直接冲视频生成,跑到第三镜发现人脸不对,只能推倒重来。在锚点上省的每一分钟,后面都要用十分钟还。
8.2 什么是分镜表
分镜表就是一张表格,把整条片子拆成一个个镜头,每一镜写清楚:编号、时长、内容、景别、引用哪些资产。
举个通用化的例子,一支四十秒左右的情绪短片,分镜表大概长这样:
|
镜号 |
时长 |
内容 |
景别 |
引用锚点 |
|
S1 |
5s |
深夜办公室,主角对着屏幕出神 |
中景 |
主角、办公室 |
|
S2 |
4s |
手机屏幕亮起,来电显示 |
特写 |
手机界面 |
|
S3 |
4s |
手指悬停,按下挂断 |
大特写 |
主角 |
|
S4 |
5s |
主角起身,关灯,离开工位 |
全景 |
办公室 |
|
S5 |
5s |
走廊尽头的应急灯 |
空镜 |
走廊 |
|
S6 |
5s |
楼下街边,回拨电话 |
中景 |
主角、街道 |
|
S7 |
4s |
听筒里的忙音,无人接听 |
特写 |
主角 |
|
S8 |
4s |
抬头,望向亮着灯的窗 |
近景 |
主角 |
|
S9 |
4s |
手机震动,一条语音消息 |
特写 |
手机界面 |
有了这张表,Agent 才知道每一镜要生成什么、用哪张参考图、切多长。没有这张表,它就只能一镜一镜地猜。
比较讲究的做法是,Agent 会先从剧情里提取几个叙事节拍,再把节拍拆成具体的镜头。节拍是情绪的骨架,镜头是骨架上的肉——先有骨架,肉才不会长歪。
8.3 镜头数量和时长的换算
这里涉及一个很实际的计算。你定了总时长,模型单段生成的时长有上限,那需要几个镜头?
设总时长为 (T),单段视频的平均时长为 (t),那么需要的镜头数:
[
n = \left\lceil \frac{T}{t} \right\rceil
]
比如你要一支 45 秒的片子,模型单段舒服的区间是 15 秒,那就是 3 段。要一支 40 秒的情绪短片,希望节奏碎一点,平均每镜 4 到 5 秒,那就是 8 到 10 个镜头。
镜头数量直接决定了两件事:生成成本和节奏感。镜头越多,节奏越碎越紧张,但每一镜的信息量就得压缩;镜头越少,每镜越长,越舒缓,但对单段画面的稳定性要求就越高。
我的经验值,供参考:
|
片型 |
总时长 |
建议平均单镜时长 |
大致镜头数 |
|
产品特写广告 |
15s |
2–3s |
5–8 |
|
品牌 TVC |
30s |
3–4s |
8–10 |
|
情绪短片 |
40–45s |
4–5s |
8–10 |
|
剧情段落 |
45–60s |
5–8s |
6–10 |
|
MV |
60s+ |
3–5s |
12–20 |
8.4 一个真实的坑:时长设定和剧情打架
这个坑我踩得挺狠,专门拿出来说。
我在自建的 Skill 里,把单镜时长限死在了 8 到 15 秒。结果实际跑起来,剧情里有些台词和过渡撑不满这个长度,Agent 就自动帮我剪掉了一些内容——它为了满足我定的规则,牺牲了叙事的完整性。
发现问题之后,我又根据叙事节奏,让 Agent 重新调整了每个片段的时长,最后拿到了一版节奏正常的成片。
教训是:Skill 里的硬性参数要留余地。 你以为你在给它定规矩,实际上你可能是在给它下达"必须删内容"的指令。时长这类参数,写成区间比写成定值好,写成"建议"比写成"必须"好。
8.5 分批生成的小技巧
镜头多的时候,Agent 通常不会一口气全跑,而是分批。比如九个镜头,先并行生成前五镜,全部完成后再自动接着生成后四镜。
这个设计对我们是有好处的:前五镜出来,你就能判断整体方向对不对。如果方向错了,及时喊停,只损失五镜的时间,而不是九镜。
所以我养成了一个习惯:第一批出来,一定认真看,别嫌麻烦。这是整个流程里性价比最高的一次质检。
九、我踩过的坑,和一些实用建议
前面讲的都是流程该怎么跑。这一节讲的是流程之外,那些没人告诉你、只能自己撞出来的东西。
9.1 别在第一镜上死抠
这条我在第五节提过,但值得单独拎出来再说一遍,因为它是新手最容易犯的错。
拿到 Skill,跑出第一镜,觉得光影差一点,改;改完觉得构图差一点,再改;改了七八轮,第一镜终于完美了,然后你发现自己已经耗了一个小时,后面还有八镜。更糟的是,等你把整条片子跑完,回头一看,那个被你抠到完美的第一镜,跟整体节奏根本不搭。
正确的顺序是:结构先跑通,细节后返修。 先拿到一版完整的、能从头看到尾的成片,哪怕每一镜都只有七十分。然后你才知道该抠哪儿——通常你会发现,真正需要改的只有两三镜,而不是九镜。
9.2 故事永远不要外包
Agent 能写故事,写得也不算差。但你要清楚一件事:它写出来的东西,是它对"这类题材通常怎么写"的理解,是均值,不是你。
我的做法是:故事大纲自己写,剩下的全外包。 哪怕只写三行字——什么人、在什么处境、发生了什么转折——都比让它自由发挥要好。因为片子的独特性只可能来自故事,来自那个只有你想得到的细节。视觉风格 Skill 能给你,节奏 Agent 能给你,唯独"这个故事只有我会讲"这件事,给不了。
9.3 元素选择:少即是多
选核心场景元素的时候,很多人恨不得全勾上,觉得元素越多画面越丰富。实际结果是反的。
元素本质上是给风格加权重的。你勾三个,每个权重三成多;你勾八个,每个权重一成多——最后哪个都不突出,风格就糊了。
我的规矩是最多三个,而且这三个要互相加强,不能互相打架。 比如"麦田+逆光+长焦"是互相加强的,出来就是那个味儿;"麦田+霓虹+赛博"是互相打架的,Agent 只能和稀泥。
9.4 用大白话提修改意见就够了
不用学什么提示词技巧。我试过一本正经地写"请将背景音乐的音量降低约 30%,提升人声轨的清晰度和存在感",也试过直接说"背景音乐太吵了,压低点",效果没差别。
Agent 的强项就是理解人话。你反而应该省下写提示词的力气,多花在判断"哪里不对"上——说出问题比描述方案更重要。 你说"结尾有点拖",它知道该怎么处理;你非要说"把最后一个镜头裁掉 1.5 秒并添加淡出转场",反而限制了它更好的解法。
9.5 名称和文件的小细节
- 自定义 Skill 的名称写中文,十二字以内,别用长英文名,会写不下。
- 锚点清单和分镜表是会真的写成文件存进画布的,跑完一个项目,翻回去看这两份文件,比看成片更能帮你复盘。
- 项目跑完,把故事板和工作流两个视图都切一遍。故事板帮你看整体,工作流帮你定位问题,两个视图看同一件事,视角完全不同。
9.6 参考图这件事,给不给、给几张
有的 Skill 允许你上传参考图——人脸参考、造型参考、产品图、风格参考。到底给不给?
我的经验分两种情况。
做商业内容,产品图必须给。 产品是不能被"创作"的,一辆车的进气格栅长什么样、一个瓶子的比例是多少,模型自由发挥的结果基本都不能用。给了参考图,Agent 会先生成产品的三视图和细节图,再基于这些去排分镜,成片里的产品才立得住。
做剧情内容,人脸参考可以不给。 我做过对比:给人脸参考,主角长得像你给的那个人,但你要额外承担一个风险——这张脸未必适合这个故事的气质。不给,让 Agent 根据剧本自己设计角色,它通常会先出几套造型方案让你挑,挑完再生成三视图。这个过程反而更贴合剧本。
还有个细节容易忽略:参考图的格式会影响效果。 有些排版形式(比如把多个角度拼成一张九宫格)在某些流程里不一定被默认识别成参考。拿不准的时候,规规矩矩上传单张清晰的图,比自作聪明地拼图靠谱。
9.7 关于"参考"和"照搬"的分寸
这一条不是技术问题,但我觉得比技术问题更重要。
现在的工具能力很强,强到你可以让它分析一支现成的片子,提炼出方法再复现。这带来一个很现实的分寸问题:学手法和抄作品,中间那条线在哪儿?
我自己的标准是这样的:
- 可以学的:视觉手法(用什么光、什么构图、什么色调)、叙事节奏(几秒一个转折)、类型规律(这类片子通常怎么开场)。这些是行业公共知识,谁都可以用。
- 不该碰的:具体的角色形象、完整的故事情节、有辨识度的原创设计、别人作品里的独特桥段。这些是别人的成果。
说得再直白点:你学的应该是"怎么拍",不是"拍什么"。一支片子的调性可以被借鉴一万次,但故事只属于写它的人。工具越强,这条线越需要自己心里有数——因为工具不会替你把关。
9.8 一份新手上手的顺序建议
如果你是第一次碰这套东西,我建议按这个顺序走,能少走很多弯路:
|
阶段 |
做什么 |
目的 |
|
第一条 |
随便挑个 Skill,全自动,15 秒 |
走通全链路,知道流程长啥样 |
|
第二条 |
同一个 Skill,手动模式 |
感受每个确认点在决定什么 |
|
第三条 |
换一个风格差异大的 Skill |
建立"Skill 决定调性"的直觉 |
|
第四条 |
自己写故事大纲,手动模式 |
第一次真正做属于自己的内容 |
|
第五条 |
建一个自己的 Skill |
把前四条的经验沉淀下来 |
到第五条,你基本就有自己的方法库了。
这个顺序里藏着一个我自己总结的规律:先别急着追求好,先追求"完整"。 很多人卡在第一条就放弃了,原因往往是一上来就想做一支惊艳的片子,结果在细节里越陷越深,最后连一条完整的成片都没拿到手,只留下一堆半成品和挫败感。而如果你第一条就用最省事的方式跑完全程,哪怕成片平平无奇,你也已经拿到了最宝贵的东西——对整条链路的手感。有了手感,后面每一步的取舍你都会心里有数。
十、Skill 真正改变了什么
写到这儿,回头看,我觉得有必要跳出操作层面聊两句。
Skill 功能解决的,从来不是"一键生成视频"这么简单的事。它把原本零散在十几个环节里的剧本、人物、场景、分镜、视频生成和后期合成,整合成了一套可以直接调用、并且可以反复调用的创作流程。
这三种用法,其实对应三种人:
- 想快速出片,用自动模式,五分钟拿一条能发的片子;
- 想加入自己的想法,用手动模式,在每个岔路口指方向;
- 想形成属于自己的风格,建一个专属 Skill,把方法固化下来。
而它们背后是同一件事:创作的重心,从"怎么把它做出来"挪回了"要做什么"。
以前我们做 AI 视频,大量时间花在提示词、节点连线和各种技术问题上。真正属于创意的部分,被这些琐事挤到了角落。现在这些琐事被工具吃掉了,我们可以把更多精力放回故事和内容本身——这才是我觉得最有价值的地方。
顺带说一句我的一点观察:Skill 这个东西,长期看是会增值的。你怎么选、怎么改、怎么用,都会慢慢沉淀成你的偏好,让工具越来越懂你的审美。而当越来越多创作者把自己的经验写成 Skill 发布出来,这个方法库会越来越厚——这有点像开源社区的逻辑,只不过共享的不是代码,是拍法。
至于工具本身,就是前面一直在用的 LibTV,LiblibAI 出品,官网在 www.liblib.tv,感兴趣可以自己去跑一条试试。这套东西的学习曲线比想象中平,第一条片子基本半小时内能出来。
最后回到最开始那个问题:15 秒这道坎过去了吗?
我觉得过去了,但过去的方式跟大家预想的不太一样——不是某个模型突然能一口气生成一分钟,而是有人把这一分钟拆成了可管理的结构:锚点钉住一致性,分镜表管住节奏,Agent 负责调度,Skill 负责方法。技术难题被工程化的方式绕过去了。
这可能就是这个阶段最真实的状态:模型决定下限,方法决定上限。 而 Skill,就是把方法变成资产的那把钥匙。
你准备好搭建自己的 Skill 创作流程了吗?
个人学习实践总结声明
本文是我个人在学习与实践过程中的整理和总结,所有操作步骤、参数经验和判断结论均来自我自己的动手体验,仅代表个人观点,供交流参考。文中涉及的产品功能与界面可能随版本更新发生变化,请以你实际使用时的界面为准。
转载请注明出处。
作者:辛梓煜 | 词元2号站 www.ciyuanerhao.com