本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
如果你只想要一个结论:AI 视频创作现在的分水岭,已经不是"哪个模型画得好看",而是"谁能把一整套拍法封装成可以反复调用的流程"。本文以 LiblibAI 旗下的 AI 视频创作产品 LibTV(www.liblib.tv)为例,把这条流程从头到尾拆一遍。所谓 Skill,本质上就是一份写给 AI 的拍摄方法说明书——它把风格定义、素材清单、分镜规范、输出标准全部固化下来,你选中它,Agent 就按这套规矩往下跑,从故事大纲、角色三视图、场景图、分镜表,一直做到多段视频、背景音乐、字幕和最终合成。它真正解决的不是"一键生成"这四个字,而是把过去分散在十几个工具、几十轮抽卡里的重复劳动,收进了同一块画布。全自动模式适合快速出片,手动模式适合把自己的想法塞进每一个环节,而当现成 Skill 满足不了你的风格时,你可以自己建一个——填名称、写简介、说清任务、执行方式和输出内容,五分钟就能拥有一位听你话的专属 AI 导演。
这篇文章我会把整条链路拆开讲透:概念是什么、Agent 在画布里到底做了哪几步、全自动和手动分别怎么操作、Skill 广场怎么挑、专属 Skill 怎么从零搭出来、锚点和分镜为什么是长视频不崩的关键,以及我自己折腾下来踩过的那些坑。
想看完整拆解,往下翻。
一、15 秒这道坎,到底卡住了什么
玩过 AI 视频的人,大概都对"15 秒"这个数字有心理阴影。
不是模型不行。单段画面的质感这两年进步得非常凶,随便挑个主流模型,出一段光影漂亮、运镜利落的片段并不难。难的是第 16 秒。你要让第二段的人脸和第一段是同一张脸,衣服是同一件衣服,房间的灯光色温不能突然从冷白跳到暖黄,镜头的情绪还得接得上。这些事,模型本身不负责。
于是过去的做法是这样的:先在一个工具里写剧本,再换一个工具生成人物参考图,还要单独做场景参考图,然后回到视频工具里一个节点一个节点地连线,把参考图喂进去,逐段生成,逐段抽卡。抽到满意的,下载下来,导进剪辑软件,配字幕、配音乐、切节奏。中间任何一步不满意,就得往回倒。
我自己最狼狈的一次,是同时开了六七个标签页,脚本还没写完,浏览器先卡了。那种感觉不是"创作受阻",是"行政工作太多"——真正属于创意的部分可能只占两成,剩下八成全是搬运、连线、复制粘贴、等待。
1.1 问题的根不在模型,在流程
把这件事拆细一点会更清楚。做一支有剧情、有镜头、有节奏的完整短片,中间至少要经过这么几层:
- 创意层:主题、故事大纲、情绪基调、视觉风格;
- 资产层:角色形象、服装造型、场景影调、道具、背景音乐;
- 结构层:分镜表、每一镜的时长、景别、机位、台词;
- 生成层:逐段出画面,逐段校验一致性;
- 后期层:剪辑、转场、字幕、混音、合成。
传统工具的分工是:模型只管"生成层"那一格。剩下四层,全是人肉在跑。而人肉跑这四层最大的成本,不是脑力,是上下文的反复搬运——你在 A 工具里定好的风格,到了 B 工具要重新用提示词描述一遍;你在 C 工具里选定的人脸,到了 D 工具要重新上传一遍。
信息每搬一次家,就漂一次。漂到最后,成片就散了。
1.2 Agent 进画布,改的是什么
真正的变化,是 Agent 被塞进了画布本身。
以前的画布是给人用的:你自己创建节点,自己连线,自己填提示词。现在画布右侧直接挂一个对话框,你用大白话说需求,节点的创建、连线、参数填写、资产调用、最终合成,全部由 Agent 在同一块画布上接着做。你从"操作员"变成了"发号施令的人"。
我第一次遇到这种交互的时候,其实是懵的。习惯性地想去画布上找"新建节点"的按钮,找了半天没找着,反应过来:不用找了,直接说就行。说完之后眼睁睁看着画布上自己长出一堆节点、自己连上线、自己开始跑——那种感觉挺难形容的,像是从"自己搬砖"变成了"站在旁边看施工队干活",而你要做的只是在关键的地方指一句"这堵墙往左挪半米"。
这个转变听起来像是省了几次点击,其实省掉的是整个上下文搬运的过程。所有资产都躺在同一张画布上,Agent 随时能引用,风格自然就不容易漂。这也是我认为这一波更新里最有价值的一点——它不是给你多加了一个功能按钮,是把工作台整个换了。
二、先把黑话翻译成人话:画布、节点、Agent、Skill
新手最容易在这几个词上卡住,我用最白的话过一遍。
在开始之前,先把主角交代清楚,免得后面读着犯迷糊:本文实操用的工具叫 LibTV,是 LiblibAI(哩布哩布) 在 2026 年 3 月推出的 AI 视频创作产品,官网 www.liblib.tv。LiblibAI 这个名字,玩过 AI 绘画的人应该都不陌生,它早年是国内做得比较大的模型社区,后来把能力延伸到了视频这一侧。LibTV 就是这条线上的产物——一块无限画布,加一个能干活的 Agent,再加一套 Skill 体系。
下面所有的概念和操作,都以 LibTV 为例。但要说明的是,这套"画布+Agent+Skill"的思路并不是它独有的,同类产品也在往这个方向走。所以你真正要理解的是这套方法论本身,工具只是载体——看懂了逻辑,换个平台你照样能上手。
2.1 画布(Canvas)
画布就是一张无限大的白纸,你所有的素材和生成结果都摆在上面。 它跟传统剪辑软件的时间轴不一样,时间轴是一条线,画布是一个平面——你可以把人物图放左上角,场景图放右上角,分镜表贴中间,视频片段排下面,彼此之间用线连起来表示"谁引用了谁"。
用过节点式创作工具的人会秒懂;没用过也不用怕,因为现在你可以完全不碰它,让 Agent 去画。
2.2 节点(Node)
节点就是画布上的一个个小方块,每一个方块代表一份素材或者一次生成动作。 常见的节点类型有文本、图片、视频、音频、脚本几种。一个"图生视频"的节点,往上连着一张参考图,往下吐出一段视频,逻辑关系一眼可见。
节点最大的好处是可追溯。哪一镜出了问题,你不用把整条片子重跑,找到对应的节点,单独重生成就行。
2.3 Agent(智能体)
Agent 就是画布右边那个会干活的对话框。 它跟普通聊天机器人的区别在于:普通机器人只会说,Agent 会动手。你说"帮我做一支复古风格的青春短片",它不会给你回一段文案,它会真的去创建节点、生成图、调模型、合成视频。
更关键的是它会反问。任务信息不全的时候,它不会硬着头皮瞎猜,而是停下来问你:多长?什么画幅?哪种语言的字幕?要不要旁白?我第一次用的时候还挺不适应,因为习惯了 AI 工具"你给什么它做什么",突然被反问,反倒觉得踏实——它是真的在对齐需求,而不是在赌概率。
2.4 Skill(技能)
这是整篇文章的核心。
Skill 就是一份写给 Agent 看的"拍法说明书"。 它里面写清楚了:这种风格的片子长什么样、需要准备哪些素材、分镜按什么节奏排、画面用什么影调、最后交付什么格式。你选中一个 Skill,等于给这次创作请了一位有明确方法论的导演。
打个比方可能更好懂:模型是摄影机,Agent 是能听懂人话的执行团队,而 Skill 是导演手里的那本分镜脚本加拍摄规范。同样一台摄影机,交给不同的导演,出来的东西天差地别——差的就是这本规范。
|
概念 |
白话解释 |
类比 |
你需要动手吗 |
|
画布 |
摆放所有素材和结果的无限白纸 |
剧组的置景棚 |
可以不碰 |
|
节点 |
画布上的单个素材或生成动作 |
一个镜头的原始素材 |
需要精修时才碰 |
|
Agent |
会真的动手干活的对话框 |
执行导演+剪辑师 |
只需要说话 |
|
Skill |
封装好的一整套拍法与规范 |
导演的分镜脚本+风格手册 |
选一个,或自己写 |
|
模型 |
底层负责出画面的引擎 |
摄影机 |
一般由 Agent 自动选 |
辛梓煜@词元2号站 在这里多提醒一句:很多人一上来就纠结"该用哪个模型",其实在这套体系下,模型的选择权大部分时候可以交给 Agent。你真正要花心思的是 Skill 的挑选和定制,那才是决定成片调性的地方。
三、Skill 的运行逻辑:一套被封装起来的方法论
搞清楚 Skill 里到底装了什么,你才知道为什么它能扛住长片。
3.1 一个 Skill 的详情页里有什么
正经的 Skill,详情页会把这几件事写明白:
- 风格介绍:这套拍法追求什么样的视觉与叙事气质;
- 适用时长:它擅长的片长区间,有的擅长 15 秒短平快,有的能撑到几十秒的剧情段落;
- 使用场景:适合拍什么题材,不适合拍什么;
- 需要的素材:要不要你提供产品图、人脸参考、音乐;
- 输出内容:最后交付人物三视图、场景图、分镜提示词、BGM、完整成片中的哪几样。
有的 Skill 还带一个"创作详情"入口,点进去能看到官方样片背后的完整画布——角色图、场景图、分段视频、BGM、字幕、合成节点全都摊开给你看。这个功能我强烈建议每次调用前都点一下,因为它等于让你在下单前先看清楚这位导演的工作方式。
3.2 Agent 拿到 Skill 之后,实际跑了哪几步
不管是哪种题材,跑起来的骨架基本是一致的:
用户意图(一句话 / 一段大纲 / 一张参考图)
↓
Agent 反问补全(时长 / 模式 / 画幅 / 语言 / 核心元素 / 大纲来源)
↓
风格基调锚定(moodboard,定死整片的色彩与影调)
↓
资产层生成(角色三视图 → 服装造型 → 场景影调图 → 道具)
↓
结构层落盘(锚点清单 + 分镜表,写成文件存进画布)
↓
分段视频生成(按分镜表逐镜或并行出画)
↓
音频层(BGM / 旁白 / 对白)
↓
合成节点(拼接 + 转场 + 字幕 → 成片)
用流程图看会更直观:
graph TD
A[一句话需求] --> B{信息够吗}
B -- 不够 --> C[Agent 反问补全]
C --> D[生成风格基调图]
B -- 够 --> D
D --> E[角色三视图 / 场景影调图]
E --> F[锚点清单]
E --> G[分镜表]
F --> H[分段视频生成]
G --> H
H --> I{效果满意吗}
I -- 否 --> J[定点返修单个节点]
J --> H
I -- 是 --> K[BGM + 字幕]
K --> L[合成节点输出成片]
注意 F 和 G 那两个框——锚点清单和分镜表。这是整套机制里最容易被忽略、但恰恰最要命的两样东西,我在第八节会专门展开讲。
3.3 为什么 Skill 不是"一段更长的提示词"
这一点我特意想澄清一下,因为很多人第一反应是:"这不就是把提示词写长一点存起来吗?"
不是。差别在三个地方:
第一,Skill 是带流程的。提示词是一次性的输入,Skill 是一条有先后顺序、有分支判断的执行路径——先定基调,再出资产,资产确认后才动视频,顺序错了效果就散。
第二,Skill 是带交互点的。它规定了哪些环节必须停下来等你确认。角色造型给你四套让你选,场景影调给你四张让你挑,这些"停顿"是写在方法论里的,不是随机的。
第三,Skill 是长在具体框架里的。它要由 Agent 来理解意图、选择模型、调度工具。同样一份 Skill 文本复制到另一套系统里,离开了原来的模型组合和调度方式,也很难复现出一样的结果。所以它更像一套"方法+环境"的组合,而不是一段可以随便搬走的文本。
3.4 顺便说说:为什么视频 Agent 这么难做
聊到这儿,可以回答一个很多人心里的疑问:文字类的 Agent 早就遍地都是了,为什么视频 Agent 拖到现在才有像样的东西?
我的理解是,卡点在于"交付"这两个字的门槛太高。
写文章的 Agent,输出一段文字,好不好你一眼就能判断,不满意重写的成本几乎为零。视频不一样。一支片子要算"能交付",至少得同时满足两个条件:
一是结构完整。 它得是一支可以直接放到内容平台上被消费的作品——该有的片头片尾、字幕、音乐都在,音画同步,不需要再进任何后期软件就能发出去。缺一样,它就只是"素材",不是"作品"。
二是过程可控。 观众不会因为你是 AI 做的就降低标准。人脸漂了、影调跳了、节奏散了,一样出戏。而这些问题,恰恰是链路越长越容易出。
这两个条件叠在一起,意味着视频 Agent 不能只做"生成"这一格,它必须把创意、资产、结构、生成、后期五层全部串起来,还得在每一层都不掉链子。链路上任何一个环节偷懒,最后交付的都不是成片。
想明白这一点,你就理解了为什么锚点、分镜表、合成节点这些看起来很"工程"的东西会被摆在这么重要的位置——它们不是花架子,是把一条长链路撑住的骨头。
3.5 三种角色,谁负责什么
我用一张表把整套体系里的分工再捋一遍,看懂这张表,后面的所有操作都会变得很自然:
|
层级 |
谁负责 |
具体做什么 |
出问题的表现 |
|
意图层 |
你 |
提供故事、判断方向、拍板选择 |
片子平庸、没有个人特点 |
|
方法层 |
Skill |
规定风格、流程、交付标准 |
风格不统一、节奏乱 |
|
调度层 |
Agent |
理解意图、选模型、建节点、跑流程 |
步骤跳步、一致性崩 |
|
执行层 |
模型 |
出画面、出声音 |
画质差、物理不合理 |
看这张表最大的价值在于:当片子不


