📍 词元二号站 就业指导 AI 视频 Agent 与 Skill 全流程实操指南:从一句话到成片,把剧本、分镜、生成、剪辑压进同一条工作流

AI 视频 Agent 与 Skill 全流程实操指南:从一句话到成片,把剧本、分镜、生成、剪辑压进同一条工作流

摘要:一篇讲透 LibTV(LiblibAI 旗下 AI 视频创作产品)Agent 与 Skill 的实操长文:拆解画布、节点、Agent、Skill 四个核心概念,完整演示全自动与手动两种模式的操作流程,详解锚点清单与分镜表这两个长视频不崩的关键机制,并手把手教你从零创建个人专属 Skill,附赠可直接套用的 Skill 内容模板、镜头时长换算方法与十条踩坑经验。
字号 100%
行距 2.05
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

如果你只想要一个结论:AI 视频创作现在的分水岭,已经不是"哪个模型画得好看",而是"谁能把一整套拍法封装成可以反复调用的流程"。本文以 LiblibAI 旗下的 AI 视频创作产品 LibTV(www.liblib.tv)为例,把这条流程从头到尾拆一遍。所谓 Skill,本质上就是一份写给 AI 的拍摄方法说明书——它把风格定义、素材清单、分镜规范、输出标准全部固化下来,你选中它,Agent 就按这套规矩往下跑,从故事大纲、角色三视图、场景图、分镜表,一直做到多段视频、背景音乐、字幕和最终合成。它真正解决的不是"一键生成"这四个字,而是把过去分散在十几个工具、几十轮抽卡里的重复劳动,收进了同一块画布。全自动模式适合快速出片,手动模式适合把自己的想法塞进每一个环节,而当现成 Skill 满足不了你的风格时,你可以自己建一个——填名称、写简介、说清任务、执行方式和输出内容,五分钟就能拥有一位听你话的专属 AI 导演。

这篇文章我会把整条链路拆开讲透:概念是什么、Agent 在画布里到底做了哪几步、全自动和手动分别怎么操作、Skill 广场怎么挑、专属 Skill 怎么从零搭出来、锚点和分镜为什么是长视频不崩的关键,以及我自己折腾下来踩过的那些坑。

想看完整拆解,往下翻。


一、15 秒这道坎,到底卡住了什么

玩过 AI 视频的人,大概都对"15 秒"这个数字有心理阴影。

不是模型不行。单段画面的质感这两年进步得非常凶,随便挑个主流模型,出一段光影漂亮、运镜利落的片段并不难。难的是第 16 秒。你要让第二段的人脸和第一段是同一张脸,衣服是同一件衣服,房间的灯光色温不能突然从冷白跳到暖黄,镜头的情绪还得接得上。这些事,模型本身不负责。

于是过去的做法是这样的:先在一个工具里写剧本,再换一个工具生成人物参考图,还要单独做场景参考图,然后回到视频工具里一个节点一个节点地连线,把参考图喂进去,逐段生成,逐段抽卡。抽到满意的,下载下来,导进剪辑软件,配字幕、配音乐、切节奏。中间任何一步不满意,就得往回倒。

我自己最狼狈的一次,是同时开了六七个标签页,脚本还没写完,浏览器先卡了。那种感觉不是"创作受阻",是"行政工作太多"——真正属于创意的部分可能只占两成,剩下八成全是搬运、连线、复制粘贴、等待。

1.1 问题的根不在模型,在流程

把这件事拆细一点会更清楚。做一支有剧情、有镜头、有节奏的完整短片,中间至少要经过这么几层:

  • 创意层:主题、故事大纲、情绪基调、视觉风格;
  • 资产层:角色形象、服装造型、场景影调、道具、背景音乐;
  • 结构层:分镜表、每一镜的时长、景别、机位、台词;
  • 生成层:逐段出画面,逐段校验一致性;
  • 后期层:剪辑、转场、字幕、混音、合成。

传统工具的分工是:模型只管"生成层"那一格。剩下四层,全是人肉在跑。而人肉跑这四层最大的成本,不是脑力,是上下文的反复搬运——你在 A 工具里定好的风格,到了 B 工具要重新用提示词描述一遍;你在 C 工具里选定的人脸,到了 D 工具要重新上传一遍。

信息每搬一次家,就漂一次。漂到最后,成片就散了。

1.2 Agent 进画布,改的是什么

真正的变化,是 Agent 被塞进了画布本身。

以前的画布是给人用的:你自己创建节点,自己连线,自己填提示词。现在画布右侧直接挂一个对话框,你用大白话说需求,节点的创建、连线、参数填写、资产调用、最终合成,全部由 Agent 在同一块画布上接着做。你从"操作员"变成了"发号施令的人"。

我第一次遇到这种交互的时候,其实是懵的。习惯性地想去画布上找"新建节点"的按钮,找了半天没找着,反应过来:不用找了,直接说就行。说完之后眼睁睁看着画布上自己长出一堆节点、自己连上线、自己开始跑——那种感觉挺难形容的,像是从"自己搬砖"变成了"站在旁边看施工队干活",而你要做的只是在关键的地方指一句"这堵墙往左挪半米"。

这个转变听起来像是省了几次点击,其实省掉的是整个上下文搬运的过程。所有资产都躺在同一张画布上,Agent 随时能引用,风格自然就不容易漂。这也是我认为这一波更新里最有价值的一点——它不是给你多加了一个功能按钮,是把工作台整个换了。


二、先把黑话翻译成人话:画布、节点、Agent、Skill

新手最容易在这几个词上卡住,我用最白的话过一遍。

在开始之前,先把主角交代清楚,免得后面读着犯迷糊:本文实操用的工具叫 LibTV,是 LiblibAI(哩布哩布) 在 2026 年 3 月推出的 AI 视频创作产品,官网 www.liblib.tv。LiblibAI 这个名字,玩过 AI 绘画的人应该都不陌生,它早年是国内做得比较大的模型社区,后来把能力延伸到了视频这一侧。LibTV 就是这条线上的产物——一块无限画布,加一个能干活的 Agent,再加一套 Skill 体系。

下面所有的概念和操作,都以 LibTV 为例。但要说明的是,这套"画布+Agent+Skill"的思路并不是它独有的,同类产品也在往这个方向走。所以你真正要理解的是这套方法论本身,工具只是载体——看懂了逻辑,换个平台你照样能上手。

2.1 画布(Canvas)

画布就是一张无限大的白纸,你所有的素材和生成结果都摆在上面。 它跟传统剪辑软件的时间轴不一样,时间轴是一条线,画布是一个平面——你可以把人物图放左上角,场景图放右上角,分镜表贴中间,视频片段排下面,彼此之间用线连起来表示"谁引用了谁"。

用过节点式创作工具的人会秒懂;没用过也不用怕,因为现在你可以完全不碰它,让 Agent 去画。

2.2 节点(Node)

节点就是画布上的一个个小方块,每一个方块代表一份素材或者一次生成动作。 常见的节点类型有文本、图片、视频、音频、脚本几种。一个"图生视频"的节点,往上连着一张参考图,往下吐出一段视频,逻辑关系一眼可见。

节点最大的好处是可追溯。哪一镜出了问题,你不用把整条片子重跑,找到对应的节点,单独重生成就行。

2.3 Agent(智能体)

Agent 就是画布右边那个会干活的对话框。 它跟普通聊天机器人的区别在于:普通机器人只会说,Agent 会动手。你说"帮我做一支复古风格的青春短片",它不会给你回一段文案,它会真的去创建节点、生成图、调模型、合成视频。

更关键的是它会反问。任务信息不全的时候,它不会硬着头皮瞎猜,而是停下来问你:多长?什么画幅?哪种语言的字幕?要不要旁白?我第一次用的时候还挺不适应,因为习惯了 AI 工具"你给什么它做什么",突然被反问,反倒觉得踏实——它是真的在对齐需求,而不是在赌概率。

2.4 Skill(技能)

这是整篇文章的核心。

Skill 就是一份写给 Agent 看的"拍法说明书"。 它里面写清楚了:这种风格的片子长什么样、需要准备哪些素材、分镜按什么节奏排、画面用什么影调、最后交付什么格式。你选中一个 Skill,等于给这次创作请了一位有明确方法论的导演。

打个比方可能更好懂:模型是摄影机,Agent 是能听懂人话的执行团队,而 Skill 是导演手里的那本分镜脚本加拍摄规范。同样一台摄影机,交给不同的导演,出来的东西天差地别——差的就是这本规范。

概念

白话解释

类比

你需要动手吗

画布

摆放所有素材和结果的无限白纸

剧组的置景棚

可以不碰

节点

画布上的单个素材或生成动作

一个镜头的原始素材

需要精修时才碰

Agent

会真的动手干活的对话框

执行导演+剪辑师

只需要说话

Skill

封装好的一整套拍法与规范

导演的分镜脚本+风格手册

选一个,或自己写

模型

底层负责出画面的引擎

摄影机

一般由 Agent 自动选

辛梓煜@词元2号站 在这里多提醒一句:很多人一上来就纠结"该用哪个模型",其实在这套体系下,模型的选择权大部分时候可以交给 Agent。你真正要花心思的是 Skill 的挑选和定制,那才是决定成片调性的地方。


三、Skill 的运行逻辑:一套被封装起来的方法论

搞清楚 Skill 里到底装了什么,你才知道为什么它能扛住长片。

3.1 一个 Skill 的详情页里有什么

正经的 Skill,详情页会把这几件事写明白:

  • 风格介绍:这套拍法追求什么样的视觉与叙事气质;
  • 适用时长:它擅长的片长区间,有的擅长 15 秒短平快,有的能撑到几十秒的剧情段落;
  • 使用场景:适合拍什么题材,不适合拍什么;
  • 需要的素材:要不要你提供产品图、人脸参考、音乐;
  • 输出内容:最后交付人物三视图、场景图、分镜提示词、BGM、完整成片中的哪几样。

有的 Skill 还带一个"创作详情"入口,点进去能看到官方样片背后的完整画布——角色图、场景图、分段视频、BGM、字幕、合成节点全都摊开给你看。这个功能我强烈建议每次调用前都点一下,因为它等于让你在下单前先看清楚这位导演的工作方式。

3.2 Agent 拿到 Skill 之后,实际跑了哪几步

不管是哪种题材,跑起来的骨架基本是一致的:

用户意图(一句话 / 一段大纲 / 一张参考图)
        ↓
Agent 反问补全(时长 / 模式 / 画幅 / 语言 / 核心元素 / 大纲来源)
        ↓
风格基调锚定(moodboard,定死整片的色彩与影调)
        ↓
资产层生成(角色三视图 → 服装造型 → 场景影调图 → 道具)
        ↓
结构层落盘(锚点清单 + 分镜表,写成文件存进画布)
        ↓
分段视频生成(按分镜表逐镜或并行出画)
        ↓
音频层(BGM / 旁白 / 对白)
        ↓
合成节点(拼接 + 转场 + 字幕 → 成片)

用流程图看会更直观:

graph TD
    A[一句话需求] --> B{信息够吗}
    B -- 不够 --> C[Agent 反问补全]
    C --> D[生成风格基调图]
    B -- 够 --> D
    D --> E[角色三视图 / 场景影调图]
    E --> F[锚点清单]
    E --> G[分镜表]
    F --> H[分段视频生成]
    G --> H
    H --> I{效果满意吗}
    I -- 否 --> J[定点返修单个节点]
    J --> H
    I -- 是 --> K[BGM + 字幕]
    K --> L[合成节点输出成片]

注意 F 和 G 那两个框——锚点清单分镜表。这是整套机制里最容易被忽略、但恰恰最要命的两样东西,我在第八节会专门展开讲。

3.3 为什么 Skill 不是"一段更长的提示词"

这一点我特意想澄清一下,因为很多人第一反应是:"这不就是把提示词写长一点存起来吗?"

不是。差别在三个地方:

第一,Skill 是带流程的。提示词是一次性的输入,Skill 是一条有先后顺序、有分支判断的执行路径——先定基调,再出资产,资产确认后才动视频,顺序错了效果就散。

第二,Skill 是带交互点的。它规定了哪些环节必须停下来等你确认。角色造型给你四套让你选,场景影调给你四张让你挑,这些"停顿"是写在方法论里的,不是随机的。

第三,Skill 是长在具体框架里的。它要由 Agent 来理解意图、选择模型、调度工具。同样一份 Skill 文本复制到另一套系统里,离开了原来的模型组合和调度方式,也很难复现出一样的结果。所以它更像一套"方法+环境"的组合,而不是一段可以随便搬走的文本。

3.4 顺便说说:为什么视频 Agent 这么难做

聊到这儿,可以回答一个很多人心里的疑问:文字类的 Agent 早就遍地都是了,为什么视频 Agent 拖到现在才有像样的东西?

我的理解是,卡点在于"交付"这两个字的门槛太高。

写文章的 Agent,输出一段文字,好不好你一眼就能判断,不满意重写的成本几乎为零。视频不一样。一支片子要算"能交付",至少得同时满足两个条件:

一是结构完整。 它得是一支可以直接放到内容平台上被消费的作品——该有的片头片尾、字幕、音乐都在,音画同步,不需要再进任何后期软件就能发出去。缺一样,它就只是"素材",不是"作品"。

二是过程可控。 观众不会因为你是 AI 做的就降低标准。人脸漂了、影调跳了、节奏散了,一样出戏。而这些问题,恰恰是链路越长越容易出。

这两个条件叠在一起,意味着视频 Agent 不能只做"生成"这一格,它必须把创意、资产、结构、生成、后期五层全部串起来,还得在每一层都不掉链子。链路上任何一个环节偷懒,最后交付的都不是成片。

想明白这一点,你就理解了为什么锚点、分镜表、合成节点这些看起来很"工程"的东西会被摆在这么重要的位置——它们不是花架子,是把一条长链路撑住的骨头。

3.5 三种角色,谁负责什么

我用一张表把整套体系里的分工再捋一遍,看懂这张表,后面的所有操作都会变得很自然:

层级

谁负责

具体做什么

出问题的表现

意图层

提供故事、判断方向、拍板选择

片子平庸、没有个人特点

方法层

Skill

规定风格、流程、交付标准

风格不统一、节奏乱

调度层

Agent

理解意图、选模型、建节点、跑流程

步骤跳步、一致性崩

执行层

模型

出画面、出声音

画质差、物理不合理

看这张表最大的价值在于:当片子不好看的时候,你能定位到是哪一层的问题。 是故事本身没意思(意图层),还是方法不对(方法层),还是执行有瑕疵(执行层)?新手最常见的误判,是把意图层的问题甩锅给执行层——故事本身乏味,怪模型画得不够炫,那再换十个模型也救不回来。


四、实操一:全自动模式,从零跑通一条短片

理论讲完,上手。我先用最省事的路径演示一遍,全程不碰画布。

4.1 入口在哪

新建一个空白画布,右侧就是 Agent 对话框。对话框下方有 Skill 入口,点开是官方已经准备好的 Skill 列表,点右上角的"全部",进入完整的 Skill 广场。

这里有个细节值得说:Skill 的部署非常轻,看中哪个,点一下"使用"或者"添加 Skill"就挂上了,不需要任何配置。

4.2 逐项拆解 Agent 的提问

选好 Skill、说一句话之后,Agent 不会立刻开跑,而是先把不确定的信息问一遍。我把这些选项逐个拆开,因为每一项都直接影响成片:

第一步:视频时长。 一般给你 15 秒以内、30 到 60 秒、自定义三档。新手第一次跑,我建议直接选最短那档。不是因为长的做不出来,而是短的能让你在最短时间内看完一整条链路,知道这套流程长什么样。

第二步:执行模式。 全自动模式是 Agent 一路往后推,不需要你每步确认;手动模式则会在关键节点停下来等你拍板。这一步是整个流程里最重要的选择,我第五节专门讲手动模式。

第三步:画幅。 这个选项对成片气质的影响,比很多人以为的大得多:

画幅

视觉感受

适合的题材

4:3

方正、复古、有胶片年代感

怀旧短片、复古美学、老电影质感

16:9

最通用,横屏观感标准

绝大多数常规内容、广告、MV

宽银幕(如 2.35:1)

上下留黑边,电影感最强

剧情片段、专业影视风格

9:16

竖屏

移动端优先的内容

我的做法是:拿不准就选 16:9,它的容错率最高。想要"高级感"三个字,宽银幕几乎是最省力的捷径——同样的画面,加上那两条黑边,气质立刻不一样。

第四步:对白与字幕语言。 中文内容我一般直接选简体中文。这里要留意的是,字幕语言和对白语言可以是两回事,做商业内容时双语字幕是个很实用的选项。

第五步:核心场景元素。 Agent 会让你挑几个题材相关的元素。比如做青春题材,透视感的长廊、麦田、教室、走廊这类元素就很对味。这一步别贪多,选两三个就够——元素越多,风格越容易被稀释。

第六步:故事来源。 通常两个选项:自己提供故事大纲,或者让它根据前面的选择自动生成一条完整短片。第一次跑,选自动生成,看看它的理解力;正式做内容时,我基本都会自己给大纲,因为故事是唯一不该外包的东西。

4.3 它自己跑起来之后

点击开始,就可以去干别的了。Agent 的执行顺序大致是:

  1. 先出一张风格基调图(moodboard),把整条片子的色彩、光线、质感先定死;
  2. 顺着基调图生成道具图、场景图、人物参考图
  3. 把这些资产写进锚点清单分镜表
  4. 按分镜表逐段生成视频
  5. 自动生成背景音乐
  6. 创建合成节点,把所有片段剪在一起,加上字幕,发布到画布上。

就是刷会儿短视频的功夫,回来一看,画布上已经密密麻麻全是节点和素材了,而这些没有一个是我手动创建的。最后拿到的,是一条远超 15 秒、音画同步、带字幕和 BGM 的完整片子——不需要再进任何后期软件,可以直接发。

这里插一句我自己的判断标准:一条片子算不算"成片",看两件事——结构完不完整(片头、片尾、字幕、音乐齐不齐,音画同不同步),以及能不能直接发布不用返工。 达不到这两条的,都只能算素材。

4.4 全自动模式适合谁

说句实话,全自动模式的成片质量,比我预期高,但它不是万能的。

它适合:验证一个创意值不值得做、快速批量出内容、给客户看方向、自己练手熟悉流程。

它不适合:你心里已经有非常具体的画面。因为全自动意味着你把审美判断权整个交出去了,Agent 的每一次选择都是它认为的最优解,不是你的最优解。想要成片长成你脑子里那个样,得往下看第五节。


五、实操二:手动模式做 TVC,把控制权拿回来

全自动是"我信你",手动是"我盯着你"。这一节我用一支高端质感的 TVC 广告来演示,其他题材的 Skill 操作方式是一样的。

5.1 为什么商业内容必须用手动

道理很简单:自娱自乐的片子,效果好就行;商业内容有明确的诉求——产品的哪个细节必须出现、品牌的调性不能跑偏、节奏卡在第几秒必须给到 logo。这些东西 Agent 猜不出来,只能你说。

所以我的原则是:练手用全自动,交付用手动。

5.2 一步一步来

进入 Skill 之后,它先问产品。 选一个奢华质感的 TVC Skill 进去,第一个问题通常是:要为哪一类产品做广告?我这次做的是跑车。这一步别只写"跑车"两个字,把产品的定位、目标人群、想强调的卖点一句话带上,后面能省掉很多来回。

完成基础选项后,它给场景方案。 我这次拿到了四个不同的场景方案,让我手动选。四个方案的差异不是换个背景那么简单,是整片的叙事空间——城市夜景、盘山公路、极简摄影棚、荒漠公路,选哪个基本决定了这支片子的性格。我挑了第三个。

根据选定的场景,生成分镜方案。 这时候有两条路:直接生成,或者点击"修改分镜"。

修改分镜这里设计得挺聪明——它既给你几套系统提供的修改方案让你直接点,也允许你自己输入想法。我当时觉得第三个镜头太空,就提了一句:这个镜头增加一些产品细节的特写。

改完继续生成,它会接着出后半段的分镜方案。 长片是分段推进的,不是一口气全出。每一段出来,你都可以继续改,也可以直接确认。我觉得整体节奏没问题,就直接放行了。

成片验收。 关键点在于:我选的那个场景,和我后来要求补的产品细节特写,都真的出现在了最终成片里。这句话听着平淡,但它意味着这不是一次"祈祷式生成"——你的每一个决定都被兑现了。

5.3 手动模式的真正价值

我把两种模式的差别整理成一张表,方便你对号入座:

维度

全自动模式

手动模式

你要做的事

回答几个问题,然后等

每个关键节点做判断

耗时

短,基本是纯等待

长,取决于你改几轮

成片可控性

低,结果是 Agent 的审美

高,结果是你的审美

适用场景

试方向、练手、批量铺量

商业交付、有明确画面预期

翻车成本

低,不满意重跑一遍

低,但你已经花了时间

我的建议

第一条片子用它

之后全部用它

有意思的是,手动模式并没有让流程变复杂,它只是在原本自动往下跑的路径上,插了几个"停一下"。Agent 该做的脏活还是它做——你只负责在岔路口指个方向。

我自己折腾下来的体会是:能把自己的想法塞进去、控制住创作的方向,才是这套工具最爽的地方。 一键出片当然省事,但省到最后,出来的东西谁都能做,那就没意思了。

5.4 出片之后,继续用嘴改

还有个容易被忽略的环节:成片出来之后的返修。

以前的习惯是把片子下载下来,导进剪辑软件,一帧一帧修。现在这一步也可以留在画布里。画布通常有两套视图,切换着用:

  • 故事板视图:负责创意、镜头、整体节奏。文本、图片、视频分区摆好,锚点、分镜、角色参考和最终成片能集中查看,单个资产可以直接重新生成或者用工具编辑。
  • 节点式工作流视图:负责精细化调整。要定位是哪一段、哪张图出了问题,回到这里最快。

基础的剪辑能力也塞进来了——分割、字幕、选区、转场这些都有,字体、字号、预设样式可以自定义。我实际用下来,做常规调整已经够了,没必要再切出去。

更省事的是,很多修改根本不需要动手。第一版出来我发现 BGM 和旁白音量打架,直接用大白话说了一句"背景音乐压低一点,让旁白清楚些",Agent 就自己去返工了。结尾定格镜头有点拖沓,也是一句话的事。

这里有个很实用的经验:做长流程视频,最有效的做法不是一开始就把每个镜头抠到完美,而是先让 Agent 按 Skill 把完整结构跑通,拿到一版能看的成片,再针对衔接、动作和节奏做定点返修。 一开始就死抠第一镜,等你抠完,后面的节奏可能全不对。


六、Skill 广场里都有什么,以及怎么挑

Skill 广场是这套体系的弹药库。目前积累的优质 Skill 已经超过一百个,覆盖面相当宽。

6.1 主要分类

官方按创作场景做了分类,大致是这么几个方向:

分类

覆盖的内容

典型用途

专业影视

各类导演的电影美学风格

剧情短片、概念片、氛围片

商业广告

高奢感 TVC、喜剧风、动画风

产品广告、品牌片、宣传片

短剧漫剧

女频、男频、手办动画

竖屏短剧、连载漫剧

动漫游戏

各类动画风格、游戏 PV

二次元内容、游戏宣发

音乐 MV

流行 MV、梦核美学等

给一首歌配一支片子

自媒体创作

带货视频、口播、图文转视频

日常内容生产

我随手翻了翻,从欧洲文艺片导演的构图美学,到皮克斯式的动画质感,再到无厘头喜剧,颗粒度比我想象中细。这也是它敢叫"Skill Hub"的底气——一百多个 Skill,等于一百多位随叫随到的专业导演。

6.2 我挑 Skill 的三条标准

翻得多了,我总结出三个判断维度:

第一,先看输出内容清单,别看样片。 样片是挑最好的放上来的,参考价值有限。真正有用的是"输出内容"那一栏——它到底给你人物三视图、场景图、BGM、分镜提示词、完整成片里的哪几样。输出越完整的 Skill,说明它封装的流程越全,你后期要补的活越少。

第二,看适用时长是否匹配。 这一点我吃过亏。有的 Skill 天生是为短平快设计的,你硬要它撑一分钟的剧情,节奏就垮了。反过来,用一个擅长剧情段落的 Skill 去做十五秒的产品展示,会显得又慢又拖。

第三,点开"创作详情"看它的实际画布。 这是最诚实的一栏。样片背后的角色图、场景图、分段视频、BGM、字幕、合成节点全摊在那儿,你能清清楚楚看到这位"导演"的工作方法是不是你想要的。

6.3 进阶:Skill 还能被"外面"调用

这是一个很多人没注意到、但想象空间很大的点。

这套体系其实是同时面向两类使用者设计的:人可以操作,AI 助手也可以操作,两者还能协作。 除了网页端的画布,LibTV 官方还开源了一套面向 AI 助手的技能包,你在账号里生成一个 API 密钥,把开源地址交给你日常在用的那个 AI 助手,它就能调用这边的生图、生视频能力——创建会话、发送创作指令、查询进度、拿回结果,一整套都能跑。

这意味着什么?意味着视频生产可以被塞进你自己的自动化流程里。

举个通用化的场景:你让日常用的 AI 助手在夜里帮你把某个主题的资料整理好,写成脚本,然后直接调用这边的能力做成视频,第二天早上起来直接看结果。整个过程你连网页都不用打开。

代码层面也不复杂,大致就是这个意思:

# 把技能包装进你的项目
npx skills add <开源技能仓库>

# 之后由你的 AI 助手负责:
# 1. 创建会话
# 2. 发送创作指令(自然语言即可,比如"生成一支动漫短片")
# 3. 轮询查询生成进展
# 4. 批量下载最终结果

需要说明的是,这条路对新手来说没必要着急碰。它的价值在于:当你已经把创作流程跑顺了,它能帮你把这条流程接到别的流程上去。 属于第二阶段的事,先把画布玩明白再说。

6.4 一个容易忽略的细节:模型

调用 Skill 生成视频时,通常会默认走某个主力视频模型。如果你想切换成别的模型,一般需要在对话里明确指定。

这套体系把市面上主流的图像和视频模型基本都集成进来了,而且更新非常快——新模型发布没几天,画布里就能选到。对我们创作者来说,最实际的好处是:不用为了一个模型单独注册一个平台、单独充一次值,也不用在几个网页之间来回倒素材。

不过我的建议是,新手前期别折腾模型。 Skill 里默认的模型组合,是设计这套流程的人反复调过的,大概率比你瞎换效果好。等你对成片有了明确的不满意点,再去针对性地换。


七、实操三:从零创建你的个人专属 Skill

前面两节都是用别人整理好的拍法。这一节讲怎么把你自己的方法装进去——这也是我认为整套体系里最有价值的部分。

7.1 什么时候需要自建

答案很简单:当广场里找不到你想要的那种感觉的时候。

一百多个 Skill 听着多,但创作这件事从来不按套路出牌。你可能想复刻某部电影里那种特定年代的画面美学,可能想做一种只有你自己审美体系里才存在的混搭风格,也可能只是有一套自己用惯了的分镜方法,想让 AI 也照着来。这些需求,现成的 Skill 覆盖不了。

我自己是因为想做一种 Q 版动画风格的短片,翻遍广场没找到完全对味的,就动手建了一个。

7.2 创建流程

操作比我想象中简单,整个过程不需要碰任何代码:

第一步:找到创建入口。 在 Agent 对话窗口点击 Skill,再点右上角的创建按钮,进入自定义 Skill 的创建页。

第二步:填名称和简介。 名称要简单介绍它的能力。这里有个很实际的坑:Skill 名称有长度限制,大约十二个字。 所以别用一长串英文名,直接写中文名,短、准、好认,后面在库里调用和查找也方便。

第三步:填 Skill 的具体内容。 这是核心,也是唯一需要花点心思的地方。你可以准备一份结构化的模板,交给 AI 工具按模板填写,生成之后直接复制到内容栏里。填完还可以点右上角,让 AI 再帮你优化一轮。

第四步:填使用场景。 说清楚这套方法适合拍什么。

第五步:填"如何使用"。 也就是这个 Skill 期望用户提供什么。我一般设置成:让用户输入一个故事大纲。

第六步:填输出内容。 明确交付物。比如我希望它最终生成一条三十秒的 Q 版动画视频,那就写清楚。

第七步:保存。 存好之后它会出现在"我的 Skill"里。回到项目画布,点开 Agent 的 Skill 入口,在"我的"分类下就能找到它,选中,点击生成,就开始调用了。

7.3 Skill 内容该怎么写

这是决定专属 Skill 好不好用的关键。我把自己用顺手的结构贴出来,你可以直接拿去改:

# 技能名称:<十二字以内的中文名>

## 一句话定位
这套方法用来拍什么类型、什么气质的片子。

## 视觉风格
- 色彩:主色调、辅助色、饱和度倾向
- 光线:光比、光位、色温、是否要硬阴影
- 质感:胶片颗粒 / 干净数字感 / 手绘 / 3D 渲染
- 构图:常用景别、机位高度、留白习惯

## 叙事规范
- 结构:开场如何抓人、中段如何推进、结尾如何收
- 节奏:平均每镜时长、快慢切换的节点
- 台词:有无对白、有无旁白、语气风格

## 必需素材
用户必须提供:<故事大纲 / 产品图 / 人脸参考 / 音乐 ...>
用户可选提供:<...>

## 执行步骤
1. 先确认:时长、画幅、字幕语言
2. 生成风格基调图,等待用户确认
3. 生成角色三视图 / 场景影调图,每项给出多个方案供选择
4. 写入锚点清单与分镜表
5. 分段生成视频
6. 生成 BGM 与字幕
7. 合成输出

## 交付物
- 角色设定图
- 场景图
- 分镜表
- 背景音乐
- 最终成片:<时长>、<分辨率>、<画幅>

## 禁止项
明确写出这套风格里绝不能出现的东西。

最后那个"禁止项"是我后来加的,效果出奇地好。告诉 AI 不要什么,往往比告诉它要什么更有效——因为"要什么"它可以有一百种理解,"不要什么"只有一种。

7.4 实测效果

Skill 建好,当然得拉出来遛遛。

我直接调用自己做的这个,选中它,把剧情、比例、时长和风格一次性写清楚,然后让它跑。出来的片子,风格是我想要的那个风格,节奏是我定的那个节奏。

那一刻的感受挺微妙的:以后我再想做这类短片,不需要每次重新写提示词,不需要重新搭一遍流程,直接调用就行。这条已经跑通的工作流被存下来了,变成了一个可以反复调用的东西。

说白了,你拥有的不再是一堆散落的提示词,而是一个属于你自己的方法库。

7.5 顺手的两个进阶玩法

一是把对话过程直接转成 Skill。 有时候你不是先设计好方法再去拍,而是拍着拍着摸出了一套好用的路子。这时候可以把这段对话过程直接沉淀成一个 Skill,下次复用。

二是把 Agent 分析视频的能力用起来。 你在网上刷到一支很有创意的片子,想用 AI 仿着拍,可以让 Agent 去分析这条视频,提炼成一套新的方法。当然,这里要提醒一句:参考风格和照搬他人作品是两回事,学的是手法,不是内容,这条线自己心里得有数。

辛梓煜@词元2号站 这里补一句实践心得:自建 Skill 最好的时机,不是你刚上手的时候,而是你已经用现成 Skill 跑过三五条片子、清楚地知道自己"不满意什么"的时候。带着具体的不满意去写规范,比凭空想象要准得多。


八、锚点与分镜:长视频不崩的真正关键

这一节稍微硬一点,但我认为是全文最有价值的部分。因为前面所有的操作,成败都取决于这两样东西。

8.1 什么是锚点

锚点,就是在整条片子里必须保持一致、不能漂移的那些东西。

具体来说,就是主角的脸和造型、每个场景的影调、关键道具的样子。Agent 在正式生成视频之前,会先把这些东西钉死:给主角出几套造型让你选,选定之后生成三视图(正面、侧面、背面),这张三视图就成了后续所有镜头里这个人的"身份证"。场景也一样,先出影调图,定死这个空间的灯光色温和质感。

然后它会把这些写成一份锚点清单,记录每个主体对应的资产节点,存进画布。

这一步为什么重要?因为长视频崩掉,九成不是崩在画质上,是崩在一致性上。 第一镜的女主是齐耳短发灰毛衣,第五镜变成了长发白衬衫——观众立刻出戏。锚点机制的作用,就是在生成任何视频之前,先把这些容易漂的东西钉住。

我见过的反面案例,都是急着看效果,跳过资产确认直接冲视频生成,跑到第三镜发现人脸不对,只能推倒重来。在锚点上省的每一分钟,后面都要用十分钟还。

8.2 什么是分镜表

分镜表就是一张表格,把整条片子拆成一个个镜头,每一镜写清楚:编号、时长、内容、景别、引用哪些资产。

举个通用化的例子,一支四十秒左右的情绪短片,分镜表大概长这样:

镜号

时长

内容

景别

引用锚点

S1

5s

深夜办公室,主角对着屏幕出神

中景

主角、办公室

S2

4s

手机屏幕亮起,来电显示

特写

手机界面

S3

4s

手指悬停,按下挂断

大特写

主角

S4

5s

主角起身,关灯,离开工位

全景

办公室

S5

5s

走廊尽头的应急灯

空镜

走廊

S6

5s

楼下街边,回拨电话

中景

主角、街道

S7

4s

听筒里的忙音,无人接听

特写

主角

S8

4s

抬头,望向亮着灯的窗

近景

主角

S9

4s

手机震动,一条语音消息

特写

手机界面

有了这张表,Agent 才知道每一镜要生成什么、用哪张参考图、切多长。没有这张表,它就只能一镜一镜地猜。

比较讲究的做法是,Agent 会先从剧情里提取几个叙事节拍,再把节拍拆成具体的镜头。节拍是情绪的骨架,镜头是骨架上的肉——先有骨架,肉才不会长歪。

8.3 镜头数量和时长的换算

这里涉及一个很实际的计算。你定了总时长,模型单段生成的时长有上限,那需要几个镜头?

设总时长为 (T),单段视频的平均时长为 (t),那么需要的镜头数:

[

n = \left\lceil \frac{T}{t} \right\rceil

]

比如你要一支 45 秒的片子,模型单段舒服的区间是 15 秒,那就是 3 段。要一支 40 秒的情绪短片,希望节奏碎一点,平均每镜 4 到 5 秒,那就是 8 到 10 个镜头。

镜头数量直接决定了两件事:生成成本节奏感。镜头越多,节奏越碎越紧张,但每一镜的信息量就得压缩;镜头越少,每镜越长,越舒缓,但对单段画面的稳定性要求就越高。

我的经验值,供参考:

片型

总时长

建议平均单镜时长

大致镜头数

产品特写广告

15s

2–3s

5–8

品牌 TVC

30s

3–4s

8–10

情绪短片

40–45s

4–5s

8–10

剧情段落

45–60s

5–8s

6–10

MV

60s+

3–5s

12–20

8.4 一个真实的坑:时长设定和剧情打架

这个坑我踩得挺狠,专门拿出来说。

我在自建的 Skill 里,把单镜时长限死在了 8 到 15 秒。结果实际跑起来,剧情里有些台词和过渡撑不满这个长度,Agent 就自动帮我剪掉了一些内容——它为了满足我定的规则,牺牲了叙事的完整性。

发现问题之后,我又根据叙事节奏,让 Agent 重新调整了每个片段的时长,最后拿到了一版节奏正常的成片。

教训是:Skill 里的硬性参数要留余地。 你以为你在给它定规矩,实际上你可能是在给它下达"必须删内容"的指令。时长这类参数,写成区间比写成定值好,写成"建议"比写成"必须"好。

8.5 分批生成的小技巧

镜头多的时候,Agent 通常不会一口气全跑,而是分批。比如九个镜头,先并行生成前五镜,全部完成后再自动接着生成后四镜。

这个设计对我们是有好处的:前五镜出来,你就能判断整体方向对不对。如果方向错了,及时喊停,只损失五镜的时间,而不是九镜。

所以我养成了一个习惯:第一批出来,一定认真看,别嫌麻烦。这是整个流程里性价比最高的一次质检。


九、我踩过的坑,和一些实用建议

前面讲的都是流程该怎么跑。这一节讲的是流程之外,那些没人告诉你、只能自己撞出来的东西。

9.1 别在第一镜上死抠

这条我在第五节提过,但值得单独拎出来再说一遍,因为它是新手最容易犯的错。

拿到 Skill,跑出第一镜,觉得光影差一点,改;改完觉得构图差一点,再改;改了七八轮,第一镜终于完美了,然后你发现自己已经耗了一个小时,后面还有八镜。更糟的是,等你把整条片子跑完,回头一看,那个被你抠到完美的第一镜,跟整体节奏根本不搭。

正确的顺序是:结构先跑通,细节后返修。 先拿到一版完整的、能从头看到尾的成片,哪怕每一镜都只有七十分。然后你才知道该抠哪儿——通常你会发现,真正需要改的只有两三镜,而不是九镜。

9.2 故事永远不要外包

Agent 能写故事,写得也不算差。但你要清楚一件事:它写出来的东西,是它对"这类题材通常怎么写"的理解,是均值,不是你。

我的做法是:故事大纲自己写,剩下的全外包。 哪怕只写三行字——什么人、在什么处境、发生了什么转折——都比让它自由发挥要好。因为片子的独特性只可能来自故事,来自那个只有你想得到的细节。视觉风格 Skill 能给你,节奏 Agent 能给你,唯独"这个故事只有我会讲"这件事,给不了。

9.3 元素选择:少即是多

选核心场景元素的时候,很多人恨不得全勾上,觉得元素越多画面越丰富。实际结果是反的。

元素本质上是给风格加权重的。你勾三个,每个权重三成多;你勾八个,每个权重一成多——最后哪个都不突出,风格就糊了。

我的规矩是最多三个,而且这三个要互相加强,不能互相打架。 比如"麦田+逆光+长焦"是互相加强的,出来就是那个味儿;"麦田+霓虹+赛博"是互相打架的,Agent 只能和稀泥。

9.4 用大白话提修改意见就够了

不用学什么提示词技巧。我试过一本正经地写"请将背景音乐的音量降低约 30%,提升人声轨的清晰度和存在感",也试过直接说"背景音乐太吵了,压低点",效果没差别。

Agent 的强项就是理解人话。你反而应该省下写提示词的力气,多花在判断"哪里不对"上——说出问题比描述方案更重要。 你说"结尾有点拖",它知道该怎么处理;你非要说"把最后一个镜头裁掉 1.5 秒并添加淡出转场",反而限制了它更好的解法。

9.5 名称和文件的小细节

  • 自定义 Skill 的名称写中文,十二字以内,别用长英文名,会写不下。
  • 锚点清单和分镜表是会真的写成文件存进画布的,跑完一个项目,翻回去看这两份文件,比看成片更能帮你复盘。
  • 项目跑完,把故事板和工作流两个视图都切一遍。故事板帮你看整体,工作流帮你定位问题,两个视图看同一件事,视角完全不同。

9.6 参考图这件事,给不给、给几张

有的 Skill 允许你上传参考图——人脸参考、造型参考、产品图、风格参考。到底给不给?

我的经验分两种情况。

做商业内容,产品图必须给。 产品是不能被"创作"的,一辆车的进气格栅长什么样、一个瓶子的比例是多少,模型自由发挥的结果基本都不能用。给了参考图,Agent 会先生成产品的三视图和细节图,再基于这些去排分镜,成片里的产品才立得住。

做剧情内容,人脸参考可以不给。 我做过对比:给人脸参考,主角长得像你给的那个人,但你要额外承担一个风险——这张脸未必适合这个故事的气质。不给,让 Agent 根据剧本自己设计角色,它通常会先出几套造型方案让你挑,挑完再生成三视图。这个过程反而更贴合剧本。

还有个细节容易忽略:参考图的格式会影响效果。 有些排版形式(比如把多个角度拼成一张九宫格)在某些流程里不一定被默认识别成参考。拿不准的时候,规规矩矩上传单张清晰的图,比自作聪明地拼图靠谱。

9.7 关于"参考"和"照搬"的分寸

这一条不是技术问题,但我觉得比技术问题更重要。

现在的工具能力很强,强到你可以让它分析一支现成的片子,提炼出方法再复现。这带来一个很现实的分寸问题:学手法和抄作品,中间那条线在哪儿?

我自己的标准是这样的:

  • 可以学的:视觉手法(用什么光、什么构图、什么色调)、叙事节奏(几秒一个转折)、类型规律(这类片子通常怎么开场)。这些是行业公共知识,谁都可以用。
  • 不该碰的:具体的角色形象、完整的故事情节、有辨识度的原创设计、别人作品里的独特桥段。这些是别人的成果。

说得再直白点:你学的应该是"怎么拍",不是"拍什么"。一支片子的调性可以被借鉴一万次,但故事只属于写它的人。工具越强,这条线越需要自己心里有数——因为工具不会替你把关。

9.8 一份新手上手的顺序建议

如果你是第一次碰这套东西,我建议按这个顺序走,能少走很多弯路:

阶段

做什么

目的

第一条

随便挑个 Skill,全自动,15 秒

走通全链路,知道流程长啥样

第二条

同一个 Skill,手动模式

感受每个确认点在决定什么

第三条

换一个风格差异大的 Skill

建立"Skill 决定调性"的直觉

第四条

自己写故事大纲,手动模式

第一次真正做属于自己的内容

第五条

建一个自己的 Skill

把前四条的经验沉淀下来

到第五条,你基本就有自己的方法库了。

这个顺序里藏着一个我自己总结的规律:先别急着追求好,先追求"完整"。 很多人卡在第一条就放弃了,原因往往是一上来就想做一支惊艳的片子,结果在细节里越陷越深,最后连一条完整的成片都没拿到手,只留下一堆半成品和挫败感。而如果你第一条就用最省事的方式跑完全程,哪怕成片平平无奇,你也已经拿到了最宝贵的东西——对整条链路的手感。有了手感,后面每一步的取舍你都会心里有数。


十、Skill 真正改变了什么

写到这儿,回头看,我觉得有必要跳出操作层面聊两句。

Skill 功能解决的,从来不是"一键生成视频"这么简单的事。它把原本零散在十几个环节里的剧本、人物、场景、分镜、视频生成和后期合成,整合成了一套可以直接调用、并且可以反复调用的创作流程。

这三种用法,其实对应三种人:

  • 想快速出片,用自动模式,五分钟拿一条能发的片子;
  • 想加入自己的想法,用手动模式,在每个岔路口指方向;
  • 想形成属于自己的风格,建一个专属 Skill,把方法固化下来。

而它们背后是同一件事:创作的重心,从"怎么把它做出来"挪回了"要做什么"。

以前我们做 AI 视频,大量时间花在提示词、节点连线和各种技术问题上。真正属于创意的部分,被这些琐事挤到了角落。现在这些琐事被工具吃掉了,我们可以把更多精力放回故事和内容本身——这才是我觉得最有价值的地方。

顺带说一句我的一点观察:Skill 这个东西,长期看是会增值的。你怎么选、怎么改、怎么用,都会慢慢沉淀成你的偏好,让工具越来越懂你的审美。而当越来越多创作者把自己的经验写成 Skill 发布出来,这个方法库会越来越厚——这有点像开源社区的逻辑,只不过共享的不是代码,是拍法。

至于工具本身,就是前面一直在用的 LibTV,LiblibAI 出品,官网在 www.liblib.tv,感兴趣可以自己去跑一条试试。这套东西的学习曲线比想象中平,第一条片子基本半小时内能出来。

最后回到最开始那个问题:15 秒这道坎过去了吗?

我觉得过去了,但过去的方式跟大家预想的不太一样——不是某个模型突然能一口气生成一分钟,而是有人把这一分钟拆成了可管理的结构:锚点钉住一致性,分镜表管住节奏,Agent 负责调度,Skill 负责方法。技术难题被工程化的方式绕过去了。

这可能就是这个阶段最真实的状态:模型决定下限,方法决定上限。 而 Skill,就是把方法变成资产的那把钥匙。

你准备好搭建自己的 Skill 创作流程了吗?


个人学习实践总结声明

本文是我个人在学习与实践过程中的整理和总结,所有操作步骤、参数经验和判断结论均来自我自己的动手体验,仅代表个人观点,供交流参考。文中涉及的产品功能与界面可能随版本更新发生变化,请以你实际使用时的界面为准。

转载请注明出处。

作者:辛梓煜 | 词元2号站 www.ciyuanerhao.com

 
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布4 篇
文章总数106 篇
昨日发布3 篇
本月发布14 篇
建站时间37 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码