📍 词元二号站 AI自媒体 AI 视频 Agent 与 Skill 全流程实操指南:从一句话到成片,把剧本、分镜、生成、剪辑压进同一条工作流

AI 视频 Agent 与 Skill 全流程实操指南:从一句话到成片,把剧本、分镜、生成、剪辑压进同一条工作流

摘要:一篇讲透 LibTV(LiblibAI 旗下 AI 视频创作产品)Agent 与 Skill 的实操长文:拆解画布、节点、Agent、Skill 四个核心概念,完整演示全自动与手动两种模式的操作流程,详解锚点清单与分镜表这两个长视频不崩的关键机制,并手把手教你从零创建个人专属 Skill,附赠可直接套用的 Skill 内容模板、镜头时长换算方法与十条踩坑经验。
字号 100%
行距 2.05
当前可见 30% 的内容
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

如果你只想要一个结论:AI 视频创作现在的分水岭,已经不是"哪个模型画得好看",而是"谁能把一整套拍法封装成可以反复调用的流程"。本文以 LiblibAI 旗下的 AI 视频创作产品 LibTV(www.liblib.tv)为例,把这条流程从头到尾拆一遍。所谓 Skill,本质上就是一份写给 AI 的拍摄方法说明书——它把风格定义、素材清单、分镜规范、输出标准全部固化下来,你选中它,Agent 就按这套规矩往下跑,从故事大纲、角色三视图、场景图、分镜表,一直做到多段视频、背景音乐、字幕和最终合成。它真正解决的不是"一键生成"这四个字,而是把过去分散在十几个工具、几十轮抽卡里的重复劳动,收进了同一块画布。全自动模式适合快速出片,手动模式适合把自己的想法塞进每一个环节,而当现成 Skill 满足不了你的风格时,你可以自己建一个——填名称、写简介、说清任务、执行方式和输出内容,五分钟就能拥有一位听你话的专属 AI 导演。

这篇文章我会把整条链路拆开讲透:概念是什么、Agent 在画布里到底做了哪几步、全自动和手动分别怎么操作、Skill 广场怎么挑、专属 Skill 怎么从零搭出来、锚点和分镜为什么是长视频不崩的关键,以及我自己折腾下来踩过的那些坑。

想看完整拆解,往下翻。


一、15 秒这道坎,到底卡住了什么

玩过 AI 视频的人,大概都对"15 秒"这个数字有心理阴影。

不是模型不行。单段画面的质感这两年进步得非常凶,随便挑个主流模型,出一段光影漂亮、运镜利落的片段并不难。难的是第 16 秒。你要让第二段的人脸和第一段是同一张脸,衣服是同一件衣服,房间的灯光色温不能突然从冷白跳到暖黄,镜头的情绪还得接得上。这些事,模型本身不负责。

于是过去的做法是这样的:先在一个工具里写剧本,再换一个工具生成人物参考图,还要单独做场景参考图,然后回到视频工具里一个节点一个节点地连线,把参考图喂进去,逐段生成,逐段抽卡。抽到满意的,下载下来,导进剪辑软件,配字幕、配音乐、切节奏。中间任何一步不满意,就得往回倒。

我自己最狼狈的一次,是同时开了六七个标签页,脚本还没写完,浏览器先卡了。那种感觉不是"创作受阻",是"行政工作太多"——真正属于创意的部分可能只占两成,剩下八成全是搬运、连线、复制粘贴、等待。

1.1 问题的根不在模型,在流程

把这件事拆细一点会更清楚。做一支有剧情、有镜头、有节奏的完整短片,中间至少要经过这么几层:

  • 创意层:主题、故事大纲、情绪基调、视觉风格;
  • 资产层:角色形象、服装造型、场景影调、道具、背景音乐;
  • 结构层:分镜表、每一镜的时长、景别、机位、台词;
  • 生成层:逐段出画面,逐段校验一致性;
  • 后期层:剪辑、转场、字幕、混音、合成。

传统工具的分工是:模型只管"生成层"那一格。剩下四层,全是人肉在跑。而人肉跑这四层最大的成本,不是脑力,是上下文的反复搬运——你在 A 工具里定好的风格,到了 B 工具要重新用提示词描述一遍;你在 C 工具里选定的人脸,到了 D 工具要重新上传一遍。

信息每搬一次家,就漂一次。漂到最后,成片就散了。

1.2 Agent 进画布,改的是什么

真正的变化,是 Agent 被塞进了画布本身。

以前的画布是给人用的:你自己创建节点,自己连线,自己填提示词。现在画布右侧直接挂一个对话框,你用大白话说需求,节点的创建、连线、参数填写、资产调用、最终合成,全部由 Agent 在同一块画布上接着做。你从"操作员"变成了"发号施令的人"。

我第一次遇到这种交互的时候,其实是懵的。习惯性地想去画布上找"新建节点"的按钮,找了半天没找着,反应过来:不用找了,直接说就行。说完之后眼睁睁看着画布上自己长出一堆节点、自己连上线、自己开始跑——那种感觉挺难形容的,像是从"自己搬砖"变成了"站在旁边看施工队干活",而你要做的只是在关键的地方指一句"这堵墙往左挪半米"。

这个转变听起来像是省了几次点击,其实省掉的是整个上下文搬运的过程。所有资产都躺在同一张画布上,Agent 随时能引用,风格自然就不容易漂。这也是我认为这一波更新里最有价值的一点——它不是给你多加了一个功能按钮,是把工作台整个换了。


二、先把黑话翻译成人话:画布、节点、Agent、Skill

新手最容易在这几个词上卡住,我用最白的话过一遍。

在开始之前,先把主角交代清楚,免得后面读着犯迷糊:本文实操用的工具叫 LibTV,是 LiblibAI(哩布哩布) 在 2026 年 3 月推出的 AI 视频创作产品,官网 www.liblib.tv。LiblibAI 这个名字,玩过 AI 绘画的人应该都不陌生,它早年是国内做得比较大的模型社区,后来把能力延伸到了视频这一侧。LibTV 就是这条线上的产物——一块无限画布,加一个能干活的 Agent,再加一套 Skill 体系。

下面所有的概念和操作,都以 LibTV 为例。但要说明的是,这套"画布+Agent+Skill"的思路并不是它独有的,同类产品也在往这个方向走。所以你真正要理解的是这套方法论本身,工具只是载体——看懂了逻辑,换个平台你照样能上手。

2.1 画布(Canvas)

画布就是一张无限大的白纸,你所有的素材和生成结果都摆在上面。 它跟传统剪辑软件的时间轴不一样,时间轴是一条线,画布是一个平面——你可以把人物图放左上角,场景图放右上角,分镜表贴中间,视频片段排下面,彼此之间用线连起来表示"谁引用了谁"。

用过节点式创作工具的人会秒懂;没用过也不用怕,因为现在你可以完全不碰它,让 Agent 去画。

2.2 节点(Node)

节点就是画布上的一个个小方块,每一个方块代表一份素材或者一次生成动作。 常见的节点类型有文本、图片、视频、音频、脚本几种。一个"图生视频"的节点,往上连着一张参考图,往下吐出一段视频,逻辑关系一眼可见。

节点最大的好处是可追溯。哪一镜出了问题,你不用把整条片子重跑,找到对应的节点,单独重生成就行。

2.3 Agent(智能体)

Agent 就是画布右边那个会干活的对话框。 它跟普通聊天机器人的区别在于:普通机器人只会说,Agent 会动手。你说"帮我做一支复古风格的青春短片",它不会给你回一段文案,它会真的去创建节点、生成图、调模型、合成视频。

更关键的是它会反问。任务信息不全的时候,它不会硬着头皮瞎猜,而是停下来问你:多长?什么画幅?哪种语言的字幕?要不要旁白?我第一次用的时候还挺不适应,因为习惯了 AI 工具"你给什么它做什么",突然被反问,反倒觉得踏实——它是真的在对齐需求,而不是在赌概率。

2.4 Skill(技能)

这是整篇文章的核心。

Skill 就是一份写给 Agent 看的"拍法说明书"。 它里面写清楚了:这种风格的片子长什么样、需要准备哪些素材、分镜按什么节奏排、画面用什么影调、最后交付什么格式。你选中一个 Skill,等于给这次创作请了一位有明确方法论的导演。

打个比方可能更好懂:模型是摄影机,Agent 是能听懂人话的执行团队,而 Skill 是导演手里的那本分镜脚本加拍摄规范。同样一台摄影机,交给不同的导演,出来的东西天差地别——差的就是这本规范。

概念

白话解释

类比

你需要动手吗

画布

摆放所有素材和结果的无限白纸

剧组的置景棚

可以不碰

节点

画布上的单个素材或生成动作

一个镜头的原始素材

需要精修时才碰

Agent

会真的动手干活的对话框

执行导演+剪辑师

只需要说话

Skill

封装好的一整套拍法与规范

导演的分镜脚本+风格手册

选一个,或自己写

模型

底层负责出画面的引擎

摄影机

一般由 Agent 自动选

辛梓煜@词元2号站 在这里多提醒一句:很多人一上来就纠结"该用哪个模型",其实在这套体系下,模型的选择权大部分时候可以交给 Agent。你真正要花心思的是 Skill 的挑选和定制,那才是决定成片调性的地方。


三、Skill 的运行逻辑:一套被封装起来的方法论

搞清楚 Skill 里到底装了什么,你才知道为什么它能扛住长片。

3.1 一个 Skill 的详情页里有什么

正经的 Skill,详情页会把这几件事写明白:

  • 风格介绍:这套拍法追求什么样的视觉与叙事气质;
  • 适用时长:它擅长的片长区间,有的擅长 15 秒短平快,有的能撑到几十秒的剧情段落;
  • 使用场景:适合拍什么题材,不适合拍什么;
  • 需要的素材:要不要你提供产品图、人脸参考、音乐;
  • 输出内容:最后交付人物三视图、场景图、分镜提示词、BGM、完整成片中的哪几样。

有的 Skill 还带一个"创作详情"入口,点进去能看到官方样片背后的完整画布——角色图、场景图、分段视频、BGM、字幕、合成节点全都摊开给你看。这个功能我强烈建议每次调用前都点一下,因为它等于让你在下单前先看清楚这位导演的工作方式。

3.2 Agent 拿到 Skill 之后,实际跑了哪几步

不管是哪种题材,跑起来的骨架基本是一致的:

用户意图(一句话 / 一段大纲 / 一张参考图)
        ↓
Agent 反问补全(时长 / 模式 / 画幅 / 语言 / 核心元素 / 大纲来源)
        ↓
风格基调锚定(moodboard,定死整片的色彩与影调)
        ↓
资产层生成(角色三视图 → 服装造型 → 场景影调图 → 道具)
        ↓
结构层落盘(锚点清单 + 分镜表,写成文件存进画布)
        ↓
分段视频生成(按分镜表逐镜或并行出画)
        ↓
音频层(BGM / 旁白 / 对白)
        ↓
合成节点(拼接 + 转场 + 字幕 → 成片)

用流程图看会更直观:

graph TD
    A[一句话需求] --> B{信息够吗}
    B -- 不够 --> C[Agent 反问补全]
    C --> D[生成风格基调图]
    B -- 够 --> D
    D --> E[角色三视图 / 场景影调图]
    E --> F[锚点清单]
    E --> G[分镜表]
    F --> H[分段视频生成]
    G --> H
    H --> I{效果满意吗}
    I -- 否 --> J[定点返修单个节点]
    J --> H
    I -- 是 --> K[BGM + 字幕]
    K --> L[合成节点输出成片]

注意 F 和 G 那两个框——锚点清单分镜表。这是整套机制里最容易被忽略、但恰恰最要命的两样东西,我在第八节会专门展开讲。

3.3 为什么 Skill 不是"一段更长的提示词"

这一点我特意想澄清一下,因为很多人第一反应是:"这不就是把提示词写长一点存起来吗?"

不是。差别在三个地方:

第一,Skill 是带流程的。提示词是一次性的输入,Skill 是一条有先后顺序、有分支判断的执行路径——先定基调,再出资产,资产确认后才动视频,顺序错了效果就散。

第二,Skill 是带交互点的。它规定了哪些环节必须停下来等你确认。角色造型给你四套让你选,场景影调给你四张让你挑,这些"停顿"是写在方法论里的,不是随机的。

第三,Skill 是长在具体框架里的。它要由 Agent 来理解意图、选择模型、调度工具。同样一份 Skill 文本复制到另一套系统里,离开了原来的模型组合和调度方式,也很难复现出一样的结果。所以它更像一套"方法+环境"的组合,而不是一段可以随便搬走的文本。

3.4 顺便说说:为什么视频 Agent 这么难做

聊到这儿,可以回答一个很多人心里的疑问:文字类的 Agent 早就遍地都是了,为什么视频 Agent 拖到现在才有像样的东西?

我的理解是,卡点在于"交付"这两个字的门槛太高。

写文章的 Agent,输出一段文字,好不好你一眼就能判断,不满意重写的成本几乎为零。视频不一样。一支片子要算"能交付",至少得同时满足两个条件:

一是结构完整。 它得是一支可以直接放到内容平台上被消费的作品——该有的片头片尾、字幕、音乐都在,音画同步,不需要再进任何后期软件就能发出去。缺一样,它就只是"素材",不是"作品"。

二是过程可控。 观众不会因为你是 AI 做的就降低标准。人脸漂了、影调跳了、节奏散了,一样出戏。而这些问题,恰恰是链路越长越容易出。

这两个条件叠在一起,意味着视频 Agent 不能只做"生成"这一格,它必须把创意、资产、结构、生成、后期五层全部串起来,还得在每一层都不掉链子。链路上任何一个环节偷懒,最后交付的都不是成片。

想明白这一点,你就理解了为什么锚点、分镜表、合成节点这些看起来很"工程"的东西会被摆在这么重要的位置——它们不是花架子,是把一条长链路撑住的骨头。

3.5 三种角色,谁负责什么

我用一张表把整套体系里的分工再捋一遍,看懂这张表,后面的所有操作都会变得很自然:

层级

谁负责

具体做什么

出问题的表现

意图层

提供故事、判断方向、拍板选择

片子平庸、没有个人特点

方法层

Skill

规定风格、流程、交付标准

风格不统一、节奏乱

调度层

Agent

理解意图、选模型、建节点、跑流程

步骤跳步、一致性崩

执行层

模型

出画面、出声音

画质差、物理不合理

看这张表最大的价值在于:当片子不

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 30% 内容 · 升级至 注册用户 可见 40%
👀
游客
可见 30%
✓ 当前
注册用户
注册用户
可见 40%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数136 篇
昨日发布0 篇
本月发布2 篇
建站时间84 天
🔍 搜索
📅 日历
« 2026 » « 09 »
 123456
78910111213
14151617181920
21222324252627
282930    
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码