本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
用 AI Agent 串联多个工具,从选题、分镜、生图、动画、配音到最终合成,可以在 40-60 分钟内做出一条 90 秒的纸拼贴风格科普动画——全程不需要手动打开任何设计软件,也不需要写一行传统意义上的代码。这套工作流的核心思路是「分层解耦」:把动画制作拆成编导、视觉、运动、声音、合成五个独立层级,每个层级保留中间产物、可以单独替换模型、单独重做。跑通这套流程的关键不是某个单一工具有多强,而是让 AI Agent 扮演「项目导演」的角色——它负责调度每个环节、传递规格文件、检查输出质量。本文会把这套五层工作流从头拆到尾,包括具体的工具选型、每一步的验收标准,以及我自己实操中踩过的各种坑。
想看完整拆解,往下翻。
开始之前,先聊聊背景。
2026 年有一个很明显的趋势:AI 能力正在从「单点工具」走向「Agent 编排」。以前我们聊 AI,说的是「这个模型能生图」「那个模型能做视频」;现在聊的是「我让 Agent 自己把选题、脚本、画面、配音、字幕全跑完了,我在旁边喝茶等成片」。
听起来是不是像科幻?其实已经可以做到了。我自己折腾了几个月,陆陆续续把市面上主流的 AI Agent 工具和各种免费模型都试了一圈,最后沉淀下来一套做科普动画的工作流。这篇文章就是这套流程的完整记录。
我说的「科普动画」,不是那种套模板、加字幕就算完事的东西。我说的是 Vox 风格——你如果看过国外的一些高质量科普频道,应该对那种「纯色背景 + 黑白半调人物 + 彩色卡纸剪贴 + 纸片滑入弹出」的画面有印象。它的辨识度极高,而且特别适合解释抽象概念。传统做法里,做一条 90 秒的这种动画,从分镜、设计素材、逐帧动画到配音字幕,一个熟练的设计师可能要花两三天。但用 AI Agent 编排之后,整条流程被压缩到了一个小时以内。
下面,我会从这种风格的特点讲起,然后一层一层拆解整个系统的结构。
一、纸拼贴风格到底是什么,为什么它突然火了
先把这个风格的几个核心特征讲清楚,不然后面聊具体操作的时候你可能会觉得「干嘛要这么麻烦」。
它长什么样?
纸拼贴动画——英文圈叫 Paper Collage Animation,国内也有人叫「贴纸动画」——在科普和知识讲解领域已经流行了快十年。它最典型的视觉配方是:
- 纯色色场做背景:通常是深蓝、深紫、墨绿这类饱和度高的暗色,很少用白色或浅色底。
- 黑白半调人物:人物不是写实的,是类似报纸印刷那种网点半调(halftone)效果,只有黑白灰,没有肤色。
- 彩色卡纸剪贴:核心信息用高饱和度的红、黄、青绿等色块来承载,模拟从彩色纸上剪下来的感觉。
- 明显的剪贴边缘和阴影:每一块「纸片」都有描边和轻微的投影,强化「拼贴」的质感。
- 固定机位、纸片滑入:镜头基本不动,画面变化靠纸片滑入、弹出、组装来完成,而不是运镜。
如果你看过国外一些知名科普媒体的视频,对这个风格一定不陌生。它在解释「处置效应」「机会成本」「博弈论」这类抽象概念时特别有优势——因为画面是高度符号化的,观众不会被无关细节分散注意力。
为什么传统做法又慢又贵
做一条 90 秒纸拼贴动画,传统流程大概长这样:
|
步骤 |
做什么 |
耗时(估算) |
|
选题与文案 |
确定主题,写脚本,反复修改 |
2-4 小时 |
|
分镜设计 |
把脚本拆成镜头,画草图 |
1-2 小时 |
|
素材绘制 |
用 Illustrator 画卡纸、人物、装饰元素 |
4-8 小时 |
|
动画制作 |
用 After Effects 做纸片滑入、弹出动画 |
6-12 小时 |
|
配音录制 |
进棚或在家录旁白,修音 |
1-3 小时 |
|
合成输出 |
音画对齐、加字幕、导出 |
1-2 小时 |
一条 90 秒的成片,前前后后可能要耗费一个设计师 15 到 30 个小时。而且中间任何一个环节翻车——比如动画做到一半发现分镜逻辑有问题——返工成本非常高。
AI 为什么特别适配这种风格
有趣的是,纸拼贴风格恰恰是当前 AI 模型最容易驾驭的动画类型之一。原因有三:
第一,镜头之间相对独立。不像真人短剧需要维持人物长相、服装、场景的长期一致性,纸拼贴动画每镜就是一个独立的视觉舞台。镜头 1 翻车了,只重做镜头 1,不会连累其他 9 个镜头。
第二,动作类型有限。纸拼贴动画的动作模式就那么几种:滑入、弹出、翻转、缩放、组装。对 AI 视频模型来说,这比「一个人从走到跑再到跳同时背景还要变化」容易得多。
第三,视觉风格高度的规则化。纯色背景、黑白人物、彩色卡纸——这些规则一旦定下来,AI 比人类更容易严格遵守(前提是你给对了 prompt 和约束条件)。
后面你会看到,正是因为这三个特点,整条 AI 工作流才会跑得这么顺。
辛梓煜@词元二号站:我自己刚开始尝试的时候也怀疑过——AI 真的能替代一个熟练的 AE 动画师吗?后来发现这个问题本身就问错了。AI 不是在「替代」,而是在把制作的门槛从「专业设计师」降到「只要你会描述你想要什么」。
二、AI Agent 如何改变了动画制作的底层逻辑
要理解这套工作流为什么厉害,得先搞清楚一个概念:AI Agent 到底是什么,以及它和「用 AI 工具」有什么区别。
从「手动串联」到「Agent 编排」
用一张对比表格说清楚:
|
维度 |
传统 AI 工具用法 |
AI Agent 编排用法 |
|
操作方式 |
打开 A 工具生图 → 下载 → 上传到 B 工具做视频 → 下载 → 导入 C 工具配音 → 手动合成 |
对着 Agent 说一句话,它自动调用各个工具,传递中间文件,最后给你成片 |
|
中间产物 |
你手动管理,容易丢失、版本混乱 |
Agent 自动保存每一层的产物,结构化命名 |
|
翻车处理 |
某个环节出错,往往要从头重跑 |
只重做翻车的那一个镜头,其他不动 |
|
工具替换 |
换工具意味着重新熟悉界面、改工作习惯 |
Agent 改一下配置或 skill,其它流程不变 |
|
可复制性 |
依赖操作者的记忆和经验 |
流程被固化在 skill 文件里,别人也能用 |
这个区别很大。我用一个具体的例子来说明:
假设你要做一个讲「处置效应」的科普动画。传统 AI 用法的流程是:你先打开 ChatGPT 写脚本 → 复制脚本到 Midjourney 生图,一张一张调 prompt → 下载图片,上传到 Runway 做视频 → 再打开 ElevenLabs 做配音 → 最后导入剪映合成。
每一步都是你手动在做「连接」。你扮演的是人肉 API。
而 Agent 编排的流程是:你告诉 Codex「用横屏纸拼贴动画讲清楚处置效应」,然后等 40 分钟,它给你一个带配音和字幕的完整 MP4。
这中间的差距,不是「AI 更强了」,而是编排逻辑变了。Agent 不是替你「做」每一步,而是替你「管」整个流程。
Codex 在这套架构里扮演什么角色
2026 年市面上能用的 AI Agent 工具有好几个——Codex(OpenAI 出品)、Claude Code、还有一些国内的方案。本文以 Codex 为主线来讲,因为它对 skill 生态的支持目前最成熟。
在纸拼贴动画这个场景里,Codex 做的是「项目导演」的工作:
- 任务拆解:把「做一条动画」拆成五个阶段,每个阶段产出什么、依赖什么、验收标准是什么。
- 工具调度:该生图的时候调 GPT Image 2,该做视频的时候调视频模型,该配音的时候调 TTS。
- 文件管理:每一层的产出(分镜 JSON、静帧 PNG、单镜 MP4、旁白 WAV)都结构化管理,方便后续替换。
- 质量把关:在关键节点设置「闸门」,先展示中间结果,你确认了再继续,避免一条路跑到黑。
用一张流程图来直观感受一下:
flowchart TD
A["你:给一个主题"] --> B["Agent:分析主题,生成选题方案"]
B --> C{"你:选一个方向?"}
C -->|确认| D["Agent:拆成叙事线 + 分镜"]
D --> E["Gate 1:展示视觉隐喻,等你确认"]
E -->|通过| F["Agent:逐镜生成静帧"]
F --> G["Gate 2:展示首尾帧,等你验收"]
G -->|通过| H["Agent:生成首尾帧动画"]
H --> I["QA:检查每镜动画质量"]
I -->|翻车某镜| H
I -->|通过| J["Agent:逐段生成 TTS 旁白"]
J --> K["Agent:合成视频+字幕→导出 MP4"]
K --> L["你:拿到成片"]
这个流程里最关键的设计是两处:一是分层解耦,每一层可以独立重做;二是闸门审批,在错误被放大之前就拦截掉。
我自己用下来最大的感受是:以前做视频的时候,最累的不是「做」,而是「管」——记住这个素材在哪个文件夹、那个版本是不是最新的、配音和画面对齐了没有。Agent 把这些杂事全接过去了,我只需要在关键节点做判断。
一个小提醒
不过也别把 Agent 想得太神。现在的 Agent 还做不到「你说一句话,它就交出一部院线级作品」。它能做的是:在规则清晰的、可以标准化的工作流里,大幅减少你的手工操作。至于创意判断——比如「这个视觉隐喻够不够精准」「首尾帧是不是真的传达了你想说的」——还是得靠你。
下面,我们来拆这套五层工作流的具体结构。
三、五层工作流架构全景拆解
好了,到这里该把整座建筑的结构图亮出来了。这套系统的核心设计思想就四个字:分层解耦。
五层总览
整条动画生产线被拆成五个层级,每层有明确的输入、输出和工具:
|
层级 |
核心任务 |
输入 |
输出产物 |
推荐工具 |
|
编导层 |
选题、叙事、分镜、视觉隐喻 |
一个主题关键词 |
分镜脚本 + visual-spec.json |
Agent 内置能力 + gbro-collage-broll skill |
|
视觉层 |
生成统一的纸拼贴静帧 |
分镜规格文件 |
每镜的首尾帧 PNG |
GPT Image 2 / 其他生图模型 |
|
运动层 |
静帧变动画 |
首尾帧 + 组装顺序 |
每镜的 5 秒 MP4 |
Agnes Video 2.0 / Seedance Mini 等 |
|
声音层 |
旁白配音 |
分镜台词文本 |
每镜的 WAV 音频 |
Dots TTS / 其他 TTS |
|
合成层 |
拼合、对齐、导出 |
所有视频片段 + 音频 + 字幕 |
最终 MP4 |
HyperFrames |
注意一个细节:每一层都是独立闭环。编导层不关心你用什么视频模型,运动层不关心你用什么 TTS。层与层之间只通过结构化的「规格文件」来通信——比如 visual-spec.json 定义了这镜要什么画面,运动层拿到这个文件就知道该怎么生成动画提示词。
为什么「分层」是最高明的设计
这个设计的好处远不止「看起来整齐」。我在实操中体会最深的有三点:
第一,单镜翻车只重做单镜。 视频生成模型目前的最大问题是稳定性不足。同样一个 prompt,跑三次可能出三种结果。如果你的流程是「一次性生成整条片」,那某一镜翻车等于整条片翻车。而分层架构下,第 7 镜手画歪了,我只重做第 7 镜的视频,其他 9 镜不受影响。
第二,随时可以升级模型。 2026 年 AI 视频模型迭代速度极快。上个月 Agnes 2.0 还是最好用的,这个月 Seedance 就出了新版本。分层之后,你只需要把运动层的工具从 A 换成 B,其他四层完全不动。
第三,中间资产可以复用。 比如你做了一条讲「机会成本」的视频,过两个月想换一个配音风格。传统做法可能要整条重做,但分层架构下只需要:把声音层的 WAV 文件替换掉 → 重新跑合成层 → 搞定。五分钟的事。
资产目录长什么样
实际跑起来后,你的项目文件夹大概是这个结构:
disposition-effect-project/
├── 01-script/
│ ├── narrative-beats.json # 叙事线
│ └── visual-specs/ # 每镜的视觉规格
│ ├── shot-01.json
│ ├── shot-02.json
│ └── ...
├── 02-keyframes/
│ ├── shot-01-firstframe.png
│ ├── shot-01-lastframe.png
│ └── ...
├── 03-videos/
│ ├── shot-01.mp4
│ ├── shot-02.mp4
│ └── ...
├── 04-audio/
│ ├── shot-01.wav
│ ├── shot-02.wav
│ └── ...
└── 05-output/
├── composition.html # HyperFrames 合成文件
└── final.mp4 # 最终成片
这个结构的好处是:任何一个环节出了问题,你都知道去哪里找对应的文件,也知道该从哪里重新开始跑。
到这里你可能已经感觉到了——这套架构的精髓不在于任何单一工具,而在于如何把一个大任务拆成可以独立管理的小块。后面四章,我会把每一层具体怎么操作、用什么 prompt、怎么验收,掰开揉碎了讲。
辛梓煜@词元二号站:我最早试的就是「一句话端到端出片」,跑出来那叫一个惨——第 3 镜人物长了三只手,第 7 镜字幕全是方块,第 9 镜干脆黑屏了。从那次翻车我才意识到,分层 + 中间手动确认,才是目前 AI 工具组合下最稳的打法。
四、编导层:把抽象概念翻译成可拍的画面
编导层是整个工作流的起点,也是决定成片质量上限的一层。如果说后面的四层是「施工队」,编导层就是「设计图纸」。图纸画错了,施工队再强也白搭。
选题不是拍脑袋想的
很多人做科普动画的第一反应是:「我要做一条讲量子力学的动画。」然后就开始写脚本了。
我的建议是:先让 Agent 帮你列选题,你只负责挑。
为什么?因为不是所有主题都适合纸拼贴风格。那种需要大量真实影像、需要展示复杂数据图表的选题,硬塞进纸拼贴风格里会很别扭。最适合纸拼贴的选题有几个共同特征:
- 讲的是一个抽象概念(比如「处置效应」「锚定效应」「机会成本」「复利」)
- 核心信息可以通过视觉隐喻来传递(而不是依赖图表和数据)
- 有冲突或矛盾可以戏剧化表达(比如「理性选择 vs 真实行为」)
实际操作中,你跟 Agent 说:「我想做金融行为学方面的科普动画,帮我列 10 个适合纸拼贴风格的选题,每个用一句话概括核心矛盾。」它会给出一份列表,你从中挑一个最有感觉的就行。
我最近做的那条讲「处置效应」的动画,选题阶段 Agent 给出了大概 10 个方向,从「损失厌恶」到「心理账户」,我挑了处置效应——因为它有一个非常直观的行为矛盾:「为什么人一赚钱就急着卖,一亏钱就死扛?」
这个矛盾天然适合视觉化。
叙事线的搭建:不是写稿,是造弧线
选定主题后,下一步是搭骨架。很多新手在这一步犯的错是:直接让 AI 写一篇 800 字的科普文章,然后按段落拆成分镜。
这种做法的问题是:文章逻辑 ≠ 画面逻辑。一篇好的科普文章可以娓娓道来、层层递进,但 90 秒的动画需要的是一个有起承转合的故事弧线。
以「处置效应」为例,Agent 帮我拆出来的叙事线是这样的:
提出矛盾(为什么行为如此割裂?)
→ 盈利像奖杯(赚钱时急于落袋为安)
→ 亏损像承认错误(亏钱时死扛,不愿面对)
→ 买入价成为锚点(成本价在心理上被放大)
→ 市场不记得成本(但市场根本不在乎你的买入价)
→ 点出核心概念(这其实就是处置效应)
→ 看到机会成本(死扛让你错过了什么)
→ 重构问题(如果是今天才买入,你会怎么选?)
→ 给出判断框架(一个简单的决策规则)
→ 回到未来(用新框架看投资)
注意到没有?这不是一篇科普文章的目录,而是一条情绪和认知的弧线。它从「咦,为什么这样?」开始,经过「哦,原来是这样」,到「那我该怎么办?」结束。每一条弧线上的节点,最终都会变成一镜画面。
实际操作时,这里有一个很重要的约束:90 秒 ≈ 16 句台词 ≈ 16 个镜头。按每秒 3 个字的中文语速算,90 秒大概能装 270 个字。每句台词控制在 15-20 字,大约 5 秒说完。把这个约束提前告诉 Agent,它就不会写出「一句话念 15 秒」的尴尬脚本。
视觉隐喻:编导层最难也最重要的工序
叙事线搭好之后,真正考验功力的环节来了——把每一句台词翻译成视觉隐喻。
什么叫视觉隐喻?我用一个例子说明。
假设这句台词是:「为什么很多人一赚钱就卖,一亏钱却死扛?」
如果直接把这句话丢给生图模型,你会得到什么?大概率是 K 线图、金币、交易界面,外加一堆文字。这本质上是「插图」,不是「动画分镜」。
而一个好的视觉隐喻会这样处理:同一个人,左手推走正在上升、开着花的红色卡片(代表急着抛弃盈利),右手紧紧抱住正在下沉、枯萎的青绿色卡片(代表死守亏损)。
看出区别了吗?视觉隐喻不直接画「股票涨了」「股票跌了」,而是用颜色、动作、物体的象征关系来传递同一层意思。观众不需要看到一个字,也能读懂画面。
这一步之所以这么重要,是因为纸拼贴动画的核心魅力就在于:画面即表达。字幕和旁白是辅助,真正让观众「秒懂」的是画面本身。
视觉规格文件(visual-spec.json)
每镜的视觉隐喻定下来之后,Agent 会生成一份结构化的规格文件。下面是我做处置效应第 1 镜时实际产出的规格(简化版):
{
"shot_id": 1,
"duration_sec": 5,
"narration": "为什么很多人一赚钱就卖,一亏钱却死扛?",
"core_message": "人类在面对盈利和亏损时行为完全相反",
"visual_metaphor": "同一人左手推走上升的红色卡片,右手抱紧下沉的青绿卡片",
"composition": {
"background": "深紫色纯色场",
"subject": "黑白半调人物居中偏下",
"left_element": "红色上升轨道 + 红色卡片上有花朵",
"right_element": "青绿色下降轨道 + 青绿卡片上有枯叶",
"depth_layers": ["背景色场", "轨道", "卡片", "人物", "前景阴影"]
},
"style_constraints": {
"color_palette": ["#2D1B4E", "#E63946", "#2A9D8F", "#F1FAEE", "#1A1A1A"],
"stroke": "奶油白 3px 描边",
"shadow": "柔和纸张投影",
"character_style": "黑白半调网点",
"forbidden": ["文字", "数字", "Logo", "UI元素", "水印", "真实照片"]
},
"animation_sequence": [
"红色上升轨道从左侧滑入",
"红色赢家卡与花朵出现",
"青绿色下降轨道从右侧进入",
"青绿色输家卡与枯叶就位",
"半调人物入场,完成推开与抱紧动作",
"最后一秒保持完成构图"
]
}
这份文件就是编导层的最终交付物。后面的视觉层、运动