本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
核心结论一句话讲完:AI视频创作的关键从来不是"换了什么新工具",而是有没有吃透传统影视的四大底层流程——脚本、分镜、剪辑、后期。AI智能体(Agent)通过Skill技能包把这四个环节串成一条可托管的全流程工作流,让一个人就能产出商业级TVC广告、AI短剧、MV短片。本文围绕"原理 + 实操"展开,重点把三件事讲清楚:第一,为什么AI没有颠覆影视行业,而是把传统流程升级成了"可对话的流水线";第二,智能体的Skill工作流到底是什么,怎么用,怎么搭;第三,从一张产品图到一支完整成片,每一步AI在做什么、创作者要在哪几个节点拍板。
文章包含十二个模块,涵盖角色三视图与一致性、虚拟代言人、分镜运镜翻译、镜头无缝衔接、口型同步、专属Skill封装等环节,文末附完整避坑清单。想看完整拆解,往下翻。
第一章 · AI视频不是"一键出片",而是"流程托管"
很多刚接触AI视频的人,会把它理解成"一句话出大片"。打开工具,输入一段提示词,等十几秒,导出一个15秒的小片段,然后开始抱怨:画面糊、人物变形、镜头乱跳、配音对不上。结论就是"AI视频没用"。
我自己折腾下来发现,这个判断错在了最底层的认知上。AI视频不等于"一键出片",它真正的形态是"流程托管"——你把脚本、分镜、镜头生成、剪辑、配音、后期这些原本要靠不同岗位的工种完成的事情,通过一个智能体协同的工作流交给AI去跑,而你扮演的是导演的角色:出审美、出判断、关键节点拍板。
1.1 "15秒粗糙碎片"的真相
为什么大部分人做出来的AI视频都是15秒以内的粗糙片段?根本原因不是模型不够强,而是工作流断裂。
打开一个生视频工具,粘贴一段提示词,这个动作只完成了"分镜生成"这一步。你拿到的是一个孤立的镜头,它没有前因后果,没有节奏,没有声音设计,没有色彩统一,角色长相每次都漂移。把十几个这样的孤立镜头硬拼在一起,结果当然惨不忍睹。
辛梓煜在词元二号站做过一个对比测试:同样一段创意脚本,一组用"单镜头逐个生成 + 手动剪辑"的方式做,一组用"智能体托管全流程"的方式做。前者花了我整整两天,出来的成片还在"能看 vs 不能看"之间挣扎;后者从下指令到导出,两个小时不到,质量稳得多。差距不在模型,而在流程。
1.2 影视的底层逻辑没被颠覆,只是被升级
一定要在脑子里搭好这条认知地基:不管AI工具多便捷,影视的底层逻辑没有被颠覆。脚本、分镜、剪辑、后期这四个环节,该有的全都还在,只是每一步的执行方式被AI重写了一遍。
传统影视流程 AI升级后的流程
───────────────── ─────────────────
编剧 → 写剧本 Prompt → 自动生成剧本初稿
分镜师 → 画故事板 脚本 → 一键生成可视化分镜
摄影师 → 实拍 文/图生视频模型 → 渲染镜头
剪辑师 → 逐帧拼接 AI编排 → 自动衔接、节奏匹配
调色师 / 配音师 → 后期 一键色彩分级、配音、配乐
看清楚这张映射表,后面所有的工具、模型、Skill就都能找到自己的位置。我习惯把这张映射表当作"理解AI视频生态"的总开关——任何新工具进来,先问它替代的是哪一步、增强的是哪一步,马上就能判断它的价值。
1.3 工具频繁迭代,但流程不会变
2025年底到2026年上半年,国产AI视频模型迭代得有多快,关注这个赛道的应该都有体感。Seedance、Kling、Wan、Vidu 一个赛一个,LibTV、TapNow、即梦、可灵这些一站式平台也都在加速涌现。这些工具会一直更新,但你只要把"脚本 → 分镜 → 镜头 → 剪辑 → 后期"这条流程刻进脑子,换任何一款新工具都能一周内上手。
辛梓煜@词元二号站的整个学习路径,基本就是顺着这条主线展开的:不追工具,只摸流程,工具变了再补一个映射就行。下面的章节会把每一步都展开讲。
第二章 · 传统影视四大流程的AI升级路径
这一章把"脚本、分镜、剪辑、后期"四个环节逐一拆开,讲清楚AI到底接管了什么、增强了什么、又留了哪些给人。
2.1 脚本:从空白文档到对话式起稿
传统影视里,脚本是整个项目的源头。一个广告片要拍什么、讲什么故事、节奏怎么走、卖点怎么埋,全在脚本里定。脚本写得磕巴,后面再怎么花钱也救不回来。
AI改写了脚本的起稿方式。你不再需要面对一张空白文档发呆,而是用对话的方式跟AI"聊出来一个剧本"。这里有个关键认知:AI写的脚本初稿,远没有它生成的图片那么惊艳,它更多是个"思路加速器"。我的做法是把品牌调性、目标人群、产品卖点、想要的情绪四件事丢给AI,让它一次产出三到五个完全不同走向的故事方向,再从中挑一个继续深化。
脚本生成的"四件套"输入
─────────────────────────
1. 品牌调性:轻量化 / 高端 / 极简 / 复古 / 国潮 ...
2. 目标人群:25-35岁都市女性 / Z世代男生 / 母婴家庭 ...
3. 核心卖点:不超过3个,排好优先级
4. 情绪基调:温暖 / 燃 / 治愈 / 反转 / 悬疑 ...
AI产出的脚本一定要人工读一遍。我有过一次踩坑:产品是健身设备,AI给我写了一个"主角早起跑步遇见暗恋多年的同学"的脚本,卖点几乎完全被淹没。卖点埋藏的位置、出现的时长、转折的节点,这些细节AI做不到位,需要人来兜底。
2.2 分镜:从手绘故事板到可视化镜头列表
分镜师是传统剧组里很专业的工种,负责把文字剧本翻译成一格一格的画面草图,确定每个镜头的景别、构图、机位、运镜方式。一个广告片可能要画几十张分镜稿,一部电影分镜稿数量惊人。
AI接管这一步之后,流程被压缩成:脚本输入 → 一键生成分镜表 → 一键批量出图。常见的呈现形式是九宫格、十六宫格、二十五宫格,每一格就是一个镜头的关键帧。分镜表会自带景别、时长、运镜建议、提示词模板。
我整理过一份"AI分镜表"的典型字段清单,做项目时直接照搬就行:
|
字段 |
含义 |
示例 |
|
镜头编号 |
顺序标识 |
S01-04 |
|
景别 |
远 / 中 / 近 / 特写 |
中景 |
|
时长(秒) |
该镜头持续多久 |
2.5 |
|
运镜 |
推 / 拉 / 摇 / 移 / 跟 |
缓慢推近 |
|
画面描述 |
主体 + 场景 + 动作 |
主角站在落地窗前,远眺城市夜景 |
|
情绪标签 |
主导情绪 |
思考 / 笃定 |
|
音效提示 |
同期声 / 配乐方向 |
低频氛围 |
|
提示词草稿 |
文 / 图生视频可直接用的Prompt |
medium shot, ... |
辛梓煜的经验是:把这张表打印出来或者用电子文档存档,作为整个项目的"中央调度面板"。镜头改、运镜改、提示词改,全部回到这张表上更新,不要让修改分散在十几个对话窗口里。
2.3 剪辑:从逐帧裁切到节奏自动匹配
传统剪辑师每天的工作是面对几十个G的素材,逐条试、逐帧裁,把符合脚本节奏的片段拼成一条连贯的成片。AI改写这步的方式,是让生成的镜头本身就带"衔接基因"。
具体怎么实现?现在主流的工作流是这样的:同一个项目里的所有镜头,共享同一套人物设定、场景设定、光照基调和色彩参数。生成的时候这些参数被一并固化进每一个片段,所以片段之间天然就能"对得上"。再加上AI根据脚本节奏自动安排镜头时长——快节奏段落安排2秒以内的短镜头,慢节奏安排5秒以上的长镜头,衔接就比手动剪辑顺很多。
但也别神化它。AI剪出来的成片,节奏点的精细程度还是不如人。比如音乐的鼓点落在哪一帧切镜头、笑点要不要"留白半拍"、情绪转折是"硬切"还是"叠化",这些都需要人来微调。我的做法是用AI跑出一版"粗剪",然后导出到剪映或者其他剪辑工具里,手动磨节奏点。
2.4 后期:一键调色 + 智能配音
后期这块的AI化,反而是最完整的。色彩分级、镜头光感、配音、配乐、字幕,这五件事现在都能一键完成。
色彩分级以前要请专业调色师在达芬奇里手调,现在AI模型可以直接根据"情绪标签"自动适配色彩风格;配音以前要租录音棚找配音演员,现在AI语音库动辄三百多种音色、覆盖十几种情绪;配乐方面,AI根据视频节奏自动生成或匹配BGM,搞定基本卡点;字幕直接从配音里反推,精准到帧。
下表是我自己整理的"AI后期能力图谱",方便对照工具能力:
|
后期环节 |
传统做法 |
AI做法 |
还需人工的部分 |
|
色彩分级 |
达芬奇手调 |
风格预设 + 情绪标签自动套用 |
商业级精修 |
|
配音 |
录音棚 + 配音演员 |
文本驱动 + 音色 / 情绪库 |
复杂情感戏份 |
|
配乐 |
版权曲库 + 剪辑师卡点 |
AI生成原创BGM + 自动节奏匹配 |
高级编曲 |
|
音效 |
拟音 + 资源库 |
镜头识别自动添加环境音 |
创意音效设计 |
|
字幕 |
听写 + 时间码 |
自动转写 + 自动时间轴 |
多语种校对 |
|
口型同步 |
后期对嘴 / 重配 |
唇形适配模型 |
极端复杂表情 |
把这张表存到桌面,你下一次面对一支成片,大概能预估到80%的后期工作量分配。
第三章 · 智能体与Skill技能包到底是什么
讲完四大流程,这一章把"智能体(Agent)"和"Skill技能包"这两个高频术语彻底讲透,这是后面所有实操的钥匙。
3.1 智能体不是"聊天机器人"
新手第一个要破的认知是:智能体不等于聊天机器人。聊天机器人只会回答问题,你问一句它答一句,出了对话框就什么都做不了。智能体不一样,它有"手脚"——可以调用工具、操作文件、执行多步骤任务、根据中间结果调整后续动作。
打个比方:聊天机器人像一个只能在前台坐着的接待员,你问它公司在几楼它会告诉你;智能体则像一个项目经理,你扔给它一个完整需求,它能拆任务、分配工具、跑流程、最后把成果交到你手上。
聊天机器人 vs 智能体
─────────────────────────────────────────────
聊天机器人 ┃ 智能体
─────────────────────────────────────────────
单轮对话 ┃ 多步骤任务编排
只能输出文本 ┃ 可以调用各种工具完成操作
没有记忆环境 ┃ 在工作上下文里持续推进
被动响应 ┃ 主动规划下一步该做什么
─────────────────────────────────────────────
3.2 Skill是装在AI身上的"岗位说明书"
那Skill是什么?简单粗暴的解释:Skill就是一份交给AI的"岗位说明书"。
每一份Skill包里写的是:遇到什么样的任务、按什么样的流程跑、用哪几个工具、每一步的输出要满足什么标准、最终怎么交付。你把这份说明书装到智能体里,智能体就具备了对应的"专业岗位"能力。
举例:一个"TVC广告片制作Skill",里面会规定——
- 收到产品图后,先做品牌调性分析;
- 输出三套差异化的创意方案;
- 用户选定方案后,生成完整脚本和分镜表;
- 分镜表逐条调用文/图生视频模型;
- 调用配音、配乐、剪辑能力合成成片;
- 最后提交可下载的MP4。
这份说明书写得越细,智能体跑出来的成果就越稳定。这也是为什么同一个底层模型,套不同Skill出来的效果差别巨大的原因。
3.3 双入口设计:人也能用,Agent也能用
2026年这批一站式AI视频平台,有一个特别值得关注的产品设计趋势:双入口。
什么叫双入口?同一套创作能力,既给人开了一个图形界面(无限画布、可视化节点、拖拽连线),也给智能体开了一个调用接口(Skill接口、自然语言指令)。这意味着:
- 你想精细控制,就打开画布,自己一个节点一个节点地搭流程;
- 你想图省事,就打开智能体,丢一句"帮我做一支新中式茶饮的TVC广告",剩下的全交给它。
辛梓煜在词元二号站的实操心得是:这两种模式不互斥,反而很互补。前期摸索一个新风格,用画布慢慢调;一旦摸出一套稳定流程,把它保存下来,后续用智能体批量复用。一个流程跑通,可以复用一百次。
3.4 Skill市场:从"自己写"到"开箱即用"
Skill还有一个特别有意思的地方——它是可以被打包、分发、再分发的。
像LibTV这类平台已经把自己的Skill开源到了GitHub上,任何支持Skill规范的智能体(Claude Code、OpenClaw、Cursor、Codex CLI 等)都能直接装载使用。这意味着普通创作者不用懂代码,也可以直接调用别人写好的、已经被验证过的工作流。
我把Skill市场理解成"工作流应用商店"。逻辑上跟手机App商店没什么区别:你不想自己学怎么编辑视频,直接下载一个剪辑App;同理,你不想自己写流程,直接下载一个Skill。
flowchart LR
A[创作者] --> B{选择入口}
B -->|手动控制| C[无限画布]
B -->|托管自动化| D[智能体]
C --> E[节点工作流]
D --> F[调用Skill包]
F --> G[官方Skill]
F --> H[社区Skill]
F --> I[自建Skill]
E --> J[成片]
G --> J
H --> J
I --> J
这张图把双入口和Skill的关系画清楚了。无论从哪条路径进,最后汇到同一个产物——一支可交付的成片。
第四章 · 商业级TVC广告片制作实战六步法
理论铺垫完毕,进入正题:从0到1,怎么用智能体工作流做出一支商业级TVC广告片。这一章用一个虚拟案例走完六个步骤,每一步都讲清楚AI在做什么、你要做什么。
虚拟案例:为一款"新中式陶瓷保温杯"做一支15-30秒的TVC广告片。
4.1 第一步:启动智能体,设定任务
打开平台,进入智能体入口,选择"TVC广告制作"这一类Skill。然后做两件事——
第一件,上传产品图。一张正面图、一张45度斜侧图、一张细节图,基本上够了。手机随便拍,光线别太糟就行,不需要专业摄影。智能体会自动识别产品形态、材质、颜色。
第二件,用一句话说清楚需求。我的范例话术是:
请基于上传的产品图,为这款新中式陶瓷保温杯做一支
20秒左右的TVC广告片。
目标人群:25-35岁注重生活仪式感的都市女性。
核心卖点:24小时保温 + 国风釉色工艺 + 单手开盖。
情绪基调:温润、雅致、有故事感。
风格参考:类似新中式茶饮品牌的视觉调性。
这一句话已经把"四件套"(人群、卖点、情绪、调性)讲完了。智能体接到指令之后,会先反问你一些它还需要补的信息——比如有没有代言人参考、需不需要旁白、希望什么场景、最终交付什么尺寸(横屏 / 竖屏)。一个一个回答就行。
4.2 第二步:虚拟代言人与风格参考
请不起明星没关系,智能体会自动帮你策划一个"不会翻车的虚拟代言人"。
它会基于品牌调性,生成两到三个虚拟人设方案——比如这个保温杯的案例,可能生成:"古风穿搭的25岁女生 + 城市公寓"、"职业女性 + 设计感工作室"、"独居博主 + 老房子改造"三种走向。每个走向都会附一张参考人物图。
挑一个最贴近品牌想要的形象,智能体会进一步生成这个虚拟代言人的三视图——正面、侧面、背面。这是为后面所有镜头里"角色长相一致"打下的根基。再细一些的话,还会顺带生成九宫格表情(微笑、平静、思考、惊讶 ...)和四种常见姿态(站、坐、走、举杯)。这些都是为下一步分镜服务的"基础资产"。
虚拟代言人资产清单
─────────────────────────
├── 三视图(正/侧/背)
├── 九宫格表情
├── 四种姿态
├── 服装与配饰特征锁定
└── 与产品互动的标准动作
辛梓煜的实操建议:这一步别赶时间。三视图不满意就重新生成,直到你看着这个虚拟代言人觉得"对,就是她"。后面所有镜头都基于这套形象展开,基础没打好,后面镜头会一直崩。
4.3 第三步:三套创意方案,选一套深化
代言人和风格定下来,智能体会自动产出三套创意方案。每一套都是一个完整的"故事走向 + 镜头走向"。
举例,刚才那个保温杯的三套方案可能长这样——
方案A · 晨光仪式:女主清晨在书房泡茶,镜头跟着保温杯从书桌到阳台,落点在城市天际线。卖点埋点:开盖动作特写、保温雾气视觉化、釉色光泽近景。
方案B · 山行茶记:女主带着保温杯去山间徒步,中途休息时倒出一杯温茶,镜头切到一组山水空镜。卖点埋点:户外环境验证保温能力、釉色与山水的色彩呼应。
方案C · 夜读时光:女主深夜在书房读书,保温杯始终在桌边,镜头用光影变化暗示时间流逝,八小时后倒出依然温热的茶。卖点埋点:时间维度的保温证明、单手开盖的工作场景。
你只需要选一套——比如选了方案B。这一步不需要解释为什么,直接告诉智能体"用方案B"就行。
4.4 第四步:脚本与分镜协同生成
选定方案后,智能体进入"脚本 + 分镜协同生成"环节。屏幕上你会看到两个区域:
- 左侧:可视化的分镜画布。每一个镜头是一张关键帧图,带着景别、时长、运镜标注。
- 右侧:对话区,智能体跟你解释每一步在做什么,你可以随时插话调整。
这种"左实操 + 右对话"的界面设计,在2026年成了主流。它的好处是:你不再是无脑点点点,而是可以在过程中学习和理解影视创作的逻辑。看到智能体说"这里安排一个2秒的近景特写,强化产品质感",你就明白"近景"在叙事里的功能;看到它说"这一段用慢推镜头,突出主角的笃定感",你就理解了"慢推"代表的是什么情绪。
每一个分镜都能单独点开重新编辑提示词。你想改某个镜头的色调、运镜、构图,直接点击那张关键帧,重新调prompt,右侧的脚本和后续镜头会同步联动调整,不需要整段推倒重来。
辛梓煜@词元二号站的实操心得:在这一步多花时间。脚本和分镜是整个项目的骨架,骨架定了,后面镜头生成基本就是体力活。
4.5 第五步:确认指令,自动合成
所有分镜确认完毕,你只需要输入一句"确认开始生成"。接下来几分钟到十几分钟里,智能体会做下面这些事情:
flowchart TD
A[确认指令] --> B[批量生成每个镜头]
B --> C[镜头之间风格统一性校验]
C --> D[自动配乐与音效匹配]
D --> E[自动语音合成与对口型]
E --> F[镜头无缝衔接]
F --> G[色彩分级与质感优化]
G --> H[字幕生成]
H --> I[导出成片]
注意中间有个风格统一性校验——智能体会自动检查每一个镜头里虚拟代言人的长相、服装、场景的统一程度。一旦发现某一帧"崩了",会自动重抽。这一步是2025年之前的工具最大的痛点,现在被Skill流程内置解决掉了。
4.6 第六步:导出 + 微调
成片导出之前,你会看到一个完整预览。这时候有两条路——
第一条:看完觉得没问题,直接点击导出,得到一支带配音、配乐、字幕、调色完整的MP4。这是最省事的走法。
第二条:看完觉得某几个镜头还需要微调,可以精确到某几秒的片段进行重新生成。比如你觉得第3个镜头的运镜太快,第7个镜头的色调偏暗,直接在画布上点开对应片段,微调prompt再生成就行。其他镜头不受影响,稳定性能保住。
整个流程跑下来,从上传产品图到成片,熟练之后大约一个工作日内能搞定。要知道,过去同样质量的TVC,从脚本到拍摄到后期,小则一周大则一个月。这个时间压缩才是AI视频真正改变行业的地方,而不是某个炫酷的特效。
第五章 · 虚拟代言人与角色一致性的解法
上一章里出现频率最高的词,可能就是"角色一致性"。这是AI视频里最容易翻车、也最体现专业度的环节。这一章把它单独拎出来,把"为什么难、怎么解、注意什么"讲透。
5.1 为什么AI生视频里角色总是"崩脸"
新手做AI视频,最常见的吐槽是:"同一个人在前后两个镜头里长得完全不一样!"
这个现象的本质,叫做"角色漂移(Character Drift)"。底层原因是这样:你每次让模型生成一张图或一段视频,它都是基于提示词"重新画一遍"。即使你写得再详细——"25岁、长发、白衬衫、戴金丝眼镜"——模型每次画出来的细节都会有微小差异。几十个镜头叠加之后,这些微小差异累积起来,就变成了观众肉眼可见的"换人"。
解决思路有两个方向——
方向一:把角色的形象"固化"成参考资产,每一次生成都强制比对这套资产。
方向二:在模型层用专门的算法锁定角色身份特征(比如脸部嵌入向量),无论提示词怎么变,脸不变。
主流做法是把两条路结合用。下面分别讲。
5.2 三视图的作用
为什么AI视频平台在做代言人时,第一件事一定是生成三视图?
三视图(正面 / 侧面 / 背面)是为了让角色的造型具备规范性和完整性。它清晰呈现正面、侧面、背面的整体比例、结构细节与轮廓特征,让AI在不同角度都能拿到稳定的参考。
为什么三视图比单张正面图好用?
─────────────────────────────────
1. 提供多视角参考 → 减少视角矛盾
2. 锁定身高比例 → 避免身体走样
3. 锁定服装结构 → 避免衣服换样
4. 锁定发型 → 避免发型抽风
5. 提供AI"抄作业"的标准答案 → 推理时更稳定
更细致的做法是,在三视图基础上再加一套九宫格表情(微笑、平静、害羞、生气、疑惑、开心、难过、惊讶、思考)和多机位四宫格(自拍角度、远景、中景、近景)。这一整套加起来,就是角色的"基础资产包"。
5.3 角色一致性的提示词工程
光有资产包还不够,提示词也得跟上。一个标准的"保一致性"提示词长这样:
[文生图提示词结构模板]
{景别选择},{角色外观完整描述},{主体动作},
{环境场景},{情绪氛围},{视觉风格},{光影效果}
关键要点:
- 每一个分镜的提示词,都必须完整重复角色外观描述
(年龄、性别、服装、发型、配饰),不要简写为"她"
- 景别按视角类型选词,自拍视角用"手机自拍角度",
第一人称用"主观镜头",第三人称用传统的远/中/近/特写
- 视觉风格和光影效果在整个项目里保持一套
我自己的实战经验:外观描述这段,直接做成一段固定文本,放在每个分镜提示词的最前面,不要每次重写。重写一次就漂移一次。
5.4 模型层的身份锁定
除了提示词工程,2026年这一代视频模型在算法层也下了功夫。比较有代表性的方向是基于面部嵌入(face embedding)的身份锁定——上传一张人物照片,模型把这张脸的关键特征向量提取出来,在生成时强制让结果向这个向量靠拢。
这种做法的好处是不受提示词变化的影响。哪怕你写"她在跑步、在吃东西、在跳舞、在哭",脸都还是同一张脸。
辛梓煜的判断是:未来一致性这件事,会从"提示词工程"逐渐转移到"模型内置能力"。现在还需要靠人去精心写prompt保一致,过一两年可能模型直接帮你搞定。但作为创作者,理解一致性的原理,什么时候都不会过时。
5.5 跨集 / 跨片段的一致性怎么保
如果你做的不是单支TVC,而是一个多集短剧或者连续MV,挑战会再升一个量级——跨集角色相似度要保持在90%以上才算合格。
主流平台的解决方案是把"角色库"做成项目级资产:同一个项目下,所有的剧集、所有的分镜,共享同一份角色定义。任何一集对角色做调整,其他集会自动同步。这种设计能把跨集相似度做到95%以上。
对创作者的提醒:项目开始就把角色库建好,中途不要轻易改。改一次,后续所有镜头都得重新跑一遍。
第六章 · 分镜里的镜头语言与提示词翻译
很多人写视频提示词,第一反应是"画一个女生在咖啡馆喝咖啡"。这种写法太业余了。专业的做法是用镜头语言去描述。这一章把分镜里的镜头语言基本盘讲一遍,然后教你怎么把它翻译成AI能理解的提示词。
6.1 景别:画面里主体占多大
景别是分镜的第一要素。它决定的是观众看到多少、看清多少、情绪有多近。
|
景别 |
范围 |
情绪功能 |
典型用法 |
|
大远景 |
主体很小,环境占主导 |
交代环境、营造孤独 / 宏大 |
开场镜头、转场镜头 |
|
远景 |
主体清晰,环境仍主导 |
强调空间感 |
城市夜景、自然风光 |
|
全景 |
主体全身入画 |
展示动作和身体语言 |
舞蹈、运动 |
|
中景 |
主体腰部以上 |
对话、叙事推进 |
大量普通叙事镜头 |
|
近景 |
主体胸部以上 |
进入情绪、强化产品质感 |
反应镜头、产品特写 |
|
特写 |
主体面部 / 局部 |
强情绪 / 关键细节 |
眼神、嘴角、产品扣件 |
|
大特写 |
主体局部细节 |
极致情绪 / 极致细节 |
眼睛、零件 |
写提示词时,直接把这些词放在最前面。AI模型对"medium shot"、"close-up"、"wide shot"这类英文术语和"中景"、"近景"、"远景"的中文表达,都已经识别得很稳定。
6.2 构图:观众的眼睛被引到哪里
构图决定的是画面里的视觉焦点在哪儿。常用的有——
- 三分法:主体落在画面三分线的交点上。
- 居中构图:主体放正中,适合产品展示、对称美感。
- 引导线构图:用路、栏杆、建筑边缘把观众视线导向主体。
- 框架构图:用窗、门、镜面把主体框在内部,营造层次。
- 留白构图:大面积空间,主体占小角,适合情绪铺陈。
提示词里写一句"rule of thirds composition"或者"centered composition with negative space"就能影响模型的画面布局。这种细节,新手最容易忽略。
6.3 运镜:镜头是怎么动的
运镜是分镜里最容易让AI"翻车"的环节,因为它涉及视频的动态。常用的运镜方式包括:
推镜头 → 镜头向主体靠近,放大主体,强化情绪
拉镜头 → 镜头远离主体,交代环境,营造抽离感
摇镜头 → 镜头水平 / 垂直转动,展示空间
移镜头 → 镜头平移,跟随主体或环境
跟镜头 → 镜头跟着主体走,沉浸式
升降镜头 → 镜头垂直上下移动,营造仪式感
环绕镜头 → 镜头围着主体转一圈,展示360度
写提示词时,把运镜放在景别后面,例如"medium shot, slow dolly in"(中景,缓慢推近)。运镜越复杂,模型越容易出错,商业级项目里优先用简单稳定的运镜,推、拉、缓移这类基本款,效果最稳。
6.4 节奏:镜头时长背后的情绪
镜头时长是节奏的核心。一般规律——
- 0.5-1.5秒:快剪片段,适合燃、动感、紧张
- 2-3秒:常规叙事,适合大部分内容
- 4-6秒:慢节奏,情绪渲染、产品展示
- 7秒以上:长镜头,需要内部动作支撑,否则观众跑神
辛梓煜在词元二号站做过一个测试:同一组镜头,把时长从平均3秒压到平均1.5秒,完播率提升了将近20%。当然这不是绝对真理,得看品类——美妆 / 食品适合慢一点,运动 / 数码适合快一点。
6.5 把语言翻译成提示词:一个完整范式
把上面这些组合在一起,一个标准的视频提示词应该是这样:
[景别] + [运镜] + [角色完整描述] + [主体动作] +
[环境场景] + [情绪氛围] + [视觉风格] + [光影效果]
示例:
Medium shot, slow dolly in, a 28-year-old Chinese
woman with long black hair wearing a beige knit
sweater, gently holding a celadon teacup, sitting
at a window-side wooden desk in a sunlit Chinese
study room, peaceful and contemplative mood,
new Chinese aesthetic style, warm a