📍 词元二号站 开源解码 AI视频创作全流程拆解:从智能体工作流到商业级成片的底层方法论

AI视频创作全流程拆解:从智能体工作流到商业级成片的底层方法论

摘要:从脚本到成片,系统讲透AI视频创作的四大底层流程、智能体Skill工作流原理、TVC广告片实战六步法、角色一致性、镜头语言、剪辑节奏与避坑清单,适合自媒体创作者和AI视频新手深度阅读。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

核心结论一句话讲完:AI视频创作的关键从来不是"换了什么新工具",而是有没有吃透传统影视的四大底层流程——脚本、分镜、剪辑、后期。AI智能体(Agent)通过Skill技能包把这四个环节串成一条可托管的全流程工作流,让一个人就能产出商业级TVC广告、AI短剧、MV短片。本文围绕"原理 + 实操"展开,重点把三件事讲清楚:第一,为什么AI没有颠覆影视行业,而是把传统流程升级成了"可对话的流水线";第二,智能体的Skill工作流到底是什么,怎么用,怎么搭;第三,从一张产品图到一支完整成片,每一步AI在做什么、创作者要在哪几个节点拍板。

文章包含十二个模块,涵盖角色三视图与一致性、虚拟代言人、分镜运镜翻译、镜头无缝衔接、口型同步、专属Skill封装等环节,文末附完整避坑清单。想看完整拆解,往下翻。


第一章 · AI视频不是"一键出片",而是"流程托管"

很多刚接触AI视频的人,会把它理解成"一句话出大片"。打开工具,输入一段提示词,等十几秒,导出一个15秒的小片段,然后开始抱怨:画面糊、人物变形、镜头乱跳、配音对不上。结论就是"AI视频没用"。

我自己折腾下来发现,这个判断错在了最底层的认知上。AI视频不等于"一键出片",它真正的形态是"流程托管"——你把脚本、分镜、镜头生成、剪辑、配音、后期这些原本要靠不同岗位的工种完成的事情,通过一个智能体协同的工作流交给AI去跑,而你扮演的是导演的角色:出审美、出判断、关键节点拍板。

1.1 "15秒粗糙碎片"的真相

为什么大部分人做出来的AI视频都是15秒以内的粗糙片段?根本原因不是模型不够强,而是工作流断裂。

打开一个生视频工具,粘贴一段提示词,这个动作只完成了"分镜生成"这一步。你拿到的是一个孤立的镜头,它没有前因后果,没有节奏,没有声音设计,没有色彩统一,角色长相每次都漂移。把十几个这样的孤立镜头硬拼在一起,结果当然惨不忍睹。

辛梓煜在词元二号站做过一个对比测试:同样一段创意脚本,一组用"单镜头逐个生成 + 手动剪辑"的方式做,一组用"智能体托管全流程"的方式做。前者花了我整整两天,出来的成片还在"能看 vs 不能看"之间挣扎;后者从下指令到导出,两个小时不到,质量稳得多。差距不在模型,而在流程。

1.2 影视的底层逻辑没被颠覆,只是被升级

一定要在脑子里搭好这条认知地基:不管AI工具多便捷,影视的底层逻辑没有被颠覆。脚本、分镜、剪辑、后期这四个环节,该有的全都还在,只是每一步的执行方式被AI重写了一遍。

传统影视流程                AI升级后的流程
─────────────────          ─────────────────
编剧 → 写剧本               Prompt → 自动生成剧本初稿
分镜师 → 画故事板           脚本 → 一键生成可视化分镜
摄影师 → 实拍               文/图生视频模型 → 渲染镜头
剪辑师 → 逐帧拼接           AI编排 → 自动衔接、节奏匹配
调色师 / 配音师 → 后期       一键色彩分级、配音、配乐

看清楚这张映射表,后面所有的工具、模型、Skill就都能找到自己的位置。我习惯把这张映射表当作"理解AI视频生态"的总开关——任何新工具进来,先问它替代的是哪一步、增强的是哪一步,马上就能判断它的价值。

1.3 工具频繁迭代,但流程不会变

2025年底到2026年上半年,国产AI视频模型迭代得有多快,关注这个赛道的应该都有体感。Seedance、Kling、Wan、Vidu 一个赛一个,LibTV、TapNow、即梦、可灵这些一站式平台也都在加速涌现。这些工具会一直更新,但你只要把"脚本 → 分镜 → 镜头 → 剪辑 → 后期"这条流程刻进脑子,换任何一款新工具都能一周内上手。

辛梓煜@词元二号站的整个学习路径,基本就是顺着这条主线展开的:不追工具,只摸流程,工具变了再补一个映射就行。下面的章节会把每一步都展开讲。


第二章 · 传统影视四大流程的AI升级路径

这一章把"脚本、分镜、剪辑、后期"四个环节逐一拆开,讲清楚AI到底接管了什么、增强了什么、又留了哪些给人。

2.1 脚本:从空白文档到对话式起稿

传统影视里,脚本是整个项目的源头。一个广告片要拍什么、讲什么故事、节奏怎么走、卖点怎么埋,全在脚本里定。脚本写得磕巴,后面再怎么花钱也救不回来。

AI改写了脚本的起稿方式。你不再需要面对一张空白文档发呆,而是用对话的方式跟AI"聊出来一个剧本"。这里有个关键认知:AI写的脚本初稿,远没有它生成的图片那么惊艳,它更多是个"思路加速器"。我的做法是把品牌调性、目标人群、产品卖点、想要的情绪四件事丢给AI,让它一次产出三到五个完全不同走向的故事方向,再从中挑一个继续深化。

脚本生成的"四件套"输入
─────────────────────────
1. 品牌调性:轻量化 / 高端 / 极简 / 复古 / 国潮 ...
2. 目标人群:25-35岁都市女性 / Z世代男生 / 母婴家庭 ...
3. 核心卖点:不超过3个,排好优先级
4. 情绪基调:温暖 / 燃 / 治愈 / 反转 / 悬疑 ...

AI产出的脚本一定要人工读一遍。我有过一次踩坑:产品是健身设备,AI给我写了一个"主角早起跑步遇见暗恋多年的同学"的脚本,卖点几乎完全被淹没。卖点埋藏的位置、出现的时长、转折的节点,这些细节AI做不到位,需要人来兜底。

2.2 分镜:从手绘故事板到可视化镜头列表

分镜师是传统剧组里很专业的工种,负责把文字剧本翻译成一格一格的画面草图,确定每个镜头的景别、构图、机位、运镜方式。一个广告片可能要画几十张分镜稿,一部电影分镜稿数量惊人。

AI接管这一步之后,流程被压缩成:脚本输入 → 一键生成分镜表 → 一键批量出图。常见的呈现形式是九宫格、十六宫格、二十五宫格,每一格就是一个镜头的关键帧。分镜表会自带景别、时长、运镜建议、提示词模板。

我整理过一份"AI分镜表"的典型字段清单,做项目时直接照搬就行:

字段

含义

示例

镜头编号

顺序标识

S01-04

景别

远 / 中 / 近 / 特写

中景

时长(秒)

该镜头持续多久

2.5

运镜

推 / 拉 / 摇 / 移 / 跟

缓慢推近

画面描述

主体 + 场景 + 动作

主角站在落地窗前,远眺城市夜景

情绪标签

主导情绪

思考 / 笃定

音效提示

同期声 / 配乐方向

低频氛围

提示词草稿

文 / 图生视频可直接用的Prompt

medium shot, ...

辛梓煜的经验是:把这张表打印出来或者用电子文档存档,作为整个项目的"中央调度面板"。镜头改、运镜改、提示词改,全部回到这张表上更新,不要让修改分散在十几个对话窗口里。

2.3 剪辑:从逐帧裁切到节奏自动匹配

传统剪辑师每天的工作是面对几十个G的素材,逐条试、逐帧裁,把符合脚本节奏的片段拼成一条连贯的成片。AI改写这步的方式,是让生成的镜头本身就带"衔接基因"。

具体怎么实现?现在主流的工作流是这样的:同一个项目里的所有镜头,共享同一套人物设定、场景设定、光照基调和色彩参数。生成的时候这些参数被一并固化进每一个片段,所以片段之间天然就能"对得上"。再加上AI根据脚本节奏自动安排镜头时长——快节奏段落安排2秒以内的短镜头,慢节奏安排5秒以上的长镜头,衔接就比手动剪辑顺很多。

但也别神化它。AI剪出来的成片,节奏点的精细程度还是不如人。比如音乐的鼓点落在哪一帧切镜头、笑点要不要"留白半拍"、情绪转折是"硬切"还是"叠化",这些都需要人来微调。我的做法是用AI跑出一版"粗剪",然后导出到剪映或者其他剪辑工具里,手动磨节奏点。

2.4 后期:一键调色 + 智能配音

后期这块的AI化,反而是最完整的。色彩分级、镜头光感、配音、配乐、字幕,这五件事现在都能一键完成。

色彩分级以前要请专业调色师在达芬奇里手调,现在AI模型可以直接根据"情绪标签"自动适配色彩风格;配音以前要租录音棚找配音演员,现在AI语音库动辄三百多种音色、覆盖十几种情绪;配乐方面,AI根据视频节奏自动生成或匹配BGM,搞定基本卡点;字幕直接从配音里反推,精准到帧。

下表是我自己整理的"AI后期能力图谱",方便对照工具能力:

后期环节

传统做法

AI做法

还需人工的部分

色彩分级

达芬奇手调

风格预设 + 情绪标签自动套用

商业级精修

配音

录音棚 + 配音演员

文本驱动 + 音色 / 情绪库

复杂情感戏份

配乐

版权曲库 + 剪辑师卡点

AI生成原创BGM + 自动节奏匹配

高级编曲

音效

拟音 + 资源库

镜头识别自动添加环境音

创意音效设计

字幕

听写 + 时间码

自动转写 + 自动时间轴

多语种校对

口型同步

后期对嘴 / 重配

唇形适配模型

极端复杂表情

把这张表存到桌面,你下一次面对一支成片,大概能预估到80%的后期工作量分配。


第三章 · 智能体与Skill技能包到底是什么

讲完四大流程,这一章把"智能体(Agent)"和"Skill技能包"这两个高频术语彻底讲透,这是后面所有实操的钥匙。

3.1 智能体不是"聊天机器人"

新手第一个要破的认知是:智能体不等于聊天机器人。聊天机器人只会回答问题,你问一句它答一句,出了对话框就什么都做不了。智能体不一样,它有"手脚"——可以调用工具、操作文件、执行多步骤任务、根据中间结果调整后续动作。

打个比方:聊天机器人像一个只能在前台坐着的接待员,你问它公司在几楼它会告诉你;智能体则像一个项目经理,你扔给它一个完整需求,它能拆任务、分配工具、跑流程、最后把成果交到你手上。

聊天机器人 vs 智能体
─────────────────────────────────────────────
聊天机器人      ┃ 智能体
─────────────────────────────────────────────
单轮对话        ┃ 多步骤任务编排
只能输出文本    ┃ 可以调用各种工具完成操作
没有记忆环境    ┃ 在工作上下文里持续推进
被动响应        ┃ 主动规划下一步该做什么
─────────────────────────────────────────────

3.2 Skill是装在AI身上的"岗位说明书"

那Skill是什么?简单粗暴的解释:Skill就是一份交给AI的"岗位说明书"

每一份Skill包里写的是:遇到什么样的任务、按什么样的流程跑、用哪几个工具、每一步的输出要满足什么标准、最终怎么交付。你把这份说明书装到智能体里,智能体就具备了对应的"专业岗位"能力。

举例:一个"TVC广告片制作Skill",里面会规定——

  • 收到产品图后,先做品牌调性分析;
  • 输出三套差异化的创意方案;
  • 用户选定方案后,生成完整脚本和分镜表;
  • 分镜表逐条调用文/图生视频模型;
  • 调用配音、配乐、剪辑能力合成成片;
  • 最后提交可下载的MP4。

这份说明书写得越细,智能体跑出来的成果就越稳定。这也是为什么同一个底层模型,套不同Skill出来的效果差别巨大的原因。

3.3 双入口设计:人也能用,Agent也能用

2026年这批一站式AI视频平台,有一个特别值得关注的产品设计趋势:双入口

什么叫双入口?同一套创作能力,既给人开了一个图形界面(无限画布、可视化节点、拖拽连线),也给智能体开了一个调用接口(Skill接口、自然语言指令)。这意味着:

  • 你想精细控制,就打开画布,自己一个节点一个节点地搭流程;
  • 你想图省事,就打开智能体,丢一句"帮我做一支新中式茶饮的TVC广告",剩下的全交给它。

辛梓煜在词元二号站的实操心得是:这两种模式不互斥,反而很互补。前期摸索一个新风格,用画布慢慢调;一旦摸出一套稳定流程,把它保存下来,后续用智能体批量复用。一个流程跑通,可以复用一百次。

3.4 Skill市场:从"自己写"到"开箱即用"

Skill还有一个特别有意思的地方——它是可以被打包、分发、再分发的。

像LibTV这类平台已经把自己的Skill开源到了GitHub上,任何支持Skill规范的智能体(Claude Code、OpenClaw、Cursor、Codex CLI 等)都能直接装载使用。这意味着普通创作者不用懂代码,也可以直接调用别人写好的、已经被验证过的工作流。

我把Skill市场理解成"工作流应用商店"。逻辑上跟手机App商店没什么区别:你不想自己学怎么编辑视频,直接下载一个剪辑App;同理,你不想自己写流程,直接下载一个Skill。

flowchart LR
    A[创作者] --> B{选择入口}
    B -->|手动控制| C[无限画布]
    B -->|托管自动化| D[智能体]
    C --> E[节点工作流]
    D --> F[调用Skill包]
    F --> G[官方Skill]
    F --> H[社区Skill]
    F --> I[自建Skill]
    E --> J[成片]
    G --> J
    H --> J
    I --> J

这张图把双入口和Skill的关系画清楚了。无论从哪条路径进,最后汇到同一个产物——一支可交付的成片。


第四章 · 商业级TVC广告片制作实战六步法

理论铺垫完毕,进入正题:从0到1,怎么用智能体工作流做出一支商业级TVC广告片。这一章用一个虚拟案例走完六个步骤,每一步都讲清楚AI在做什么、你要做什么。

虚拟案例:为一款"新中式陶瓷保温杯"做一支15-30秒的TVC广告片。

4.1 第一步:启动智能体,设定任务

打开平台,进入智能体入口,选择"TVC广告制作"这一类Skill。然后做两件事——

第一件,上传产品图。一张正面图、一张45度斜侧图、一张细节图,基本上够了。手机随便拍,光线别太糟就行,不需要专业摄影。智能体会自动识别产品形态、材质、颜色。

第二件,用一句话说清楚需求。我的范例话术是:

请基于上传的产品图,为这款新中式陶瓷保温杯做一支
20秒左右的TVC广告片。
目标人群:25-35岁注重生活仪式感的都市女性。
核心卖点:24小时保温 + 国风釉色工艺 + 单手开盖。
情绪基调:温润、雅致、有故事感。
风格参考:类似新中式茶饮品牌的视觉调性。

这一句话已经把"四件套"(人群、卖点、情绪、调性)讲完了。智能体接到指令之后,会先反问你一些它还需要补的信息——比如有没有代言人参考、需不需要旁白、希望什么场景、最终交付什么尺寸(横屏 / 竖屏)。一个一个回答就行。

4.2 第二步:虚拟代言人与风格参考

请不起明星没关系,智能体会自动帮你策划一个"不会翻车的虚拟代言人"。

它会基于品牌调性,生成两到三个虚拟人设方案——比如这个保温杯的案例,可能生成:"古风穿搭的25岁女生 + 城市公寓"、"职业女性 + 设计感工作室"、"独居博主 + 老房子改造"三种走向。每个走向都会附一张参考人物图。

挑一个最贴近品牌想要的形象,智能体会进一步生成这个虚拟代言人的三视图——正面、侧面、背面。这是为后面所有镜头里"角色长相一致"打下的根基。再细一些的话,还会顺带生成九宫格表情(微笑、平静、思考、惊讶 ...)和四种常见姿态(站、坐、走、举杯)。这些都是为下一步分镜服务的"基础资产"。

虚拟代言人资产清单
─────────────────────────
├── 三视图(正/侧/背)
├── 九宫格表情
├── 四种姿态
├── 服装与配饰特征锁定
└── 与产品互动的标准动作

辛梓煜的实操建议:这一步别赶时间。三视图不满意就重新生成,直到你看着这个虚拟代言人觉得"对,就是她"。后面所有镜头都基于这套形象展开,基础没打好,后面镜头会一直崩。

4.3 第三步:三套创意方案,选一套深化

代言人和风格定下来,智能体会自动产出三套创意方案。每一套都是一个完整的"故事走向 + 镜头走向"。

举例,刚才那个保温杯的三套方案可能长这样——

方案A · 晨光仪式:女主清晨在书房泡茶,镜头跟着保温杯从书桌到阳台,落点在城市天际线。卖点埋点:开盖动作特写、保温雾气视觉化、釉色光泽近景。

方案B · 山行茶记:女主带着保温杯去山间徒步,中途休息时倒出一杯温茶,镜头切到一组山水空镜。卖点埋点:户外环境验证保温能力、釉色与山水的色彩呼应。

方案C · 夜读时光:女主深夜在书房读书,保温杯始终在桌边,镜头用光影变化暗示时间流逝,八小时后倒出依然温热的茶。卖点埋点:时间维度的保温证明、单手开盖的工作场景。

你只需要选一套——比如选了方案B。这一步不需要解释为什么,直接告诉智能体"用方案B"就行

4.4 第四步:脚本与分镜协同生成

选定方案后,智能体进入"脚本 + 分镜协同生成"环节。屏幕上你会看到两个区域:

  • 左侧:可视化的分镜画布。每一个镜头是一张关键帧图,带着景别、时长、运镜标注。
  • 右侧:对话区,智能体跟你解释每一步在做什么,你可以随时插话调整。

这种"左实操 + 右对话"的界面设计,在2026年成了主流。它的好处是:你不再是无脑点点点,而是可以在过程中学习和理解影视创作的逻辑。看到智能体说"这里安排一个2秒的近景特写,强化产品质感",你就明白"近景"在叙事里的功能;看到它说"这一段用慢推镜头,突出主角的笃定感",你就理解了"慢推"代表的是什么情绪。

每一个分镜都能单独点开重新编辑提示词。你想改某个镜头的色调、运镜、构图,直接点击那张关键帧,重新调prompt,右侧的脚本和后续镜头会同步联动调整,不需要整段推倒重来

辛梓煜@词元二号站的实操心得:在这一步多花时间。脚本和分镜是整个项目的骨架,骨架定了,后面镜头生成基本就是体力活。

4.5 第五步:确认指令,自动合成

所有分镜确认完毕,你只需要输入一句"确认开始生成"。接下来几分钟到十几分钟里,智能体会做下面这些事情:

flowchart TD
    A[确认指令] --> B[批量生成每个镜头]
    B --> C[镜头之间风格统一性校验]
    C --> D[自动配乐与音效匹配]
    D --> E[自动语音合成与对口型]
    E --> F[镜头无缝衔接]
    F --> G[色彩分级与质感优化]
    G --> H[字幕生成]
    H --> I[导出成片]

注意中间有个风格统一性校验——智能体会自动检查每一个镜头里虚拟代言人的长相、服装、场景的统一程度。一旦发现某一帧"崩了",会自动重抽。这一步是2025年之前的工具最大的痛点,现在被Skill流程内置解决掉了。

4.6 第六步:导出 + 微调

成片导出之前,你会看到一个完整预览。这时候有两条路——

第一条:看完觉得没问题,直接点击导出,得到一支带配音、配乐、字幕、调色完整的MP4。这是最省事的走法。

第二条:看完觉得某几个镜头还需要微调,可以精确到某几秒的片段进行重新生成。比如你觉得第3个镜头的运镜太快,第7个镜头的色调偏暗,直接在画布上点开对应片段,微调prompt再生成就行。其他镜头不受影响,稳定性能保住。

整个流程跑下来,从上传产品图到成片,熟练之后大约一个工作日内能搞定。要知道,过去同样质量的TVC,从脚本到拍摄到后期,小则一周大则一个月。这个时间压缩才是AI视频真正改变行业的地方,而不是某个炫酷的特效。


第五章 · 虚拟代言人与角色一致性的解法

上一章里出现频率最高的词,可能就是"角色一致性"。这是AI视频里最容易翻车、也最体现专业度的环节。这一章把它单独拎出来,把"为什么难、怎么解、注意什么"讲透。

5.1 为什么AI生视频里角色总是"崩脸"

新手做AI视频,最常见的吐槽是:"同一个人在前后两个镜头里长得完全不一样!"

这个现象的本质,叫做"角色漂移(Character Drift)"。底层原因是这样:你每次让模型生成一张图或一段视频,它都是基于提示词"重新画一遍"。即使你写得再详细——"25岁、长发、白衬衫、戴金丝眼镜"——模型每次画出来的细节都会有微小差异。几十个镜头叠加之后,这些微小差异累积起来,就变成了观众肉眼可见的"换人"

解决思路有两个方向——

方向一:把角色的形象"固化"成参考资产,每一次生成都强制比对这套资产。

方向二:在模型层用专门的算法锁定角色身份特征(比如脸部嵌入向量),无论提示词怎么变,脸不变。

主流做法是把两条路结合用。下面分别讲。

5.2 三视图的作用

为什么AI视频平台在做代言人时,第一件事一定是生成三视图?

三视图(正面 / 侧面 / 背面)是为了让角色的造型具备规范性和完整性。它清晰呈现正面、侧面、背面的整体比例、结构细节与轮廓特征,让AI在不同角度都能拿到稳定的参考。

为什么三视图比单张正面图好用?
─────────────────────────────────
1. 提供多视角参考 → 减少视角矛盾
2. 锁定身高比例 → 避免身体走样
3. 锁定服装结构 → 避免衣服换样
4. 锁定发型 → 避免发型抽风
5. 提供AI"抄作业"的标准答案 → 推理时更稳定

更细致的做法是,在三视图基础上再加一套九宫格表情(微笑、平静、害羞、生气、疑惑、开心、难过、惊讶、思考)和多机位四宫格(自拍角度、远景、中景、近景)。这一整套加起来,就是角色的"基础资产包"。

5.3 角色一致性的提示词工程

光有资产包还不够,提示词也得跟上。一个标准的"保一致性"提示词长这样:

[文生图提示词结构模板]
{景别选择},{角色外观完整描述},{主体动作},
{环境场景},{情绪氛围},{视觉风格},{光影效果}

关键要点:
- 每一个分镜的提示词,都必须完整重复角色外观描述
  (年龄、性别、服装、发型、配饰),不要简写为"她"
- 景别按视角类型选词,自拍视角用"手机自拍角度",
  第一人称用"主观镜头",第三人称用传统的远/中/近/特写
- 视觉风格和光影效果在整个项目里保持一套

我自己的实战经验:外观描述这段,直接做成一段固定文本,放在每个分镜提示词的最前面,不要每次重写。重写一次就漂移一次。

5.4 模型层的身份锁定

除了提示词工程,2026年这一代视频模型在算法层也下了功夫。比较有代表性的方向是基于面部嵌入(face embedding)的身份锁定——上传一张人物照片,模型把这张脸的关键特征向量提取出来,在生成时强制让结果向这个向量靠拢。

这种做法的好处是不受提示词变化的影响。哪怕你写"她在跑步、在吃东西、在跳舞、在哭",脸都还是同一张脸。

辛梓煜的判断是:未来一致性这件事,会从"提示词工程"逐渐转移到"模型内置能力"。现在还需要靠人去精心写prompt保一致,过一两年可能模型直接帮你搞定。但作为创作者,理解一致性的原理,什么时候都不会过时。

5.5 跨集 / 跨片段的一致性怎么保

如果你做的不是单支TVC,而是一个多集短剧或者连续MV,挑战会再升一个量级——跨集角色相似度要保持在90%以上才算合格。

主流平台的解决方案是把"角色库"做成项目级资产:同一个项目下,所有的剧集、所有的分镜,共享同一份角色定义。任何一集对角色做调整,其他集会自动同步。这种设计能把跨集相似度做到95%以上。

对创作者的提醒:项目开始就把角色库建好,中途不要轻易改。改一次,后续所有镜头都得重新跑一遍。


第六章 · 分镜里的镜头语言与提示词翻译

很多人写视频提示词,第一反应是"画一个女生在咖啡馆喝咖啡"。这种写法太业余了。专业的做法是用镜头语言去描述。这一章把分镜里的镜头语言基本盘讲一遍,然后教你怎么把它翻译成AI能理解的提示词。

6.1 景别:画面里主体占多大

景别是分镜的第一要素。它决定的是观众看到多少、看清多少、情绪有多近。

景别

范围

情绪功能

典型用法

大远景

主体很小,环境占主导

交代环境、营造孤独 / 宏大

开场镜头、转场镜头

远景

主体清晰,环境仍主导

强调空间感

城市夜景、自然风光

全景

主体全身入画

展示动作和身体语言

舞蹈、运动

中景

主体腰部以上

对话、叙事推进

大量普通叙事镜头

近景

主体胸部以上

进入情绪、强化产品质感

反应镜头、产品特写

特写

主体面部 / 局部

强情绪 / 关键细节

眼神、嘴角、产品扣件

大特写

主体局部细节

极致情绪 / 极致细节

眼睛、零件

写提示词时,直接把这些词放在最前面。AI模型对"medium shot"、"close-up"、"wide shot"这类英文术语和"中景"、"近景"、"远景"的中文表达,都已经识别得很稳定。

6.2 构图:观众的眼睛被引到哪里

构图决定的是画面里的视觉焦点在哪儿。常用的有——

  • 三分法:主体落在画面三分线的交点上。
  • 居中构图:主体放正中,适合产品展示、对称美感。
  • 引导线构图:用路、栏杆、建筑边缘把观众视线导向主体。
  • 框架构图:用窗、门、镜面把主体框在内部,营造层次。
  • 留白构图:大面积空间,主体占小角,适合情绪铺陈。

提示词里写一句"rule of thirds composition"或者"centered composition with negative space"就能影响模型的画面布局。这种细节,新手最容易忽略。

6.3 运镜:镜头是怎么动的

运镜是分镜里最容易让AI"翻车"的环节,因为它涉及视频的动态。常用的运镜方式包括:

推镜头 → 镜头向主体靠近,放大主体,强化情绪
拉镜头 → 镜头远离主体,交代环境,营造抽离感
摇镜头 → 镜头水平 / 垂直转动,展示空间
移镜头 → 镜头平移,跟随主体或环境
跟镜头 → 镜头跟着主体走,沉浸式
升降镜头 → 镜头垂直上下移动,营造仪式感
环绕镜头 → 镜头围着主体转一圈,展示360度

写提示词时,把运镜放在景别后面,例如"medium shot, slow dolly in"(中景,缓慢推近)。运镜越复杂,模型越容易出错,商业级项目里优先用简单稳定的运镜,推、拉、缓移这类基本款,效果最稳。

6.4 节奏:镜头时长背后的情绪

镜头时长是节奏的核心。一般规律——

  • 0.5-1.5秒:快剪片段,适合燃、动感、紧张
  • 2-3秒:常规叙事,适合大部分内容
  • 4-6秒:慢节奏,情绪渲染、产品展示
  • 7秒以上:长镜头,需要内部动作支撑,否则观众跑神

辛梓煜在词元二号站做过一个测试:同一组镜头,把时长从平均3秒压到平均1.5秒,完播率提升了将近20%。当然这不是绝对真理,得看品类——美妆 / 食品适合慢一点,运动 / 数码适合快一点。

6.5 把语言翻译成提示词:一个完整范式

把上面这些组合在一起,一个标准的视频提示词应该是这样:

[景别] + [运镜] + [角色完整描述] + [主体动作] + 
[环境场景] + [情绪氛围] + [视觉风格] + [光影效果]

示例:
Medium shot, slow dolly in, a 28-year-old Chinese 
woman with long black hair wearing a beige knit 
sweater, gently holding a celadon teacup, sitting 
at a window-side wooden desk in a sunlit Chinese 
study room, peaceful and contemplative mood, 
new Chinese aesthetic style, warm a
🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数106 篇
昨日发布4 篇
本月发布14 篇
建站时间38 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码