本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要:字节跳动的视频生成模型 Seedance 2.5 在 2026 年 7 月 31 日正式上线,单次生成时长从上一代的 15 秒翻倍到 30 秒,原生直出 4K 分辨率,参考素材上限从 12 个猛增到 50 个(30 张图 + 10 段视频 + 10 段音频),还多了帧级定向编辑和白模、绿幕等专业参考能力。配合 AI 视频创作平台 LibTV(哩布哩布 AI 出品)围绕它做的适配,创作者可以在一个画布里完成从剧本、角色设定、分镜、超长成片到剪辑、局部重拍的完整链路——最直观的变化是:以前一集 AI 短剧要拼两三次镜头,现在能一次生成最长 5 分钟的连贯成片,人物、场景、光影全程不掉线。这篇文章我会把 SD2.5 的升级点、LibTV 的五大配套功能(超长视频、Agent 工作流、智能引用、奇妙拉片、智能剪辑、片段重拍)逐个拆开讲,附上我自己实测的提示词写法和避坑经验。想看完整拆解,往下翻。
我自己折腾 AI 视频也有一年多了,从最早的"抽卡式"短镜头一路玩到现在的长视频工作流,最大的感受是:工具迭代的速度,比大多数人想象的要快。上个月我还在为一集 60 秒的 AI 短剧反复抽镜头、拼素材、调一致性焦头烂额,这个月换上新模型和新平台之后,整个流程顺畅得有点不真实。这篇文章就把我这一轮实测的完整记录整理出来,从模型升级到平台功能,再到具体的提示词和操作步骤,尽量一次讲透,希望能帮同样在玩 AI 视频的朋友少走点弯路。
第一章 从拼镜头到一条过——AI 视频创作到底卡在哪
先说点背景。做 AI 视频的人应该都有过这种经历:想要一段稍微长一点、有点叙事的内容,就得把几个三五秒的短镜头一条条生成出来,再拖进剪辑软件里拼。拼完一看,问题全来了。
1.1 老一代模型的三座大山
我复盘了一下自己前半年用 Seedance 2.0 和其他主流模型做视频时反复踩的坑,基本可以归纳成三个:
第一,时长不够。 单次生成上限一般就是 15 秒左右,超过这个长度,模型就像被按了暂停键,硬生生断掉。做一条 60 秒的片子,最少也要生成四到五个片段。片段一多,拼接的工作量就上来了,剪辑软件里对时间轴、对动作、对情绪,每一项都得手动磨。
第二,一致性难保。 这是最头疼的。同一个角色,第一个镜头是黑头发,第二个镜头可能就变成深棕色;上一秒还穿着红色外套,下一秒外套上的图案就变了。衣服、发型、五官细节,在跨镜头之后经常"漂移"。你说它完全不像吧,五官还在;你说它像吧,就是处处透着不对劲。为了治这个毛病,我之前只能反复写"保持角色形象不变"之类的提示词,效果却时好时坏。
第三,抽卡成本高。 老模型一次生成想直接满意,概率不高。一个镜头平均要抽两三次才能得到能用的,碰上动作复杂的场景,抽五六次也正常。抽卡不只是花时间,每次生成都要消耗算力积分,积少成多,成本就上去了。
这三座大山,几乎是所有做 AI 短剧、AI 短片的人共同的痛点。我见过不少朋友,工具都学得挺熟,最后卡在"生成 20 个镜头、拼出一部完整片子"这一步放弃了。
1.2 Seedance 2.5 带来的是什么
2026 年 6 月,火山引擎在 FORCE 原动力大会上预告了 Seedance 2.5;7 月 31 日,这个模型正式上线。它最大的特点,就是冲着上面三个痛点去的:
- 单次生成 30 秒:比上一代直接翻倍,而且不是简单把两个 15 秒拼起来,是一次性原生生成,镜头内部的光影、运动、衔接都是连续的。
- 参考素材上限 50 个:上一代最多塞 12 个参考,这一代直接干到 50 个,其中图片 30 张、视频 10 段、音频 10 段,可以一次性把角色多角度视图、场景风格、产品细节全喂给模型。
- 原生 4K 输出:3840×2160 的分辨率,是生成出来的,不是后期放大的。画面质感的提升是肉眼可见的。
- 帧级定向编辑:支持按时间戳(精度到 1 秒以内)定向修改局部画面,还能换人、换物、换背景、换道具。
- 提示词遵循度提升约 20%:官方给的说法,我自己实测下来,复杂指令的执行确实比上一代靠谱不少。
我做了个表格,把两代模型的差异列出来,看着更直观:
|
对比维度 |
Seedance 2.0 |
Seedance 2.5 |
|
单次生成时长 |
最长 15 秒 |
最长 30 秒,原生直出 |
|
参考素材上限 |
约 12 个 |
50 个(30 图 + 10 视频 + 10 音频) |
|
输出分辨率 |
最高 1080p |
原生 4K(3840×2160) |
|
编辑能力 |
片段级修改 |
帧级定向编辑、区域级局部修改 |
|
参考类型 |
图片、视频为主 |
图片、视频、音频、白模、绿幕、运动参考 |
|
提示词遵循度 |
基准 |
提升约 20% |
这里有个细节值得单独说:50 个参考素材这个能力,看起来只是数字变大,其实是创作思路的转变。以前我们写提示词,是"用文字描述想要什么";现在喂参考图,是"把想要的东西直接摆给模型看"。素材越具体,模型还原就越准,这比堆形容词管用得多。
1.3 为什么说平台适配比模型本身更关键
模型升级是一回事,但模型能不能落地成作品,还得看平台。Seedance 2.5 能力再强,如果只能在官方控制台里敲提示词、等结果,那它离"生产力工具"还差得远。
这也是我这轮实测最在意的点:模型的能力,有没有被平台真正接住、放大。 好消息是,LibTV 这轮围绕 SD2.5 做的适配,确实把模型的新特性转化成了具体可用的功能——超长视频、智能引用、奇妙拉片、片段重拍、智能剪辑,每一个都是踩着 SD2.5 的新能力设计的。后面我把平台本身讲清楚,再把功能逐个拆开。
第二章 LibTV 是什么——为 AI 视频而生的创作工作台
LibTV 是哩布哩布 AI(LiblibAI)在 2026 年 3 月推出的一款 AI 视频创作平台,上线当天访问量就破了 10 万。它的定位很明确:把"写剧本、定角色、画分镜、生成视频、剪辑配音"这一整条链路,装进同一个工作台里,让创作者不用再在七八个工具之间来回切换。
2.1 无限画布 + 节点式工作流
LibTV 的核心界面是一块无限大的画布。双击任意位置,就能生成一个节点——文本、图片、视频、音频、脚本,想加什么加什么,也可以直接把本地素材拖进去。节点之间用连线串起来,就成了一条可视化的创作流水线。
这种"节点式工作流"的好处,我用一句话概括:每一步都看得见、改得动。 比如你生成了一组分镜图,想换掉其中一张,直接在那个节点上操作就行,不用从头再来;想调整某个镜头的提示词,点开节点改几个字,重新生成,后面的流程自动接着走。
我自己用下来的感受是,它介于两种老方案之间:一种是纯对话式的 AI 工具,给一句话它帮你生成,上手快但能力上限低,稍微复杂的创作意图它就理解不了;另一种是 ComfyUI 那种纯节点式工作流,能力很强但门槛太高,光搭节点就能劝退大半新手。LibTV 把两者揉在一起——画布上可以像 ComfyUI 一样精细控制,对话框里也可以像对话式工具一样直接下指令,两边还能联动。
2.2 人与 Agent 的双入口
LibTV 另一个比较特别的设计,是它同时给"人"和"AI 智能体"开了两个入口。
人类创作者用网页端画布,一步步操作;AI 智能体(Agent)则通过官方的 Skill 接口接入,可以自动编排节点、后台排队生成。官方还提供了 CLI 工具,把一段安装指令发给支持 Skill 的编程助手,就能让它直接调用 LibTV 的能力自动出片。
我举个自己实测的例子:我在对话框里输入"给我做一部 1 分钟的赛博朋克风格漫剧",然后让 Agent 接手。它自己拆解了任务:先写剧本,再定角色三视图,生成分镜,逐个镜头生成视频,最后把片段拼起来。全程大约二十分钟,我基本没怎么手动干预,中间只改了两处提示词。当然,Agent 模式适合流程相对成熟的活儿,复杂项目我还是更愿意自己上手在画布里排布节点——工具是死的,想法是活的,这点后面细说。
2.3 与火山引擎的官方合作
聊到 Seedance 2.5,就绕不开 LibTV 和火山引擎的合作关系。LibTV 是火山官方的合作伙伴,平台上用 Seedance 系列模型生成的所有视频,都可以查到对应的 taskid(任务 ID),通过官方渠道核验生成记录。这一点对在乎"是不是真模型"的创作者挺重要——至少不用担心用了个假壳子套了别的模型。
平台内置的视频模型不止 Seedance 一家,像可灵、Wan 等主流模型也都能调用,创作者可以根据不同分镜的需求切换模型。我把 LibTV 目前能覆盖的创作环节整理了一下:
|
创作环节 |
LibTV 对应能力 |
说明 |
|
剧本 |
脚本节点、Agent 技能 |
描述剧情意图,AI 生成脚本与分镜表 |
|
角色设定 |
角色三视图节点 |
多角度固定角色形象,供后续镜头引用 |
|
分镜 |
多宫格分镜节点 |
一键生成 4 宫格、9 宫格、25 宫格分镜 |
|
视频生成 |
视频节点 |
接入 Seedance 2.5、可灵、Wan 等模型 |
|
剪辑 |
剪辑台 |
时间轴剪辑、智能剪辑、批量广告 |
|
音频 |
音效节点 |
生成 BGM、配音,与画面同步 |
|
素材管理 |
智能引用 |
按名称直接引用参考素材,最多 50 个 |
这张表基本就是我现在做 AI 视频的完整工具箱了。以前我做一个 3 分钟短片,要在剧本工具、绘图工具、视频工具、剪辑软件之间来回倒腾十几次;现在大部分环节在 LibTV 一个页面里就能闭环,省下来的时间都用在打磨内容本身了。
2.4 订阅与算力
LibTV 采用积分制,开通会员后每天有积分额度,视频生成按秒数消耗。Seedance 2.5 上线后,平台的定价做了下调,720P 规格的单秒生成成本降到了 0.4 元档位,订阅会员最高能拿到 60 条视频的免费生成额度。这个价位放在一年前是不敢想的——当时一条 5 秒的 1080P 视频就要几块钱。价格下来之后,最大的变化是敢多试了,反正试错成本不高,抽几版对比着选,创作心态完全不一样。
当然,我写这些不是让大家一上来就买会员。平台都有免费体验额度,先把流程跑通、确认自己真的需要高频生成,再考虑订阅也不迟。
第三章 超长视频模式——一次生成 5 分钟成片的秘密
SD2.5 原生支持单次生成 30 秒,这已经是行业里数一数二的单段长度了。但 LibTV 还留了一手:在它的工作台里用 SD2.5,最长可以直接生成 5 分钟的视频。这个"5 分钟"意味着什么,得从 AI 视频的实际场景说起。
3.1 为什么 5 分钟是个分水岭
我翻了翻最近半年市面上比较出圈的 AI 作品,发现一个规律:AI 短剧单集大多在 1 分钟左右,AI 短片基本在 3 分钟上下,很少有超过 5 分钟的作品。为什么?不是创作者不想做长,而是做长的成本高到离谱。
以前做一条 3 分钟短片,按单段 15 秒算,至少要生成 12 个片段,每个片段还要抽卡 2-3 次,也就是 30 次左右的生成量。生成完还得拼:镜头之间要对齐人物、对齐场景、对齐光影,稍有偏差就要重抽。一套流程走下来,一周时间就搭进去了。
而 LibTV 的超长视频模式,是把"一次成片"这件事直接做成了产品功能。5 分钟的视频,理论上只需要生成一次,中间不需要拼接,人物、场景、光影从头到尾保持一致。我实测生成过一条接近 5 分钟的片子,整个视频就生成了一次,不是多个镜头拼出来的,BGM 是我后配的。成片看下来非常连贯,几乎没有明显的拼接感——这在半年前是不可想象的。
3.2 超长模式是怎么做到的
LibTV 的超长视频模式,本质上是把 SD2.5 的"多轮续写"能力封装进了产品里。模型在生成完前 30 秒之后,会以上一段的画面、角色、场景状态为基准,继续往后推演下一段,相当于"带着记忆往下拍"。这样一来,单段 30 秒的限制就被突破了,只要算力跟得上,可以一直续写下去。
我画了个简单的流程图,方便理解它的工作逻辑:
输入提示词(剧情 + 角色 + 场景)
│
▼
SD2.5 生成第 1 段(30 秒)◄──────┐
│ │
▼ │
记录角色/场景/光影状态 ──────────┤
│ │
▼ │
SD2.5 基于上段状态续写第 2 段 ───┘
│
▼
…… 循环续写,直至目标时长
│
▼
一次导出成片(最长 5 分钟)
这个机制的好处很直接:镜头之间的"接缝"消失了。以前最怕的就是两个镜头里角色服装细节对不上,超长模式下角色是在同一段生成逻辑里延续的,一致性天然有保障。
3.3 实操:我的超长视频制作流程
我把我最近一次用超长模式做片的完整流程记录下来,给大家一个参考:
- 先写剧本大纲:确定要讲什么故事、时长多长、分几个情节点。我建议先列个三到五行的大纲,把起承转合说清楚,再往下走。
- 生成角色设定图:用"剧本视觉资产师"之类的技能,把主角、配角的多角度视图生成出来,作为后续的参考素材。角色定妆照一定要多生成几个角度,正面、侧面、全身,方便模型在长视频里保持形象稳定。
- 把剧本转成视频提示词:这一步很关键


