本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
如果你只想要结论,这一段先给你钉死:现在的 NotebookLM 已经能把你上传的任何一份资料,自动压缩成一支约 60 秒、竖屏 9:16 的"短视频摘要",画面由 Google 的 Nano Banana 2 Lite 图像模型生成,质感比过去的图文摘要高一大截。这个新的竖屏短视频格式在目前的推出阶段是英文优先的(要先讲清楚:NotebookLM 更早的长视频摘要早已支持含中文在内的 80 多种语言,这里单指刚上线的竖屏短视频这个新格式);如果你就想要这个竖屏格式的中文配音字幕版,或者想把手头任意一支英文视频本地化,思路是——把英文成片下载下来,交给一个"AI 编程代理"(Antigravity / Codex / Claude Code 都行),用一把 Gemini API Key,跑一条"语音识别 → 翻译 → 中文语音合成(TTS)→ FFmpeg 合成"的流水线,全程几乎零成本、零剪辑功底。 这套方法真正值钱的不是某个按钮在哪里,而是"让 AI 代理帮你把一件重复的工程活自动跑完"的工作范式。
整篇文章我会从零讲起:NotebookLM 的短视频功能到底是什么、Nano Banana 2 Lite 凭什么让画面起飞、怎么建笔记本、怎么切出短视频、怎么拿 API Key、怎么给代理写任务提示词、三个关键产物(SRT 字幕 / 中文语音 / 成片)分别怎么来,最后附上我自己一路踩过的坑。想看完整拆解,往下翻。
一、先把这件事说清楚:我们到底在折腾什么
先别急着打开任何软件。我发现很多人一上来就跟着点按钮,点到一半彻底懵掉,就是因为没搞清楚这条链路的"骨架"。所以第一节我不讲操作,只讲脉络。
这两年 AI 内容工具进化得有点吓人。以前你要把一份几十页的资料"消化"掉,只能自己读,或者让工具生成一段文字摘要。后来 NotebookLM 加了音频摘要,能把资料读成两个人对谈的"播客"。再后来它能出图文并茂的长视频。而现在,它把最流行的短视频形态也接了进来——你丢一份 PDF、一份笔记、几个网页链接进去,它给你吐一支竖屏小视频,配画面、配旁白、配动态字幕,一分钟看完一份长文档的核心。
问题在哪儿?这个刚上线的竖屏短视频格式,在目前的推出阶段是英文优先的。 这里得说准一点,免得你误会:NotebookLM 更早的那种长视频摘要(16:9 的演示型长片),其实早就支持了包括中文在内的 80 多种语言,输出语言在生成前还能自己挑。真正暂时"只出英文"的,是这个新加的竖屏短视频格式——它跟其他新功能一样,上线初期先出英文,多语言随后再跟上。所以对想用这个新格式的中文创作者来说,一支英文竖屏视频没法直接用。于是就有了本文的核心任务:
把 NotebookLM 生成的英文短视频,本地化成一支自然口语的中文配音、带中文字幕、时间轴尽量对齐原片的成品。
先把话说在前头,免得你白忙活:如果你要的只是"中文视频摘要"、并不在乎是不是竖屏短片,那你根本不用走这条流水线——直接用长视频摘要、在生成前把输出语言选成中文就行。 这条本地化流水线真正的适用场景有两个:一是你确实想要那个新的竖屏短视频格式的中文版(它目前还没跟上中文),二是你想把任意一支英文视频(不限于 NotebookLM 出的)本地化成中文。想清楚自己属于哪种,再决定要不要往下折腾。
听起来像是要开一堆剪辑软件、逐句配音、逐帧对字幕。放在两年前确实是这样,是个纯体力活。但今天我们有了"AI 编程代理"——你用大白话把需求描述清楚,它自己去写脚本、装依赖、调 API、跑命令,把这条流水线端到端跑完。整件事的鸟瞰图长这样:
flowchart LR
A[上传资料到 NotebookLM] --> B[生成英文短视频摘要]
B --> C[下载英文成片 input.mp4]
C --> D[AI 编程代理接管]
D --> E[语音识别: 生成英文 SRT]
E --> F[翻译: 英文 SRT -> 中文 SRT]
F --> G[Gemini TTS: 中文旁白配音]
G --> H[FFmpeg: 音视频字幕合成]
H --> I[中文配音字幕成片]
看懂这张图,你就抓住了全文的主线。左半边是"内容生产"(NotebookLM 出片),右半边是"本地化工程"(代理跑流水线)。下面我会把每一段都拆开讲透,新手也能跟着走完。辛梓煜@词元二号站的习惯是:先给骨架,再填血肉。
1.1 为什么"本地化"这件事值得单独拎出来讲
我知道有人会想:不就是加个中文字幕吗,有必要写这么长?还真有必要。语言这道坎,是中文内容创作者面对海外优质工具时永远绕不开的。海外的 AI 内容工具往往是"英文优先",一个功能上线,中文用户经常要等好几个版本才轮到自己。你要么干等,要么自己想办法把英文成品"翻译"过来。
而"翻译一支视频",跟"翻译一段文字"完全不是一个量级的活。文字翻译,复制粘贴就行;视频本地化,牵涉到音频、时间轴、字幕、画面四条线要同时对齐,任何一条错位,成片就废了。过去这种活是专业后期团队干的,一支一分钟的片子,人工配音加对轴可能要折腾大半天。
所以这篇文章真正想教你的,是怎么把这个"大半天的体力活"压缩成"点几下、等几分钟"的自动化流程。一旦你把这条流水线跑通,它就是可复用的——今天拿来本地化 NotebookLM 的短视频,明天就能拿来本地化任何一支英文视频。这才是它的复利所在。
1.2 这条链路对硬件和门槛的要求
再帮你打消一个顾虑:这套流程对电脑配置几乎没要求。NotebookLM 是在浏览器里跑的,出片全靠云端;本地化流水线里,识别、翻译、配音也都是调云端 API,只有 FFmpeg 合成那一步在本地跑,而 FFmpeg 处理一支一分钟的小视频,几乎不吃性能。换句话说,一台普通笔记本就能全程跑完,不需要什么高端显卡。真正的门槛只有一个:你愿不愿意把这套流程的逻辑搞清楚。 这也是我把前几节写得这么细的原因。
二、NotebookLM 的"短视频摘要"到底是什么
2.1 一句话认识 NotebookLM
如果你完全没听过 NotebookLM,可以先这样理解它:这是一个"基于你自己资料"的 AI 学习整理工具。 关键词是"基于你自己的资料"。它跟你平时用的通用对话 AI 不一样——通用 AI 什么都聊,但可能一本正经地胡说;NotebookLM 只在你上传的资料范围内工作,回答、摘要、视频统统"接地气"地绑定在你的原始来源上,尽量不瞎编。
它一路长出了很多种"输出形态":文字摘要、可以追问的问答、双人对谈的音频、图文长视频、可视化讲解等等,现在又多了一个短视频。可以说它已经从一个"文档问答工具"长成了一个横跨文字、音频、视频的多形态内容平台。
2.2 短视频摘要 vs 传统视频摘要
短视频摘要是约 60 秒、9:16 的竖屏视频,是 NotebookLM 更长的 16:9 视频摘要的"移动端小弟" 。两者的差别,我整理成一张表:
|
维度 |
传统视频摘要(长片) |
短视频摘要(竖屏) |
|
画幅 |
16:9 横屏 |
9:16 竖屏 |
|
时长 |
几分钟,允许展开论证 |
约 60 秒,一个钩子一个要点 |
|
定位 |
桌面端、系统性讲解 |
手机端、社媒刷流形态 |
|
生成节奏 |
更"电影感"、更精雕 |
快、便宜、鼓励你多生成 |
|
语言 |
已支持 80+ 语言(含中文) |
新格式,推出初期英文优先 |
短视频这种"一个概念一支片"的形态,就是奔着 TikTok、YouTube Shorts、Instagram Reels 这类平台的观看习惯设计的,逼着模型只讲一个核心洞见——钩子、关键证据、结论 。换句话说,它天生适合做知识科普的引流小片。
最后一行"语言"这栏,是全文的关键前提,我单独强调一下:更早的长视频摘要原本也是英文独占,后来 Google 把它扩展到了 80 种语言,法语、德语、西班牙语、日语、中文等都覆盖了 ;音频和视频摘要如今都能生成中文,系统按你 Google 账号的首选语言输出,你也可以在每次生成前手动切换输出语言 。所以"要本地化"这件事,只针对刚上线、还没跟上多语言的竖屏短视频这个新格式,别把它误读成"整个 NotebookLM 都只会英文"——那是不准确的。
2.3 让画面"起飞"的关键:Nano Banana 2 Lite
短视频摘要之所以质感比以前好看太多,核心是换了图像引擎。这个功能用的是 Nano Banana 2 Lite,官方名字叫 Gemini 3.1 Flash-Lite Image,是 Google 号称"最快、最省"的图像生成与编辑模型,主打约 4 秒出一张图 。为什么要用一个"轻量"模型?道理很直白:
一支一分钟的视频,本质是把很多帧图串起来。图要生成得又快又便宜,整条视频才跑得起来,你才会愿意一支接一支地做。
这套图像模型能搭出有上下文的场景、保持画面里物体的一致性,还能把清晰、同步的动态字幕叠到适配手机的版面上 。这也是为什么现在的短视频摘要看起来不像"AI 随手拼的图",而更像有人认真做过美术设计。
顺带说一句权限:这个功能面向 Google AI Ultra 和 Pro 订阅用户先开放,网页端和手机端都能用,Google 说随后会向免费用户扩展,且限定 18 岁及以上使用 。所以你如果暂时找不到入口,先确认账号权限和是否还在灰度中。
2.4 它凭什么"接地气":内容始终绑定你的来源
短视频摘要跟外面那些"随便生成一段视频"的工具,有一个本质差别,我必须单独说清楚,因为这决定了它能不能用来做严肃的知识科普。
让这个功能不只是噱头的关键,是内容始终锚定在你的来源上——它不是给一段通用素材配个旁白,而是把你自己的材料(研究论文、季度报告、课堂笔记)压缩成一分钟里最有说服力的那个点 。这句话翻译成大白话就是:它讲的每一句,理论上都能在你上传的资料里找到出处,不是凭空编的。
这一点对做知识内容的人太重要了。通用 AI 生成视频,最大的风险是"一本正经地胡说"——画面很漂亮,内容却似是而非。而 NotebookLM 因为被"钉"在你的资料上,跑偏的概率小很多。当然它也不是绝对不会错,我后面会讲怎么用提示词进一步收窄它的发挥空间。
2.5 视觉风格:为什么每支片子长得不一样
你多生成几支会发现,画面风格会变。在更早的视频摘要升级里,Google 就为画面引入了水彩、剪纸、动漫、白板、复古印刷、传统风等多种视觉风格,让视频不只是"告诉你"文档讲了什么,而是帮你理解和记住 。短视频延续了这套思路:系统会根据主题自动挑一种美术风格,配上动态排版的字幕,观感因此有一种"图文并茂"的精致感。
这背后其实是一个很聪明的产品判断:图像模型能基于你上传的来源生成有帮助、贴合上下文的插画 。也就是说,画面不是套模板贴上去的通用素材,而是"读懂了你的内容之后"画出来的。这也是为什么同样一个知识点,NotebookLM 出的短视频往往比你自己用模板拼的更耐看。
2.6 短视频在整个 NotebookLM 里的位置
把视野拉高一点看:NotebookLM 一开始只是个简单的文字摘要助手,后来迅速扩展成能生成深度音频讨论、可视化幻灯、电影感讲解的多形态媒体中枢,如今再把竖屏短视频纳入其中,明显是在贴合年轻学生和创作者的媒体消费习惯 。理解这个演化脉络有好处——它意味着短视频不是一个孤立功能,而是这套"一份资料、多种形态输出"体系里的一环。你今天学会用它出短视频,明天顺手就能用同一份资料出音频、出长视频,一鱼多吃。
三、动手第一步:建立笔记本并汇入资料
理论铺垫完,开始上手。这一段的目标很简单:建一个笔记本,把要讲的主题资料喂进去。
3.1 找到入口、建立新笔记本
在浏览器里登录你的 Google 账号,从右上角的应用程序入口往下找到 NotebookLM,进去之后点"新建笔记本"。这一步没有任何玄机,跟你新建一个文档差不多。
3.2 汇入资料
进到笔记本里,把你想讲的资料汇进去。资料可以是 PDF、网页链接、粘贴的文字、Google 文档等等。我这次拿来做示范的主题,是一个很适合科普的技术点:Google 的 Gemma 4 开源模型,尤其是它那个"混合专家"版本。为什么选它?因为它本身概念清楚、又足够新、又能讲出"原理感",特别适合被压成一支 60 秒短视频。
顺便,我把这个主题的原理也给你讲明白——这样你既懂了操作,又顺手学到一个知识点。
3.3 顺手科普:Gemma 4 26B MoE 的原理
传统大模型是"密集(Dense)"结构:处理每一个词,都要把网络里所有的参数(你可以理解成一个个"神经连接")全部点亮一遍。 参数越多算得越准,但也越吃显存、越慢、越贵,动不动就得上昂贵的云端服务器。
Gemma 4 里那个受关注的版本换了思路,用的是"混合专家(MoE,Mixture of Experts)"结构。打个比方:与其让全公司所有人一起处理每一份工作,不如养一群"专家",来一个任务,只叫最相关的几位出手,其余的人先歇着。
具体到数字:这个 26B 的 MoE 版本,虽然总参数量很大,但每处理一个词只激活大约 38 亿参数,算力负担比 31B 的密集版小很多 。也就是说,激活比例大致是
[ \frac{38\ \text{亿}}{260\ \text{亿}} \approx 14.6% ]
带来的直接好处是——用消费级显卡就能在本地跑:这个 MoE 模型能以较低显存需求跑推理,Q4 量化下大约 8GB 显存就能在 RTX 3070 甚至 RTX 2080 这类消费级显卡上运行,兼顾了性能与可及性 。一句话总结这段科普:
你能拿到"巨型网络的推理品质",却只付"小型网络的运行速度"。
不过这里有个容易被忽略的细节,我必须提醒你:虽然每个词只激活约 40 亿参数,但全部参数都得常驻显存,因为路由器要能随时访问所有专家来决定激活谁;所以它"跑起来像小模型,装起来却像大模型" 。省的是算力,不是显存——这点很多人一开始会搞混。
3.4 再往深挖一层:路由器和"专家"是怎么协作的
上面那个"叫专家出手"的比喻,我再拆细一点,帮你把 MoE 彻底吃透——顺便这也是一支好短视频该讲清楚的深度。
一个 MoE 层内部,藏着很多个"专家"小网络,外加一个叫"路由器(router)"的调度员。每来一个词,路由器就把它分派给最相关的少数几个专家,其余专家不参与计算,从而让整体计算保持稀疏;这让模型既能拥有很大的总容量,每次推理又只用其中一部分 。你可以想象成一个庞大的会诊团队:病人(词)来了,分诊台(路由器)只叫对口的几位专家(专家网络)来看,不用全院上阵。
这套设计的稀疏程度可以做得很夸张。有的实现里每层放上百个专家,每个词只激活其中极少数,激活比例低到百分之一点几,意味着单个专家更小、能更专注地各管一摊 。总容量巨大,单次开销却很小——这就是 MoE 的魔法。
我把"密集"和"混合专家"两种路线的差别压成一张表,一眼看明白:
|
对比项 |
密集(Dense)结构 |
混合专家(MoE)结构 |
|
每个词的参数参与 |
全部参数都点亮 |
只激活一小部分专家 |
|
单次推理算力 |
高 |
低(跟激活的小模型相当) |
|
显存占用 |
高 |
同样高(所有专家都得常驻) |
|
总知识容量 |
受算力预算限制 |
可以做得很大 |
|
通俗类比 |
全员上阵处理每件事 |
按需叫对口专家出手 |
3.5 为什么"能本地跑"是件大事
你可能会问:讲这么多原理干嘛?因为"能不能在自己电脑上跑",直接决定了这类模型的普及程度,而这恰恰是个好选题。Google 团队自己就说,MoE 架构对本地部署是一次范式转变——每个词只激活一小部分参数,就把"26B 级别的质量"带到了多数开发者手里已有的消费级显卡上 。
本地能跑意味着三件实在的好处:不用按 token 付费、数据不出本机因而更私密、下载好之后离线也能用。对追求本地部署的人来说,这三点合起来就是零 API 成本、完整隐私、离线可用 。
再补一个容易被误读的点,前面提过、这里落成结论:MoE"跑起来像小模型,装起来像大模型"。 省的是每次推理的算力,不是显存——所有专家都得先塞进显存,路由器才能随时挑。搞混这一点,你选硬件时就会踩坑。好了,这段原理本身,就是我们等下要让 NotebookLM 压成短视频的"内容"。你可以把它整理成一段文字或一份 PDF 汇入笔记本。
四、打开"短视频摘要"功能:界面语言切换的小技巧
资料喂进去后,右侧的工作区里就能找到视频摘要相关的设置。点进去,你会看到"短视频摘要"的选项。
4.1 如果你只看到英文界面 / 没看到短视频选项
这个竖屏短视频格式在推出初期是英文优先的。如果你的界面还没出现短视频入口,一个常用的小办法是把 Google 账户的显示语言切成英文,让新功能先露出来。步骤:
- 新开一个标签页,进入 Google 账户管理。
- 在"个人资料 / 个人信息"里找到"语言"设置。
- 新增一门语言,把英文(English)加进去。
- 把英文用箭头顶到最上面,设为首选语言,保存。
- 回到 NotebookLM,刷新页面。
刷新后界面会切成英文,短视频(Short Video Overviews)入口通常就出来了。等你用完,随时可以把中文顶回去,不影响日常使用。
小提醒:这纯粹是"切换账户显示语言"的合规操作,跟任何绕过网络管控的手段无关,别想复杂了。功能全量之后,这一步大概率也就不需要了。
4.2 生成你的第一支短视频
回到笔记本,打开视频摘要设置,你会看到系统根据你汇入的资料,自动推荐了几个候选主题。你可以直接选一个,也可以在自定义主题(custom topic)里写自己的提示词,指定这支短视频要聚焦讲什么。
关于提示词,我的经验是:
- 优先用英文写提示词。 目前英文提示词的效果最稳。
- 不用写得很复杂。 一两句话点明"聚焦哪个概念、面向谁、什么调性"就够了。
- 你可以准备两三个提示词模板轮着试,挑生成效果最好的那支。
写好点生成(Generate),等一小会儿,一支约一分钟、带动画、带字幕、带英文旁白的竖屏短视频就出来了。以我这次的示范来说,成片会用一分钟左右把