📍 词元二号站 AI互联网 用 NotebookLM 短视频 + AI 编程代理 + Gemini API,把英文竖屏解说一键做成中文配音字幕版:一条龙本地化实战手册

用 NotebookLM 短视频 + AI 编程代理 + Gemini API,把英文竖屏解说一键做成中文配音字幕版:一条龙本地化实战手册

摘要:手把手教你用 NotebookLM 的短视频摘要功能生成竖屏解说,再用 Antigravity / Codex / Claude Code 这类 AI 编程代理,配合 Gemini API 跑通"识别—翻译—配音—合成"流水线,把英文短视频本地化成中文配音字幕版,全程零剪辑功底、几乎零成本。
字号 100%
行距 2.05
当前可见 35% 的内容
本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

如果你只想要结论,这一段先给你钉死:现在的 NotebookLM 已经能把你上传的任何一份资料,自动压缩成一支约 60 秒、竖屏 9:16 的"短视频摘要",画面由 Google 的 Nano Banana 2 Lite 图像模型生成,质感比过去的图文摘要高一大截。这个新的竖屏短视频格式在目前的推出阶段是英文优先的(要先讲清楚:NotebookLM 更早的长视频摘要早已支持含中文在内的 80 多种语言,这里单指刚上线的竖屏短视频这个新格式);如果你就想要这个竖屏格式的中文配音字幕版,或者想把手头任意一支英文视频本地化,思路是——把英文成片下载下来,交给一个"AI 编程代理"(Antigravity / Codex / Claude Code 都行),用一把 Gemini API Key,跑一条"语音识别 → 翻译 → 中文语音合成(TTS)→ FFmpeg 合成"的流水线,全程几乎零成本、零剪辑功底。 这套方法真正值钱的不是某个按钮在哪里,而是"让 AI 代理帮你把一件重复的工程活自动跑完"的工作范式。

整篇文章我会从零讲起:NotebookLM 的短视频功能到底是什么、Nano Banana 2 Lite 凭什么让画面起飞、怎么建笔记本、怎么切出短视频、怎么拿 API Key、怎么给代理写任务提示词、三个关键产物(SRT 字幕 / 中文语音 / 成片)分别怎么来,最后附上我自己一路踩过的坑。想看完整拆解,往下翻。


一、先把这件事说清楚:我们到底在折腾什么

先别急着打开任何软件。我发现很多人一上来就跟着点按钮,点到一半彻底懵掉,就是因为没搞清楚这条链路的"骨架"。所以第一节我不讲操作,只讲脉络。

这两年 AI 内容工具进化得有点吓人。以前你要把一份几十页的资料"消化"掉,只能自己读,或者让工具生成一段文字摘要。后来 NotebookLM 加了音频摘要,能把资料读成两个人对谈的"播客"。再后来它能出图文并茂的长视频。而现在,它把最流行的短视频形态也接了进来——你丢一份 PDF、一份笔记、几个网页链接进去,它给你吐一支竖屏小视频,配画面、配旁白、配动态字幕,一分钟看完一份长文档的核心。

问题在哪儿?这个刚上线的竖屏短视频格式,在目前的推出阶段是英文优先的。 这里得说准一点,免得你误会:NotebookLM 更早的那种长视频摘要(16:9 的演示型长片),其实早就支持了包括中文在内的 80 多种语言,输出语言在生成前还能自己挑。真正暂时"只出英文"的,是这个新加的竖屏短视频格式——它跟其他新功能一样,上线初期先出英文,多语言随后再跟上。所以对想用这个新格式的中文创作者来说,一支英文竖屏视频没法直接用。于是就有了本文的核心任务:

把 NotebookLM 生成的英文短视频,本地化成一支自然口语的中文配音、带中文字幕、时间轴尽量对齐原片的成品。

先把话说在前头,免得你白忙活:如果你要的只是"中文视频摘要"、并不在乎是不是竖屏短片,那你根本不用走这条流水线——直接用长视频摘要、在生成前把输出语言选成中文就行。 这条本地化流水线真正的适用场景有两个:一是你确实想要那个新的竖屏短视频格式的中文版(它目前还没跟上中文),二是你想把任意一支英文视频(不限于 NotebookLM 出的)本地化成中文。想清楚自己属于哪种,再决定要不要往下折腾。

听起来像是要开一堆剪辑软件、逐句配音、逐帧对字幕。放在两年前确实是这样,是个纯体力活。但今天我们有了"AI 编程代理"——你用大白话把需求描述清楚,它自己去写脚本、装依赖、调 API、跑命令,把这条流水线端到端跑完。整件事的鸟瞰图长这样:

flowchart LR
    A[上传资料到 NotebookLM] --> B[生成英文短视频摘要]
    B --> C[下载英文成片 input.mp4]
    C --> D[AI 编程代理接管]
    D --> E[语音识别: 生成英文 SRT]
    E --> F[翻译: 英文 SRT -> 中文 SRT]
    F --> G[Gemini TTS: 中文旁白配音]
    G --> H[FFmpeg: 音视频字幕合成]
    H --> I[中文配音字幕成片]

看懂这张图,你就抓住了全文的主线。左半边是"内容生产"(NotebookLM 出片),右半边是"本地化工程"(代理跑流水线)。下面我会把每一段都拆开讲透,新手也能跟着走完。辛梓煜@词元二号站的习惯是:先给骨架,再填血肉。

1.1 为什么"本地化"这件事值得单独拎出来讲

我知道有人会想:不就是加个中文字幕吗,有必要写这么长?还真有必要。语言这道坎,是中文内容创作者面对海外优质工具时永远绕不开的。海外的 AI 内容工具往往是"英文优先",一个功能上线,中文用户经常要等好几个版本才轮到自己。你要么干等,要么自己想办法把英文成品"翻译"过来。

而"翻译一支视频",跟"翻译一段文字"完全不是一个量级的活。文字翻译,复制粘贴就行;视频本地化,牵涉到音频、时间轴、字幕、画面四条线要同时对齐,任何一条错位,成片就废了。过去这种活是专业后期团队干的,一支一分钟的片子,人工配音加对轴可能要折腾大半天。

所以这篇文章真正想教你的,是怎么把这个"大半天的体力活"压缩成"点几下、等几分钟"的自动化流程。一旦你把这条流水线跑通,它就是可复用的——今天拿来本地化 NotebookLM 的短视频,明天就能拿来本地化任何一支英文视频。这才是它的复利所在。

1.2 这条链路对硬件和门槛的要求

再帮你打消一个顾虑:这套流程对电脑配置几乎没要求。NotebookLM 是在浏览器里跑的,出片全靠云端;本地化流水线里,识别、翻译、配音也都是调云端 API,只有 FFmpeg 合成那一步在本地跑,而 FFmpeg 处理一支一分钟的小视频,几乎不吃性能。换句话说,一台普通笔记本就能全程跑完,不需要什么高端显卡。真正的门槛只有一个:你愿不愿意把这套流程的逻辑搞清楚。 这也是我把前几节写得这么细的原因。


二、NotebookLM 的"短视频摘要"到底是什么

2.1 一句话认识 NotebookLM

如果你完全没听过 NotebookLM,可以先这样理解它:这是一个"基于你自己资料"的 AI 学习整理工具。 关键词是"基于你自己的资料"。它跟你平时用的通用对话 AI 不一样——通用 AI 什么都聊,但可能一本正经地胡说;NotebookLM 只在你上传的资料范围内工作,回答、摘要、视频统统"接地气"地绑定在你的原始来源上,尽量不瞎编。

它一路长出了很多种"输出形态":文字摘要、可以追问的问答、双人对谈的音频、图文长视频、可视化讲解等等,现在又多了一个短视频。可以说它已经从一个"文档问答工具"长成了一个横跨文字、音频、视频的多形态内容平台。

2.2 短视频摘要 vs 传统视频摘要

短视频摘要是约 60 秒、9:16 的竖屏视频,是 NotebookLM 更长的 16:9 视频摘要的"移动端小弟" 。两者的差别,我整理成一张表:

维度

传统视频摘要(长片)

短视频摘要(竖屏)

画幅

16:9 横屏

9:16 竖屏

时长

几分钟,允许展开论证

约 60 秒,一个钩子一个要点

定位

桌面端、系统性讲解

手机端、社媒刷流形态

生成节奏

更"电影感"、更精雕

快、便宜、鼓励你多生成

语言

已支持 80+ 语言(含中文)

新格式,推出初期英文优先

短视频这种"一个概念一支片"的形态,就是奔着 TikTok、YouTube Shorts、Instagram Reels 这类平台的观看习惯设计的,逼着模型只讲一个核心洞见——钩子、关键证据、结论 。换句话说,它天生适合做知识科普的引流小片。

最后一行"语言"这栏,是全文的关键前提,我单独强调一下:更早的长视频摘要原本也是英文独占,后来 Google 把它扩展到了 80 种语言,法语、德语、西班牙语、日语、中文等都覆盖了 ;音频和视频摘要如今都能生成中文,系统按你 Google 账号的首选语言输出,你也可以在每次生成前手动切换输出语言 。所以"要本地化"这件事,只针对刚上线、还没跟上多语言的竖屏短视频这个新格式,别把它误读成"整个 NotebookLM 都只会英文"——那是不准确的。

2.3 让画面"起飞"的关键:Nano Banana 2 Lite

短视频摘要之所以质感比以前好看太多,核心是换了图像引擎。这个功能用的是 Nano Banana 2 Lite,官方名字叫 Gemini 3.1 Flash-Lite Image,是 Google 号称"最快、最省"的图像生成与编辑模型,主打约 4 秒出一张图 。为什么要用一个"轻量"模型?道理很直白:

一支一分钟的视频,本质是把很多帧图串起来。图要生成得又快又便宜,整条视频才跑得起来,你才会愿意一支接一支地做。

这套图像模型能搭出有上下文的场景、保持画面里物体的一致性,还能把清晰、同步的动态字幕叠到适配手机的版面上 。这也是为什么现在的短视频摘要看起来不像"AI 随手拼的图",而更像有人认真做过美术设计。

顺带说一句权限:这个功能面向 Google AI Ultra 和 Pro 订阅用户先开放,网页端和手机端都能用,Google 说随后会向免费用户扩展,且限定 18 岁及以上使用 。所以你如果暂时找不到入口,先确认账号权限和是否还在灰度中。

2.4 它凭什么"接地气":内容始终绑定你的来源

短视频摘要跟外面那些"随便生成一段视频"的工具,有一个本质差别,我必须单独说清楚,因为这决定了它能不能用来做严肃的知识科普。

让这个功能不只是噱头的关键,是内容始终锚定在你的来源上——它不是给一段通用素材配个旁白,而是把你自己的材料(研究论文、季度报告、课堂笔记)压缩成一分钟里最有说服力的那个点 。这句话翻译成大白话就是:它讲的每一句,理论上都能在你上传的资料里找到出处,不是凭空编的。

这一点对做知识内容的人太重要了。通用 AI 生成视频,最大的风险是"一本正经地胡说"——画面很漂亮,内容却似是而非。而 NotebookLM 因为被"钉"在你的资料上,跑偏的概率小很多。当然它也不是绝对不会错,我后面会讲怎么用提示词进一步收窄它的发挥空间。

2.5 视觉风格:为什么每支片子长得不一样

你多生成几支会发现,画面风格会变。在更早的视频摘要升级里,Google 就为画面引入了水彩、剪纸、动漫、白板、复古印刷、传统风等多种视觉风格,让视频不只是"告诉你"文档讲了什么,而是帮你理解和记住 。短视频延续了这套思路:系统会根据主题自动挑一种美术风格,配上动态排版的字幕,观感因此有一种"图文并茂"的精致感。

这背后其实是一个很聪明的产品判断:图像模型能基于你上传的来源生成有帮助、贴合上下文的插画 。也就是说,画面不是套模板贴上去的通用素材,而是"读懂了你的内容之后"画出来的。这也是为什么同样一个知识点,NotebookLM 出的短视频往往比你自己用模板拼的更耐看。

2.6 短视频在整个 NotebookLM 里的位置

把视野拉高一点看:NotebookLM 一开始只是个简单的文字摘要助手,后来迅速扩展成能生成深度音频讨论、可视化幻灯、电影感讲解的多形态媒体中枢,如今再把竖屏短视频纳入其中,明显是在贴合年轻学生和创作者的媒体消费习惯 。理解这个演化脉络有好处——它意味着短视频不是一个孤立功能,而是这套"一份资料、多种形态输出"体系里的一环。你今天学会用它出短视频,明天顺手就能用同一份资料出音频、出长视频,一鱼多吃。


三、动手第一步:建立笔记本并汇入资料

理论铺垫完,开始上手。这一段的目标很简单:建一个笔记本,把要讲的主题资料喂进去。

3.1 找到入口、建立新笔记本

在浏览器里登录你的 Google 账号,从右上角的应用程序入口往下找到 NotebookLM,进去之后点"新建笔记本"。这一步没有任何玄机,跟你新建一个文档差不多。

3.2 汇入资料

进到笔记本里,把你想讲的资料汇进去。资料可以是 PDF、网页链接、粘贴的文字、Google 文档等等。我这次拿来做示范的主题,是一个很适合科普的技术点:Google 的 Gemma 4 开源模型,尤其是它那个"混合专家"版本。为什么选它?因为它本身概念清楚、又足够新、又能讲出"原理感",特别适合被压成一支 60 秒短视频。

顺便,我把这个主题的原理也给你讲明白——这样你既懂了操作,又顺手学到一个知识点。

3.3 顺手科普:Gemma 4 26B MoE 的原理

传统大模型是"密集(Dense)"结构:处理每一个词,都要把网络里所有的参数(你可以理解成一个个"神经连接")全部点亮一遍。 参数越多算得越准,但也越吃显存、越慢、越贵,动不动就得上昂贵的云端服务器。

Gemma 4 里那个受关注的版本换了思路,用的是"混合专家(MoE,Mixture of Experts)"结构。打个比方:与其让全公司所有人一起处理每一份工作,不如养一群"专家",来一个任务,只叫最相关的几位出手,其余的人先歇着。

具体到数字:这个 26B 的 MoE 版本,虽然总参数量很大,但每处理一个词只激活大约 38 亿参数,算力负担比 31B 的密集版小很多 。也就是说,激活比例大致是

[ \frac{38\ \text{亿}}{260\ \text{亿}} \approx 14.6% ]

带来的直接好处是——用消费级显卡就能在本地跑:这个 MoE 模型能以较低显存需求跑推理,Q4 量化下大约 8GB 显存就能在 RTX 3070 甚至 RTX 2080 这类消费级显卡上运行,兼顾了性能与可及性 。一句话总结这段科普:

你能拿到"巨型网络的推理品质",却只付"小型网络的运行速度"。

不过这里有个容易被忽略的细节,我必须提醒你:虽然每个词只激活约 40 亿参数,但全部参数都得常驻显存,因为路由器要能随时访问所有专家来决定激活谁;所以它"跑起来像小模型,装起来却像大模型" 。省的是算力,不是显存——这点很多人一开始会搞混。

3.4 再往深挖一层:路由器和"专家"是怎么协作的

上面那个"叫专家出手"的比喻,我再拆细一点,帮你把 MoE 彻底吃透——顺便这也是一支好短视频该讲清楚的深度。

一个 MoE 层内部,藏着很多个"专家"小网络,外加一个叫"路由器(router)"的调度员。每来一个词,路由器就把它分派给最相关的少数几个专家,其余专家不参与计算,从而让整体计算保持稀疏;这让模型既能拥有很大的总容量,每次推理又只用其中一部分 。你可以想象成一个庞大的会诊团队:病人(词)来了,分诊台(路由器)只叫对口的几位专家(专家网络)来看,不用全院上阵。

这套设计的稀疏程度可以做得很夸张。有的实现里每层放上百个专家,每个词只激活其中极少数,激活比例低到百分之一点几,意味着单个专家更小、能更专注地各管一摊 。总容量巨大,单次开销却很小——这就是 MoE 的魔法。

我把"密集"和"混合专家"两种路线的差别压成一张表,一眼看明白:

对比项

密集(Dense)结构

混合专家(MoE)结构

每个词的参数参与

全部参数都点亮

只激活一小部分专家

单次推理算力

低(跟激活的小模型相当)

显存占用

同样高(所有专家都得常驻)

总知识容量

受算力预算限制

可以做得很大

通俗类比

全员上阵处理每件事

按需叫对口专家出手

3.5 为什么"能本地跑"是件大事

你可能会问:讲这么多原理干嘛?因为"能不能在自己电脑上跑",直接决定了这类模型的普及程度,而这恰恰是个好选题。Google 团队自己就说,MoE 架构对本地部署是一次范式转变——每个词只激活一小部分参数,就把"26B 级别的质量"带到了多数开发者手里已有的消费级显卡上 。

本地能跑意味着三件实在的好处:不用按 token 付费、数据不出本机因而更私密、下载好之后离线也能用。对追求本地部署的人来说,这三点合起来就是零 API 成本、完整隐私、离线可用 。

再补一个容易被误读的点,前面提过、这里落成结论:MoE"跑起来像小模型,装起来像大模型"。 省的是每次推理的算力,不是显存——所有专家都得先塞进显存,路由器才能随时挑。搞混这一点,你选硬件时就会踩坑。好了,这段原理本身,就是我们等下要让 NotebookLM 压成短视频的"内容"。你可以把它整理成一段文字或一份 PDF 汇入笔记本。


四、打开"短视频摘要"功能:界面语言切换的小技巧

资料喂进去后,右侧的工作区里就能找到视频摘要相关的设置。点进去,你会看到"短视频摘要"的选项。

4.1 如果你只看到英文界面 / 没看到短视频选项

这个竖屏短视频格式在推出初期是英文优先的。如果你的界面还没出现短视频入口,一个常用的小办法是把 Google 账户的显示语言切成英文,让新功能先露出来。步骤:

  1. 新开一个标签页,进入 Google 账户管理。
  2. 在"个人资料 / 个人信息"里找到"语言"设置。
  3. 新增一门语言,把英文(English)加进去。
  4. 把英文用箭头顶到最上面,设为首选语言,保存。
  5. 回到 NotebookLM,刷新页面。

刷新后界面会切成英文,短视频(Short Video Overviews)入口通常就出来了。等你用完,随时可以把中文顶回去,不影响日常使用。

小提醒:这纯粹是"切换账户显示语言"的合规操作,跟任何绕过网络管控的手段无关,别想复杂了。功能全量之后,这一步大概率也就不需要了。

4.2 生成你的第一支短视频

回到笔记本,打开视频摘要设置,你会看到系统根据你汇入的资料,自动推荐了几个候选主题。你可以直接选一个,也可以在自定义主题(custom topic)里写自己的提示词,指定这支短视频要聚焦讲什么。

关于提示词,我的经验是:

  • 优先用英文写提示词。 目前英文提示词的效果最稳。
  • 不用写得很复杂。 一两句话点明"聚焦哪个概念、面向谁、什么调性"就够了。
  • 你可以准备两三个提示词模板轮着试,挑生成效果最好的那支。

写好点生成(Generate),等一小会儿,一支约一分钟、带动画、带字幕、带英文旁白的竖屏短视频就出来了。以我这次的示范来说,成片会用一分钟左右把

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 35% 内容 · 升级至 注册用户 可见 45%
👀
游客
可见 35%
✓ 当前
👤
注册用户
可见 45%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布4 篇
文章总数106 篇
昨日发布3 篇
本月发布14 篇
建站时间37 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码