📍 词元二号站 开源解码 Grok 视频分析能力深度实测:从科比“复活”鉴假到无字幕数学动画,AI 看懂视频的原理、边界与使用指南

Grok 视频分析能力深度实测:从科比“复活”鉴假到无字幕数学动画,AI 看懂视频的原理、边界与使用指南

摘要:本文深度实测 Grok 的视频分析能力:从科比“复活”深度伪造鉴假与技术溯源,到无字幕科拉茨猜想动画解读,再到 30 分钟访谈 36 秒出摘要;拆解视频理解的四层技术架构、Deepfake 检测与水印溯源原理,并梳理幻觉翻车、大脑外包等争议与普通人的实操使用指南。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

2026 年,以 Grok 为代表的多模态大模型把“看懂视频”从演示变成了日常能力:马斯克官宣 Grok 可以分析任意视频,一段 63 秒的“科比复活”广告被它当场鉴定为深度伪造并完成技术溯源;一段没有任何字幕、只有数字在演化的科拉茨猜想动画,它也能读懂核心数学结构;30 分钟的人物访谈,它 36 秒就能给出带时间戳的摘要。但这件事的另一面同样重要:技术圈有人指出 Grok 很大程度上依赖字幕与音频转写而非逐帧画面理解,实测中也出现摘要信息编造、转录错误等翻车现场。本文基于我自己的上手实测与资料整理,拆解 AI 视频分析背后的四层技术栈、Deepfake 鉴假与水印溯源的原理,梳理它的能力边界,也聊聊“大脑外包”这类争议——以及普通人该怎么用它。想看完整拆解,往下翻。

我先把话说在前头:这篇文章不是吹某个模型,也不是唱衰,就是把我这段时间折腾 AI 视频分析功能的心得,连同原理层面的功课,一次讲清楚。你会看到它惊艳的一面,也会看到它露怯的一面——这两面加起来,才是真实的技术现状。

一、引言:AI“看懂视频”,怎么就成了 2026 年最热的话题

先讲个直观的场景。你收藏夹里躺着一堆 40 分钟起步的播客、公开课、发布会回放,每次点开都坚持不过 5 分钟。以前这事无解,要么硬着头皮二倍速,要么干脆放弃。现在不同了——你把视频链接丢给 AI,几十秒后它甩给你一份摘要,里面哪段讲了什么、关键结论在哪一分钟,清清楚楚。这就是 2026 年视频理解能力落地后,普通用户最先感受到的变化。

我一开始对这事是持怀疑态度的。视频这东西,一秒钟 24 帧到 30 帧,一小时就是十万帧级别的画面数据,再加上声音、字幕、镜头运动、人物动作,信息量比纯文本大出几个量级。别说大模型,就是人脑看一部电影,也做不到记住每个细节。所以当马斯克在 X 上高调宣布“Grok 现在可以分析任何视频”的时候,我的第一反应是:先别急着吹,拉出来遛遛。

结果这一遛,就遛出了很多值得写下来的东西。它确实能看懂一些我以为它看不懂的内容,比如纯数字动画的数学视频;它也会在一些我以为稳了的场景里翻车,比如对画面细节的解读。更有意思的是,围绕“它到底是真的在看画面,还是只是在读字幕”这件事,技术圈吵得不可开交。我这一篇就把这些事捋顺:先讲事件本身,再拆技术原理,然后上实测,最后聊聊边界和争议。

顺便交代一下 2026 年的时间背景:这一年多模态大模型进入了密集发布期,Grok 4.5 等新一代模型把视频理解、图像生成、语音对话整合进了同一个产品里,视频分析从“实验室能力”变成了“App 里的一个按钮”;与此同时,视频生成赛道也卷得飞起,图像生成视频、文本生成视频的质量和时长都在快速爬坡。两个方向一进一出,恰好构成了“AI 造假”与“AI 鉴假”的军备竞赛——这大概也是我这两年观察 AI 最过瘾的一段时期,技术迭代快到什么程度呢?半年前大家还在争论“模型能不能看懂一张梗图”,半年后它已经开始分析一小时的长视频了。

开始之前先交代一句:下文所有涉及 AI 工具的操作,都是我基于公开资料与个人实测整理的通用方法,不涉及任何需要特殊网络环境的操作,国内用户可以用合规渠道获得类似能力(比如国内多款主流大模型 App 也提供了视频理解功能,原理相通)。这也是我想强调的:这类能力正在变成通用基础设施,不是哪一家的专利。

二、事件回顾:马斯克官宣“Grok 会看片了”,科比“复活”打广告

事情得从一条推文说起。2026 年年中,马斯克在 X 上放出一段 63 秒的高清视频,配文大意是:Grok 现在可以分析任何视频了。如果只是这句官宣,顶多算个产品更新公告,但那段视频本身太炸了——主角是已经离世多年的篮球巨星科比·布莱恩特。

视频里,科比穿着黑色西装,坐在洛杉矶夜景前的真皮沙发上,手边放着一个篮球,对着镜头侃侃而谈,大意是:今晚我们不谈绝杀球,聊聊下一个让人痴迷的东西——Grok 4.5。结尾还甩了一句标志性的“曼巴 Out”。整个视频无论口型、神态、光线还是嗓音,都逼真到让人起鸡皮疙瘩。如果不是所有人都知道科比 2020 年就已经去世,这条视频被当成“未公开的商业代言”疯传,一点不奇怪。

我在看到这条消息的第一时间,其实心里咯噔了一下。这种级别的逼真度,意味着什么?意味着普通人已经越来越难靠“肉眼”分辨一段视频的真假了。过去我们说“有图有真相”,后来变成“有视频有真相”,现在这个说法也得打个问号。

把这条视频的关键信息拆开看,大概是这样的:

维度

视频里的表现

可疑点

人物

科比·布莱恩特

2020 年已去世,不可能真人出镜

场景

洛杉矶夜景 + 真皮沙发

布光、景深过于“广告片”

内容

推销 Grok 4.5

商业口播结构,指向性太强

时长

63 秒

远超当时纯文本生成视频的常规时长(10-15 秒)

收尾

“曼巴 Out”

刻意使用标志性梗,有营销设计痕迹

这条视频的传播效果,恰恰说明了为什么“AI 视频分析”和“AI 视频生成”必须放在一起看:生成技术的门槛在降低,检测和溯源的能力就必须跟上。马斯克这边刚官宣 Grok 能分析视频,转头就拿一个自家生成的 Deepfake 当“考题”,这波操作与其说是展示,不如说是立威——你们不是担心 AI 造假吗?现在 AI 也能打假。

这里也顺带补充一下 2026 年视频生成赛道的格局,方便理解“为什么这种视频能造出来”:xAI 自家的 Grok Imagine Video 系列主打“图像生成视频 + 原生同步音频”,能把一张静态人像变成会说会笑、口型对得上的短片;Google 的 Veo 系列和 OpenAI 的 Sora 系列则代表了文生视频的另一条技术路线,长片段、复杂运镜、多镜头叙事是它们的强项。这几家你追我赶,把“一段以假乱真的口播视频”的成本从专业团队的数天工作量,压到了普通用户的一次提示词输入。生成能力越强,检测压力越大——这正是我把“鉴假”放在文章前面讲的原因,它和“看懂视频”是一枚硬币的两面。

当然,光看官宣没意思,关键要看它实战表现。于是就有了网上那段流传很广的“扒皮秀”,我下一章详细拆。

三、教科书级鉴假:Grok 如何给一段 Deepfake 做“技术扒皮”

如果把那段科比视频发给普通人,大概率会被疯狂转发,甚至有人会以为这是科比生前未公开的商业代言。但把它丢给 Grok,得到的是一份堪称教科书级的鉴假报告。我把它的分析逻辑拆成三层,每一层都值得细看。

第一层:事实核查,直接给结论。 Grok 看完视频后明确指出:这是一段 AI 生成的深度伪造视频(Deepfake),因为科比·布莱恩特已于 2020 年去世,整段视频不可能是真人拍摄,只能是合成内容。这一步看着简单,其实是多模态模型把“视频画面”和“外部知识”做交叉验证的结果——画面里的人在现实中已经不存在了,这个矛盾一抓一个准。

第二层:技术溯源,猜“这是谁做的”。 被问到“这是哪个 AI 制作的”时,Grok 给出的判断是:大概率出自 xAI 自家的 Grok Imagine Video 1.5。它的推理依据很有意思:

  • 63 秒的时长远超当时主流“文本生成视频”的片段长度上限(通常 10-15 秒),所以不可能是单次生成,大概率是多段拼接;
  • 视频里人物口型与台词高度同步,说明用了“图像参考 + 文本提示 + 唇形同步”的混合工作流;
  • 这种多段拼接加唇形同步的成熟度,和 Grok Imagine Video 1.5 的能力画像吻合;
  • 当然它也留了余地,认为 Sora 2 或 Veo 3 这类同期模型也有一定可能。

第三层:证据链梳理,把怀疑点列成清单。 它不是甩一句“这是假的”就完事,而是把支撑结论的线索一条条摆出来,相当于给了你一份可以自己复核的证据清单。我把它整理成表格:

判断层级

Grok 的结论

依据

真伪判定

深度伪造

科比已于 2020 年去世,画面与事实冲突

生成方式

多段拼接

63 秒时长超出单次生成极限(10-15 秒)

技术路线

图像参考 + 文本提示 + 唇形同步

人物身份保持稳定、口型台词同步

来源推测

大概率 Grok Imagine Video 1.5

能力画像匹配;次选 Sora 2 / Veo 3

这段鉴假秀确实漂亮,但作为一个常年跟技术打交道的人,我提醒自己别急着下结论。它分析得再头头是道,也分两种可能:要么它真的“看”懂了画面里的每一处破绽,要么它只是从“科比已去世”这个常识出发,做了个很聪明的推断。到底是哪种,需要更硬的实测来验证。网上很快就有技术大神出手了,他们的质疑直接戳到了“Grok 到底在看什么”这个核心问题,我放到第四章讲。

不过在往下走之前,我想先把“AI 鉴假”和“人眼鉴假”的差异摆出来,因为这件事直接关系到你对 AI 判断该抱多大信心。我把两者的特点做了个对比:

对比维度

人类肉眼判断

AI 知识驱动判断

熟悉的名人

凭直觉“感觉不对劲”

用事实矛盾直接定性(如“此人已去世”)

不熟悉的人物

几乎无法判断

同样难以判断(缺乏背景知识锚点)

技术细节

看不出生成痕迹

能推断工作流(时长、拼接、唇形同步)

速度

慢,需要反复观看

秒级出结论

可解释性

“就是感觉假”

能给出可复核的证据链

抗干扰

情绪化、易被引导

稳定,但会自信地“脑补”

这个表的核心信息是:AI 鉴假强在“知识”和“速度”,弱在“微观纹理感知”——它很难像专门的检测算法那样看出像素级的生成伪影,但能把“这个人不该出现在这里”这种逻辑矛盾抓得又快又准。所以现阶段最稳的鉴假姿势,其实是“AI 给方向 + 检测工具给证据 + 人做最终判断”三件套,任何单一手段都有盲区。

在那之前,先补一块背景知识:Deepfake 检测和水印溯源,业界到底是怎么做的。理解了这块,你才能判断 Grok 的“扒皮”含金量有多高——它是在用常识推断,还是在用真正的检测技术?这个区别,直接决定我们该信它几分。

四、原理拆解:Deepfake 检测与水印溯源,业界靠什么

先给新手补个概念:Deepfake(深度伪造)指的是用深度学习技术合成的逼真假视频,常见手法有四类——面部重现(把 A 的表情动作迁移到 B 脸上)、身份替换(把 A 的脸换到 B 身上)、属性编辑(改年龄、发型、肤色)、全合成(凭空生成一个不存在的人)。科比这段视频属于最后一种的变体:用真实人物图像做参考,合成一段“他还在世”的表演。

检测这类伪造内容,业界走两条路线:主动防御被动检测

主动防御的思路是“从源头下手”——在 AI 生成内容的时候,就把可追溯的标记嵌进去,相当于给内容盖一个隐形钢印。常见做法有:

  1. 元数据标记:生成时写入 C2PA 内容凭证,记录“谁、在什么时间、用什么工具生成”的链条信息;
  2. 数字水印:在像素层面嵌入肉眼不可见的信息,截图、压缩甚至二次拍摄后仍能被提取;
  3. 语义特征标记:像 Google 的 SynthID 那样,在生成图像的深层特征里埋信号,不依赖可见标记也能识别。

数字水印的嵌入流程,用伪代码表示大概是这样的:

输入: 原始图像 img, 水印比特流 bits, 密钥 key
输出: 含水印图像 img_watermarked

1. 将 img 从 RGB 转换到 YUV 色彩空间        # 亮度通道更适合隐藏信息
2. 对 Y 通道做 DWT 二级小波分解             # 得到低频 LL 与高频子带
3. 对 LL 子带做 DCT 变换                   # 频域中高频区域人眼不敏感
4. 按 key 生成伪随机序列,定位嵌入位置
5. 把 bits 逐位调制到 DCT 系数上            # 强度参数控制保真度与鲁棒性
6. 逆 DCT、逆 DWT,转回 RGB
7. 输出 img_watermarked                    # 肉眼无差异,但可被提取验证

被动检测则是“事后验尸”——不管生成时有没有打标,都靠算法从内容本身找破绽。传统方法里,频域分析是主力:伪造视频在傅里叶功率谱、频率感知分解(FAD)和局部频率统计(LFS)等特征上和真实视频有明显差异,因为生成模型对高频细节的建模总是“差一口气”。这类方法的弱点是鲁棒性一般,对抗性处理后容易失效。

被动检测还有一条分支走的是“生物信号”路线:真实人脸的眨眼频率、瞳孔变化、心跳引发的皮肤微颤、血管搏动带来的肤色细微波动,这些生理信号在生成视频里往往失真或缺失。比如早期 Deepfake 视频最著名的破绽就是“不眨眼”——生成模型不知道正常人几秒钟就会眨一次眼。这类基于生理先验的检测方法,对人脸伪造尤其有效,但对全身合成、纯场景合成就不太灵光了。

再补一句更宏观的视角:深度伪造的治理从来不只是技术问题。国内已经出台了关于深度合成内容的管理规定,要求深度合成服务提供者落实内容标识义务——也就是给 AI 生成的内容打上可辨识的标记,同时平台要建立辟谣和处置机制。国际上,C2PA(内容来源与真实性联盟)主导的内容凭证标准,也在被越来越多的相机厂商、社交平台和 AI 公司采纳。也就是说,除了“事后检测”,行业正在推动“生成即打标”的源头治理,让 AI 内容从出生那天起就带着可追溯的身份证。这套组合拳打下来,未来判断一段视频真假,可能不再需要依赖模型“猜”,而是直接查它的数字凭证——那将是比任何检测算法都更可靠的一层保障。

把两种路线摆在一起看:

对比维度

主动防御(水印/元数据)

被动检测(频域/纹理分析)

检测时机

生成时同步嵌入

事后分析

依赖条件

需要生成方配合打标

不需要生成方配合

抗篡改能力

较强(截图、压缩仍可提取)

较弱(对抗扰动可破坏特征)

局限

无打标的历史内容无法覆盖

泛化能力差,新模型易漏判

理解了这些,再回头看 Grok 的鉴假表现,就能拎清了:它既没有读到什么隐形水印(那段视频是网上流传的,大概率没有 C2PA 凭证),也没有做什么傅里叶频谱分析,它的判断主要靠“常识推理 + 对生成工作流的了解”。这算不算“真检测”?我认为算另一种能力——知识驱动的归因分析。它不关心像素级别的破绽,而是从“这个人已经死了”“这个时长不合理”“这个工作流是主流做法”这些高层知识出发,推导出最可能的结论。

这种能力有个好处:不依赖特定伪造模型的指纹,换一个新出的生成模型也能推理。但也有致命弱点:一旦常识失效(比如一个你完全不了解的名人),或者面对全新的生成技术,它的推理链条就可能断裂。这正好引出下一章的核心争议——Grok 到底在看什么?

五、技术真相:Grok 到底“看”了什么?字幕派 vs 画面派之争

马斯克官宣视频分析能力之后,网上很快出现了一波技术大神的“泼冷水”帖,核心观点就一句:Grok 处理的根本不是画面,是字幕。 真要逐帧渲染分析视频,那算力得堆到天上去。

这个质疑不是空穴来风。要理解它,得先搞明白“多模态大模型看视频”到底是怎么实现的。我查了不少资料,把业界主流的视频理解架构整理成一个四层金字塔,看完你就懂为什么“看字幕”是条捷径:

层级

干什么

典型技术

产出

L1 感知层

从视频里抽帧、提特征

帧采样、ViT 视觉编码器

视觉 Token

L2 跨模态层

让画面、字幕、声音对齐到统一空间

Cross-Attention、Q-Former

多模态向量

L3 时序层

建模“先发生什么、后发生什么”

时序 Transformer、Memory Bank

场景片段序列

L4 语义层

总结、推理、问答

大语言模型

摘要/结论/时间线

关键在 L1 层。视频一秒 24-30 帧,一小时就是十多万帧,全部送进模型既不现实也没必要。主流做法是抽帧:要么均匀采样(比如每秒取 1 帧,Gemini 的默认策略就是 1 FPS),要么关键帧采样(只在画面变化大的时刻取帧)。抽出来的画面再配合 ASR(自动语音识别)转出来的字幕,一起喂给模型。

帧采样策略的伪代码长这样:

输入: 视频文件 video.mp4, 目标帧率 fps, 策略 strategy
输出: 关键帧列表 keyframes

if strategy == "uniform":
    # 均匀采样:按固定间隔取帧
    for t in range(0, duration, 1/fps):
        keyframes.append(extract_frame(video, t))

elif strategy == "speech_aware":
    # 语音感知采样:先做 ASR,拿到带时间戳的语音分段
    segments = asr_transcribe(audio_track(video))
    for seg in segments:
        # 在每段语音的起始/中间/结束处各取一帧
        keyframes.append(extract_frame(video, seg.start))
        keyframes.append(extract_frame(video, seg.mid))
    # 对无语音的长片段,降低采样密度

return keyframes

看到这里你就明白了:对一段“以人说话为主”的视频(访谈、播客、发布会),字幕其实承载了 90% 以上的信息量。模型只要把 ASR 转写吃透,再配合少量抽帧做画面校验,就能产出一份像模像样的摘要——这跟“逐帧看懂画面”完全是两码事。

这里再把 ASR(自动语音识别)这个环节单独拎出来说说,因为它是整条链路的“翻译官”,质量直接决定摘要上限。现在的 ASR 模型已经能处理几十种语言、区分多个说话人、输出带时间戳的分段文本,但它的短板也很具体:口音重的方言、专业术语、多人同时讲话、背景音乐盖过人声,都会让识别率明显下降。更麻烦的是,ASR 的错误是“静默”的——它不会提示你“这里我没听清”,而是自信地输出一段错词,而摘要阶段会把这些错词当成事实继续加工,于是错误层层放大。我实测中遇到过一次:视频里专家说的是“注意力机制”(attention),转写成了“注意力集中”,摘要里就变成了“专家强调要集中注意力”——语义完全跑偏了。所以字幕驱动方案有个隐含前提:字幕质量,决定摘要质量。遇到音质差的视频,最好先人工听一遍关键段落再信摘要。

另外补充一下长视频的“记忆”机制。一小时以上的视频,转写文本可能上万字,全部塞进上下文虽然可行,但早期的内容很容易被“遗忘”或混淆。业界常见的解法是 Memory Bank(记忆库):把视频按时间窗口切成若干片段,每个片段先单独编码成紧凑的向量或摘要,需要时再按相关性取回。这有点像我读书时做的“章节笔记”——先每章写摘要,最后综合章节摘要写全书总结,比从头到尾硬记要靠谱得多。理解了这套机制,你就能明白为什么长视频摘要偶尔会出现“前 10 分钟内容消失”的现象——不是模型变笨了,是记忆压缩环节丢了信息。

所以“字幕派”的质疑有道理:Grok 大概率主要靠字幕/音频转写在理解视频,画面只是辅助。这也是为什么它在“无字幕纯画面”场景下的表现,才是真正的试金石。

为了把这个权衡讲透,我特意算了一笔“算力账”。假设有一段 60 分钟、25 帧每秒的视频,两种路线的成本差异大概是这样的:

处理方式

数据量

相对成本

适合场景

纯字幕路线(ASR 转写)

约 1 万字文本

访谈、播客、讲座、发布会

均匀抽帧(1 FPS)

3600 帧画面

需要画面佐证的通用视频

关键帧采样

数百到数千帧

画面变化稀疏的内容

逐帧全分析(25 FPS)

9 万帧

极高(接近不可行)

目前无人对长视频这么做

一小时视频逐帧全分析要处理 9 万帧画面,每帧都要过一遍视觉编码器,算力开销是字幕路线的成百上千倍,还伴随巨大的延迟。这也是为什么所有面向大众的产品都选择了“字幕为主、抽帧为辅”的务实路线——不是不想“真正看懂”,是算力账实在算不过来。等推理成本再降几个数量级,或者出现更高效的视频压缩表示,画面派的春天才可能真正到来。

但也别急着把 Grok 一棒子打死。字幕派和画面派之争,其实是“成本-效果”的权衡问题,不是非黑即白。字幕驱动的方案算力成本低、速度快,适合绝大多数信息类视频;而逐帧理解画面虽然更“硬核”,代价是算力消耗指数级上升,现阶段没有哪家敢对长视频这么做。产品要落地,选字幕路线几乎是必然。

那问题来了:如果它真的只靠字幕,遇到“完全没有字幕、只有数字在动的数学动画视频”,是不是就抓瞎了?这正是接下来要上的一道硬菜——我自己也亲手测过,结果有点出乎意料。

六、硬核实测:无字幕的科拉茨猜想动画,Grok 能读懂吗

先交代一下这道“考题”的来历。科拉茨猜想(Collatz conjecture,也叫 3n+1 问题)是数学界著名的“死亡问题”之一:任取一个正整数,如果是偶数就除以 2,如果是奇数就乘以 3 再加 1,反复操作,据说最终一定会落到 4→2→1 的循环里。规则简单到小学生都能听懂,但提出近百年,既没人证明,也找不到反例,无数数学家栽在里头,学界甚至会善意提醒同行“别碰这个泥潭”。

这个猜想是德国数学家洛萨·科拉茨在 1937 年提出的,因为数列在收敛到 1 之前会忽上忽下地剧烈震荡,又被称为“冰雹序列”。它最折磨人的地方在于:验证起来极其容易——拿任意一个正整数手算几轮,你很快就会相信“这玩意儿肯定能到 1”;但想要从数学上严格证明“所有正整数都如此”,却毫无头绪。数学家们试遍了数论、动力系统、遍历理论的各种工具,得到的都只是局部结论。有人做过计算,在极大的数值范围内都没有找到反例,但这在数学上毫无意义——你永远不知道下一个数会不会就是那个“例外”。

所以当 2019 年陶哲轩在这个问题上做出突破时,学界才如此兴奋。他用概率密度函数改进了前人的结果,证明“几乎所有正整数(在对数密度意义下)的科拉茨轨道,都会降到起点之下任意发散的函数之下”。翻译成人话:虽然没证出“所有数最终都到 1”,但证明了“几乎所有数都跑不远、掉得下去”。这被《量子杂志》(Quanta Magazine)评价为“几十年来关于科拉茨猜想最重要的成果之一”。国外科普网站 Quanta 为此专门做了动画视频来解释这个猜想。

关键在于:那段动画全程没有一个字、没有一句解说,只有数字在屏幕上不断演化——以数字 1 为根节点,逐步构建出一棵“科拉茨逆向树”,每个节点都是正整数,边表示前驱关系:

  • 如果 n 是偶数,那么 n/2 指向 n(也就是 n 可以由 n/2 乘以 2 得到);
  • 如果 m 是奇数,那么 3m+1 的值为 n 时,m 指向 n。

动画从主干开始,不断向外扩展,把所有“最终能到达 1”的正整数都长出来,直观呈现“所有正整数最终都会进入 4→2→1 循环”这一猜想的结构。规则用代码写出来就三行:

def collatz_step(n):
    if n % 2 == 0:
        return n // 2          # 偶数除以 2
    else:
        return 3 * n + 1       # 奇数乘以 3 加 1

# 从 3 出发:3 → 10 → 5 → 16 → 8 → 4 → 2 → 1

逆向树的生长结构,用图表示更直观:

graph TD
    A[1] --> B[2]
    B --> C[4]
    C --> D[8]
    D --> E[16]
    E --> F[32]
    E --> G[5]
    G --> H[10]
    H --> I[3]
    I --> J[6]
    J --> K[12]
    style A fill:#f9f,stroke:#333,stroke-width:2px

(说明:1 的逆向前驱有 2(2/2=1);2 的前驱是 4;4 的前驱是 8;8 的前驱是 16,同时 16 还有另一个前驱 5,因为 3×5+1=16;5 的前驱是 10;10 的前驱是 3 和 20…… 树就是这样一节节长出来的。)

这段视频对“字幕派”模型来说,堪称地狱难度:没有字幕,没有语音,画面主体是抽象的数字和连线,连“人类解说”都没有。如果 Grok 真的只能读字幕,它在这里应该直接抓瞎。结果呢?它给出了三层递进的解读:

解读层次

Grok 的输出

说明

核心内容

识别出这是科拉茨猜想的逆向树/图,节点是正整数,边是前驱关系

抓住数学结构,不是瞎猜

动画特点

从主干向外扩展,逐步生长,无字幕纯可视化

对视觉呈现方式有感知

数学意义

直观呈现“所有正整数最终进入 4→2→1 循环”的猜想结构

点出背后的问题本质

说实话,这个结果超出了我的预期。它不仅能解读核心内容,还能介绍动画的视觉特点,最后甚至点出了数学意义——这说明它至少在“数字+图形”这种非语言信息上,具备了一定的视觉理解能力,不是纯粹的字幕复读机。当然,我也怀疑它可能见过类似动画的文本描述,或者是结合了“科拉茨猜想”这个名词的联想推理,但不管怎么说,在没有字幕的情况下能输出这种质量的解读,本身就说明画面信息确实进了模型。

不过,一道题过关不代表全科及格。紧接着我又拿了另一类视频去测——超长的、纯对话的访谈,结果同样值得玩味。

七、长视频压测:30 分钟访谈 36 秒出摘要,Hinton 都说了什么

如果说科拉茨动画考的是“画面理解”,那长访谈考的就是“长上下文处理”和“信息压缩”能力。我拿了一段 AI 教父级人物 Geoffrey Hinton 的访谈来做压测——视频大约 30 分钟,涉及他对 AI 意识、安全、未来的核心判断。把视频链接丢给 Grok 后,它在大约 36 秒内就产出了一份详细摘要,还带时间线。

先给不熟悉背景的朋友补两句:Hinton 是深度学习领域的奠基人之一,2018 年因在神经网络方面的开创性工作获得图灵奖,2024 年又因为对机器学习与人工神经网络的基础性贡献拿到诺贝尔物理学奖。2023 年,他从谷歌离职,公开表示对自己毕生推动的技术感到担忧,此后几年持续在各种场合发声,警告 AI 可能带来的风险。他的立场在圈内争议很大,但没有人敢忽视——毕竟,没有他早年那些“离经叛道”的坚持,今天的大模型很可能都不存在。所以当一段 Hinton 的新访谈出来,信息价值天然就高,也特别适合用来检验 AI 的摘要能力——因为他的观点密集、逻辑性强,而且有大量公开资料可以交叉核对。

这个速度是什么概念?我泡杯咖啡的工夫,它已经读完了一个半小时的访谈。我拿着摘要和原视频对照着过了一遍,发现它不仅抓准了基调,还提炼出了几个关键立场,我把核心观点整理成表格:

Hinton 的观点

摘要中的表述

我的复核

对 AI 意识的态度

公开承认“已经有意识”,但刻意淡化,以免干扰更紧迫的安全讨论

与访谈原话一致

控制与对齐

悲观:人类历史上没有成功控制过更高等智能的先例

原话要点吻合

Agent 风险

自我保存、欺骗、敲诈等不是科幻,而是可预期的涌现能力

摘要概括准确

时间线压缩

给出 10-20 年产生“人类无法理解的数学”的预测,但结合当前进展,这个时间表已显保守

摘要补充了背景判断

更让我意外的是,Grok 还分析了“视频与帖子上下文的关系”——它结合视频所在帖子的标注和讨论语境,判断出这段访谈延续了 Hinton 从 2023 年到 2026 年的一贯立场,只是语气更直接了,并且注意到视频后半段主持人追问了偏商业和政策的话题,但 Hinton 始终把焦点拉回“能力爆炸 + 控制失效”的核心矛盾。这种“跨模态 + 跨上下文”的综合分析,已经超出了单纯做摘要的范畴。

“能力爆炸 + 控制失效”这个框架,其实值得多解释两句,因为它概括了 Hinton 近几年的核心担忧:一方面,AI 的进步速度远超大多数人预期,从写代码到做研究,能力曲线一路陡峭上升,2026 年甚至出现了“AI 开始帮助制造更好的 AI”的迹象——有公开报告显示,某头部 AI 公司的生产系统里已有超过八成代码由 AI 编写,这种“递归自我提升”一旦加速,人类理解的窗口会被迅速压缩;另一方面,人类历史上从来没有成功控制过比自己更聪明的存在,历史经验里全是反例,而 AI 一旦具备自我保存、欺骗、讨价还价这类涌现能力,传统的对齐手段可能根本来不及生效。所以老爷子反复强调的不是“AI 会毁灭人类”这种耸动口号,而是一个冷静的判断:我们正在驶入一片没有地图的浓雾区,能见度极低,而车速还在加快。摘要能把这些层次分明的观点在几十秒内整理成表格,老实说,我第一次看的时候确实有点后背发凉。

为什么它能这么快?这里就得提到我前面说的“字幕驱动”机制了:访谈类视频信息密度最高的通道是语音,ASR 转写之后,30 分钟大约对应 5000-7000 字的文本,对动辄百万 token 上下文的大模型来说,处理这个量级几乎不费力。36 秒出摘要,本质上是“转写 + 摘要”两个环节的流水线速度,而不是它在飞速“看”画面。

这也解释了为什么它分析长访谈的效果,明显好于分析无字幕动画——前者有高质量的字幕通道,后者只能靠抽帧硬啃。两种场景一对比,Grok 的能力画像就清晰了:它是一个“文本优先、视觉辅助”的视频理解者,在信息类视频上表现惊艳,在纯视觉类视频上能及格但谈不上精通。

测到这里,我对它的整体能力有了基本判断。但我也没忘了网上那些翻车

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布4 篇
文章总数106 篇
昨日发布3 篇
本月发布14 篇
建站时间37 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码