📍 词元二号站 开源解码 实时交互式 AI 视频的「奇点时刻」:Vivix-A1 与 Vivix-W1 全拆解

实时交互式 AI 视频的「奇点时刻」:Vivix-A1 与 Vivix-W1 全拆解

摘要:2026 年 7 月 Vivix 发布了两款激活参数约 30B 的实时交互多模态模型 A1 和 W1,首次实现了 AI 视频的全双工实时交互。本文从公司背景、技术架构(原生流式因果生成、MJD 蒸馏、NVFP4 量化、VMI 推理引擎)、性能指标、应用场景和行业格局六个维度,完整拆解这套系统的原理与落地路径。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

Vivix 在 2026 年 7 月 24 日正式发布了两款激活参数约 30B 的实时交互多模态模型——Vivix-A1(开放世界演员)和 Vivix-W1(开放世界剧情)。这不是一次普通的「生成更快」的升级,而是把 AI 视频从「生成一段固定素材」推到了「持续生成一个可被用户实时改变的过程」。A1 让 AI 数字角色拥有了完整的全身动作能力、环境交互能力和实时全双工对话能力;W1 则让 AI 可以为用户生成一段持续演进的故事,观众能随时用语音、文字甚至拖拽图片来改变剧情走向。

技术上,Vivix 走了一条和主流视频模型完全不同的路:原生流式因果生成替代 clip 级扩散、MJD 蒸馏把 8 步去噪压到 2 步、NVFP4 量化训练在消费级显卡上跑 30B 参数、VMI 推理引擎做到首帧延迟低于 0.6 秒。这些技术的组合,让实时推理成本压到了每小时不到 1 美元——已经和主流视频平台单小时的 CDN 带宽成本接近同一量级。

这篇文章会从公司背景、模型能力、技术架构、成本与性能、应用场景、行业格局六个维度,把 Vivix 这套系统从头到尾拆一遍。如果你是 AI 视频创作者、技术开发者,或者只是好奇 AI 内容下一步会走向哪里,这篇文章应该能给你一个比较完整的图景。

想看完整拆解,往下翻。


一、一个让从业者「坐不住」的发现

说句实话,这几年看 AI 视频领域的发布会看得有点麻木了。每隔一两个月就有一家新公司、一个新模型跳出来说自己「又快了 30%」「画质又提升了」「分辨率到了 4K」。这些东西当然有进步,但看多了就会发现,大家基本都在同一个方向上卷——生成更快、画质更好、镜头更稳。本质上,输入一段提示词,输出一段固定视频,这个范式没变过。

所以当 Vivix 的演示视频出现在我屏幕上的时候,我第一反应不是「哇好厉害」,而是一种更复杂的感觉:这不只是「更好」,这是「不同」。

演示里一个 AI 数字角色坐在镜头前,和用户聊着天。到这里还算正常——数字人直播带货我们已经见了不少了。但接下来的画面让我不由自主坐直了:这个角色站起来了,走动了,转身拿起了桌上的一杯咖啡,喝了一口,然后继续聊天。过程中用户中途插了一句话,角色自然地停顿、调整表情、切换话题,画面没有中断、没有重新加载、没有「卡一下再跳帧」——一切都是连续的、实时的。

后来又看到 Vivix-W1 的演示。用户输入了一句「外星人入侵地球」,画面就开始自动生成一段持续展开的科幻故事。故事进行到一半,用户突然用语音说了一句「让外星人友善一点」,场景里的外星生物居然真的改变了行为——从攻击姿态变成了试探性的接触。镜头语言、环境音、角色反应同步调整,没有任何拼接痕迹。

到这里我已经不只是坐直了,我有点坐不住了。

因为这两个模型在做的事情,和我们过去理解的「AI 视频生成」完全不在一个维度上。过去我们理解的 AI 视频是「生成一段素材」,你用或者不用,它就是那一段。而 Vivix 做的事情是「持续生成一个过程」,用户可以随时介入、随时改变、随时打断。这不再是内容生产工具,这是一种新的内容体验形态。

打个可能不太严谨但比较好理解的比方:传统 AI 视频生成像是用相机拍了一张照片或者一段视频,拍完就定型了;而 Vivix 的实时交互模型像是在打一通视频电话——画面一直在流动,双方都能随时影响对方看到的和听到的。

这篇文章,我就想认真拆一拆:Vivix 这两个模型到底是怎么做到的?它们的技术架构有什么不同?能用在哪些场景?对普通创作者和开发者意味着什么?带着这些问题,辛梓煜@词元二号站花了不少时间研究技术报告、翻官方 Demo、甚至自己上 API 平台跑了几轮测试(这个后面会细说),把能挖到的信息都梳理了一遍。

二、Vivix 是谁?一家「闷声憋大招」的公司

在深入模型之前,有必要先搞清楚这家公司本身。因为在 2026 年 7 月之前,Vivix 这个名字在大众视野里几乎是隐形的。

创始人:一个 95 后的技术狂人

Vivix 的创始人和 CEO 叫刘宇,1995 年生人,香港中文大学多媒体实验室博士毕业。简历上几个关键词就能看出这人不太一般:26 岁成为商汤科技历史上最年轻的研究执行总监和事业部总经理之一;发表过近 100 篇 AI 顶会论文;2014 年大三时就用 3D 卷积神经网络做了自动跟踪人的无人机飞控——那时候大疆精灵四都还没发布。

在商汤的九年里,刘宇管理过近 200 人的团队,手握商汤数千张 GPU 资源。当年商汤拿下 ImageNet 世界冠军,也有他的贡献。有个细节挺有意思的:读博期间他几乎每周都在北京和香港之间来回飞——周五回港中文交作业,周一飞北京上班。

2024 年 10 月,刘宇要离职创业的消息开始在投资圈里传开。但直到将近一年之后,外界才隐约知道了一件事:他成立了一家叫 Vivix 的公司。那段时间,许多投资人都在打听这个名字。

有意思的是,Vivix 在成立后的相当长一段时间里几乎不发声。刘宇后来在接受采访时提到,公司战略重心经历了「从模型能力,到产品定义,再回到模型能力」这样一次「痛并快乐的绕行」。他反复说一句话:「互动内容的机会不在于工具也不在于产品侧,模态越丰富,消费者才越沉浸。」

融资情况:五轮、13.2 亿美元估值

尽管对外沉默,Vivix 的融资节奏一点没慢。公开信息显示,公司在不到一年半的时间里完成了五轮融资:

轮次

主要投资方

时间节点

早期轮次

IDG资本、红杉中国

2025年上半年

后续轮次

蓝驰创投、五源资本

2025年中

战略轮

Monolith砺思资本

2025年下半年

产业资本

京东、阿里等

2026年初

最新轮次

多家联合

2026年中

整体估值达到 13.2 亿美元(约合人民币 90 亿元),妥妥的独角兽。

面对赶来下注的投资人,刘宇总是一遍又一遍提醒:「做这件事情挺难的。」但同时也说:这条路上 Vivix 走得很快。确实,从 2025 年 1 月 1 日正式决定开干,到 2026 年 7 月发布可用的模型和 API,前后不过一年半。这个速度在 AI 基础模型领域是相当惊人的。

「灵动时刻」

Vivix 的运营主体在香港注册(Vivix Group Limited),控股杭州和上海两地的「维悦时刻科技」。而面向市场的产品品牌用的则是「灵动时刻」这个名字。2026 年 7 月 24 日,「灵动时刻」正式发布了 Vivix-A1 和 Vivix-W1 两个模型,并同步上线了 API 开放平台供开发者和企业用户申请体验。

从团队背景来看,Vivix 的技术积累是实打实的。商汤九年的视觉 AI 研发经验、多媒体实验室的学术基因、近 100 篇顶会论文的学术底蕴——这些不是靠堆钱就能短期复制的。这也是为什么 Vivix 敢于不走「小参数 + 大压缩比」的捷径,而是一上来就做 30B 激活参数的原生流式多模态模型。

三、两个模型,两把钥匙:A1 做「人」,W1 做「世界」

Vivix 这次发布同时推出了两个模型,这个安排本身就有讲究。先说结论:A1 和 W1 不是「一个基础款一个高级款」,而是分别解决两个不同但互相依赖的问题——A1 负责把单个数字角色做活,W1 负责把多个角色构成的故事世界做活。

A1:开放世界演员

Vivix-A1 的官方定义是「首个面向交互式 AI 角色的实时全双工模型」。拆开来看,这里有两个关键词。

「全双工」这个词在通信领域很常见,意思是双方可以同时发送和接收信息。放到 AI 交互里,全双工意味着模型在生成音视频的同时,还能持续接收和处理用户的新输入——不需要等当前生成完成,不需要用户「说完一句等回应」,真正的并行处理。

市面上绝大多数的 AI 语音助手、数字人直播,本质上是「半双工」——你说我停、我说你停,一次一个回合。包括很多标榜「实时」的产品,底层其实还是「加速版的请求-响应循环」:给条件→快速返回结果→再给下一个。Vivix 自己在技术博客里点破了这一点:模型输出时用户无法介入,用户操作时模型已经停了。

而 A1 的全双工意味着:角色正在说话、正在走动、正在拿东西的时候,你突然说一句话,它可以在不中断当前动作的前提下接收并处理你的输入,然后自然地调整回应。这听起来简单,技术实现上极为复杂——后面技术章节会详细拆。

「全身角色」是第二个关键词。过去的 AI 数字人,本质上是一个会说话的头——画面预测量局限在面部区域,身体和背景几乎无法改变。A1 支持完整的全身角色生成与全身动作生成:说话、行走、转身、弯腰、拿取物体、产生表情变化、甚至跳舞。角色能感知环境声音,能对空间变化做出反应,不再是「钉在固定机位里对口型」。

W1:开放世界剧情

Vivix-W1 面向的是互动叙事。它的核心能力是:你给它一个提示词,它生成一段持续展开的音视频故事。故事播到一半,你可以用语音、文字、点击、拖拽图片甚至触控来改变正在发生的情节。

比如:W1 开始生成一段「两个人在咖啡馆聊天」的故事。你可以中途输入「让窗外下起暴雨」,场景立刻变化——窗外变暗、雨声加入音轨、角色的对话内容也同步调整(比如从闲聊变成讨论天气)。甚至可以拖两张人物画像进去,这两个角色就出现在故事世界里。

W1 的交互响应延迟低于 1 秒。换句话说,你说一句话,不到一秒后画面就开始按你的新方向变化。

为什么是两个模型,不是一个?

这个问题 Vivix 的技术报告里给出了明确的逻辑。

A1 和 W1 之间存在能力依赖关系。人类在消费短视频、短剧和游戏的时候,大约 70% 到 80% 的注意力都和人有关——角色是一切叙事的锚点。A1 先解决单个数字角色的行动力问题:全身运动、物体交互、实时响应。当单个角色已经能自主行动了,才有可能让一个「导演」去协调多个角色之间的事件、对白和镜头关系,推动故事持续演进。

换句话说:A1 是 W1 的基础能力单元。A1 做单个角色的「演员」,W1 做协调多角色的「导演」。这种拆分不是产品策略选择,而是技术依赖关系决定的。

在下层的技术基础设施上,两款模型共享同一套数据管线。Vivix 围绕「观测-交互-生成」构建交互数据三元组,通过数十个专项训练的专家模型完成自动化数据筛选与标注,目前已积累了与头部视频模型相当规模的精标数据。

和传统方案的核心区别

为了让这个对比更直观,我把 A1/W1 和市面上几种常见的方案放在一张表里:

能力维度

传统数字人

主流AI视频生成(可灵/Sora等)

Vivix-A1

Vivix-W1

角色全身动作

仅头部/上半身

但为预生成固定内容

实时全身

多角色实时

实时交互

但仅限文本驱动

生成后无法介入

全双工实时

多模态实时介入

环境感知

环境音感知

全局环境变化

生成范式

画面预测

离线clip生成

流式因果生成

流式因果生成

用户中断/改写

300-900ms响应

<1秒响应

多模态输入

文本

文本/图片(一次性)

语音+文本+图片(持续)

语音+文本+图片+触控(持续)

这张表看完,基本就能理解为什么 Vivix 这次发布让人坐不住:它不是在一个已有的象限里做得更好,而是开了一个新的象限。

四、拆解 A1:一个会「动全身」的数字角色是怎么炼成的

前面说了 A1 能做什么,这一章来拆它是怎么做到的。技术细节比较硬核,我尽量用通俗的方式讲清楚,但有些关键概念还是得保留原名——否则反而讲不明白。

绕开「ASR → LLM → TTS」这条老路

市面上绝大多数 AI 语音助手和数字人系统,底层都走同一条级联路线:

用户语音 → ASR(语音识别转文字) → LLM(大模型理解+生成回复文字) → TTS(文字转语音) → 口型驱动

这条路走了很多年,成熟稳定,但有一个根本缺陷:每一步都是串行的,每一步都有延迟,每一步都在丢失信息。语音里的情绪、语调、环境声音,在 ASR 转文字的那一步就被扔掉了。最后 LLM 只看到一段扁平的文字,它能做的只是生成一段回复文字,再让 TTS 念出来。

A1 的做法完全不同。它采用原生多模态生成循环:语音语义、声学特征、环境声音、手势和视觉信号被统一建模在同一个多模态空间里。模型不经过「语音→文字」的中间表示,而是直接在原始多模态信号空间里完成感知和生成。

用更直白的话说:A1 不先「听懂你说什么」再「想怎么回」,而是同时处理你说话的内容、你的语气、你周围的背景声音、你的面部表情和手势,然后直接生成包含语音、动作、表情和环境互动在内的完整回应。

这个架构选择带来的好处不只是延迟低。更重要的是,角色能感知到语音流中嵌入的语义信息——比如你那边突然传来的门铃声、风声,或者你语气中的犹豫和紧张——这些在传统级联架构里都被扔掉了的信息,在 A1 这里是原生的输入信号。

Director Agent:角色的「大脑」

A1 引入了一个叫 Director Agent 的机制,负责更高层次的推理、回应规划和行为控制。可以把这个 Director Agent 理解为角色的「导演」——它不是一帧一帧地去算画面,而是在更高维度上决定「角色现在应该是什么状态」「当前互动应该走向什么方向」。

Director Agent 的存在让 A1 有能力在更长的时间跨度上保持连贯的、有上下文感知的交互。比如你五分钟前说「我很难过」,五分钟后再提到相关话题,角色还能记住这个情绪语境并做出恰当回应——而不是像金鱼一样每轮对话都重新开始。

流式生成:从「做一段视频」到「持续生成」

这是 A1 架构中最关键的转变。传统视频生成模型的操作单位是「clip」——5 秒或 10 秒的一段。模型先看完整个时间窗口的信息,再整体规划输出。这种做法的好处是画质好、全局一致性强,但坏处也很明显:生成过程中没法塞进新指令。

A1 改成了流式生成:逐帧往前推,当前帧看不到未来。这本质上是一种因果生成范式——每一步只基于过去的信息产生当前输出。

流式生成的好处是随时能接住新输入——用户中途说话、改变指令,模型在当前帧之后的所有内容都可以即时调整。难处是没有全局信息兜底——角色身份一致性、物体空间关系、动作连贯性,全靠模型自己在每一帧在线维护。

下面是流式生成和 clip 级生成的简化对比(伪代码表示):

# Clip 级生成(传统方案)
def clip_generation(prompt, duration_seconds):
    full_context = encode(prompt)            # 看完全部输入
    video_clip = generate_whole_clip(        # 一次性生成整段
        context=full_context,
        frames=duration_seconds * fps
    )
    return video_clip  # 生成完毕,不可修改

# 流式生成(Vivix-A1 方案)
def streaming_generation(initial_prompt):
    context = encode(initial_prompt)
    while True:
        frame = generate_next_frame(context)  # 只生成下一帧
        yield frame                           # 立即输出

        if new_user_input_available():        # 随时检查新输入
            new_signal = encode_multimodal(   # 直接编码多模态信号
                audio=mic_buffer,
                text=user_text,
                image=user_upload
            )
            context = update_context(context, new_signal)  # 即时更新

这个伪代码虽然极度简化,但能帮理解核心差异:clip 方案是一次性烹饪,端上来就不能改了;流式方案是边炒边加料,客人随时能提新要求。

多模态参考注入与长程一致性

流式生成有一个天然的难题:怎么保证角色在生成 5 分钟之后看起来还是同一个人?

A1 的做法是引入局部连续性先验。在技术报告中 Vivix 提到,他们把连续性信号和多样性信号在多模态生成中做了分离。传统的做法是通过「sink tokens」和「reference anchors」来稳定长程生成——这些机制帮助模型在扩展序列上保持一致性。但这也带来了一个微妙的代价:预设的稳定信号会约束模型产生多样化的角色外观和开放行为的能力。

Vivix 的解决方案是在多模态生成中解耦这两个信号——让连续性归连续性管,多样性归多样性管,两者不再互相干扰。具体实现细节没有完全公开,但从效果来看,这个设计是奏效的。

五、拆解 W1:一个可以被随时「改写」的活故事

如果说 A1 的关键问题是「怎么让一个角色活起来」,那 W1 的关键问题是「怎么让一个故事世界持续运转,并且随时能被观众介入」。

从生成一段视频到生成一个世界

W1 在技术报告中被称为「面向叙事智能的流式原生多模态交互模型」。听着很学术,翻译成人话就是:它不只是生成一段视频,而是生成一个持续演变的叙事空间——里面有角色、有环境、有事件,而且所有这些元素都在随着时间自然推进。

操作流程是这样的:

  1. 你输入一段初始提示词(比如「一个侦探在雨夜的伦敦街头调查一桩谋杀案」)
  2. W1 生成故事世界并开始自动播放——角色出现、场景铺设、对白和音效同步生成
  3. 你随时可以通过多种方式介入——
    • 语音:「让侦探走进那家古董店」
    • 文字:输入新的场景描述
    • 图片:拖一张人物照进去,这个人物就出现在故事中
    • 触控/点击:点击场景中的某个物体触发事件
  4. W1 实时接收你的输入,调整后续的故事走向——镜头切换、角色反应、对白内容、环境音都同步变化

最让人印象深刻的是,这些改变不是多个素材拼在一起的,而是模型原生同步生成的。镜头语言、音效、对白、角色动作在同一个生成过程中被协调。你看到的是一个完整、连贯的音视频流,而不是能看出接缝的「交互式 PPT」。

多镜头叙事能力

W1 的一个独特能力是多镜头叙事。传统 AI 视频生成你给一段提示词,它输出一个固定镜头下的画面。W1 在生成过程中会自动进行镜头切换——远景、近景、特写、跟拍——而且这些镜头切换本身也是叙事的一部分。

更厉害的是,当用户介入改变剧情时,镜头语言也会跟着调整。比如原来的剧情是「角色平静地走在街上」,用的是平稳的跟拍镜头;用户突然输入「让他开始逃跑」,W1 不仅会让角色跑起来,镜头也会切换成手持抖动风格来配合紧张感。

这种「内容+形式」的原生同步协调,在传统视频制作中需要导演、摄影师、剪辑师三方协作,在 W1 这里变成了模型单次推理的自然输出。

MJD 蒸馏:把 8 步压到 2 步

W1 的实时性依赖于一个关键技术:MJD(Multidimensional Joint Distillation,多维联合蒸馏)。

视频扩散模型通常需要 4 到 8 步去噪。直觉上砍步数就能提速,但 Vivix 在 W1-Turbo 评测中发现了一个关键问题:不同的去噪步骤分别承载不同类型的信息——

去噪阶段

主要承载的信息维度

早期步骤(Step 1-3)

语义布局、整体构图

中期步骤(Step 4-5)

运动动态、物体位移

后期步骤(Step 6-8)

细节纹理、时序稳定性

直接砍掉任何阶段的步骤,不是「去冗余」,而是「丢能力」。比如砍掉早期步骤,画面语义会混乱;砍掉中期步骤,运动动态会下降;砍掉后期步骤,细节会丢失且出现长期漂移。

MJD 蒸馏框架的思路是:不是简单地减少步数,而是按去噪阶段的能力分布做联合压缩。把 8 步的去噪过程中每一步承载的多维信息,通过知识蒸馏的方式压缩到 2 步里——每一步同时承载原来多个步骤的信息维度。

评测结果显示,MJD 蒸馏后的 2 步模型在运动表现和长期稳定性上维持了 8 步基线的水平。这在视频扩散模型加速领域是一个相当显著的成果。

六、技术深水区:四个绕不开的硬骨头

前面两章分别拆了 A1 和 W1 的架构设计,这一章把视角拉高一层,看看 Vivix 这套系统在工程层面要同时解决哪些技术瓶颈。根据官方技术博客和 36氪的深度报道,至少四个问题是环环相扣的。

硬骨头一:因果生成 vs. 双向注意力

这是最底层也最根本的架构选择问题。

目前主流的视频模型(Sora、可灵、Runway 等)采用的是 clip-based 架构,依赖固定时间窗口和双向注意力机制。双向注意力意味着模型在生成第 5 秒画面时,可以同时「看到」第 1 秒和第 10 秒的信息——全局视野让画质和一致性更容易保证。但代价是:生成前必须确定全部输入条件,生成过程中不能再改。

Vivix 走的是因果生成路线:当前帧只能看到过去,不能看到未来。这个选择直接决定了交互能力的有无——只有因果生成,才能在中途接住用户的新输入。

但因果生成也带来了巨大的挑战:

维度

双向注意力(clip-based)

因果生成(Vivix方案)

画质上限

更高(全局信息支撑)

略低(局部信息决策)

长程一致性

天然优势

需要额外机制维护

交互能力

无(生成后不可改)

原生支持随时介入

推理延迟

高(需完整生成)

低(逐帧流式输出)

适用场景

影视后期、素材制作

直播、互动娱乐、实时体验

Vivix 的选择本质上是用画质的上限换交互的可能性。他们把多模态参考注入、因果时序建模和流式状态维护做进了同一套架构里,让图片、语音、文字等信号在生成链路中持续起作用,而不仅限于第一帧。

硬骨头二:MJD 多维联合蒸馏

前面在 W1 章节已经提到了 MJD 的基本思路,这里补充一些更具体的细节。

传统的扩散模型蒸馏方法(比如渐进式蒸馏、一致性模型等)大多采用「均匀压缩」策略——每一步承载同等的信息量损失。Vivix 的发现是:不同去噪步骤承载的能力维度不同,均匀压缩会导致某些维度的能力被系统性削弱。

MJD 的核心创新在于「非均匀联合蒸馏」:先通过能力维度分析找出每一步实际承载的信息类型(语义、运动、细节、时序),然后在蒸馏过程中对不同维度施加不同的压缩策略和损失权重。简单说,就是把「重要的东西多保留,不太重要的多压缩」。

最终的蒸馏效果:8 步 → 2 步,在 Vivix-Bench 的 1000 样本人工评测中,运动动态和长期稳定性与基线持平。这个结果意味着实时交互在算力上变得可行——2 步去噪的计算量约是 8 步的 1/4,延迟也相应降低。

硬骨头三:NVFP4 量化训练

30B 激活参数跑实时推理,不量化是不可能的。但视频扩散模型的量化比语言模型难得多。

语言模型逐 token 生成,量化偏差基本各管各的——一个 token 的四舍五入误差不会显著影响下一个 token。视频扩散去噪是一个连续迭代过程:第一步去噪的微小偏差,会作为第二步的输入被放大,一路沿时间轴传导下去。生成的时间越长,偏差漂移得越远。

业内常见的做法是训练完再做量化(PTQ,Post-Training Quantization)。但对于视频扩散模型,PTQ 在面对连续去噪的误差传导时几乎「堵不住口子」。

Vivix 的做法是反过来:以 Blackwell NVFP4 GEMM 为目标推理路径,在训练阶段就让模型适配 4-bit 数值分布。换句话说,模型在训练时就「知道」自己将来要以 4-bit 精度运行,从一开始就学会了在低精度下维持生成质量。

为了更清楚地对比这两种量化策略的区别,我整理了一张表:

维度

PTQ(训练后量化)

QAT(Vivix的量化感知训练)

训练成本

低(只在训练完成后做一次)

高(训练过程中持续模拟低精度)

对视频扩散的适配

差(跨帧误差传导无法抑制)

好(训练时就学习低精度下的稳定性)

精度损失

通常 2-5% 质量下降

近乎无损(官方宣称)

硬件适配

通用

针对 Blackwell NVFP4 GEMM 优化

去噪稳定性

随步数增加而漂移

去噪误差校正抑制跨帧传导

同时,Vivix 加入了专门的去噪误差校正机制来抑制偏差的跨帧传导。这个机制的核心思路是:在每一帧去噪完成后,计算当前帧与参考帧之间的偏差向量,然后向后续帧注入一个反向的补偿信号,提前抵消量化误差的累积效应。可以把它想象成一个「自动纠偏系统」——每一步都微量调整,防止小偏差像滚雪球一样越滚越大。

据 Vivix 披露,FP4 推理相对 BF16 基线的生成质量近乎无损。这个「近乎无损」的声明如果属实,意味着 30B 参数模型在消费级显卡上实时运行从理论变成了现实。

实际使用中,NVFP4 量化对整个系统的贡献可以量化为几个数字:

  • 显存占用:从 BF16 的约 60GB 压到约 18GB(30B 参数),意味着可以在单张 RTX 4090(24GB)级别的消费级显卡上运行
  • 计算吞吐:4-bit GEMM 在 Blackwell 架构上的吞吐约为 BF16 的 2-3 倍
  • 带宽压力:显存带宽需求等比降低,PCIe 带宽瓶颈被大幅缓解

这三个因素叠加,才让「消费级显卡跑 30B 实时视频推理」从一个疯狂的想法变成了工程上可以交付的现实。

硬骨头四:VMI 推理引擎

模型再快,系统调度跟不上也是白搭。

Vivix 为这套实时链路专门开发了 VMI(Vivix Model Infra)推理引擎。架构设计上最主要的一个决策是「编码与解码分离」:

┌─────────────────────────────────────┐
│             VMI 推理引擎              │
│                                     │
│  ┌──────────┐      ┌──────────┐     │
│  │ 编码服务  │      │ 解码服务  │     │
│  │          │      │          │     │
│  │ 大Batch  │ ───► │ 实时链路  │     │
│  │ 高吞吐   │      │ 低延迟   │     │
│  │          │      │          │     │
│  │ 多模态   │      │ 逐帧解码  │     │
│  │ 编码     │      │ 流式输出  │     │
│  └──────────┘      └──────────┘     │
│                                     │
│  执行引擎:CUDA Graphs + Mega Kernel │
└─────────────────────────────────────┘

编码端吃大 batch 求吞吐——把用户的多模态输入(语音、文字、图片)一次性高效编码成模型可以消费的表示。解码端跑实时链路求低延迟——逐帧解码、逐帧输出,流式推给用户端。

两条线互不干扰的设计直接影响了打断体验:用户中途说了句新指令,系统直接在解码链路里追加新输入作为新的条件信号,当前生成不需要中断重来。这比「停掉当前生成→重新编码→重新开始生成」的流程快了不止一个数量级。

在底层的执行引擎上,VMI 通过 CUDA Graphs 统一提交算子、通过计算通信融合至 Mega Kernel,在消费级 GPU 上跑出了单卡超 10,000 video tokens/s 的吞吐,PCIe 带宽利用率达到 88% 以上。

七、成本与性能:30B 参数跑在消费级显卡上

聊完技术架构,来聊一个更现实的问题:这玩意儿跑起来到底要多少钱、有多快?

实测性能指标

Vivix 官方公布了一组在消费级显卡配置下的实测性能数据(官方测试口径):

指标

数值

意味着什么

首帧延迟(TTFF)

< 0.6 秒

从用户输入到画面出现第一帧反应,不到 0.6 秒

端到端延迟(TTFR)

< 1.7 秒

包含全球网络延迟和直播推流的全部链条,不到 1.7 秒

原生打断区间

300-900 毫秒

用户中途插话到模型开始调整生成,最快 0.3 秒

推理成本

< 1 美元/小时

单小时实时视频推理的算力开销

单卡吞吐

10,000 video tokens/s

一张消费级 GPU 每秒处理超过 10000 个视频 token

这几个数字放在一起看,有几个值得注意的点。

第一,TTFF < 0.6 秒是什么概念?目前主流的 AI 视频生成模型,生成一段 10 秒视频通常需要 3 到 5 分钟。Vivix 是实时流式输出,首帧延迟不到 0.6 秒——这个速度差距不是「快几倍」,而是量级上的跨越。

第二,推理成本 < 1 美元/小时。做一个对比:主流视频平台的 CDN 带宽成本,单小时也在 1 美元左右的量级。Vivix 的实时视频推理成本和 CDN 分发成本已经接近同一量级——这意味着从商业上,实时 AI 视频的算力成本不再是一个不可逾越的障碍。

第三,NVFP4 量化的「近乎无损」是支撑这一切的基础。如果没有有效的 4-bit 量化,30B 参数模型在消费级显卡上实时运行就是天方夜谭。

与同类的性能对比

市面上也出现了一些近似实时推理的视频生成模型,但它们的实现路径通常是基于小参数量(1-5B)或者较大的 VAE 压缩比(如 16x16x8)来降低计算量。这种做法的代价是模型容量受限——要么画面不能有大运动,要么频繁出现较大的画面伪影。

Vivix 选择的是一条更难但上限更高的路:保持 30B 激活参数,采用 8x8x4 的高质量压缩率。计算下来,每秒 token 吞吐需要做到小参数方案的数十倍。VMI 推理引擎就是为了应对这个挑战而设计的。

下面是几种方案的粗略对比:

方案类型

典型参数规模

压缩比

实时性

运动能力

画质稳定性

传统AI视频(可灵/Sora)

大(数十B)

高质量

离线

小参数实时方案

小(1-5B)

大压缩比

实时

⚠️ 受限

⚠️ 有伪影

Vivix A1/W1

30B激活

8x8x4

实时

较强

较好

这张表基本上解释了 Vivix 的技术路线选择:不做「小模型快跑」的低配版,而是用架构创新(因果生成+MJD蒸馏+NVFP4量化+VMI引擎)让大模型也能实时跑。

还有一个值得留意的数据:Vivix 官方公布的 Vivix-Bench 1000 样本人工评测中,A1 在运动动态和音画同步维度上相对现有方案有明显优势,在一致性维度上基本持平。这个评测是独立于技术指标之外的第三方参考,虽然评测细节没有完全公开,但至少说明 Vivix 对自己的产品在真人体验层面的表现是有信心的——不仅仅是纸面上的参数好看。

把所有这些性能和成本数据放在一起看,一个更宏观的判断是:Vivix 已经跨过了「技术演示」到「商业可用」的门槛。延迟够低、成本够低、画质够用——剩下的问题不再是「能不能做」,而是「怎么做大」。

八、应用场景拆解:从直播间到游戏世界

技术讲得再深,最终还是要落到「能用来干什么」上。Vivix 这次的发布之所以受到大量关注,不只是因为技术牛,更因为它打开了一批此前 AI 视频无法覆盖的场景。

场景一:直播电商——数字主播终于有了「活人感」

这是 A1 最直接的应用场景。

目前的 AI 数字人直播,说白了就是一个会念稿的头。全身不动、环境不交互、背景不变——观众看几分钟就知道这是数字人,互动感几乎为零。直播电商的核心是「展示」和「互动」:主播要能拿起商品、展示细节、根据弹幕调整讲解重点。传统的数字人做不到这些。

A1 改变了这个局面。在 Vivix 官方演示中,A1 生成的数字主播可以自由转身、自然地与商品互动、表情丰富且能即时应变。运营人员在直播过程中通过语音指令调整讲解方向,角色在自然的语句间隙完成切换,不需要中断重来。

可以想象的实际操作流程:

  • 运营人员提前准备好商品信息和基础话术
  • 直播开始,A1 数字主播开始讲解商品
  • 弹幕有人问「这个口红涂在嘴上是什么颜色」,运营人员语音指令「试涂一下」
  • A1 实时拿起口红模型,在镜头前完成试涂动作,同时继续讲解
  • 直播间有人刷「想看背面」,运营人员说「转过去展示背面」
  • A1 自然转身展示,全程画面流畅无切换感

这种「实时操控+全身动作」的能力组合,让 AI 直播从「念稿工具」升级成了「可操控的虚拟导购」。对实际从事电商的朋友来说,这意味着一个人可以同时操控多个直播间的多个 AI 角色——人力成本大幅压缩,而互动质量不降反升。

场景二:互动短剧——每个观众看到的都是不同的故事

2026 年 AI 短剧市场经历了爆发式增长。据行业报告,2026 年 Q1 微短剧行业中 AI 微短剧占比已超过 95%。但问题是,大多数 AI 短剧仍然是「线性内容」——生成好就固定了,和传统影视没有本质区别,只是制作成本更低。

W1 的出现可能改变这个局面。它能生成的不再是一段固定剧情,而是一个可以持续演变的故事世界。观众不只是「看剧」,而是参与剧情走向。

举一个具体的例子:

  • W1 生成一段「末日求生」主题的互动故事,主角在城市废墟中搜索物资
  • 观众 A 输入「让主角发现一个地下避难所」——故事走向探索与重建
  • 观众 B 输入「让他遇到一队武装幸存者」——故事走向冲突与博弈
  • 同一个初始设定,不同观众看到完全不同的剧情发展

2026 年 5 月上线的 AI 互动短剧《全球冰封:我打造了末日安全屋》已经有了类似的雏形——观众以「幸存者」身份参与关键决策,推动剧情发展。但当时的实现方式还是基于预设分支,本质上和传统互动影视(如《黑镜:潘达斯奈基》)没区别。W1 的突破在于,剧情分支不需要预设——模型实时根据用户输入生成新的发展方向。

场景三:游戏——NPC 真的能「听懂」你说的话

游戏行业可能是 W1 最激动人心的应用场景。

目前游戏里的 NPC 交互,本质上是播放预先录好的几条对话分支。你说什么,NPC 从有限的选项库里选一条最相关的回复——有时候选得准,大部分时候牛头不对马嘴。

W1 的能力意味着:游戏里的 NPC 可以根据玩家的语音输入,实时生成个性化的回应——包括对话内容、表情、动作和场景反应。不是从 10 条预设对话里选一条,而是真正「理解」玩家说了什么然后生成回应。

更进一步的想象:在一个开放世界 RPG 里,玩家不是按照任务线走,而是真正自由行动。你走进一家酒馆,跟老板聊天,聊着聊着触发了你完全没想到的支线任务——这个任务不是策划提前写好的,而是 W1 根据对话内容和游戏世界设定实时生成的。

当然,这个场景离实际落地还有距离。游戏中 NPC 交互需要极低的延迟(< 100ms)和极高的角色一致性,W1 目前的性能指标(交互响应 < 1 秒)对于非实时对话场景已经够用,但对于战斗和快节奏交互还需要进一步优化。

场景四:虚拟陪伴——不只是「陪聊」

A1 的全双工能力和环境感知能力,让虚拟陪伴这个场景往前迈了一大步。

传统的 AI 虚拟陪伴(如 Character.AI、星野等)本质上是文字聊天,最多加一张静态立绘。有些产品加入了语音,但交互模式仍然是回合制——你说一句,TA 回一句。

A1 能做的事是:一个能看到你、听到你周围声音、能做出全身动作反应的 AI 角色。你跟 TA 说「我今天好累」,TA 不只是回一句「辛苦了」,而是会调整表情和姿态——可能靠近一点,语气更温柔一些。你在 TA 面前拿起一本书,TA 能看到并主动问「你在看什么书」。你那边突然传来门铃声,TA 会说「有人来找你了,先去开门吧」。

这种「多模态感知+全身表达」带来的沉浸感,是纯文字或纯语音交互无法替代的。

场景五:教育——一对一辅导不再稀缺

教育场景中,A1 和 W1 各有应用。

A1 可以作为 AI 辅导老师:学生在解题时表现出困惑的表情,A1 能感知到并放慢讲解节奏、调整讲法。学生走神了,A1 能通过视觉感知到并重新吸引注意力。讲解一个物理实验时,A1 可以直接在虚拟环境中拿起实验器材进行演示操作。

W1 可以生成互动式教学内容:比如历史课上,W1 生成一段「古罗马元老院辩论」的实时场景,学生可以参与其中——问西塞罗一个问题,或者改变一个历史条件看故事如何演变。

好老师的一对一辅导之所以稀缺,是因为一个好老师的时间精力有限。AI 辅导如果只是「念 PPT 的虚拟头像」,价值不大。但如果 AI 能真的「看」学生、「听」学生的反应并动态调整教学策略,那优质教育资源的规模化复制就不再是空话。

各场景需求与技术匹配度

下面这张表汇总了不同应用场景对 A1/W1 核心能力的需求程度:

应用场景

全双工交互

全身动作

环境感知

多模态输入

多镜头叙事

当前可行性

直播电商

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数106 篇
昨日发布4 篇
本月发布14 篇
建站时间38 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码