本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
DeepSeek V4 系列于 2026 年 4 月 24 日正式开源,采用 MIT 许可证,包含 V4-Pro(1.6 万亿总参数 / 49B 激活)与 V4-Flash(2840 亿总参数 / 13B 激活)两个 MoE 版本,均原生支持 100 万 token 上下文,预训练数据量从 V3 时期的约 15T 翻倍到 32T 以上。架构层面引入三项关键创新:CSA + HCA 混合注意力、mHC 流形约束超连接、Muon 优化器。在 1M 上下文场景下,V4-Pro 单 token 推理 FLOPs 只有 V3.2 的 27%,KV Cache 占用降到 10%。MoE 专家权重首次采用 MXFP4 精度,与华为昇腾 950PR 原生支持的精度格式正好对齐——这是国产顶级开源模型第一次从底层精度设计上就为国产算力栈量身定制。
官方自承能力轨迹滞后 GPT-5.5、Gemini-3.1-Pro 等闭源前沿约 3 到 6 个月,但价格仅为同档闭源 API 的约 1/9 到 1/50,V4-Pro 输出价 24 元/百万 token、V4-Flash 输出价 2 元/百万 token。这不是又一次"参数数字游戏"的升级,而是一次系统级的技术下沉。
想看完整拆解,往下翻。下文会从架构原理、训练细节、国产算力适配、蒸馏争议、定价逻辑、Agent 后训练范式一直聊到我自己的上手体验,新手友好,术语第一次出现都会用白话讲一遍。
一、V4 Pro 究竟发布了什么:一次被严重低估的"基础设施级"开源
很多人看到 DeepSeek V4 的发布,第一反应是"哦,又出了一个国产大模型,参数更多了"。如果只看到这一层,那真的是把这次发布看薄了。
我把 V4 的技术报告反复啃了几遍,加上自己手里跑的几个实际任务的对比数据,得出的判断很直接:V4 不是一次性能跨代,而是一次面向"AI 公共基础设施"的关键铺路。要理解它的分量,先把基本信息捋清楚。
1.1 双版本同步开源:Pro 顶配 + Flash 轻量
DeepSeek 这一代不是发一个模型,而是直接端出一个完整矩阵。这种发法很像消费电子领域同时发布旗舰与高性价比两条产品线——一个面向上限,一个面向普及。
下面这张表是我整理的两个版本核心参数对比,数据基于官方技术报告和 Hugging Face 模型卡:
|
指标 |
DeepSeek V4-Pro |
DeepSeek V4-Flash |
|
总参数 |
1.6 万亿 (1.6T) |
2840 亿 (284B) |
|
激活参数 |
490 亿 (49B) |
130 亿 (13B) |
|
上下文长度 |
100 万 token (1M) |
100 万 token (1M) |
|
最大输出 |
384K token |
384K token |
|
推理模式 |
Non-think / Think High / Think Max |
同上 |
|
架构类型 |
MoE(混合专家) |
MoE(混合专家) |
|
开源协议 |
MIT License |
MIT License |
|
主要场景 |
顶级推理、Agentic Coding |
高并发、低成本、长上下文经济推理 |
这里有几个细节值得拎出来强调一下。
第一,原生支持 1M 上下文。注意"原生"两个字。市面上一些模型号称百万上下文,实际上是后期通过 RoPE 外推、滑动窗口拼接等工程手段扩出来的,在真实长文档场景里"前后呼应"的能力非常差。V4 是在预训练阶段就把长上下文当成一等公民来设计的,这一点后面单独讲。
第二,两个版本都是 MoE 架构。说人话就是:模型内部其实有几百个"专家小网络",每次处理一个 token 只会激活其中很小一部分专家来干活。V4-Pro 总共 1.6 万亿参数,但每次推理只激活 490 亿——大约 3% 出头。这意味着同样规模的"知识储量",计算开销却只有稠密模型的一小部分。
第三,MIT 许可证开源。这是开源界相当宽松的协议,允许商用、修改、再分发,而且对再分发出的衍生品几乎没有传染性约束。1.6 万亿参数 + MIT,这个组合迄今为止在公开权重的大语言模型里没有先例。
辛梓煜@词元二号站 这边自己整理过开源大模型的许可证矩阵,Llama 系列是有商用门槛的"半开源",Qwen 部分模型是 Apache 2.0,而 V4 直接是 MIT。从协议宽松度来讲,V4 的态度可以说是"全送了"。
1.2 484 天的等待:不是退场,而是攻坚
从 V3 到 V4,中间隔了大约 484 天。这一年多里,网上的传闻一直没断:有说团队人才被大厂挖空的,有说卡不够用、训练训不起的,还有说被某些合作方"拖累"的。今天回头看技术报告,这些猜测基本都站不住脚。
技术报告长达 58 页,作者名单里挂名的研究与工程人员将近 300 人,比 V3 时期的不到 200 人还要多。报告里有十个人的名字前标了星号,意思是已经离开团队——但相比近 290 人的留任规模,这点流动属于正常水平。创始人梁文锋的名字也只是和其他研究人员、工程师并列出现,没有放在什么特别突出的位置。
那 484 天到底花在哪儿了?答案在技术报告里写得清清楚楚:
- 预训练数据量从 V3 时期的约 15 万亿 token,翻倍到 32 万亿 token 以上。 数据量翻倍,训练过程中梯度爆炸、loss 突刺、专家路由失衡这些"超大规模训练通病"会集中爆发。
- 架构同时换了三大件:注意力机制(CSA/HCA)、残差结构(mHC)、优化器(Muon)。任何一处单独换都需要大量调参,三处一起换基本相当于推倒重来。
- 同时为国产算力栈做底层适配。 从 CUDA 生态迁到华为 CANN,涉及到 kernel 重写、算子库重建、精度格式对齐,这是一项长期的系统工程,不是临时贴一层兼容层就行。
所以 V4 的延迟,不是"出事了",而是"在啃硬骨头"。这一点理解清楚,后面才能看懂 V4 各种设计取舍背后的逻辑。
1.3 性能定位:坦诚承认 3 到 6 个月差距
DeepSeek 在报告里有一句话写得很坦诚:V4 的能力轨迹仍滞后 GPT-5.5、Gemini-3.1-Pro 等闭源前沿模型大约 3 到 6 个月。这种话从一家中国 AI 公司嘴里讲出来,在 PR 满天飞的当下,反而显得很难得。
但 3 到 6 个月意味着什么?我自己算了一笔账,大家可以一起感受下规模差距。
V4 的预训练计算量大约在 (10^{25}) FLOPs 这个量级。听起来很吓人。可如果用 OpenAI 公开披露过的算力规模反推——他们手上据传有数万张 GB200 量级的 Blackwell 架构卡,假设其中相当一部分专门用于训练,以 15% 左右的有效利用率算,跑完 V4 这个量级的预训练只需要一天多的时间。
也就是说,从纯算力供给角度,顶尖闭源实验室在物理上可以用几十个小时复制 V4 的训练规模。但实际能力差距只有 3 到 6 个月。这背后体现出的是中国研究团队在算法、架构、工程上的密集创新——用更少的卡,做更多的活,把能力对齐的窗口期压缩到了季度级别。
更关键的是,V4 把这套能力完整开源,而对面顶级闭源模型即便在能力上领先,也只是把这种领先封装成高价 API 卖出去。在"技术普惠"这件事上,两种发展路径已经完全分叉了。
二、为什么"百万 token 上下文"远不止省 API 钱
V4 发布后,网上有一种声音很常见:"百万上下文不就是省点钱嘛,不用分段处理了。" 这种理解,大约只看到了表层。
百万 token 上下文真正改变的,是模型能处理的"工作单元"边界。我自己折腾过一阵子之后,体感最深的是:从聊天工具,到能够独立干活的工具,这一步迈过去就靠它。
2.1 100 万 token 到底有多大
先给个直观参照。100 万 token,差不多对应:
- 一整本中等厚度的技术书(参考:《算法导论》全书约 60 万英文单词,折合 token 大约 80 万 ~ 100 万)。
- 一个中等规模代码仓库的所有源文件(几万行代码 + 注释 + README 是绰绰有余的)。
- 一家上市公司全年的财报、季报、电话会议纪要合订本。
- 一份完整的法律卷宗,包括起诉状、答辩、所有证据材料。
- 几十小时音频转写后的完整记录。
这里有一个新手友好的小说明:token 是大模型处理文本的基本单位,可以粗略理解为"一个汉字大约对应 0.7 到 1.5 个 token",英文一个常见单词差不多 1 个 token。
2.2 从"分段喂"到"整本读"的本质区别
过去做长文档分析,流程通常是这样的:
长文档
→ 切成 N 段(每段 8K ~ 32K token)
→ 每段单独喂给模型 → 各自总结
→ 把所有总结再拼起来 → 让模型生成最终答案
这种流水线有几个绕不开的问题:
- 跨段依赖丢失。第 3 段提到的人物在第 15 段又出现了,模型很难自己把这两处串起来。
- 总结时重要细节被压缩掉。一旦细节没进总结,后续就再也找不回来。
- 多次调用增加错误累积。每次调用都是一个独立的概率事件,误差会层层叠加。
V4 把这一切的解法直接做成了基础设施:整本扔进去。下面这张 Mermaid 图直观展示了两种工作流的对比。
flowchart LR
A[长文档/代码库] --> B1[分段切分]
B1 --> C1[逐段独立处理]
C1 --> D1[各自生成摘要]
D1 --> E1[拼接整合]
E1 --> F1[最终答案<br/>跨段依赖易丢失]
A --> B2[整体喂入<br/>100万 token 上下文]
B2 --> C2[模型一次性建立全局依赖]
C2 --> F2[最终答案<br/>跨段关系自然保留]
style F1 fill:#fdd,stroke:#c66
style F2 fill:#dfd,stroke:#6c6
辛梓煜@词元二号站 这边实测过一个 30 万 token 左右的代码仓库分析任务,过去用分段方案需要写一堆 chunking 与摘要合并的胶水代码,自己实现一遍 RAG 流水线;切换到 V4 之后,直接把代码 zip 解压拼接成一个超长 prompt 喂进去,模型能正确识别出跨文件之间的依赖关系和接口耦合点。这种"少写胶水代码"的感觉,只有跑过的人才知道有多爽。
2.3 智能体能力的物理基础
更值得讲的是另一件事——百万上下文是真正可用的智能体(Agent)系统的物理前提。
什么是智能体?简单讲就是"AI 能自主规划一连串动作,调用工具,完成一个真实任务"。比如让 AI 自己读完代码仓库、定位 bug、修改文件、跑测试、提 PR——这一连串动作就是一个 Agent 工作流。
Agent 工作流最大的瓶颈不是单步推理够不够强,而是模型能不能在一个上下文里同时记住:
- 用户最初的任务描述
- 项目的整体架构和约束
- 它自己之前已经做过哪些动作
- 每一次工具调用拿回来的中间结果
- 已经尝试过、失败过的路径
- 当前应该走的下一步
这些信息加起来,在一个真实开发任务里,轻松突破几十万 token。上下文窗口不够大,Agent 就会变成"金鱼的记忆",每隔几步就忘前面在干嘛。
V4 把上下文做到 100 万,意味着 Agent 终于有了一个"完整工作日级别"的记忆容量。技术报告里也提到,V4 在工具调用场景下会完整保留跨轮次的推理痕迹,而不是像 V3.2 那样每次调用后清空——这一点为 Agent 的"长程推理"提供了显式支持。
2.4 长上下文不是免费的:这才是真正难的地方
百万上下文为什么以前没普及?因为传统 Transformer 处理长文本的代价是平方级增长的——文本长度翻倍,所需的算力和显存就要变成四倍。从 4K 到 1M,理论上代价要乘以 6 万倍以上。
这就是为什么过去 1M 上下文只在少数闭源模型的高端 API 里出现,而且收费极其昂贵。V4 真正的技术分量在于:它通过架构创新把这种平方爆炸压了下去,让百万上下文从"高端选配"变成"开源标配"。具体怎么做到的,放在下一章细聊。
三、技术黑箱拆解:V4 的三大架构创新
这一章会稍微硬核一点,但我尽量用大白话讲。一个有趣的事实是,V4 的官方技术报告罕见地详尽——58 页里把每一个关键设计选择都写得明明白白,这在闭源闭口的时代,本身就是一种公共贡献。
V4 相比 V3,在架构层面动了三处大手术,任何一处单独拿出来都可以写一篇长文。这三处加在一起,才让"万亿参数 + 百万上下文 + 低推理成本"这套组合在同一个模型里成立。
3.1 第一刀:CSA + HCA 混合注意力机制
这是 V4 长上下文能力的"心脏"。
传统 Transformer 的注意力机制可以打个比方:让模型读一篇文章,每次产生一个新词,都要回头把前面所有的词重新看一遍,看哪几个词跟当前这个词关系最近,然后加权融合。问题在于,文本越长,需要"回头看"的范围就越大,而且每个新词都要看一遍,代价是平方级。
V4 的解法是把注意力拆成两条并行的路径——一条负责"跳读+读重点",另一条负责"细读+读全文",然后把两边结果融合。报告里给这两条路径分别起了名字:
- CSA(Compressed Sparse Attention,压缩稀疏注意力):先沿序列维度把 KV 缓存做一次压缩,把连续 4 个 token 压成 1 个 KV 条目,然后在压缩后的索引上做 DSA(DeepSeek Sparse Attention)的 top-k 稀疏选择。一句话总结:先快速跳读,再精读最相关的几段。
- HCA(Heavily Compressed Attention,重度压缩注意力):对 KV 缓存使用比 CSA 更激进的压缩比(可达 128 倍),但保留稠密(dense)注意力——也就是说,在这条路径上模型仍然会"看全文",只不过看的是高度压缩后的版本。一句话总结:用一个高度浓缩的视角通览全文。
这两条路径并行,各自有不同的偏好——CSA 擅长抓局部精细关系,HCA 擅长抓全局粗粒度依赖。两者结合,效果上既不丢局部信息,又能在长文本里看清整体结构。
效果有多猛?技术报告披露了一组关键数据:
|
指标 (1M 上下文设定) |
V4-Pro |
V4-Flash |
|
相对 V3.2 单 token 推理 FLOPs |
27% |
10% |
|
相对 V3.2 单 token KV Cache 占用 |
10% |
7% |
注意这是在上下文长度从 V3.2 的 128K 扩展到 V4 的 1M、长度翻了 8 倍的前提下,单 token 的推理算力反而下降了三到十倍。这就是架构创新的复利效应。
辛梓煜@词元二号站 这里多说一句:这种"长上下文 + 低单 token 成本"的组合,过去只有 Anthropic 和 Google 内部走过同样的工程化路线,而且都没开源。V4 把这套核心做法开源了,等于把长上下文工程化的路径图直接贡献给了开源社区。
3.2 第二刀:mHC 流形约束超连接
这一项相对小众,但对模型训练稳定性的提升非常关键。
先用大白话讲清楚"残差连接(Residual Connection)"是什么。Transformer 网络是由很多层堆叠起来的,如果每一层都把输入彻底改写,那信息很容易在层层传递中失真。残差连接的思路是:每一层不"覆盖"前一层的输出,而是"加上一点修正"——原始信号 + 修正信号一起送给下一层。这相当于给信息开了一条"高速公路",可以一路直达高层而不丢失。
但是当网络非常深、参数非常多的时候,残差连接也会出问题。具体表现是:深层堆叠的修正信号会逐渐累积出数值不稳定,出现梯度爆炸或者塌缩,训练 loss 一抖一抖的根本停不下来。
V4 引入的 mHC(Manifold-Constrained Hyper-Connections,流形约束超连接) 就是用来解决这个问题的。它的核心思路是把"修正信号"经过一个矩阵变换,这个矩阵不能随便取——必须被约束在"双随机矩阵流形"上(数学上意味着这个矩阵的每行每列加起来都等于 1,谱范数受限不超过 1)。报告里采用了 Sinkhorn-Knopp 迭代算法来做这个约束。
打个不那么严谨的比方:残差连接像一条高速公路,但车想加多少油就加多少油,跑着跑着就有车爆缸了。mHC 相当于给每辆车都装了一个"动力限幅器"——既不影响整体通行效率,又保证没人会因为加油过猛而炸缸。
技术报告显示,引入 mHC 后,深层堆叠的训练稳定性提升了约 6.7%。这个数字看起来不大,但在万亿参数模型的训练场景下,1% 的稳定性提升就意味着几百万元成本的节省。
3.3 第三刀:Muon 优化器替换 AdamW
这是 V4 训练上最大的一次"换发动机"。
绝大多数现代大模型用的优化器都是 AdamW——它是 2014 年 Adam 优化器的改进版,稳定、好用、是十年来的事实标准。但在万亿参数 MoE 模型这个量级上,AdamW 的两个问题被放大了:
- 收敛速度不够快,训练同样的目标 loss 需要的步数偏多。
- 对学习率非常敏感,需要繁琐的调参才能保持稳定。
V4 大刀阔斧地换上了 Muon 优化器(由 Keller Jordan 等人提出,核心思想是基于矩阵正交化)。Muon 只优化二维参数矩阵——也就是占模型参数 99% 以上的那部分线性变换权重。剩下的 embedding、prediction head、RMSNorm 权重等小部件,仍然走 AdamW。
Muon 在 LLM 规模上的第一次大规模验证,是月之暗面的 Kimi K2(1T 参数 MoE,15.5T token 全程零崩溃)。V4 在 Muon 的基础上做了自己的版本——混合 Newton-Schulz 迭代,10 步迭代分成两段:
- 前 8 步用激进系数:把矩阵奇异值快速推到 1 附近,先收敛速度。
- 后 2 步用温和系数:精确把奇异值稳定在 1,保证数值稳定。
这是典型的工程"分阶段优化"哲学——先求速度,后求精度。
报告里还有一个细节值得提:Kimi 用 Muon 时需要 QK-Clip 这种技术来防止注意力 logit 爆炸,而 V4 没用 QK-Clip。原因是 V4 在注意力的 query 和 KV 上直接做了 RMSNorm,从源头上把爆炸的可能性压制住了。一处架构选择带来的稳定性收益,直接省掉了一道额外的工程补丁——这种系统性的设计感,在 V4 的报告里随处可见。
下面这段伪代码是 V4 训练中 Muon 的整体调用结构,简化展示其分阶段思想:
# 简化版伪代码:V4 风格的 Muon + AdamW 混合优化
def step(params, grads):
# 主体二维权重矩阵走 Muon
for p, g in zip(params.matrix_params, grads.matrix_params):
ortho_g = hybrid_newton_schulz(
g,
steps=10,
aggressive_phase=8, # 前 8 步快速逼近
gentle_phase=2 # 后 2 步精确稳定
)
p -= lr_muon * ortho_g
# embedding / RMSNorm / mHC 静态偏置等走 AdamW
for p, g in zip(params.small_params, grads.small_params):
adamw_update(p, g, lr=lr_adamw)
把三刀连起来看:注意力解决"长上下文成本"问题,mHC 解决"深层稳定性"问题,Muon 解决"万亿参数收敛速度"问题。这三处单独看都属于工程优化,但合在一起,才让"万亿参数级 MoE + 百万上下文 + 33T token 预训练"这条工艺路线在现实里跑得通。
四、训练规模翻倍的代价:33 万亿 token 与稳定性攻坚
很多人不太理解一个超大规模模型的训练到底有多难。我自己第一次试着复现一个百亿参数的 MoE 训练时,被各种各样的"灵异崩溃"狠狠教育过——loss 突刺、router 失衡、专家塌缩、梯度爆炸、显存溢出、节点掉线……每一项都能让训练任务直接报废几天的算力。万亿参数的版本,把这些问题全部都放大几十倍。
4.1 数据量翻倍的真实代价
V4 预训练数据量从 V3 时期的约 15T token,翻倍到了 32T 以上,达到 33T 量级。这种翻倍意味着什么?
首先,有效高质量数据本身就稀缺。互联网上能用的、清洗过的、去重过的中英文文本,加起来本来就只有那么多。从 15T 翻到 33T,意味着团队必须深入挖掘原本不在常规语料库里的数据源——更广的代码仓库、更深的学术论文库、更多语言的本地内容、更长的对话记录等等。每一类数据的清洗、去毒、去重都是单独的工程项目。
其次,数据量翻倍直接放大了训练的不稳定性。这是一个简单的统计事实:同样的崩溃概率,在更长的训练步数下,实际发生崩溃的次数会按比例上升。如果在 15T token 的训练里平均会遇到 N 次需要回滚的崩溃,那么 33T token 大概率会遇到至少 2N 次。
第三,Token 数据的"分布漂移"问题。前 10T token 训练出来的模型权重已经把某些模式"刻"得很深了,新进来的 23T token 如果分布不同,会让模型出现"灾难性遗忘"——把好不容易学到的能力又学丢了。如何安排数据课程(curriculum),让每一波新数据都"承上启下",是一项专门的研究。
这三件事叠加,使得 V4 的预训练注定不会是"V3 加上更多数据"那么简单。
4.2 工程上如何防止训练崩溃
V4 在防崩溃这件事上,基本上把能用的招都用上了。技术报告里关键工程手段大致可以归纳成下面几条:
[1] 架构层面:
- 注意力 query/KV 上直接做 RMSNorm,根除 logits 爆炸
- mHC 替代普通残差,约束修正信号的谱范数
[2] 优化器层面:
- Muon + 混合 Newton-Schulz 两阶段迭代
- 关键小部件仍用 AdamW 兜底
- 为 Muon 设计了与 ZeRO 兼容的 hybrid bucket assignment
[3] 训练系统层面:
- 沿用 V3 已经验证过的 DualPipe 流水线并行
- 针对 mHC 做了流水线调整
- 自建 DSec 沙箱平台支撑后训练评测,单集群并发数十万个沙箱
[4] 数据层面:
- 课程化数据安排,逐步引入难度递增的语料
- 对疑似污染数据做多轮去重和去毒
这一整套组合拳放出来的效果,就是 V4-Pro 这种 1.6 万亿参数级别的模型,在 32T+ token 上能跑出一个相对干净的训练曲线。这种工程稳定性能力,本身就是一种壁垒。
4.3 484 天背后的真实节奏
回到那个流传很广的疑问:"V4 为什么拖了一年多?"
把上面这些技术细节摆出来之后,答案其实很清楚了:整套训练工艺被换了一遍,而新工艺需要在万亿参数、33T token、百万上下文这种"前人没走过"的尺度上一点点磨合。这不是单纯靠堆人、堆卡能加速的事——很多稳定性问题只有真的跑起来之后才会暴露,然后停下来分析、改、重启,这个循环本身就需要时间。
辛梓煜@词元二号站 这里讲一个体感:模型训练里有一句行话叫"loss spike(损失突刺)"。指的是训练过程中 loss 偶尔突然飙升一下又掉回来。在小模型里,这种东西大多无关紧要;在万亿参数模型里,一次没控制好的 spike 就可能让前面几周的训练全部白费——梯度信号传播下去,会把已经收敛好的权重打乱重来。
484 天里,据公开信息推测,DeepSeek 团队大概率经历了不止一次类似的反复。但最终他们把这套工艺打磨到了报告里能写出"训练全程稳定"的程度。这件事的工程价值,值得给团队一个"扎实"的标签。
五、从 CUDA 到 CANN:国产算力栈的关键一跃
如果说前几章讲的是"技术好不好",这一章要讲的是"位置重不重要"。V4 这次发布,有一件事在传统媒体的报道里被低估了——它是国产顶级大模型第一次从底层精度设计就为国产芯片量身定制。
5.1 昇腾 950PR:为推理而生的国产 AI 芯片
先把硬件背景讲清楚。华为昇腾 950 系列是昇腾 910 系列之后的下一代,专门为大模型推理场景做了深度优化。其中:
- 昇腾 950PR:2026 年 3 月完成量产,面向 Prefill(预填充)和推荐场景。
- 昇腾 950DT:面向训练场景,计划 2026 年四季度推出。
- 昇腾 A3 超节点:更大规模的集群组件,V4 发布同日全面适配。
950PR 单卡的关键指标我整理了一下,方便和大家熟悉的英伟达产品对照:
|
指标 |
昇腾 950PR (Atlas 350 卡) |
英伟达 H20 (中国特供) |
|
FP4 算力 |
1.56 PFLOPS |
不原生支持 FP4 |
|
HBM 容量 |
112 GB |
96 GB |
|
内存带宽 |
1.4 TB/s |
较低 |
|
支持精度 |
FP32/FP16/BF16/FP8/MXFP8/MXFP4 |
主要 FP16/BF16/FP8 |
|
互联带宽 |
2 TB/s |
— |
|
相对 H20 性能 |
单卡 FP4 算力为 H20 的 2.87 倍 |
基线 |
最关键的差异点是 FP4 原生支持——950PR 是目前国内唯一原生支持 FP4 推理精度的商用芯片。
5.2 为什么 FP4 这么重要
新手友好一句话解释:FP4 = 用 4 个比特表示一个数字。
传统模型权重存储用 FP16(16 比特),后来主流转向 FP8(8 比特),现在 V4 把 MoE 专家权重直接压到 MXFP4(4 比特 + 共享缩放因子,平均每个权重约 4.25 比特)。
[
\text{MXFP4 平均比特数} = 4 + \frac{8}{32} = 4.25 \ \text{bits/value}
]
意味着什么?
- 存储密度提升约 4 倍:同样 100GB 显存,FP16 只能装 50B 参数的模型,FP4 能装 200B。
- 内存带宽需求降到 1/4:在带宽是瓶颈的推理场景下,这是质变。
- 算力效率提升:在原生支持 FP4 matmul 的芯片上,矩阵乘法的吞吐量大幅提升。
V4 技术报告里有一句非常关键的话:"我们在英伟达 GPU 和华为昇腾 NPU 两个平台上均验证了细粒度 EP(专家并行)方案。" 这是 DeepSeek 官方首次在正式文档里把华为昇腾和英伟达并列写入硬件验证清单。
这句话的潜台词是:V4 不是"事后再适配一下国产芯片",而是从设计阶段就把昇腾当作一等公民——MoE 专家权重选用 MXFP4 精度,而 MXFP4 正好是昇腾 950PR 原生支持的格式,这种精度选择上的默契不会是巧合。
5.3 双精度路径:既兼容 Hopper,也兼容昇腾
V4 设计上有一个非常聪明的取舍——MoE 专家权重以 MXFP4 格式存储,但在运行时根据硬件能力动态选择计算精度:
权重统一:MXFP4 存储(约 4.25 bit/value)
运行时计算路径:
┌─ 硬件原生支持 FP4(昇腾 950PR / Blackwell)
│ → 直接 FP4 matmul,带宽减半,吞吐翻倍
│
└─ 硬件只支持 FP8(H800 / 昇腾 910C 等)
→ 运行时 FP4 → FP8 反量化,再做 matmul
这两条路径都基于同一个数学性质:FP4 到 FP8 的反量化是无损的——也就是说,FP4 存储的权重在 FP8 上计算,与"原本就用 FP8 训练"得到的结果在数值上是等价的。
这个设计的精妙之处在于:它让 V4 既能跑在最新的昇腾 950PR 上,也能跑在两年前的 H800、910C 上——一份权重,两种硬件代际都能用。这意味着 DeepSeek 不需要为不同硬件维护多份权重,运维和分发成本都大幅降低。
更深一层意义在于,这种设计是对"卡脖子"叙事的一次正面回应。当国产顶级开源模型在底层精度上和国产芯片完全对齐,英伟达独占的"AI 算力中心"地位就开始松动了。
5.4 实测吞吐:昇腾 950 超节点的真实表现
华为官方在发布同日给出了 V4 在昇腾 950 超节点上的实测数据:
|
模型 |
输入序列 |
时延目标 (TPOT) |
单卡 Decode 吞吐 |
|
V4-Pro |
8K |
~20ms |
4700 TPS |
|
V4-Flash |
8K |
~10ms |
1600 TPS |
(注:数据来自昇腾官方,基于 Offline 推理模式,不包含 Serving 调度和框架负载均衡的影响。)
这个吞吐已经达到一线推理工程的水平。具体的提升来源,华为官方归功于昇腾 950 三大底层升级:
- 原生精度加速:全面支持 FP8、MXFP8、MXFP4 等格式,内存占用降低 50% 以上,计算能力翻倍。
- 稀疏访存优化:针对 MoE 模型的离散访存特征,大幅提升硬件级稀疏访存能力,解决专家路由的带宽瓶颈。
- 向量单元与矩阵单元共享 Memory:这一项是架构级创新,消除了片上数据搬运开销,降低端到端时延。
辛梓煜@词元二号站 看到这组数据的第一反应是:国产算力栈终于补齐了最关键的"软硬协同"短板。过去国产芯片最大的痛点不是峰值算力差,而是软件栈适配深度不够——同样的卡,在国产框架下跑不出英伟达 CUDA 上的效果。V4 × 昇腾这次的协同,标志着这种局面正在被打破。
5.5 不只是华为:多家国产算力 Day 0 适配
除了华为昇腾,V4 发布同日还有几家国产算力厂商完成 Day 0 适配:
- 寒武纪:基于 vLLM 推理框架完成 V4-Pro 和 V4-Flash 的 Day 0 适配,代码同步开源到 GitHub。通过自研 Torch-MLU-Ops 算子库、BangC 编程语言、多维度推理优化,深度释放硬件能力。
- 摩尔线程:携手智源 FlagOS 社区,在旗舰级 MTT S5000 GPU 上完成 V4-Flash 的 Day 0 极速适配,完成核心算子的深度优化。
这种"一发布即多厂商 Day 0 适配"的盛况,在过去几代 DeepSeek 模型里就开始有了苗头,但 V4 这一次更系统、更彻底。这意味着开源模型 + 国产算力的协同生态,正在变成一种被反复验证的工程范式。
六、蒸馏争议拆解:白盒蒸馏、黑盒模仿与一场技术 PR 战
V4 发布几乎同一时间,海外舆论场上又开始出现一种熟悉的声音——指责开源模型"蒸馏"或者"抄袭"闭源前沿模型。这种说法在 V3 时期就出现过,V4 出来后又被翻新了一遍。今天借这次拆解,把蒸馏这件事讲清楚,免得新手被各种 PR 话术带偏。
6.1 真正的知识蒸馏到底学的是什么
知识蒸馏(Knowledge Distillation) 这个概念,最早由深度学习教父 Geoffrey Hinton 等人在 2015 年提出。核心思想可以用一句大白话讲明白:
不是让小模型背老师的答案,而是让小模型学习老师"打分的方式"。
具体来讲,模型在生成下一个 token 时,内部其实对所有候选 token 都计算了一个分数——叫做 logits。这些 logits 经过 softmax 函数,会变成一个概率分布,表示"模型认为每个候选 token 出现的可能性是多少"。
举个例子,假设模型要预测下一个词,候选有 4 个:"苹果"、"梨"、"汽车"、"原子核"。
# 教师模型内部的 logits(原始分数)
logits = {
"苹果": 8.2,
"梨": 6.5,
"汽车": -2.1,
"原子核":-4.7
}
# 经过 softmax 转换成概率分布
soft_targets = softmax(logits / T) # T 是温度系数
# 比如:
# 苹果 -> 0.78
# 梨 -> 0.21
# 汽车 -> 0.008
# 原子核 -> 0.002
这个概率分布里藏着教师模型的"暗知识"——它不只知道答案是"苹果",还知道"梨"和"苹果"在语义上接近(都是水果),而"汽车"和"原子核"则完全偏离。
真正的蒸馏,就是让学生模型学这个完整的概率分布。 学生不仅要复制最终答案,还要复制"模型对错误选项是怎么打分的"——这种相对概率的信息量比纯答案大得多。
[
\mathcal{L}{\text{distill}} = \text{KL}\Big(, \text{softmax}(z{\text{teacher}} / T) \ \big| \ \text{softmax}(z_{\text{student}} / T),\Big)
]
只有拿到教师模型完整的 logits 输出,才能做这种"白盒蒸馏"。
6.2 闭源 API 根本无法支撑真蒸馏
这里就出现了一个关键的硬约束。目前主流闭源前沿模型——比如 GPT-5.5、Claude Opus 4.7、Gemini-3.1-Pro 等——它们的 API 根本不对外开放 logits。
调用闭源 API 能拿到什么?只能拿到最终生成的文本字符串。也就是说:
flowchart LR
A[输入 prompt] --> B[闭源模型内部推理]
B --> C{API 输出层}
C --> D[只暴露:最终文本]
C -.被屏蔽.-> E[logits 概率分布]