本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
2026 年 7 月 31 日,DeepSeek 悄悄上线了 V4 Flash 正式版(模型标识 deepseek-v4-flash-0731),只做 API 公测、没有发布会。这次升级最值得关注的三件事:第一,模型架构、参数规模和预览版完全一致,纯粹靠重新后训练就把 Agent 能力拉到远超 V4-Pro 预览版的水准;第二,官方明确表示针对 Codex 做了适配,并且原生支持 Responses API 格式,接入成本几乎为零;第三,价格依旧是白菜价——输入 1 元/百万 token、输出 2 元/百万 token,配合约 98% 的缓存命中折扣,单任务成本比 GPT-5.6 Luna 低约 60%。在 Arena 的前端代码榜单 Frontend Code Arena 上,它拿到 1586 分,总排名全球第 7、开放模型第 3,仅次于智谱 GLM-5.2,直接把闭源的 Claude Opus 4.8 甩在了身后。如果你想在 Codex 里用上一个便宜、稳定、编码能力接近旗舰的模型,这篇笔记把原理、跑分、配置方式、实测体验和避坑清单一次讲完。
想看完整拆解,往下翻。
在动手写这篇之前,我先交代一下背景:这篇文章是基于我自己的学习实践整理出来的,素材来自多方资料和我的实际操作记录,不是官方通稿,也不替任何厂商站台。下面所有跑分数据、配置步骤、实测感受,我都尽量给出出处和可复现的方法,方便你自己动手验证。老规矩,文中的信息以 2026 年 8 月的最新公开资料为准,如果后续官方有更新,以官方文档为准。
第一章:DeepSeek V4 家族:Flash 正式版的前世今生
先把这个模型的"家谱"捋清楚,不然很多朋友会搞混版本号。
1.1 从预览版到正式版:一次"悄悄"的公测
DeepSeek 的第四代旗舰模型 V4 是 2026 年 4 月 24 日以预览版形式亮相的,当时一口气放出了两个版本:主打全能的 V4-Pro 和主打轻快的 V4-Flash。预览版阶段,Flash 的口碑其实一般,很多开发者试完觉得它就是个"便宜但不够聪明"的轻量款,Agent 任务里经常掉链子,工具调用一多就开始犯迷糊。
转折发生在 2026 年 7 月 31 日下午。DeepSeek 没有开发布会,只在 API 文档的更新日志里贴了一行字:DeepSeek-V4-Flash 正式版 API 上线公测。随后 IT 之家等科技媒体跟进报道,消息才在开发者圈子里炸开。
这次升级有几个关键信息值得单独划重点:
- 正式版模型标识为
deepseek-v4-flash-0731,结构、尺寸和预览版完全一致,只是重新做了后训练; - 官方原话是"Agent 能力大幅增强,基准测试远超 V4-Pro-Preview";
- 正式版原生支持 Responses API 格式,并针对性适配了 Codex;
- 本次只升级了 Flash 的 API 接口,V4-Pro 的 API 和 App/Web 端模型都没动,官方预告 V4-Pro 正式版"将尽快发布"。
你没看错,这次 Flash 是"单兵突进"——旗舰 Pro 还没转正,小弟 Flash 先拿着正式版身份证上街了。而且按官方日志的说法,V4-Pro 正式版在 8 月初也会接入 Responses API,到时候这套配置方法可以原样复用。
1.2 看懂 V4 的架构:MoE 是什么
聊参数之前,先给新手补一个基础概念:MoE(Mixture of Experts,混合专家模型)。你可以把它想象成一家公司:平时上班的不是所有员工,而是根据任务类型临时抽调一小批"专家"来干活。模型把"总参数"看作员工总数,"激活参数"看作每次实际干活的人数。
DeepSeek V4 两个版本的具体数字差别很大,我整理成了表格,方便对比:
|
维度 |
DeepSeek V4-Pro |
DeepSeek V4-Flash |
|
总参数量 |
1.6 万亿(1.6T) |
2840 亿(284B) |
|
每 token 激活参数 |
490 亿(49B) |
130 亿(13B) |
|
上下文窗口 |
最高 100 万 token |
最高 100 万 token |
|
开源协议 |
MIT |
MIT |
|
定位 |
复杂推理、架构设计 |
日常编码、快速迭代 |
|
2026-07-31 状态 |
预览版(正式版预告中) |
正式版已公测 |
注意 Flash 的激活参数只有 13B——这个数字放在两年前会被当成"小模型"嘲笑,但正式版用实际成绩证明了一件事:模型大不大不重要,练得好不好才重要。后训练做得到位,13B 激活参数的模型照样能把自家旗舰的预览版按在地上摩擦。
1.3 旧端点停用:一次必须注意的迁移
还有一个容易被忽略的细节:DeepSeek 原有的 API 端点 deepseek-chat 和 deepseek-reasoner 已经在 2026 年 7 月 24 日正式停用,分别转接到了 V4-Flash 的非思考模式与思考模式。也就是说,如果你手上还挂着老代码、老配置,很可能已经悄悄开始走 V4-Flash 了——这未必是坏事,但如果你没意识到这点,出问题时会一脸懵。建议所有开发者都去后台确认一下自己当前实际调用的模型标识,别稀里糊涂用着旧名字。
这一章把背景交代完了。其实 DeepSeek 这次的迭代节奏也值得玩味:4 月发布预览版、7 月底转正 Flash、预告 Pro 马上跟进——半年一个周期的步伐非常紧凑,而且每次都把"最便宜的那个版本"先推到台前。这背后的策略逻辑不难猜:先用性价比版本把开发者生态喂饱,再用旗舰版本把能力天花板立起来。对用户来说,这反而是好事——永远有便宜好用的版本可以先用起来,不用干等。
第二章:官方成绩单:九项 Agent 基准全面反超 Pro 预览版
跑分这东西,平时看看图个乐,但这次不一样——官方明明白白写着"基准测试远超 V4-Pro-Preview",而且 Flash 是在参数不变的情况下反超的自家旗舰,这在行业里相当罕见。我把官方公布的九项 Agent 基准数据整理成了表格,后面再逐个解释这些英文缩写到底在测什么。
2.1 九项基准成绩一览
|
基准测试 |
V4-Flash 正式版 |
说明(测什么) |
|
Terminal Bench 2.1 |
82.7 |
在真实终端环境里执行命令、操作系统的能力 |
|
NL2Repo |
54.2 |
根据自然语言描述生成整个代码仓库 |
|
Cybergym |
76.7 |
网络安全相关任务的智能体表现 |
|
DeepSWE |
54.4 |
复现真实 GitHub 软件工程问题并修复(预览版仅 7.3) |
|
Toolathlon verified |
70.3 |
多工具组合调用的完成度 |
|
Agent Last Exam |
25.2 |
综合智能体考试,偏难 |
|
Automation Bench (Public) |
25.1 |
自动化完成端到端业务流程 |
|
DSBench-FullStack |
68.7 |
全栈开发任务(前端+后端+部署) |
|
DSBench-Hard |
59.6 |
高难度全栈任务 |
先给新手翻译几个关键术语:Agent(智能体) 就是"能自己动手干活"的 AI——不只是回答你的问题,而是可以调用工具、读写文件、执行命令、修改代码,把一件事从头做到尾;基准测试(Benchmark) 就是一套标准化的考题,用来横向比较不同模型的水平。
这九项里面,我最看重的是 DeepSWE——它模拟的是真实世界的软件工程场景:给你一个 GitHub 仓库里的真实 issue,让你自己定位 bug、写修复、跑测试。预览版只有 7.3 分,正式版一口气干到 54.4 分,翻了七倍多。这说明正式版不是"微调了一下",而是真的把"读懂项目、动手改代码"这条链路练通了。
为了让新手对"考什么"有更直观的感受,我把其中几项基准的考试场景展开说说:
- Terminal Bench 2.1(82.7 分):给模型一个终端环境,让它自己敲命令完成操作任务——装依赖、查日志、改配置、起服务。这项分数高,意味着模型在真实命令行环境里"动手能力"强,而不是只会纸上谈兵。这也是 Agent 类产品最核心的能力之一。
- NL2Repo(54.2 分):只给你一句自然语言描述(比如"写一个带登录功能的博客系统"),让模型从零生成一个完整仓库。考的是"从需求到项目落地"的整体规划能力,比单纯补全代码难得多。
- Cybergym(76.7 分):网络安全方向的智能体考场,涉及漏洞分析、脚本编写、攻防演练类任务。这个方向能拿高分,侧面说明模型的代码理解和推理深度不差。
- Agent Last Exam(25.2 分):可以理解为"智能体版的奥赛题",题目刁钻、场景综合,25.2 分在开源模型里已经是相当能打的水平——这个分数看着低,是因为考试本身就难。
- Automation Bench (Public)(25.1 分):考"端到端自动化"——让模型自己规划并完成一个完整业务流程,中间涉及多步工具调用和异常处理,最考验 Agent 的"办事靠谱程度"。
看完全部九项,你会发现一个共性:这些考试几乎没有一道是"背答案"能过的,全部要求模型在真实或接近真实的环境里动手干完一件事。 这也是为什么这次 Flash 正式版的口碑和预览版完全不同——预览版可能只是"读得懂题",正式版是真的"干得动活"。
另外,我把这次升级里几个关键的"前后对比"数字单独列出来,方便你感受进步幅度(数据均来自官方与第三方公开评测):
|
指标 |
升级前 |
升级后 |
提升 |
|
DeepSWE(真实工程修复) |
7.3(预览版) |
54.4(正式版) |
约 7.5 倍 |
|
Frontend Code Arena 总分 |
1432(Flash 预览版) |
1586(正式版) |
+154 分 |
|
Frontend Code Arena 总分 |
1465(Pro 预览版) |
1586(正式版) |
+121 分 |
|
AII 智能指数 |
40(4 月首发版) |
50(正式版) |
+10 分 |
|
AII 智能指数 |
44(Pro 预览版) |
50(正式版) |
+6 分 |
这张表最扎眼的一行是最后一行:Flash 正式版的 AII 分数,比自家旗舰 Pro 的预览版还高 6 分。 在 DeepSeek 的历史上,这是第一次出现"轻量版在预览期压过旗舰版"的场面。当然,这里面有 Pro 还没做完后训练的客观原因,但至少说明 DeepSeek 这轮后训练的投入是真的猛。
2.2 为什么参数没变,能力却暴涨?
这里涉及大模型训练的一个核心概念:后训练(Post-training)。大模型的训练可以粗分成两段:
- 预训练:在海量文本上"读万卷书",学语言规律和世界知识,决定模型的"底子";
- 后训练:用指令数据、强化学习等方式"定向训练",决定模型"会不会干活、听不听得懂人话"。
打个比方:预训练决定一个人是不是聪明,后训练决定他能不能在具体岗位上把活干利索。V4-Flash 正式版做的就是后者——底子没换,但把"当 Agent 干活"这项技能狠狠练了一轮。
另外还有个值得注意的信号:官方这次评测 Coding Agent 任务时,用了自研的 DeepSeek Harness 评测框架(据传即将开源)。Harness 就是"给模型考试时用的监考系统"。DeepSeek 的思路是"训推一致"——平时怎么练的,考试就怎么考,线上就怎么跑,这样适配出来的 Agent 行为更稳定。这套自研评测框架的开源,对国内 Agent 生态会是件好事,大家以后跑分也有统一尺子了。
2.3 怎么理解"远超 Pro 预览版"
我用一张简单的图来展示这次能力跃迁的逻辑:
flowchart LR
A[V4-Flash 预览版] -->|重新后训练| B[V4-Flash 正式版 0731]
B -->|Agent 能力大幅增强| C[九项基准全面反超]
B -->|原生支持| D[Responses API]
B -->|针对性适配| E[Codex]
C --> F[结论:轻量模型也能打旗舰]
这里要澄清一个容易误读的点:"反超 Pro 预览版"不等于"Flash 比 Pro 强"。Pro 定位是旗舰,参数规模大得多,它只是还没转正、后训练还没做完而已。等 V4-Pro 正式版出来,大概率又是一轮新的碾压。所以更准确的说法是:Flash 正式版证明了一件事——后训练的水平,正在成为模型能力分水岭的关键变量。
这里也要多说一句怎么看跑分:跑分永远只能反映测试环境下的表现,真实的项目千奇百怪,最终还是要以你自己的实际体验为准。我见过太多模型跑分漂亮、上手拉胯的例子,也见过跑分一般但实际用着很顺手的模型。所以榜单数据你当成参考坐标系就行,最终的结论,得靠自己在项目里跑几轮才能下。
第三章:Arena 前端代码第 7、开放模型第 3:一份被低估的跑分
3.1 Frontend Code Arena 是什么,为什么有含金量
先介绍这个榜单的来历。Arena.ai 的前身是业内知名的 LMSYS Chatbot Arena 团队——就是那个搞"大模型对战"的平台。它用类似国际象棋的 Elo 积分系统,让两个模型匿名对战,由真实的人类开发者进行双盲投票(投票者不知道哪个模型是谁),赢者加分、输者减分,最终排出名次。因为打分的是人而不是考试题,这个榜单反映的是"真实人类用着爽不爽",而不是"模型会不会背答案"。
Frontend Code Arena(前端代码竞技场) 是 Arena.ai 的专项榜单,专门考验模型把网页/前端项目做出来的能力:给一句需求描述,让模型自己写 HTML、CSS、JavaScript,生成能跑的网页。业内普遍把它看作评估大模型"网页开发 + Agent 级自动化编码"能力的黄金标准——因为前端任务最考验模型对真实产品需求的理解,而不是纯文本生成。
3.2 1586 分:一个刷新纪录的成绩
这次 DeepSeek-V4-Flash 正式版在 Frontend Code Arena 拿到的成绩是:
- 总排名第 7,开放模型(开源)排名第 3,仅次于智谱 GLM-5.2;
- 总分 1586 分,比 Flash-High-Preview 提升 154 分,比 V4-Pro-Preview 提升 121 分;
- 在细分领域里:消费产品开发第 4,基于参考的设计、数据与分析、游戏开发第 6,品牌与营销第 7;
- 直接超越闭源的 Claude Opus 4.8,而 Opus 4.8 每百万 token 要 25 美元,Flash 只要约 0.28 美元,价格差了近 99 个点。
我把关键排名整理成一张表:
|
排名维度 |
DeepSeek-V4-Flash-High 的位置 |
说明 |
|
前端代码总榜 |
第 7 名 |
全球所有模型(含闭源) |
|
开放模型榜 |
第 3 名 |
仅限开源模型,仅次于 GLM-5.2 |
|
消费产品开发 |
第 4 名 |
做用户端产品的专项能力 |
|
设计/数据/游戏 |
第 6 名 |
按参考设计还原、数据分析、游戏开发 |
|
品牌与营销 |
第 7 名 |
品牌官网、营销页面制作 |
顺便说一句,Arena.ai 官方还给了个评价:V4-Flash 正式版刷新了 Frontend Code Arena 的性能与成本综合表现(Pareto Frontier)——翻译成大白话就是:在"又要跑得快、又要花得少"这件事上,它目前是榜单上最划算的选择之一。
3.3 Artificial Analysis 的 AII 智能指数:只差 GPT-5.6 Luna 1 分
除了 Arena,另一个独立评测机构 Artificial Analysis 也更新了数据。它的核心指标叫 AII(Artificial Analysis Intelligence Index,人工智能分析智能指数),通过多维任务综合衡量模型"绝对智能水平"。
- V4-Flash-0731 拿到 50 分,比 4 月刚发布时高出 10 分,比自家 V4-Pro 预览版还高 6 分;
- 在全球大模型中排名第 15,与谷歌 Gemini 3.6 Flash 同分;
- 距离闭源旗舰 GPT-5.6 Luna 的 51 分只差 1 分;
- 由于 DeepSeek 第一方 API 提供约 98% 的缓存命中折扣,它的单任务成本比 GPT-5.6 Luna 低了约 60%。
一个激活参数只有 13B 的开源轻量模型,综合智能


