📍 词元二号站 AI自媒体 DeepSeek V4 Flash 正式版接入 Codex 全解析:从跑分到实测的完整上手笔记

DeepSeek V4 Flash 正式版接入 Codex 全解析:从跑分到实测的完整上手笔记

摘要:2026 年 7 月 31 日 DeepSeek V4 Flash 正式版上线公测,Agent 能力远超 Pro 预览版,原生适配 Codex。本文详解九项基准跑分、Frontend Code Arena 第 7 名成绩、四种接入方式、官方一键脚本、实测体验与成本测算,附新手避坑清单。
字号 100%
行距 2.05
当前可见 30% 的内容
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要

2026 年 7 月 31 日,DeepSeek 悄悄上线了 V4 Flash 正式版(模型标识 deepseek-v4-flash-0731),只做 API 公测、没有发布会。这次升级最值得关注的三件事:第一,模型架构、参数规模和预览版完全一致,纯粹靠重新后训练就把 Agent 能力拉到远超 V4-Pro 预览版的水准;第二,官方明确表示针对 Codex 做了适配,并且原生支持 Responses API 格式,接入成本几乎为零;第三,价格依旧是白菜价——输入 1 元/百万 token、输出 2 元/百万 token,配合约 98% 的缓存命中折扣,单任务成本比 GPT-5.6 Luna 低约 60%。在 Arena 的前端代码榜单 Frontend Code Arena 上,它拿到 1586 分,总排名全球第 7、开放模型第 3,仅次于智谱 GLM-5.2,直接把闭源的 Claude Opus 4.8 甩在了身后。如果你想在 Codex 里用上一个便宜、稳定、编码能力接近旗舰的模型,这篇笔记把原理、跑分、配置方式、实测体验和避坑清单一次讲完。

想看完整拆解,往下翻。


在动手写这篇之前,我先交代一下背景:这篇文章是基于我自己的学习实践整理出来的,素材来自多方资料和我的实际操作记录,不是官方通稿,也不替任何厂商站台。下面所有跑分数据、配置步骤、实测感受,我都尽量给出出处和可复现的方法,方便你自己动手验证。老规矩,文中的信息以 2026 年 8 月的最新公开资料为准,如果后续官方有更新,以官方文档为准。

第一章:DeepSeek V4 家族:Flash 正式版的前世今生

先把这个模型的"家谱"捋清楚,不然很多朋友会搞混版本号。

1.1 从预览版到正式版:一次"悄悄"的公测

DeepSeek 的第四代旗舰模型 V4 是 2026 年 4 月 24 日以预览版形式亮相的,当时一口气放出了两个版本:主打全能的 V4-Pro 和主打轻快的 V4-Flash。预览版阶段,Flash 的口碑其实一般,很多开发者试完觉得它就是个"便宜但不够聪明"的轻量款,Agent 任务里经常掉链子,工具调用一多就开始犯迷糊。

转折发生在 2026 年 7 月 31 日下午。DeepSeek 没有开发布会,只在 API 文档的更新日志里贴了一行字:DeepSeek-V4-Flash 正式版 API 上线公测。随后 IT 之家等科技媒体跟进报道,消息才在开发者圈子里炸开。

这次升级有几个关键信息值得单独划重点:

  • 正式版模型标识为 deepseek-v4-flash-0731,结构、尺寸和预览版完全一致,只是重新做了后训练
  • 官方原话是"Agent 能力大幅增强,基准测试远超 V4-Pro-Preview";
  • 正式版原生支持 Responses API 格式,并针对性适配了 Codex
  • 本次只升级了 Flash 的 API 接口,V4-Pro 的 API 和 App/Web 端模型都没动,官方预告 V4-Pro 正式版"将尽快发布"。

你没看错,这次 Flash 是"单兵突进"——旗舰 Pro 还没转正,小弟 Flash 先拿着正式版身份证上街了。而且按官方日志的说法,V4-Pro 正式版在 8 月初也会接入 Responses API,到时候这套配置方法可以原样复用。

1.2 看懂 V4 的架构:MoE 是什么

聊参数之前,先给新手补一个基础概念:MoE(Mixture of Experts,混合专家模型)。你可以把它想象成一家公司:平时上班的不是所有员工,而是根据任务类型临时抽调一小批"专家"来干活。模型把"总参数"看作员工总数,"激活参数"看作每次实际干活的人数。

DeepSeek V4 两个版本的具体数字差别很大,我整理成了表格,方便对比:

维度

DeepSeek V4-Pro

DeepSeek V4-Flash

总参数量

1.6 万亿(1.6T)

2840 亿(284B)

每 token 激活参数

490 亿(49B)

130 亿(13B)

上下文窗口

最高 100 万 token

最高 100 万 token

开源协议

MIT

MIT

定位

复杂推理、架构设计

日常编码、快速迭代

2026-07-31 状态

预览版(正式版预告中)

正式版已公测

注意 Flash 的激活参数只有 13B——这个数字放在两年前会被当成"小模型"嘲笑,但正式版用实际成绩证明了一件事:模型大不大不重要,练得好不好才重要。后训练做得到位,13B 激活参数的模型照样能把自家旗舰的预览版按在地上摩擦。

1.3 旧端点停用:一次必须注意的迁移

还有一个容易被忽略的细节:DeepSeek 原有的 API 端点 deepseek-chatdeepseek-reasoner 已经在 2026 年 7 月 24 日正式停用,分别转接到了 V4-Flash 的非思考模式与思考模式。也就是说,如果你手上还挂着老代码、老配置,很可能已经悄悄开始走 V4-Flash 了——这未必是坏事,但如果你没意识到这点,出问题时会一脸懵。建议所有开发者都去后台确认一下自己当前实际调用的模型标识,别稀里糊涂用着旧名字。

这一章把背景交代完了。其实 DeepSeek 这次的迭代节奏也值得玩味:4 月发布预览版、7 月底转正 Flash、预告 Pro 马上跟进——半年一个周期的步伐非常紧凑,而且每次都把"最便宜的那个版本"先推到台前。这背后的策略逻辑不难猜:先用性价比版本把开发者生态喂饱,再用旗舰版本把能力天花板立起来。对用户来说,这反而是好事——永远有便宜好用的版本可以先用起来,不用干等。

第二章:官方成绩单:九项 Agent 基准全面反超 Pro 预览版

跑分这东西,平时看看图个乐,但这次不一样——官方明明白白写着"基准测试远超 V4-Pro-Preview",而且 Flash 是在参数不变的情况下反超的自家旗舰,这在行业里相当罕见。我把官方公布的九项 Agent 基准数据整理成了表格,后面再逐个解释这些英文缩写到底在测什么。

2.1 九项基准成绩一览

基准测试

V4-Flash 正式版

说明(测什么)

Terminal Bench 2.1

82.7

在真实终端环境里执行命令、操作系统的能力

NL2Repo

54.2

根据自然语言描述生成整个代码仓库

Cybergym

76.7

网络安全相关任务的智能体表现

DeepSWE

54.4

复现真实 GitHub 软件工程问题并修复(预览版仅 7.3)

Toolathlon verified

70.3

多工具组合调用的完成度

Agent Last Exam

25.2

综合智能体考试,偏难

Automation Bench (Public)

25.1

自动化完成端到端业务流程

DSBench-FullStack

68.7

全栈开发任务(前端+后端+部署)

DSBench-Hard

59.6

高难度全栈任务

先给新手翻译几个关键术语:Agent(智能体) 就是"能自己动手干活"的 AI——不只是回答你的问题,而是可以调用工具、读写文件、执行命令、修改代码,把一件事从头做到尾;基准测试(Benchmark) 就是一套标准化的考题,用来横向比较不同模型的水平。

这九项里面,我最看重的是 DeepSWE——它模拟的是真实世界的软件工程场景:给你一个 GitHub 仓库里的真实 issue,让你自己定位 bug、写修复、跑测试。预览版只有 7.3 分,正式版一口气干到 54.4 分,翻了七倍多。这说明正式版不是"微调了一下",而是真的把"读懂项目、动手改代码"这条链路练通了。

为了让新手对"考什么"有更直观的感受,我把其中几项基准的考试场景展开说说:

  • Terminal Bench 2.1(82.7 分):给模型一个终端环境,让它自己敲命令完成操作任务——装依赖、查日志、改配置、起服务。这项分数高,意味着模型在真实命令行环境里"动手能力"强,而不是只会纸上谈兵。这也是 Agent 类产品最核心的能力之一。
  • NL2Repo(54.2 分):只给你一句自然语言描述(比如"写一个带登录功能的博客系统"),让模型从零生成一个完整仓库。考的是"从需求到项目落地"的整体规划能力,比单纯补全代码难得多。
  • Cybergym(76.7 分):网络安全方向的智能体考场,涉及漏洞分析、脚本编写、攻防演练类任务。这个方向能拿高分,侧面说明模型的代码理解和推理深度不差。
  • Agent Last Exam(25.2 分):可以理解为"智能体版的奥赛题",题目刁钻、场景综合,25.2 分在开源模型里已经是相当能打的水平——这个分数看着低,是因为考试本身就难。
  • Automation Bench (Public)(25.1 分):考"端到端自动化"——让模型自己规划并完成一个完整业务流程,中间涉及多步工具调用和异常处理,最考验 Agent 的"办事靠谱程度"。

看完全部九项,你会发现一个共性:这些考试几乎没有一道是"背答案"能过的,全部要求模型在真实或接近真实的环境里动手干完一件事。 这也是为什么这次 Flash 正式版的口碑和预览版完全不同——预览版可能只是"读得懂题",正式版是真的"干得动活"。

另外,我把这次升级里几个关键的"前后对比"数字单独列出来,方便你感受进步幅度(数据均来自官方与第三方公开评测):

指标

升级前

升级后

提升

DeepSWE(真实工程修复)

7.3(预览版)

54.4(正式版)

约 7.5 倍

Frontend Code Arena 总分

1432(Flash 预览版)

1586(正式版)

+154 分

Frontend Code Arena 总分

1465(Pro 预览版)

1586(正式版)

+121 分

AII 智能指数

40(4 月首发版)

50(正式版)

+10 分

AII 智能指数

44(Pro 预览版)

50(正式版)

+6 分

这张表最扎眼的一行是最后一行:Flash 正式版的 AII 分数,比自家旗舰 Pro 的预览版还高 6 分。 在 DeepSeek 的历史上,这是第一次出现"轻量版在预览期压过旗舰版"的场面。当然,这里面有 Pro 还没做完后训练的客观原因,但至少说明 DeepSeek 这轮后训练的投入是真的猛。

2.2 为什么参数没变,能力却暴涨?

这里涉及大模型训练的一个核心概念:后训练(Post-training)。大模型的训练可以粗分成两段:

  1. 预训练:在海量文本上"读万卷书",学语言规律和世界知识,决定模型的"底子";
  2. 后训练:用指令数据、强化学习等方式"定向训练",决定模型"会不会干活、听不听得懂人话"。

打个比方:预训练决定一个人是不是聪明,后训练决定他能不能在具体岗位上把活干利索。V4-Flash 正式版做的就是后者——底子没换,但把"当 Agent 干活"这项技能狠狠练了一轮。

另外还有个值得注意的信号:官方这次评测 Coding Agent 任务时,用了自研的 DeepSeek Harness 评测框架(据传即将开源)。Harness 就是"给模型考试时用的监考系统"。DeepSeek 的思路是"训推一致"——平时怎么练的,考试就怎么考,线上就怎么跑,这样适配出来的 Agent 行为更稳定。这套自研评测框架的开源,对国内 Agent 生态会是件好事,大家以后跑分也有统一尺子了。

2.3 怎么理解"远超 Pro 预览版"

我用一张简单的图来展示这次能力跃迁的逻辑:

flowchart LR
    A[V4-Flash 预览版] -->|重新后训练| B[V4-Flash 正式版 0731]
    B -->|Agent 能力大幅增强| C[九项基准全面反超]
    B -->|原生支持| D[Responses API]
    B -->|针对性适配| E[Codex]
    C --> F[结论:轻量模型也能打旗舰]

这里要澄清一个容易误读的点:"反超 Pro 预览版"不等于"Flash 比 Pro 强"。Pro 定位是旗舰,参数规模大得多,它只是还没转正、后训练还没做完而已。等 V4-Pro 正式版出来,大概率又是一轮新的碾压。所以更准确的说法是:Flash 正式版证明了一件事——后训练的水平,正在成为模型能力分水岭的关键变量。

这里也要多说一句怎么看跑分:跑分永远只能反映测试环境下的表现,真实的项目千奇百怪,最终还是要以你自己的实际体验为准。我见过太多模型跑分漂亮、上手拉胯的例子,也见过跑分一般但实际用着很顺手的模型。所以榜单数据你当成参考坐标系就行,最终的结论,得靠自己在项目里跑几轮才能下。

第三章:Arena 前端代码第 7、开放模型第 3:一份被低估的跑分

3.1 Frontend Code Arena 是什么,为什么有含金量

先介绍这个榜单的来历。Arena.ai 的前身是业内知名的 LMSYS Chatbot Arena 团队——就是那个搞"大模型对战"的平台。它用类似国际象棋的 Elo 积分系统,让两个模型匿名对战,由真实的人类开发者进行双盲投票(投票者不知道哪个模型是谁),赢者加分、输者减分,最终排出名次。因为打分的是人而不是考试题,这个榜单反映的是"真实人类用着爽不爽",而不是"模型会不会背答案"。

Frontend Code Arena(前端代码竞技场) 是 Arena.ai 的专项榜单,专门考验模型把网页/前端项目做出来的能力:给一句需求描述,让模型自己写 HTML、CSS、JavaScript,生成能跑的网页。业内普遍把它看作评估大模型"网页开发 + Agent 级自动化编码"能力的黄金标准——因为前端任务最考验模型对真实产品需求的理解,而不是纯文本生成。

3.2 1586 分:一个刷新纪录的成绩

这次 DeepSeek-V4-Flash 正式版在 Frontend Code Arena 拿到的成绩是:

  • 总排名第 7,开放模型(开源)排名第 3,仅次于智谱 GLM-5.2;
  • 总分 1586 分,比 Flash-High-Preview 提升 154 分,比 V4-Pro-Preview 提升 121 分
  • 在细分领域里:消费产品开发第 4,基于参考的设计、数据与分析、游戏开发第 6,品牌与营销第 7;
  • 直接超越闭源的 Claude Opus 4.8,而 Opus 4.8 每百万 token 要 25 美元,Flash 只要约 0.28 美元,价格差了近 99 个点。

我把关键排名整理成一张表:

排名维度

DeepSeek-V4-Flash-High 的位置

说明

前端代码总榜

第 7 名

全球所有模型(含闭源)

开放模型榜

第 3 名

仅限开源模型,仅次于 GLM-5.2

消费产品开发

第 4 名

做用户端产品的专项能力

设计/数据/游戏

第 6 名

按参考设计还原、数据分析、游戏开发

品牌与营销

第 7 名

品牌官网、营销页面制作

顺便说一句,Arena.ai 官方还给了个评价:V4-Flash 正式版刷新了 Frontend Code Arena 的性能与成本综合表现(Pareto Frontier)——翻译成大白话就是:在"又要跑得快、又要花得少"这件事上,它目前是榜单上最划算的选择之一。

3.3 Artificial Analysis 的 AII 智能指数:只差 GPT-5.6 Luna 1 分

除了 Arena,另一个独立评测机构 Artificial Analysis 也更新了数据。它的核心指标叫 AII(Artificial Analysis Intelligence Index,人工智能分析智能指数),通过多维任务综合衡量模型"绝对智能水平"。

  • V4-Flash-0731 拿到 50 分,比 4 月刚发布时高出 10 分,比自家 V4-Pro 预览版还高 6 分
  • 在全球大模型中排名第 15,与谷歌 Gemini 3.6 Flash 同分;
  • 距离闭源旗舰 GPT-5.6 Luna 的 51 分只差 1 分
  • 由于 DeepSeek 第一方 API 提供约 98% 的缓存命中折扣,它的单任务成本比 GPT-5.6 Luna 低了约 60%。

一个激活参数只有 13B 的开源轻量模型,综合智能

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 30% 内容 · 升级至 注册用户 可见 40%
👀
游客
可见 30%
✓ 当前
注册用户
注册用户
可见 40%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布0 篇
文章总数135 篇
昨日发布0 篇
本月发布1 篇
建站时间67 天
🔍 搜索
📅 日历
« 2026 » « 09 »
 123456
78910111213
14151617181920
21222324252627
282930    
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码