本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
这一周模型圈挤了四件大事,串起来看只有一个结论:模型能力本身的溢价正在被快速摊薄,真正决定你账单的,已经不是"选哪个模型",而是"怎么把任务分给不同价位的模型"。具体到数字:DeepSeek-V4-Flash 正式版(0731)在保持结构与尺寸完全不变的前提下重做了后训练,九项 Agent 基准全面超过体量更大的 V4-Pro 预览版,Terminal Bench 2.1 拿到 82.7,而官方 API 价格一分没涨——常规时段每百万 tokens 缓存命中输入 0.02 元、未命中输入 1 元、输出 2 元;GPT-5.6 Luna 的 API 价格被砍掉 80%,降到每百万 tokens 输入 0.2 美元、输出 1.2 美元,Terra 同步降 20%,旗舰 Sol 价格不动但新增了更快的 Fast 模式;智谱的 GLM Coding Plan 结束限量抢购状态恢复开放订阅,同时把计费方式换成积分制,国内版连续包月三档定价调整为 118 元、538 元、1078 元;Codex 那个被临时撤掉的五小时窗口,也已经在 7 月 30 日回归。
上面这段是给"只想要结论"的人看的。如果你现在正在为 Agent 应用的调用成本发愁,或者在犹豫该续订哪家的编程套餐,那接下来的内容会更有用:我会把这几件事背后的机制拆开讲——后训练到底改变了什么、缓存命中为什么比标价重要一个数量级、峰谷定价该怎么绕、订阅制和按量付费的临界点在哪里,最后给出一套我自己在用的分层调度方案,包含可直接复用的路由伪代码和成本核算公式。
想看完整拆解,往下翻。
一、把时间线拉直:这一周到底发生了什么
先说个观察。这类消息单看一条,都只是"某某模型又降价了"这种级别的行业新闻,划过去就忘了。但如果把七月下旬这一串事件按时间顺序摆开,会发现它们不是互不相干的巧合,而是同一条产业逻辑在不同环节上的连续反应。
1.1 四件事,十天之内
按时间顺序捋一遍:
|
时间 |
事件 |
关键变化 |
|
7 月 27 日 |
某 3T 参数级开源模型放出权重 |
顶尖能力首次以开放权重形式流出 |
|
7 月 29 日 |
社区放出该模型的动态低比特量化版本 |
体积从 1.56 TB 压到 594 GB |
|
7 月 30 日 |
OpenAI 下调 GPT-5.6 系列 API 价格 |
Luna 降 80%,Terra 降 20% |
|
7 月 30 日 |
Codex 五小时使用窗口恢复 |
临时取消的限制被拿回来了 |
|
7 月 30 日 |
智谱 GLM Coding Plan 套餐改版 |
换成积分制,价格上调 |
|
7 月 31 日 |
DeepSeek-V4-Flash 正式版 API 公测 |
后训练重做,Agent 能力大幅增强 |
|
7 月 31 日 |
GLM Coding Plan 恢复开放订阅 |
结束长期限量抢购状态 |
七天,七件事。密度高得有点反常。
1.2 为什么这几件事必须放在一起看
我第一次快速扫完这些消息的时候,本能反应是"又在打价格战"。但多琢磨两天,感觉不太对——如果只是单纯的价格战,逻辑应该是"你降我也降",可实际情况是有人在降、有人在涨,方向都不一样。
拆开看会清楚很多。
顶配开源模型放出权重这件事,改变的是能力的稀缺性。在此之前,"这一档智力水平只能从少数几家闭源厂商买到"是一个成立的前提,价格可以建立在这个前提之上。权重公开之后,这个前提就松动了——虽然真要跑起来门槛依然高得吓人(后面第二章会算这笔账),但"技术上不可替代"变成了"经济上不划算",性质完全不同。
紧接着的大幅降价,改变的是价格的锚点。当一个前沿系列里最轻的那档模型把输入价压到每百万 tokens 两毛美元,它就不再是"高端产品线的入门款",而是直接杀进了低成本推理这个市场分层。这个动作的目标很明确:把那些原本因为价格因素被路由到小模型、开源模型上的高频任务重新抢回来。
而 V4-Flash 正式版走的是第三条路径——不动价格,只把能力提上去。这是最难被跟进的一种打法,因为它拼的不是补贴力度,而是训练效率。
至于订阅套餐涨价,看起来跟前面三件事拧着来,其实指向的是同一个问题的另一面:Agent 类应用的实际算力消耗,比大家原先估计的高太多了。按量付费那头在降单价,包月订阅这头在涨月费,两边同时发生并不矛盾——单次调用便宜了,但 Agent 一个任务能自己发起几十上百次调用,总量反而在涨。
1.3 这篇文章想解决的问题
我不打算把这些消息复述一遍就完事,那样的信息随处可见。我更想回答几个实际问题:
- 同样一笔预算,怎么花能跑更多的活?
- 那些标价背后,哪些数字是真会影响账单的,哪些是看着吓人其实无所谓的?
- 订阅套餐和按量付费,临界点到底在哪?
- 一套分层调度的方案,具体该怎么落地?
这些问题的答案,需要先把底层机制搞明白。所以下面几章会花不少篇幅讲原理——不是为了显得专业,而是因为不懂机制的话,价格表你根本读不对。
二、3T 级开源模型:一次门槛的重新标定
先从开源那件事说起。因为它是这一连串反应的起点。
2.1 这个体量意味着什么
这次放出的模型总参数量到了 2.8T 这个级别,激活参数约 104B,原生支持视觉输入,上下文窗口 100 万 token。架构上用的是一种改良的稀疏专家路由方案,在 896 个专家里只激活 16 个。
这里先立个界桩,免得后面串线。本章讨论的是这个 3T 级的开源模型,它和第三章要讲的 DeepSeek-V4 系列是完全不同的两个模型,分别出自不同厂商,参数规模差了整整一个数量级。两者唯一的关联是:前者拉低了这一档能力的稀缺性,后者是这场连锁反应里的参与者之一。后文凡是提到"2.8T / 104B"的地方指的都是本章这个开源模型,提到"284B / 13B"的地方指的都是 V4-Flash,不要弄混。
这里得先给新手解释两个词。
MoE(混合专家,Mixture of Experts):你可以把它想象成一家超大型综合医院。医院里有几百个科室(专家网络),但你挂号看病的时候,不需要所有科室的医生同时会诊——分诊台(路由器)判断你的问题属于哪一类,只把你转给其中两三个相关科室。模型也一样:总参数量记录的是"医院有多大",激活参数量记录的是"看一次病实际动用了多少医生"。所以 2.8T 总参数、104B 激活参数的含义是:模型肚子里存了海量知识,但每次推理只调用其中约 3.7% 的权重参与计算。
稀疏度(Sparsity):就是"总参数 / 激活参数"这个比值。这次的 896 选 16,稀疏度比上一代提升了一大截。稀疏度越高,理论上"知识存量"和"单次计算量"的比值就越划算——同样的推理开销,能撬动更多的存量知识。这也是近两年模型规模能一路往上堆、单次调用价格却在往下走的核心原因之一。
用一个简化的式子表达单次前向传播的计算量关系:
[
C_{\text{单次推理}} \propto N_{\text{激活}} \times L_{\text{序列}}
]
也就是说,决定推理开销的是激活参数量 (N_{\text{激活}}) 和序列长度 (L_{\text{序列}}),而不是总参数量。这个认知很关键——很多人看到"2.8T 参数"就默认它一定比"284B 参数"贵十倍,其实完全不是这么算的。
2.2 权重开放了,但你大概率跑不起来
社区随后放出的量化版本,是这件事里最有意思的一环。
原始精度下,光是权重文件就要 1.56 TB。经过动态低比特量化处理后,体积压到 594 GB,缩了大约 62%,而模型在测试中仍保留了约 78.9% 的准确率。听起来像是"用两成多的精度损失换六成体积",很划算。
但这里有个坑。594 GB 是文件体积,不是运行所需内存。实际跑起来还要加上 KV 缓存、激活值、框架开销,社区给出的可用下限大约在 650 GB 的显存加内存总量。这个数字什么概念?顶配到 512 GB 内存的桌面工作站,一台还不够,得两台机器组集群。
我自己算了一下这笔账,结论是:对绝大多数人来说,"能不能本地跑"这个问题的答案是明确的"不能"。
辛梓煜@词元二号站 提醒一句,别被"1-bit 量化"这种词吓得以为门槛降到消费级了。量化技术确实在快速进步,但它压缩的是模型体积,而顶配模型的绝对体积本身还在膨胀,两条曲线目前谁也没甩开谁。
顺带说一下量化的原理。神经网络的权重原本是高精度浮点数(比如 16 位),量化就是把它们压成低精度整数表示。粗暴地全部压到 1 位显然会毁掉模型,所以现在主流做法是动态量化——对模型不同部位区别对待:注意力层、归一化层这些对精度敏感的部分保留较高精度,专家网络里那些相对冗余的权重压得狠一点。这就像给行李打包,易碎品单独裹泡沫,衣服可以往死里压。
用一张图表示这个取舍关系:
graph LR
A[原始权重 1.56TB] --> B{量化策略}
B -->|全部压到低位| C[体积最小 / 精度崩塌]
B -->|动态分层量化| D[594GB / 保留约 78.9%]
B -->|保守量化| E[861GB / 保留约 90%]
B -->|近无损| F[接近原始体积 / 精度基本不变]
可以看到,体积和精度是一条明显的取舍曲线,没有免费午餐。
2.3 它对价格体系的真实影响
现在回到主线。既然几乎没人能本地跑,为什么说它改变了价格体系?
因为它改变的不是终端用户的选择,而是服务商的定价底气。
权重公开之后,任何一家有足够算力的云服务商都可以把它部署起来对外提供接口。这意味着这一档能力的供给方从"一家"变成了"很多家",而多方供给的直接后果就是价格竞争。终端用户不需要自己买机器,只需要在众多托管服务里挑一个便宜的。
所以真正的逻辑链条是:
权重开放 → 托管服务商增多 → 同档能力供给增加 → 该档位价格下行
↓
闭源厂商的高价位段被压缩
↓
闭源厂商向下抢占低成本推理市场
后面 GPT-5.6 系列的大幅降价,放在这个链条里看就顺理成章了——不是突然想让利,而是上游能力的稀缺性被削弱之后,必须往下找新的价值支撑点。
我自己折腾这一行有段时间了,感受是:每一次有顶配模型开放权重,接下来两三周内一定会有闭源厂商跟着调价,几乎成了规律。这次只是间隔特别短,从权重公开到降价公告只隔了三天。
三、V4-Flash 正式版:结构一个字没改,能力换了个人
这是这批消息里我个人认为技术含量最高的一条,也是最容易被"又降价了"的标题淹没掉的一条。因为它压根就没降价。
3.1 官方日志里的关键句
DeepSeek 在 7 月 31 日的更新日志里写得很直白:V4-Flash 正式版 API 上线公测,调用方式不变,模型名依然设为 deepseek-v4-flash 即可用上最新版本;模型结构、尺寸与此前的 preview 版本保持一致,仅重新进行了后训练。
同时明确说明:本次只升级了 V4-Flash 的 API 接口,V4-Pro 的 API 以及应用端、网页端的模型都没有改动,Pro 的正式版还在路上。
这几句话信息量很大。翻译成人话就是:同一个模型骨架,换了一套训练后期的调教方案,能力跳了一大截,价格不变。
先把这个"骨架"的规格摆清楚,因为它和第二章那个开源模型完全不是一个体量。V4-Flash 采用效率导向的混合专家架构,总参数 284B、激活参数 13B,上下文窗口 100 万 token,最大输出长度 38.4 万 token,配合 token 压缩注意力与稀疏注意力机制优化长上下文开销。
把两者放一起对照一下,差距很直观:
|
|
第二章的开源模型 |
DeepSeek-V4-Flash |
|
总参数 |
约 2.8T |
284B |
|
激活参数 |
约 104B |
13B |
|
上下文窗口 |
100 万 token |
100 万 token |
|
本地部署门槛 |
约 650 GB 显存加内存起步 |
同样不适合个人本地跑 |
|
权重是否公开 |
是 |
Flash 与 Pro 的开源节奏各有安排 |
总参数差约十倍,激活参数差约八倍。用第二章那个式子 (C_{\text{单次推理}} \propto N_{\text{激活}} \times L_{\text{序列}}) 去估,同样长度的输入下,Flash 的单次推理开销大致只有前者的八分之一左右。这就是它敢把输出价定在每百万 tokens 2 元的底层原因——不是靠补贴硬撑,是激活规模本来就小。
理解这个数量级差异之后,下面这组基准成绩才读得出味道:一个激活参数只有 13B 的模型,在 Agent 基准上反超了同门体量更大的旗舰预览版。
对开发者来说这意味着什么?意味着你现有的项目一行代码都不用改,接口不用换,价格不用重新核算,模型能力自己涨了。这种升级方式在工程上的友好程度,比"发布一个全新模型请迁移"高出一大截。
3.2 九项 Agent 基准,怎么读才不被数字忽悠
官方公布了九项基准成绩:
|
基准测试 |
得分 |
大致考察内容 |
|
Terminal Bench 2.1 |
82.7 |
终端环境下的命令行操作与问题解决 |
|
NL2Repo |
54.2 |
从自然语言描述生成完整代码仓库 |
|
Cybergym |
76.7 |
安全攻防场景下的推理与工具使用 |
|
DeepSWE |
54.4 |
真实软件工程任务的端到端解决 |
|
Toolathlon verified |
70.3 |
多工具协同调用的正确性 |
|
Agent Last Exam |
25.2 |
高难度综合智能体任务 |
|
Automation Bench (Public) |
25.1 |
自动化流程编排能力 |
|
DSBench-FullStack |
68.7 |
内部全栈开发测试集 |
|
DSBench-Hard |
59.6 |
内部编码智能体难题测试集 |
官方给这组数据加了两条注释,这两条注释比数字本身更值得注意:第一,公开基准中的代码智能体任务,测试时用的是官方自己的极简框架,参数设定为最高推理档位、topp = 0.95、temperature = 1.0;第二,最后两项是内部测试集,外部无法复现。
我的解读是这样的。
**先说数字本身的含金量。**Terminal Bench 2.1 的 82.7 分,相比 preview 版本的 61.8 分是个巨大的跃升,也超过了 V4-Pro preview 版本的 72.1 分。一个轻量档位的模型在 Agent 基准上反超同系列的旗舰预览版,这在过去的产品分层逻辑里是不太出现的。
**再说要打的折扣。**Terminal Bench 2.0 和 2.1 不是同一个版本的测试集,跨版本直接对比并不严谨。而且"最高推理档位"这个设定意味着测试时模型是在满负荷思考,实际生产中如果你为了控制延迟调低推理档位,成绩不会是这个水平。至于两项内部测试集,只能当作官方对自身定位的说明来看,没法作为横向对比的依据。
**最后说结论怎么下。**我的看法是:这组数据不足以支撑"Flash 已经可以全面替代 Pro",但足以支撑"做 Agent 类任务时,Flash 值得进入第一轮候选,而不是只作为省钱备胎"。这两个结论之间的差距很大,别混为一谈。
需要额外提醒的是,Agent 基准只覆盖了模型能力的一个切面。世界知识储备、复杂推理的上限、超长文本下的稳定性、事实准确率、指令遵循的严格程度,这些维度上模型规模的差异仍然会体现出来。做法律条文检索、学术文献分析这类重知识的任务,大模型的优势还在。
3.3 "只重做后训练"到底改了什么
这是全文我最想讲清楚的一个原理点。
现在的大模型训练大致分两个阶段。预训练是让模型读海量文本,学会语言规律和世界知识,这一步成本极高,动辄几千万美元级别的算力投入,参数结构在这一步就定型了。后训练是在预训练模型的基础上做精调,教它怎么按人类期望的方式回答问题、怎么正确调用工具、怎么在多轮任务里保持目标不跑偏。
打个比方:预训练像是让一个人念完了大学,具备了完整的知识体系;后训练则像是入职培训,教他这家公司的工作流程、汇报规范、怎么用内部系统。同一个大学毕业生,入职培训做得好不好,工作表现能差出十万八千里。
V4-Flash 这次干的就是把"入职培训"整个重做了一遍。
为什么后训练对 Agent 能力影响这么大?因为 Agent 任务的核心不是"知道答案",而是"知道下一步该干什么"。一个完整的 Agent 循环长这样:
观察当前状态 → 决定调用哪个工具 → 构造正确的调用参数
↑ ↓
└────── 读取工具返回结果 ←────── 执行调用
这个循环里的每一步都是行为模式而不是知识储备:什么时候该停下来、什么时候该重试、工具报错了怎么处理、参数格式该怎么写。这些恰恰是后训练阶段用大量交互数据教出来的,跟预训练学到的知识关系不大。
所以"结构不变、重做后训练就能让 Agent 基准大幅提升"这件事,逻辑上完全说得通。它同时也说明一个问题:preview 阶段的后训练大概率是赶进度的产物,正式版才用上了更充分的数据和方法。
对我们使用者的启发是:**看到某个模型 Agent 表现不佳时,别急着断定"这个模型不行",先确认你用的是不是最新版本。**后训练迭代的速度比换架构快得多,同一个模型名下,三个月前和现在可能完全是两回事。
3.4 原生支持 Responses API 与 Codex 适配
正式版另一个变化是原生支持 Responses API 格式,并针对 Codex 做了适配。
Responses API 是相对传统 Chat Completions 接口的一次演进。传统接口的设计假设是"一问一答":你发一段消息,模型回一段文本,工具调用是后来打补丁加上去的。Responses API 则从设计之初就面向多轮推理、工具调用和结构化输出,对流式工具调用、复杂多轮交互、输出格式的精细控制都有更好的支持。
对国内开发者的实际意义是:如果你的 Agent 应用原本是基于某个海外生态的接口格式开发的,现在迁移过来的改造成本大幅降低。接口格式一致,很多时候只需要改一个 base_url 和 api_key。
这一步棋的意图很清楚——不跟你比谁的生态更完整,直接兼容你的生态,然后在价格上做文章。这是国内厂商这两年一直在用的策略,只不过这次执行得更彻底:连对方最新推出的接口格式都直接原生支持了。
需要说明的是,目前 Responses API 格式只支持 Flash 这一档,Pro 的接入还要再等一段时间。如果你的项目重度依赖这个格式,选型时要把这一点算进去。
四、GPT-5.6 系列降价:把最轻的那档砍到两折
7 月 30 日的这次调价,幅度确实少见。
4.1 具体数字
|
模型 |
调整前(输入 / 输出) |
调整后(输入 / 输出) |
降幅 |
|
GPT-5.6 Luna |
|
|
80% |
|
GPT-5.6 Terra |
|
|
20% |
|
GPT-5.6 Sol |
不变 |
不变 |
— |
单位均为每百万 tokens。Terra 的组合价格从 17.5 美元降到 14 美元,Luna 则是从 7 美元直接降到 1.4 美元。
这个系列的三档定位是:Sol 是旗舰,处理最复杂的推理和长程智能体任务;Terra 是均衡档,面向日常生产环境;Luna 是最快最便宜的一档,官方给的定位是高吞吐、低延迟场景——文档分类、请求路由、摘要生成、轻量级实时助手,这类"单次请求成本是主要约束"的活儿。
官方对降价原因的解释是服务效率提升,包括模型自身在开发过程中优化生产代码、改进 token 生成效率带来的收益。这个说法有多少水分不好判断,但从时间点看,跟前面讲的开源模型放权重只隔三天,很难说是纯粹的技术红利释放。
4.2 Fast 模式:把速度单独做成商品
旗舰档 Sol 的价格没动,但新增了一个 Fast 模式,替代原先的优先处理选项。这个模式的规则很简单:速度最高提升 2.5 倍,价格翻倍,智力水平不变。
我觉得这个设计值得单独说两句,因为它体现了一种定价思路的转变。
过去模型服务的定价维度基本只有一个——智力水平。你想要更聪明的模型,就付更多的钱。Fast 模式把响应速度拆出来做成了独立的付费维度:同样的智力,你可以选择便宜且慢,或者贵一倍但快 2.5 倍。
这对什么场景有意义?交互式产品。如果你在做一个用户面对面等待响应的应用,延迟直接影响体验,多花的钱是买体验;而批量处理任务、后台跑的定时作业,延迟根本不重要,那就用标准模式。
换句话说,从这一版开始,成本优化多了一个可调的旋钮。原来你只能在"用哪个模型"上做文章,现在还可以在"同一个模型用哪种速度档"上做文章。
4.3 订阅侧的连带效应
这次降价还有一个容易被忽略的影响:订阅制产品的额度换算方式跟着调整了。
订阅价格本身没变,但 Terra 和 Luna 在订阅额度中消耗的信用点变少了。也就是说,同样的月费,同样的额度上限,你现在能用这两档模型跑更多的任务。
这是一个"不涨价的涨价"——或者说"不降价的降价"。对已经在付订阅费的人来说,实际获得的算力变多了,但账单数字没变,感知上不如直接降价那么强烈,成本却实实在在地降了。
4.4 官方给 Luna 安排的位置
从官方给出的使用建议看,Luna 的定位相当明确:它不是用来独当一面的,是用来给大模型打下手的。
推荐的编码工作流是这样分工的——先让旗舰模型处理不确定性、拆解问题、制定方案,再让 Luna 去实现那些已经定义清楚的改动、编写和运行测试、核验执行结果。
这个分工逻辑我非常认同,也是我自己实践下来觉得最省钱的一种做法。原因很简单:一个软件开发任务里,真正需要"高智力"的环节其实占比很小。判断该改哪个文件、设计什么样的接口,这些需要旗舰模型;而按照既定方案改二十处调用点、跑一遍测试、把报错信息整理出来,这些活儿轻量模型完全能干,而且干得又快又便宜。
如果把这些低风险、高频次的琐碎工作全部堆给前沿旗舰模型,成本一定降不下来。Luna 这一档存在的意义就是填这个空档。
另外提醒一句,海外厂商的接口在国内使用时,请通过官方合规渠道或国内云服务商提供的正规代理服务接入,不要图省事走来路不明的中转。接口稳定性、数据安全、账号合规这三件事,任何一件出问题都够你折腾很久。
五、把价格摊开算:标价之外的三个变量
聊完各家的动作,该算账了。这一章是全文最实用的部分,建议对着自己的实际用量一起看。
5.1 统一口径的价格对照
先把三家主力放在同一张表里。注意这里的口径统一换算成人民币,按当前汇率粗略折算,实际结算以各家计费为准。
|
每百万 tokens |
GPT-5.6 Luna |
DeepSeek V4 Pro |
DeepSeek V4 Flash |
|
输入(缓存未命中) |
约 1.4 元($0.20) |
3 元 |
1 元 |
|
输出 |
约 8.5 元($1.20) |
6 元 |
2 元 |
|
输入(缓存命中) |
按折扣计算,约 0.14 元 |
0.025 元 |
0.02 元 |
这里要特别说明一下 Pro 的价格来历,因为网上流传的旧数字很多。V4-Pro 刚发布时的原定价是缓存命中输入 0.1 元、未命中输入 12 元、输出 24 元,当时叠加了一个限时 2.5 折优惠。2026 年 5 月 22 日官方宣布这个折扣不再限时,自 5 月 31 日起永久锁定为原定价的四分之一,也就是上表里的 0.025 / 3 / 6 元。所以如果你在别处看到"Pro 输出 24 元"的说法,那是被优惠取代之前的价格,不是现价。上表所有数字均为平时段价格,高峰时段的倍率见 5.3 节。
单看这张表能得出几个结论:
第一,Flash 这一档在三项单价上全面最低,输出价格只有 Luna 的四分之一左右。
第二,Pro 的输出价格比 Luna 便宜,输入价格比 Luna 贵。这意味着两者的成本排序取决于你的任务是"输入重"还是"输出重"——做长文档分析(输入多输出少)Luna 划算,做代码生成(输入少输出多)Pro 划算。
第三,也是最容易被忽略的一点:**缓存命中价格的差距,比未命中价格的差距大得多。**Flash 的缓存命中输入价是未命中价的五十分之一。这个比例在整套成本结构里的分量,远超标价本身。
关于第三方评测,Artificial Analysis 对正