本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
2026 年 7 月 8 日,SpaceXAI 与 Cursor 联合发布 Grok 4.5,定价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,推理速度约 80 TPS,上下文窗口 500K。它没有拿下任何一个主流榜单的第一,但在"完成同一件事要花多少钱"这个维度上,把整张性价比曲线往下压了一大截:Artificial Analysis 实测其在 GDPval-AA v2 上以 Elo 1543 排第四,单任务成本 0.49 美元,比排在它前面的模型便宜近九成。这次发布真正值得读的不是分数,而是一个信号——模型厂商开始把"单位智能的单价"当成核心卖点来打了。
如果你只想要一个结论,上面这段就够了。但如果你想搞清楚下面这几件事,值得往下翻:
- 「Token 效率」到底是个什么东西,为什么它比跑分更值得你关心;
- 同一个模型,为什么在 DeepSWE 1.0 上压过 Opus 4.8,换到 DeepSWE 1.1 就反过来被压——这里面藏着读榜单最重要的一课;
- Cursor 的交互数据为什么比 GitHub 上的开源代码更值钱;
- 官方主动承认的那个训练数据污染,说明了什么;
- 手上有活要干的时候,你到底该按什么标准选模型。
想看完整拆解,往下翻。
一、先把这次发布的事实摆清楚
网上的信息在头几个小时里通常最乱。我自己的习惯是,先只看两个地方:厂商的发布页,和独立第三方的评测页。剩下的转述一律先放一放。
1.1 时间线
Grok 4.5 的发布并不算突袭,前面有一串可以复盘的痕迹。
七月初,Grok 网页端的界面里被人扒出了一段还没上线的提示文案,里面直接出现了"Grok 4.5"的字样。差不多同一时间,有人注意到 Grok 与 Cursor 菜单里的版本号被抹掉了。这类小动作在模型发布前很常见,属于典型的"要出货了"的征兆,但它本身不构成任何证据。
真正落地是在 7 月 8 日。SpaceXAI 在自己的新闻页放出 Grok 4.5 的发布文章,Cursor 在同一天发出配套的技术博客。两边口径一致:这是一个由双方联合训练的模型,第一次不只为软件工程一个场景服务。
发布前一天,马斯克在 X 上先放了话,说基于 beta 用户的反馈,第二天会向公众开放,并把它定位成"Opus 级别"的模型——更快、更省 Token、更便宜。随后他补了一句更实在的自评:内部评估认为它大致对标 Opus 4.7,但速度快得多;能力、速度、成本三者叠在一起,才构成竞争力。
这句自评其实比任何跑分都诚实。它承认了不是最强,同时把战场从"谁更聪明"挪到了"谁更划算"。
1.2 一张速查表
|
项目 |
官方口径 |
|
发布日期 |
2026 年 7 月 8 日 |
|
联合训练方 |
SpaceXAI × Cursor |
|
架构 |
混合专家(MoE) |
|
训练硬件 |
数万块 NVIDIA GB300 |
|
上下文窗口 |
500,000 Token |
|
输入模态 |
文本 + 图像 |
|
输出模态 |
文本 |
|
生成速度 |
约 80 TPS |
|
基础定价 |
输入 $2 / 百万 Token,输出 $6 / 百万 Token |
|
缓存命中输入 |
$0.50 / 百万 Token |
|
快速变体(Cursor 侧) |
输入 $4 / 输出 $18 |
|
推理档位 |
low / medium / high,默认 high,不可关闭 |
|
内置能力 |
函数调用、结构化输出、网页搜索、X 搜索、代码执行 |
|
区域限制 |
欧盟暂未开放,预计 7 月中旬 |
上下文这一项值得单独说一句。500K 听起来不小,但相比上一代 Grok 4.3 的一百万上下文,这其实是收缩了。Artificial Analysis 在测评里明确点出了这一点。我看到不少转述把它写成"上下文升级到一百万",这是把旧版本的参数安在了新版本上。
1.3 官方口径 vs 江湖传闻
有一条流传很广的信息是:Grok 4.5 建立在一个叫 V9 的 1.5T 参数基座模型之上,参数量大约是此前 v8-small(约 0.5T)的三倍;同时还有一个 2T 规模的训练任务在跑,瞄准更晚的发布。
这些说法来自发布前的泄露报道与二手转述,官方发布页从头到尾没有披露过参数量。写文章的时候把它当成"业内传闻"处理是合适的,当成事实引用就不合适了。我在这里把它标出来,是因为我看到太多文章直接写成"官方介绍底座是 V9",这是不准确的。
Cursor 官方唯一确认的架构信息只有一条:这是一个 MoE 模型。除此之外,参数量、专家数、激活比例,一律没说。
二、开始之前,五个名词讲清楚
这篇文章后面会反复用到几个词。如果你是第一次接触,这一节花三分钟看完,后面会顺很多。已经熟悉的朋友可以直接跳到第三节。
2.1 Token
Token 是模型处理文本的最小单位。它不是"字",也不是"词",而是介于两者之间的一段字符片段。中文里大致一个汉字对应一到两个 Token,英文里一个常见单词往往就是一个 Token。
你可以把它理解成模型的计价单位,就像电表上的"度"。你给模型的提示词消耗输入 Token,模型吐出来的回答消耗输出 Token。两者单价不一样,输出通常贵得多——这个不对称在后面算账的时候非常关键。
2.2 上下文窗口
上下文窗口是模型一次能"看见"的 Token 总量上限,包括你给的输入和它已经生成的输出。超出这个窗口,早先的内容就会被挤出去。
一个直观的类比:这是模型的短期记忆容量。500K 的窗口大约能装下一部中等长度的长篇小说,或者一个中型代码库的核心部分。窗口不是越大越好,因为长上下文会显著抬高延迟和成本,而且模型在超长上下文里的"注意力"往往会衰减。
2.3 智能体
智能体(Agent)指的是模型不再一问一答,而是自己规划步骤、调用工具、观察结果、再决定下一步,循环往复直到把任务干完。
写代码这件事天然适合智能体:读代码、改文件、跑测试、看报错、再改。一个人类工程师半天的活儿,智能体可能要往返几十上百轮。这也是为什么智能体场景下 Token 消耗会爆炸——每一轮它都要重新把上下文喂进去。
2.4 混合专家(MoE)
MoE 是一种模型结构。传统稠密模型每处理一个 Token,全部参数都要参与计算。MoE 把网络切成很多个"专家"子模块,每个 Token 只激活其中一小部分。
好处很直接:总参数量可以做得很大,但每次实际计算的量小得多,于是推理更快、更便宜。代价是训练更复杂,路由(决定哪个 Token 交给哪个专家)本身就是个难题。
Grok 4.5 是 MoE,这一点由 Cursor 明确确认。它也部分解释了 80 TPS 这个速度是怎么来的。
2.5 推理努力(Reasoning Effort)
现在的前沿模型大多支持"先想再答":模型在给出最终回答之前,会先生成一段内部推理过程。这段推理也是要消耗输出 Token 的,而且往往占大头。
Grok 4.5 把这个开关做成了三档:low、medium、high,默认走 high,并且不允许完全关闭推理。这个设计意味着你没法把它当成纯粹的快速补全模型来用——它总要想一会儿。
好了,词汇表铺完,进正题。
三、它是怎么被训练出来的
辛梓煜@词元二号站 一直觉得,看一个模型发布,最有信息量的部分从来不是跑分那几张柱状图,而是训练方法那一节里,厂商愿意说出来的和刻意不说的分别是什么。
3.1 算力只是入场券
官方说 Grok 4.5 在数万块 NVIDIA GB300 上完成训练,并针对超大规模训练做了稳定性优化。
这句话信息量其实不大。"数万块 GB300"在 2026 年的头部实验室里已经算标配,堆卡不再是差异化。真正决定模型上限的,是你往这些卡里灌什么,以及怎么灌。
有意思的是官方紧接着的措辞:他们强调"除了原始 Token 数量之外",在数据筛选和整理上投入很大。这是一句典型的划重点式否定——潜台词是,我们没有靠单纯堆数据量取胜。
不过话说回来,GB300 这个型号本身还是值得展开一句,因为它和上一代的差别,恰好落在这次发布最在意的那个点上。
简单说,训练超大模型的瓶颈从来不只是算力峰值,而是三样东西的配合:单卡的显存容量决定了你能放下多大的模型分片,卡间互联带宽决定了梯度同步会不会成为瓶颈,单机整体的功耗与散热决定了这套东西能不能连续跑上几个月不出事。GB300 这一代在显存和互联上都做了明显加码,对 MoE 这种参数总量巨大、但每次只激活一小部分的结构尤其友好——因为 MoE 的痛点恰恰是"参数放不下"而不是"算不过来"。
再叠加官方那句"为大规模训练设计的稳定性技术"。这句话听起来像套话,实际分量不轻。数万块 GPU 连续跑数周,硬件故障是必然事件而非意外事件:某块卡掉了、某条链路抖动了、某个节点温度异常了。能不能在不中断训练的前提下把故障节点摘掉、把状态恢复回来,是区分"能训"和"能训完"的关键。这部分工程能力不会体现在任何一张跑分图上,但它决定了你一年能出几个模型。
所以我看到"数万块 GB300"这几个字时的真实反应是:这说明他们有钱,也说明他们的基础设施团队够硬。但它不说明模型好。
3.2 数据:过滤、去重、质量打分
预训练数据的处理被拆成了三步:
去重。互联网语料里同一段内容会以各种变体反复出现。重复数据不但浪费算力,还会让模型对某些表达形成病态的偏好。
质量打分。给每一段语料打一个质量分,低分的直接丢掉。打分器本身通常也是个模型。
领域定向筛选。刻意保证编程、科学、工程、数学这几个领域的覆盖度和密度。
三步下来的目标,官方的说法是让数据混合保持"高覆盖、高信噪比"。翻译成人话就是:宁可少喂,不喂垃圾。
3.3 强化学习,以及那个不太常被提起的指标
预训练之后是强化学习阶段。这里出现了整篇发布博客里我认为最值得琢磨的一个词:per-token intelligence,单位 Token 智能度。
官方明确说,他们把强化学习的规模化重心压在了这个指标上。RL 训练覆盖数十万个任务,集中在多步骤软件工程和其他技术工作上,评分方式是自动化评分加模型评分相结合。
这个取向很不一样。绝大多数实验室优化 RL 的目标函数是"任务成功率"——只要最后做对了,中间绕多少弯不重要。而优化单位 Token 智能度,等于在成功率之外额外加了一项惩罚:你绕的弯越多,得分越低。
结果就是模型学会了一种"少废话"的推理习惯。这直接对应了后面我们会看到的那个 4.2 倍的效率数字。
3.4 异步训练栈
第三个技术点是训练基础设施。官方说他们的技术栈是为高度异步训练设计的,智能体的 rollout 可以连续跑好几个小时,而学习过程在数万块 GPU 上同时持续进行。
要理解这句话的分量,得先理解智能体训练的痛点。
传统的 RL 训练是同步的:让模型跑一批任务,等全部跑完,收集结果,更新一次权重,再跑下一批。问题在于,智能体任务的耗时方差极大——有的任务两分钟结束,有的要跑三小时。同步训练意味着几万块 GPU 要陪着最慢的那个任务一起干等。
异步的做法是解耦:采样和学习各跑各的,谁跑完谁交卷,学习端持续消费。GPU 利用率因此能维持在高位。
同步训练(GPU 大量空转)
├── 任务 A ██░░░░░░░░ 2min → 等待 ████████
├── 任务 B ████████░░ 90min → 等待 ██
└── 任务 C ██████████ 180min → 触发权重更新
↑ 所有 GPU 在此对齐
异步训练(GPU 持续满载)
├── 任务 A ██ → 交卷 → 立刻领取新任务 ██████
├── 任务 B ████████ → 交卷 → 领取新任务 ██
└── 任务 C ██████████████ → 交卷
学习端 ▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓ 持续消费,不停机
这也是为什么官方特意强调"模型能扛住数小时的长任务"。它在训练时就是这么被喂大的。
3.5 用上一代模型,去造下一代的训练环境
Cursor 那边披露的一个细节,我觉得比 SpaceXAI 说的任何一句都更有分量。
他们做 RL 需要大量"真实环境"——不是刷题,而是有代码库、有工具、有验证器的完整环境。难点在于,随着模型变强,旧环境会迅速失去教学价值:曾经需要绞尽脑汁的问题,现在模型闭着眼就做完了。于是他们必须持续构造出连前沿模型都会做错的新问题。
人力造这种环境的成本高到离谱。Cursor 的做法是搭了一套分布式智能体系统:工程师只负责定义"问题是什么"和"怎么算解对了",剩下的构造、测试、打磨全交给一大群智能体去做。官方原话里提到,其中一些环境如果靠人来建,需要几百人的团队干上好几个月。
这就是所谓的飞轮:用上一代模型去加速下一代模型的训练。
graph LR
A[上一代模型] -->|批量构造训练环境| B[难题环境池]
B -->|强化学习| C[新一代模型]
C -->|能力更强,可造更难的环境| B
C -->|部署给真实用户| D[交互数据]
D -->|清洗筛选| B
style C fill:#e8f4f8
style B fill:#fff4e6
值得注意的是,官方也承认这条飞轮有边界:环境必须"难到连前沿模型都会失败"才有教学价值。这是一个越来越难满足的条件。
四、Cursor 这条数据管道,到底值多少钱
Cursor 此前被 SpaceX 以约 600 亿美元的估值收购,Grok 4.5 是这笔交易之后的第一个实际产物。理解这次发布,绕不开这条数据管道。
4.1 交互轨迹,不等于静态代码
官方说,训练里加入了数万亿 Token 量级的 Cursor 数据,这些数据记录了真实开发者与代码库、与软件工具之间的广泛交互。
我第一次读到这句的时候停了一下。互联网上的开源代码是取之不尽的,为什么还要专门去要这些数据?
因为两者记录的东西根本不是一回事。
GitHub 上的代码是结果:一个已经写完、已经合并的最终状态。你从中能学到"正确的代码长什么样"。
而 Cursor 的交互轨迹是过程:一个开发者接到需求,先搜了哪个文件,为什么搜错了,怎么回退,智能体建议了什么,人类拒绝了什么,最后测试报了什么错,又是怎么改对的。
你从中能学到的是——人和智能体是怎么一起把代码写出来的。
这个差别对训练智能体至关重要。因为智能体在真实工作中面对的从来不是"写出正确代码"这一个动作,而是"在一团乱麻里定位、试错、验证、回滚"的完整循环。Cursor 官方的措辞很准确:这份数据让模型既能从既有软件里学习,也能从开发者与智能体的互动里学习。
4.2 从专才到通才
Cursor 提到一个对比。他们上一个模型 Composer 2.5 是刻意训练成编码专才的。这次做 Grok 4.5,数据配比被有意放宽:加入了高质量的 STEM 任务、研究论文、以及其他类型的知识工作。
结果是模型的适用面从软件工程扩展到了数据科学、金融、法律等场景。SpaceXAI 也在自己的博客里给这条路线找了个证据——Grok 4.5 在 Harvey 的法律智能体基准上拿了第一。
这里插一句我的判断:从专才回摆到通才,往往不是技术选择,而是商业选择。专才模型的天花板是"某个岗位的工具",通才模型的天花板是"所有用电脑的岗位的工具"。后者的故事大得多。
Cursor 也说明了 Composer 2.5 不会下线,两者属于不同的权重量级,各有各的位置。这是句实在话:不是所有活都值得动用大模型。
4.3 一个被主动承认的污染
Cursor 博客的脚注里有一段,我觉得整个发布材料里最有职业操守的就是它:
他们承认,Grok 4.5 在 CursorBench 这个内部基准上的成绩不可信,因为一份早期的 Cursor 代码库快照意外混进了训练数据。影响有多大他们说不清楚,所以这一榜的分数直接从对比里拿掉了,同时那批数据已从后续模型的训练集里移除,并且他们正在做一次更大规模的 CursorBench 更新。
这叫数据污染(data contamination)。模型在训练时见过了考卷,考试成绩自然虚高。
主动披露这件事的成本很高——你等于亲手把自己的一个亮点划掉。绝大多数厂商的选择是不提。所以当我看到有人拿"Cursor 承认作弊"来做标题时,我的判断恰恰相反:能在脚注里写出这段的团队,其他数字的可信度反而更高一些。
同一页脚注里还有另一条同样重要的自曝:SWE-Bench Pro 和 Terminal-Bench 里,第三方模型的分数是各厂自己上报的,不是 Cursor 统一跑出来的。这条我们放到第七节详细展开。
4.4 数据飞轮的三个隐忧
把交互数据回灌进训练,这条路听起来完美,但它有几个我一直没想通的地方。
第一,幸存者偏差。 能被记录下来的交互轨迹,是那些用户愿意继续用下去的会话。用户开了个头觉得不对劲、直接关掉换别的工具的那些轨迹,要么没被采集,要么因为太短而被过滤掉了。于是模型学到的是"在它已经表现得还行的场景里,怎么表现得更行",而不是"在它一直做不好的场景里,问题出在哪"。这条路走久了,模型会在自己的舒适区里越钻越深。
第二,风格趋同。 大量 Cursor 用户的操作习惯被喂进同一个模型,模型再反过来影响这些用户的操作习惯。几轮之后,训练数据的多样性会自然收窄。这不一定是坏事——收敛到一套好用的工作流有其价值——但代价是模型对非主流工作流的适应能力会下降。你要是习惯用一套很特别的工程范式,可能会觉得它越来越不懂你。
第三,也是最要紧的一条:污染是结构性的,不是意外。 CursorBench 那次被官方承认的污染,源头是"早期代码库快照混进了训练集"。但请想一想这条飞轮的本质——训练数据来自产品,评测基准也来自产品,两者共用同一套代码库和同一批用户行为。在这种架构下,训练集和测试集之间出现重叠,与其说是失误,不如说是默认状态。你需要持续投入去把它们隔离开,而不是假定它们天然是分开的。
这三条我没有答案,只是记在这里。辛梓煜@词元二号站 的习惯是,看到一个漂亮的正反馈循环,先去找它的负反馈项在哪里;找不到,通常说明我还没看懂。
五、跑分逐条拆:五个榜单分别在测什么
这是全文最需要慢读的一节。因为如果你只看总排名,会得出一个和真相偏差很大的结论。
5.1 SWE-Bench Pro
这是 Scale AI 出的软件工程基准,规模不小:1865 个任务,取自 41 个代码仓库,覆盖 Python、Go、TypeScript 和 JavaScript 四种语言,用 Pass@1 计分,题库分成公开集、商用集和留出集三份。任务的平均改动量在百行代码、四个文件左右。
它的定位是比经典 SWE-bench 更接近真实工程。同一个模型从 SWE-bench Verified 换到 Pro,分数通常要掉十几到三十几个点。
Grok 4.5 在这一榜的成绩是 64.7%。
5.2 DeepSWE 1.0 与 1.1:这里藏着最重要的一课
DeepSWE 是 Datacurve 在 2026 年 5 月发布的长时程软件工程基准。它的设计目标就是解决前面那些榜单的毛病:
- 无污染:所有任务从零编写,不从已有 commit 或 PR 改编,模型不可能在预训练时见过答案;
- 高多样性:91 个仓库,5 种语言;
- 真实复杂度:提示词长度只有 SWE-bench Pro 的一半左右,但参考解法的代码量是它的五倍多;
- 可靠验证:验证器手写,测的是软件行为而不是实现细节。
提示短、活儿重,意味着模型没法照着步骤走,必须自己读懂代码库、找到入口、跨文件改动、还不能弄坏已有功能。
现在看数字。同一个 DeepSWE,两个版本,结论完全相反。
DeepSWE 1.0,各厂在自家 harness 里跑:
|
模型 |
得分 |
|
Fable(max) |
66.1% |
|
GPT-5.5(xhigh) |
64.31% |
|
Grok 4.5 |
62.0% |
|
Opus 4.8(max) |
55.75% |
|
Opus 4.7(max) |
40.12% |
看起来 Grok 4.5 稳压 Opus 4.8 六个多点。
DeepSWE 1.1,由 Datacurve 用统一的 mini-swe-agent 跑:
|
模型 |
得分 |
|
Fable(max) |
70% |
|
GPT-5.5(xhigh) |
67% |
|
Opus 4.8(max) |
59% |
|
Grok 4.5 |
53% |
|
GLM 5.2 |
44% |
排名反转了。Opus 4.8 反超 Grok 4.5 六个点。
关键差别是 harness。harness 就是包在模型外面的那层脚手架:系统提示怎么写、工具怎么定义、上下文怎么裁剪、失败了怎么重试、什么时候判定任务结束。同一个模型,配一套为它精心调过的 harness,和塞进一套所有模型共用的最小化 harness,表现可以差出十几个点。
前者衡量的是"这家厂商能把模型的上限压榨到多少",后者衡量的是"模型裸机能力有多强"。两个都是有效的数字,但它们回答的不是同一个问题。
我把这条单拎出来说,是因为我看到的绝大多数报道只引用了 1.0 的数据,然后写下"碾压 Opus 4.8"。这不算造假,但它是一种选择性呈现。而 1.1 的数据就印在同一张官方图表里。
5.3 Terminal-Bench 2.1
这一榜考的是模型在终端环境里的操作能力:给你一个 shell,让你完成一系列真实的系统任务。它和写代码不完全重合——更多是环境交互、命令组合、错误恢复。
|
模型 |
得分 |
|
Fable(max) |
84.3% |
|
GPT-5.5(xhigh) |
83.4% |
|
Grok 4.5 |
83.3% |
|
Opus 4.8(max) |
78.9% |
|
Opus 4.7(max) |
78.9% |
Grok 4.5 和 GPT-5.5 只差 0.1 个百分点。这个差距在统计意义上基本等于零,把它写成"紧咬"或"打平"都行,写成"输了"就有点过度解读。
5.4 SWE Marathon
这一榜是本次发布里 Grok 4.5 唯一拿到第一的公开工程榜单:
|
模型 |
解决率(pass@1) |
|
Grok 4.5 |
29.0% |
|
Opus 4.8(max) |
26.0% |
|
Fable(max) |
24.0% |
|
Opus 4.7(max) |
16.0% |
注意绝对数值——最高也就 29%。这说明这一榜的任务难度极高,所有模型都在及格线以下爬。名字里的"马拉松"点明了它的性质:超长时程任务。
Grok 4.5 在这里领先,和它在训练时被喂了大量长时程异步 rollout 的经历是自洽的。这大概是全部跑分里,最能支撑官方"扛得住数小时长任务"这一说法的一条证据。
5.5 GDPval-AA v2:不写代码的那一半世界
前面四个榜单都在测工程。GDPval-AA v2 测的是别的东西。
它是 Artificial Analysis 基于 OpenAI 的 GDPval 数据集搭的评测框架,包含 220 个由行业专业人士参与设计的任务,覆盖 44 种职业、9 大行业。模型要在一个带 shell 访问和网页浏览能力的智能体循环里,产出文档、表格、幻灯片、示意图这类真实的工作交付物。
评分方式是盲配对:同一个任务的两份产出被匿名化,由 LLM 裁判选出胜者,大量对局聚合成 Elo 分。人类基线锚定在 1000 分。
Grok 4.5 的成绩:Elo 1543,排名第四,前面三位都是 Anthropic 的 Claude 系列。
同时 Artificial Analysis 给出的 Intelligence Index 综合分是 54,同样排第四,位列 Fable 5、GPT-5.5、Opus 4.8 之后。相比 Grok 4.3,这一项提升了 16 分——这是个不小的代际进步,把 SpaceXAI 送进了只有 OpenAI 和 Anthropic 的第一梯队,并且超过了所有开源权重模型。
榜首长期由 Claude Fable 5 占据,其 GDPval-AA v2 的 Elo 是 1760。
5.6 一张汇总表
|
榜单 |
测什么 |
Grok 4.5 名次 |
关键读法 |
|
SWE-Bench Pro |
真实仓库补丁 |
第 3 |
第三方分数为自报 |
|
DeepSWE 1.0 |
长时程工程(自家 harness) |
第 3 |
上限,非裸机能力 |
|
DeepSWE 1.1 |
长时程工程(统一 harness) |
第 4 |
更接近裸机能力 |
|
Terminal-Bench 2.1 |
终端操作 |
第 3 |
与第 2 差 0.1 分 |
|
SWE Marathon |
超长时程 |
第 1 |
绝对分数普遍偏低 |
|
GDPval-AA v2 |
跨行业知识工作 |
第 4 |
独立方评测,含成本维度 |
|
Intelligence Index |
综合智能 |
第 4 |
较上代 +16 |
结论其实很清楚:Grok 4.5 稳稳站在第一梯队,但它不是这个梯队里最聪明的那个。 它自己也没这么宣称过。
六、真正的变量:Token 效率与单位成本
前面五节都是铺垫。这一节才是这次发布的主线。
6.1 那个 4.2 倍
官方给出的核心数字是这样的:在 SWE-Bench Pro 的任务上,Grok 4.5 平均输出 15,954 个 Token 就解决了问题,而 Opus 4.8(max 配置)平均需要 67,020 个。
比值是 4.2 倍。
同时,官方还给了一个更宽泛的说法:在相同任务上,它的 Token 效率大约是当前主流领先模型的两倍,解决同一个问题所需的步骤数不到对方的一半。
请注意这两个数字口径不同:4.2 倍是针对 Opus 4.8 在 SWE-Bench Pro 上的具体对比,2 倍是整体平均的说法。混用会闹笑话。
6.2 把成本写成公式
Token 效率之所以重要,是因为它和价格是相乘关系,不是相加。
单次任务的 API 成本可以写成:
[
C_{\text{task}} = \frac{T_{\text{in}}}{10^6} \times P_{\text{in}} + \frac{T_{\text{out}}}{10^6} \times P_{\text{out}}
]
其中 (T_{\text{in}}) 和 (T_{\text{out}}) 是输入输出 Token 数,(P_{\text{in}}) 和 (P_{\text{out}}) 是对应单价。
在智能体场景里,输出 Token(含推理 Token)通常主导总成本,于是可以近似简化为:
[
C_{\text{task}} \approx \frac{T_{\text{out}}}{10^6} \times P_{\text{out}}
]
现在把两个变量都摆上桌。假设模型 A 的输出单价是模型 B 的 (k) 倍,而 B 完成同一任务需要的输出 Token 是 A 的 (m) 倍,那么 A 相对 B 的成本比是:
[
\frac{C_A}{C_B} = \frac{k}{m}
]
代入实际数字。据 TechCrunch 与 SiliconANGLE 的报道,Opus 4.8 的输出定价为每百万 Token 25 美元,Grok 4.5 是 6 美元,所以 (k \approx 0.24)。而 Token 消耗上 (m \approx 4.2)。
[
\frac{C_{\text{Grok}}}{C_{\text{Opus}}} \approx \frac{0.24}{4.2} \approx 0.057
]
也就是说,在这个特定任务集上,跑一遍的成本大约是十七分之一。
这才是"打骨折"三个字的真实含义——它不是单纯的降价,而是降价与提效的乘积。单看价格是四倍差距,单看效率是四倍差距,两者一乘,变成十七倍。
6.3 独立第三方的验证
厂商自己算的账要打折扣。好在 Artificial Analysis 给了一套独立测算。
在 GDPval-AA v2 上,Grok 4.5 的单任务平均成本是 0.49 美元。Artificial Analysis 的评价是:这个成本低于 GLM-5.2 和 Kimi K2.6,比榜单上排在它前面的那几个模型便宜将近九成,稳稳落在性能—成本的帕累托前沿上。
在 Coding Agent Index 上(这个指数由 DeepSWE、Terminal-Bench v2 和 SWE-Atlas QnA 三部分构成),数字更具体:
|
组合 |
得分 |
单任务成本 |
单任务平均 Token |
|
Fable 5(max)+ Claude Code |
最高 |
$11.80 |
720 万 |
|
GPT-5.5(xhigh)+ Codex |
76 |
$5.07 |
620 万 |
|
Grok 4.5 + Grok Build |
76 |
$2.49 |
190 万 |
Grok 4.5 与 GPT-5.5 得分持平,成本不到一半,Token 消耗不到三分之一。对比 Fable 5,得分略低,成本不到四分之一。
"性价比之王"这个说法,到这里才算有了独立数据支撑。
6.4 效率是从哪来的
回头看第三节的伏笔。官方把 RL 的重心压在"单位 Token 智能度"上,这个目标函数直接塑造了模型的行为模式:它倾向于更早收敛、更少反复、更短的推理链。
再叠加 MoE 架构带来的低激活成本,以及 80 TPS 的生成速度——每秒 80 个 Token 是什么概念?大约相当于一个人快速朗读的速度的四五倍。官方形容它比 flash 类的轻量模型还快。
三件事叠在一起:便宜的单价 × 更少的 Token × 更快的吐字速度。这是一个完整的成本工程,而不是单点优化。
6.5 一个容易被忽略的隐藏成本
前面的公式我做了简化,实际用起来还有两条要盯:
缓存。Grok 4.5 的缓存命中输入是 0.50 美元每百万 Token,只有正常输入价的四分之一。智能体场景里,同一个系统提示和代码库上下文会被反复送进去,缓存能省下相当可观的一笔。
长上下文加价。超过 20 万 Token 的部分,适用更高档的定价。这意味着你不能无脑把整个仓库塞进 500K 的窗口——那会让账单以你意想不到的方式增长。
再加上 Cursor 侧还提供一个更快的变体,定价是输入 4 美元、输出 18 美元。速度更快,但成本优势明显收窄。选哪个,取决于你的任务对延迟有多敏感。
6.6 三种工作负载,把账算一遍
抽象的公式看着容易,代进真实场景才知道差别有多大。我拿三种常见负载走一遍,数字都是量级估算,不必较真,看的是结构。
负载一:短问答。 输入 2,000 Token,输出 500 Token,推理档位拉到 high 之后额外产生大约 1,500 个推理 Token。
用基础价代进公式:
[
C = \frac{2000}{10^6}\times 2 + \frac{2000}{10^6}\times 6 = 0.004 + 0.012 = 0.016\ \text{美元}
]
一次一分六厘美元。这个量级下,你选哪个模型都无所谓,单价差三倍也就是差三分钱。Token 效率在这里毫无意义。
负载二:单轮代码修复。 输入 30,000 Token(一段代码上下文),输出含推理约 16,000 Token——正好是官方给的 SWE-Bench Pro 平均值。
[
C = \frac{30000}{10^6}\times 2 + \frac{15954}{10^6}\times 6 \approx 0.060 + 0.096 = 0.156\ \text{美元}
]
换成一个输出单价 25 美元、且需要 67,020 个输出 Token 的模型:
[
C = \frac{30000}{10^6}\times 5 + \frac{67020}{10^6}\times 25 \approx 0.150 + 1.676 = 1.826\ \text{美元}
]
一毛六 vs 一块八。差距开始显形了,但单次绝对值仍然不痛不痒。
负载三:长时程智能体任务。 假设一个重构任务要跑 60 轮,每轮平均输入 40,000 Token(大部分可缓存)、输出 8,000 Token。
|
项目 |
效率型($2/$6,缓存 $0.5) |
对照组($5/$25) |
|
输入总量 |
240 万 Token |
240 万 Token |
|
其中缓存命中 |
约 200 万 |
约 200 万 |
|
输入成本 |
2.0×0.5 + 0.4×2 = 1.8 美元 |
按 $5 不打折约 12.0 美元 |
|
输出总量 |
48 万 Token |
约 200 万 Token(× 4.2) |
|
输出成本 |
0.48×6 = 2.88 美元 |
2.0×25 = 50.0 美元 |
|
单任务合计 |
约 4.7 美元 |
约 62 美元 |
十三倍。而且这还只是一个任务。如果你的团队一天跑五百个这样的任务,一年下来是八十六万美元和一千一百三十万美元的区别。
三个负载摆在一起,结论就出来了:
Token 效率的价值,随任务轮数呈超线性放大。 在短问答里它是零,在单轮任务里它是十倍差价,在长时程智能体里它是整