本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
一句话结论:Kimi K3 是月之暗面在 2026 年 7 月中旬放出的旗舰模型,2.8 万亿总参数、100 万 token 上下文、原生看得懂图,号称目前参数规模最大的开源级模型。它最出圈的点是"前端编程"——在专门评前端的 Frontend Code Arena 榜单上冲到了第一,把此前领跑的闭源模型都压在了下面。它真正的技术底牌不是"参数堆得大",而是三项架构改动(KDA、AttnRes、Stable LatentMoE)把超长上下文和超深网络的效率问题一起解决了,再加上稀疏 MoE 让 2.8 万亿参数跑起来并不烧钱。综合能力上,它离最强闭源模型还有一截差距,但已经稳稳站进第一梯队。
下面这篇文章,我会把它的来龙去脉、底层原理、前端为什么这么能打、长程 Agent 到底强在哪、怎么调用、以及适不适合你,全部一次拆清楚。术语我都会用大白话先解释一遍,新手也能跟上。想看完整拆解,往下翻。
一、先把 Kimi K3 到底是什么讲清楚
先说结论:如果你这两天刷到过一堆"某模型一句话生成整个游戏""一句话复刻某操作系统界面"的动图,八成就是它。
Kimi K3 是月之暗面(Moonshot AI)2026 年 7 月 16 日晚上线、7 月 17 日在世界人工智能大会上正式对外发布的最新旗舰模型。它有几个硬指标一摆出来就很唬人:约 2.8 万亿总参数、100 万 token 上下文窗口、原生支持视觉理解,被官方称为"目前全球参数规模最大的开源模型",也是第一个迈进 3 万亿参数量级的开放权重模型。官方还承诺完整权重会在 7 月 27 日前后放出。
我知道对不少刚接触大模型的朋友来说,"参数""上下文""开源权重"这几个词本身就有点门槛。我(辛梓煜@词元二号站)习惯先把黑话翻译成人话,我们再往下走。
1.1 三个关键词,先用大白话解释一遍
参数(Parameter):你可以粗略理解成模型"脑子里的神经连接数"。连接越多,能记住的知识、能捕捉的模式就越多,理论上理解得更深、答得更准。2.8 万亿是什么概念?比很多主流开源模型大出七八成,属于"脑容量"直接拉到新高度。
上下文窗口(Context Window):指模型一次能"读进去并同时记住"的内容量。100 万 token 大约相当于好几本厚书 / 好几个代码仓库一次性塞进去。窗口越大,越适合"通读整个项目再动手"这类活,而不是聊两句就忘。
开源 / 开放权重(Open Weights):意思是模型训练好的"大脑参数文件"会公开放出来,任何开发者都能下载到自己机器上部署、微调、蒸馏。这跟只能通过接口调用的闭源模型是两码事——它把一个接近前沿水平的模型,交到了所有人手里。
原生视觉(Native Vision):指模型不是"外挂一个识图插件",而是从设计之初就能直接看懂图片。这对后面要讲的前端能力至关重要——它能看着自己生成的页面截图去改代码,就是靠这个。
还有一点新手常搞混:K3 其实有面向不同场景的形态,一种更偏对话与智能体任务,另一种更侧重编程与工程。你在配置里要写的模型名统一是 kimi-k3,思考模式默认是"最大强度",后续官方还会补充更省的低强度档位。这些细节你现在有个印象就行,用到时再回来查。
1.2 它在整个模型格局里站在哪
先摆一张我自己整理的定位表,方便你有个直观坐标:
|
维度 |
Kimi K3 的位置 |
|
综合能力(Artificial Analysis 智能指数) |
约 57 分,全球第三梯队靠前,仅次于两款最强闭源模型 |
|
前端编程(Frontend Code Arena) |
第一名,反超此前领跑的闭源模型 |
|
长程 Agent / 长周期任务 |
开源阵营领先,能连续自主跑数十小时 |
|
上下文长度 |
100 万 token,第一梯队 |
|
开放程度 |
开放权重,可自部署 |
官方在技术博客里的说法很坦诚也很自信:综合表现仍落后于最强的两款闭源旗舰,但在自家整套评测里,它稳定超过了其余所有被测模型。 这句话我觉得是理解 K3 的关键——它不是全能第一,而是"某些主战场已经追平甚至反超,整体仍在追赶"。这种既承认差距、又敢秀肌肉的态度,反而挺加分。
1.3 从 K2 到 K3,跨的这一步有多大
要体会这次发布的分量,得把时间线往前拉一拉。就在 K3 出现之前,市面上最大的开放权重模型也就一万亿参数出头的量级。K3 一上来把总参数干到了 2.8 万亿,差不多是上一代的近三倍,一步就把"开源模型能做多大"这条天花板顶到了 3 万亿量级。这不是简单地把旧设计放大,而是换了一套新架构、换了一个新方向。
我特意提一句:过去这一年里,有相当长的时间,"开源模型规模上限"这个位置都是月之暗面家占着的。所以这次 K3 的发布,与其说是一次常规迭代,不如说是它把自己长期押注的那条技术路线,一次性兑现给了所有开发者看。
1.4 为什么这次发布这么受关注
我觉得有三个原因叠加在一起,才让 K3 这两天霸屏。
第一,它是"带着权重来的",不是又一款只能远观的闭源模型。 官方承诺完整权重会公开放出,意味着任何开发者,哪怕是个人,都可能把一个接近前沿水平的模型下载到自己机器上部署、微调、蒸馏。开源和闭源之间那道一直存在的能力鸿沟,被它实实在在地拉近了。
第二,它选在一个高关注度的行业大会期间正式亮相,话题度自带放大器。 发布当天,海外社区的讨论热度直接拉满,连一些行业大佬都在评论区留下"令人印象深刻"这样的评价。
第三,也是最重要的——它的效果肉眼可见地好。 前端一句话出成品、长程任务连轴转几十小时,这类演示不需要你懂技术就能感受到冲击力。技术圈之外的人,看的就是"它到底能做出什么东西",而 K3 在这一点上给得非常足。
顺带说个我观察到的行业背景。这一波国产开源模型集体发力,走的其实是一条和很多厂商不一样的路子:把接口做开放、把生态做起来、用开放权重扩大技术影响力,而不是靠算力垄断把用户圈在自己的闭源接口里。这条路能不能长期跑通还得看,但至少 K3 证明了,开源这张牌,是真能打到前沿水平的。这也是我(辛梓煜@词元二号站)持续盯着这条线的原因——对普通开发者来说,可选的好工具越多,越是好事。
二、2.8 万亿参数为什么不会"贵到离谱":稀疏 MoE 那本账
很多人一看到"2.8 万亿参数",第一反应是:这玩意儿每问一句,是不是要把全部 2.8 万亿参数都算一遍?那推理成本不得高到没法用?
这也是我一开始最好奇的点。答案是:不会,因为它根本没让全部参数同时参与计算。
这里得先破除一个常见误解:很多人默认"参数量"和"每次计算量"是一回事,参数越多就一定越烧钱。对传统的稠密模型来说,这个直觉是对的;但对 K3 这种稀疏 MoE 模型来说,这两个数字已经被拆开了——它有一个很大的"总参数量"(决定能力上限),和一个小得多的"每次实际激活参数量"(决定单次开销)。理解了这层拆分,你才能看懂它为什么敢把参数堆到 2.8 万亿,还敢说自己"跑得起"。
2.1 什么是 MoE:把"全科专家"换成"专科会诊"
K3 用的是 MoE(Mixture of Experts,混合专家)架构。打个比方:传统"稠密模型"像请一个全科医生,什么病都由他一个人从头看到尾,累且慢;MoE 则像一家医院,里面养了一大批专科医生(专家),每次来一个病人(也就是一个 token),只挑最对口的几位专科来会诊,其余人歇着。
K3 一共有 896 个专家,每处理一个 token 只激活其中 16 个。这样一来,模型保留了 2.8 万亿参数的巨大"能力容量",但每一步实际动用的参数只有大约 500 到 600 亿。容量很大,单次开销却被压得很低,这就是稀疏 MoE 的精髓。
为了让你更直观地感受"稠密"和"稀疏"的差别,我列一张对照表:
|
对比项 |
稠密模型(传统) |
稀疏 MoE(K3) |
|
每次计算动用的参数 |
全部参数都参与 |
只激活极少一部分(16/896) |
|
能力容量 |
受算力限制,不敢做太大 |
可以做到很大,容量充足 |
|
单次推理开销 |
随参数量线性增长 |
和"总参数量"基本脱钩 |
|
打个比方 |
一个全科医生从头看到尾 |
一家医院按需专科会诊 |
我用一段伪代码把这个"路由再计算"的过程写出来,你一看就懂:
# 稀疏 MoE 的直观逻辑(伪代码,仅示意)
def moe_forward(token):
scores = router(token) # 给 896 个专家打分
top16 = pick_top_k(scores, k=16) # 只挑分数最高的 16 个
out = 0
for expert_id, weight in top16: # 只有这 16 个被真正计算
out += weight * experts[expert_id](token)
return out # 剩下 880 个专家完全不参与本次计算
2.2 高稀疏度带来的新麻烦,以及 K3 的解法
稀疏度这么高,会冒出一个新问题:怎么保证"路由"(也就是那个给专家打分、决定用谁的调度环节)稳定、均衡?如果调度乱了,某些专家累死、某些专家闲死,训练和推理都会出问题。
K3 的解法叫 Stable LatentMoE,配套一个叫"分位数均衡(Quantile Balancing)"的机制。简单说,它直接用路由打分的分位数来决定专家分配,把过去那种脆弱、难调的均衡超参数给去掉了——这类超参数正是很多 MoE 模型在超大规模下翻车的常见原因。K3 把这块做稳了,才敢把稀疏度推到 16/896 这么极端。
2.3 成本这件事,摆数据
落到实际调用,官方给出的 API 计费大致是这样(每百万 token):
|
计费项 |
价格 |
|
缓存命中输入 |
约 0.3 美元 |
|
普通输入 |
约 3 美元 |
|
输出 |
约 15 美元 |
这里有个容易被忽略、但对实际开销影响巨大的点——缓存命中率。给新手解释一下:你在做编程、多轮对话这类任务时,前面很大一段上下文(比如同一个项目的代码、同一段系统提示)是反复出现、几乎不变的。如果这部分能"命中缓存",就不用每次都按普通输入价重新计费,而是走那个便宜得多的缓存价(前面表里,缓存命中输入只要约 0.3 美元,是普通输入的十分之一)。
K3 在编程负载下的缓存命中率能超过 90%。月之暗面为此专门为它的新注意力机制做了一套前缀缓存方案,还把这套实现回馈给了开源推理社区。这意味着什么?意味着你真实账单里的大头,很多都落在了那个"十分之一价"的档位上。所以别只盯着"输出 15 美元"这个数字吓自己,把缓存命中一算进去,长上下文、多轮迭代的编程场景,总成本会比你直觉估的低不少。
用一句话概括我的感受:用中端闭源模型的费用,去够顶级模型才有的活儿,这才是稀疏 MoE 真正的意义。它把"大模型"和"用得起"这两件本来矛盾的事,尽量凑到了一起。
三、三项架构改动到底改了什么
这一节是全文最硬核的部分,但也是我觉得最值得花时间的地方。因为 K3 真正让我服气的不是参数大,而是它把三个一直很难同时解决的问题,用三项独立又能拼在一起的改动给收拾了。
先上一张全景表,心里有个框架再往下看:
|
改动 |
管的是哪条"轴" |
一句话作用 |
|
KDA(Kimi Delta Attention) |
序列长度(token 之间怎么传信息) |
让百万级长上下文算得起、算得快 |
|
AttnRes(Attention Residuals) |
网络深度(层与层之间怎么传信息) |
让很深的网络里,重要信息不被埋掉 |
|
Stable LatentMoE |
网络宽度(专家之间怎么分工) |
让极高稀疏度下的调度稳定高效 |
用一张流程图把它们各管一摊的关系画出来:
graph LR
A[输入 token 序列] --> B[序列轴: KDA<br/>压缩长上下文记忆]
B --> C[深度轴: AttnRes<br/>跨层按需取信息]
C --> D[宽度轴: Stable LatentMoE<br/>896选16 稀疏计算]
D --> E[输出]
3.1 KDA:给"长记忆"换一套更聪明的遗忘方式
先说最核心的痛点。传统 Transformer 的注意力机制有个毛病:每来一个新 token,都要回头看一遍前面所有 token。上下文越长,需要缓存的东西(也就是 KV 缓存)和计算量就涨得越猛,到 100 万 token 这个量级,基本是一堵墙。
这里插一句给新手的解释:KV 缓存你可以理解成模型的"草稿纸"。为了不每一步都重算前面所有内容,模型会把已经算过的历史信息暂存在这块草稿纸上。问题是,传统做法里,每多读一个 token,草稿纸就得多留一份,上下文一长,这张纸就大到显存吃不消。KDA 的思路,本质上就是把"无限增长的草稿纸"换成"一块固定大小、反复擦写的白板"。
KDA 是一种"混合线性注意力"机制。它的思路是:不再为每个历史 token 都单独存一份记忆,而是维护一块固定大小的记忆,每读一个新 token 就更新一次这块记忆。这样一来,记忆不会随上下文无限膨胀。
顺便说个来历,也方便你理解它不是拍脑袋想出来的。KDA 这套思路,月之暗面早在更早的一篇"线性注意力"研究里就打过样,当时就验证了它在长上下文和强化学习式评测里的效果,还把配套的底层算子开源了出去。到了 K3,他们把这套原型大幅放大、用到了旗舰模型上。换句话说,这不是为了发布 K3 临时攒的花活,而是一条研究了很久、验证过、再规模化的成熟路线。 我个人比较看重这种"有前置研究铺垫"的技术,因为它往往比一次性的惊喜更靠得住。
有两个细节让 KDA 比普通线性注意力聪明:
第一是"delta 规则"(差值更新)。 它不是把新信息一股脑塞进记忆里(那样旧信息会糊成一团),而是先"减掉某个键对应的旧值,再写入新值",相当于做一次精准的纠错更新,让固定大小的记忆始终保持干净。
第二是"逐通道的遗忘门"。 传统做法用一个统一的衰减系数 (\lambda) 让整块记忆一起变淡——太一刀切了。KDA 把这个标量换成了一个向量、变成对角矩阵,让记忆的每个维度都有自己独立的遗忘速度。这意味着:某个负责记"关键长程事实"的通道可以一直牢牢记住,而某个负责记"临时局部信息"的通道可以随时清空复用。
如果你能接受一点点符号,它的状态更新大致长这样(看个意思即可):
[
S_t = \mathrm{Diag}(\alpha_t),S_{t-1} + \beta_t,\big(v_t - S_{t-1}k_t\big),k_t^{\top}
]
其中 (\mathrm{Diag}(\alpha_t)) 就是那个"逐通道遗忘"的对角矩阵,括号里的 (v_t - S_{t-1}k_t) 就是那个"差值纠错"。
当然,固定大小的记忆也有短板:它能记住大意,却可能丢掉精确细节(比如记得文档里有个交易号,却记不全每一位)。所以 KDA 不是单打独斗,而是和"完整注意力"层按 3:1 的比例交替使用——三层 KDA 配一层全注意力,既省了内存,又把"精确全局检索"的能力补回来。官方给的收益很直接:百万 token 上下文下,KV 缓存内存最多砍掉约 75%,解码速度最高快约 6 倍。
我把几种注意力思路的取舍列成一张表,方便你对号入座:
|
思路 |
记忆方式 |
长上下文开销 |
精确检索能力 |
|
传统全注意力 |
每个历史 token 都存一份 |
随长度暴涨,很吃显存 |
强,但代价大 |
|
纯线性注意力 |
一块固定记忆,统一衰减 |
低 |
偏弱,容易丢细节 |
|
KDA(逐通道遗忘 + 差值纠错) |
一块固定记忆,每维独立衰减 |
低 |
明显改善 |
|
K3 的做法(KDA + 全注意力 3:1 混合) |
两者交替 |
低 |
兼顾,取长补短 |
看这张表你就能明白 K3 的取舍逻辑:它没有一条路走到黑,而是让"便宜的线性注意力"扛大部分活,再用"少量昂贵的全注意力"把精度找补回来。工程上这种"混合"往往比任何一种极端方案都更实用。
3.2 AttnRes:让深网络别把好东西埋在底下
KDA 管的是"序列有多长",AttnRes 管的是另一条轴——"网络有多深"。
传统深层网络有个隐患:信息一层层往上累积,网络一深,真正重要的那点信息很容易被淹没在一大堆历史表示里,翻都翻不出来。
AttnRes(注意力残差)的做法是:允许每一层按需去更早的任意层里"取"它现在需要的表示,而不是被动地一律往上堆。这样,做复杂推理、多轮任务、以及那种一跑就是几十小时的长程 Agent 工作流时,模型能更精准地调取深处的关键信息。官方数据是:这套设计只增加了不到 2% 的额外计算,却带来约 25% 的训练效率提升——花小钱办大事的典型。
3.3 Stable LatentMoE:宽度轴上的稳定器
这项前面第二节已经聊过它解决的问题(极高稀疏度下的调度稳定),这里补一个视角:它作用在"宽度"这条轴上,也就是"这么多专家之间怎么分工"。它还配了两个很关键的训练技巧:一个叫"分位数均衡",直接用打分的分位数来决定专家分配,把过去那种脆弱、难调的均衡超参数彻底去掉;另一个是对优化器的改进,让每个注意力头都能被独立优化。这两点听起来抽象,落到实处就是一句话——在这么极端的稀疏度下,让训练和推理都不塌方。
KDA 管长度、AttnRes 管深度、Stable LatentMoE 管宽度,三者互相独立又能叠在一起用——这正是 K3 架构里我最欣赏的一点:不是一个魔改,而是三个正交的改动组合成了一次代际跳跃。 官方给出的综合收益是:相比上一代,整体"算力换能力"的扩展效率提升了约 2.5 倍。
3.4 顺带说说"省钱"是从训练阶段就开始的
还有个容易被忽略的细节,我觉得挺有意思。K3 不是训练完了才想着怎么压成本,而是从训练阶段就开始做"低精度"适配——简单说,就是让模型天生就习惯用更省的数值格式来存权重、算激活。给新手翻译一下:数值精度就像照片分辨率,分辨率越高越清晰但也越占空间。K3 的做法是在保证效果的前提下,尽量用"够用就好"的低精度,从而更省显存、更适配硬件。
配合专家并行训练做到完全均衡、关键路径上不需要频繁的主机同步,这些工程上的打磨叠在一起,才让一个 2.8 万亿参数的庞然大物,在训练和服务两端都跑得起来。架构负责"能不能行",工程负责"划不划算",K3 这次是两头都下了功夫的。 这也是为什么我一直说,看一个大模型别只看跑分,底层这套账才决定它能不能长期用得起。
四、前端编程凭什么这么惊艳:竞技场登顶背后
聊完底层,我们说说 K3 这两天最出圈的能力——前端。
4.1 一个专测前端的擂台,它拿了第一
有个叫 Frontend Code Arena 的榜单,专门评"把需求变成一个好看、能用、愿意点下去的网页"这件事,尤其看视觉和交互。K3 在这个榜单上冲到了第一,反超了此前排在前面的顶级闭源模型。更夸张的是它的跨越幅度:上一代还在第 18 名,这一代直接跳到榜首。
榜单还把前端拆成了七个细分领域,K3 拿下了其中六项第一:品牌营销、参考图还原设计、数据与分析、消费级产品、模拟仿真、内容创作工具,只有游戏类屈居第二。
具体分数上,K3 在这个前端擂台拿到了约 1679 分登顶,把此前的领跑者甩开了一个不小的身位。而在更综合的智能指数评测里,它拿到约 57 分排在全球第三,仅次于两款最强闭源旗舰,同时领先了一批同样知名的模型。这两张榜放一起看,结论就很清晰:综合能力它还在追赶最强闭源,但在"前端"这个主战场,它已经是能站到最前面的那一个。
我得提醒一句,别把这个榜单神化。它测的是前端的视觉与交互,代替不了后端 Bug 修复、终端任务这些评测。但仅就"生成一个能看能用的网页"这件事,K3 确实已经进入最强一档。
4.2·补 顺便教你怎么看一张"跑分榜"
既然聊到榜单,我插一段新手最该建立的判断力,这比记住某个具体分数有用得多。看模型评测,我一般盯三点:
- 看它测的是什么。 前端榜测视觉交互,编程榜测代码正确率,检索榜测长文档里找信息的能力。一个模型在某张榜第一,只能说明它在那件事上强,不能推广到"它全能第一"。别被一个漂亮数字带节奏。
- 看是不是独立第三方测的。 厂商自己公布的评测当然要看,但独立机构、公开竞技场的结果更有参考价值,因为大家用的是同一套标准、同一个环境。
- 看测试环境(也就是所谓 harness)。 同一个模型,配不同的 Agent 框架、不同的采样参数,跑出来的分能差一截。所以看到别人晒的效果,先问一句"它是怎么跑的",再决定信几分。
建立起这三点判断,你就不会一看到"第一"两个字就上头,也不会因为某张榜没夺冠就轻视一个模型。
4.2 真正的杀手锏:视觉在环(vision in the loop)
传统模型写前端是"一锤子买卖"——根据文字描述一次性把代码吐出来,好不好看全凭运气。K3 不一样,它原生能看懂图,于是可以跑一个闭环:
graph TD
A[根据需求写代码] --> B[渲染出页面]
B --> C[截图, 模型自己看效果]
C --> D{布局/配色/交互对不对?}
D -- 有问题 --> E[定位问题, 改代码]
E --> B
D -- 满意 --> F[交付]
它写完代码后能直接查看实时运行截图,识别里面的布局、间距、配色、交互问题,然后自己改、再看、再改。这个"渲染 → 截图 → 自我批评 → 打补丁"的循环,就是它前端效果稳的根本原因。海外一位开发者只用了一句还带错别字的短提示,它就直接渲染出了一个风格完整、细节到位的暗黑工业风企业官网——这种"一次成型"的鲁棒性,正是视觉闭环撑起来的。
4.3 它是真"有审美",还是配色碰运气
很多人说模型"有审美",理解就停在"配色不错"。但真实的考验更细。举个我看到的典型例子(做了通用化处理):让它做一座中式屋檐,下面垂着大量竖排文字,鼠标划过时文字要像珠帘一样被拨开、摆动,离开后自然回弹。
这背后不是一张静态海报——每一列文字都得是可计算、可响应的对象,鼠标经过要产生位移和摆动。它得先理解"文字是一道帘子"这个隐喻,再用代码把这个隐喻还原出来。屋檐比例、纸张质感、竖排节奏、文字密度、留白,全都要收得住。能把"意境"翻译成"可交互的代码",这才是"审美"这个词在前端里真正的含义。
我为什么反复强调这点?因为"配色好看"其实是最容易堆出来的表面功夫,真正难的是理解意图背后的那层隐喻,并且用工程手段把它稳定地实现出来。 前者靠模板就能糊弄,后者才见真章。K3 让我印象深的地方,正是它能接住这种"只可意会"的需求:你说一个氛围、一个比喻、一个感觉,它能把它拆成一堆具体的交互和样式落地。对做设计、做创意的人来说,这种"懂你想要什么"的能力,比单纯"代码写得对"要值钱得多。当然,它也不是每次都一步到位,复杂需求往往要补一两次提示,让它把比例、节奏、留白再收一收——但能沿着你的反馈越改越准,本身就说明它真的"听懂了",而不是碰运气。
五、从"代码复印机"到"虚拟工程师":长程编程能力
如果说前端是 K3 的"门面",那长程编程(long-horizon coding)就是它的"里子",也是我个人觉得更值得关注的方向。
5.1 什么叫"长程"
普通问答是"你问一句、它答一句"。长程任务不一样:你给它一个目标,它得自己规划步骤、自己找文件、自己改代码、自己验证结果,中间某一步失败了,还要判断原因、换条路继续。整个过程可能持续数小时甚至数十小时,人几乎不用盯着。
K3 就是奔着这个场景设计的。它能在极少人工监督下,持续读大型代码库、在终端敲命令、协调调用各种工具,并根据执行结果反复迭代。适合处理跨文件 Bug、项目重构、性能优化、陌生代码库分析这类"啃硬骨头"的活。
你可能会觉得"不就是多干几步吗,有那么难?"——还真有。长程任务真正难的地方,我总结成三点。
一是不能"跑偏了还不知道"。 步骤一多,早期一个小错会被后面几十步不断放大,等你发现时已经面目全非。好的长程模型得能在中途察觉"这条路不对劲",然后回退、换招。
二是得记得住自己干过什么。 几十小时的任务里,前面读过的文件、试过的方案、踩过的坑,都要能随时调取,不能读了后面忘了前面。这正好呼应了前面讲的两件事:100 万上下文让它"装得下",AttnRes 让它能从深层"精准翻出"需要的信息。
三是要会用工具,而不只是会说话。 它得真的去敲终端、跑测试、看报错,再根据真实反馈调整,而不是空想。这跟"聊天问答"完全是两种能力。
把这三点凑齐,才谈得上"虚拟工程师"。K3 在这三点上都交出了能打的答卷,这也是我更看重它长程能力、而不只是前端惊艳效果的原因。
5.2 三个让我印象很深的验证案例
官方为了证明这套能力,放了几个相当硬核的案例。我把它们讲成人话:
其一,从零造了个 GPU 编译器。 K3 自己攒了一款叫 MiniTriton 的类 Triton 编译器,从中间表示层、优化环节一路做到底层代码生成的完整流水线。在标准基准测试里,部分负载上它的性能能追平甚至超过成熟工具。作为端到端验证,团队还用它训了一个小型 GPT 模型,loss 曲线正常收敛——说明它造的不是零散片段,而是一整套能跑通的系统。
其二,48 小时自主设计了一颗芯片。 在连续 48 小时、几乎零人工干预的自主运行里,K3 用开源 EDA 工具和一套开源工艺库,独立完成了一颗芯片从读文档、写硬件描述、跑仿真、迭代修复到验证的全流程。最终这颗 4 平方毫米的芯片里塞进了 146 万个标准单元,跑到时序收敛,仿真解码吞吐超过每秒 8700 个 token。官方给了个很浪漫的注脚:一颗由模型设计、为模型服务的芯片。
其三,两小时干完研究员一两周的活。 在一个科研复现任务里,它大约两小时就读完并交叉验证了 20 多篇论文、评估了 300 多种方程、生成 3000 多行代码,还产出了一份可交互的分析看板。
除了这三个,官方还搭了一个"内核优化竞技场"专门压测它。做法很硬核:把每个模型丢进独立的 GPU 沙箱,任务、测试框架、负载完全一致,给最多 24 小时,让它自己分析现有实现、重写底层内核、反复跑分验证。在最