本文由 辛梓煜@词元二号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要
Anthropic 在 2026 年 7 月 24 日深夜发布了 Claude Opus 5——一款定价仅为 Fable 5 一半(输入 25/百万 token),但智能水平已无限逼近旗舰的新模型。它现在是 Claude Max 的默认模型,也是 Pro 订阅里能用到的最强模型。跑分层面,Frontier-Bench 得分是上一代 Opus 4.8 的两倍多,ARC-AGI 3 得分是第二名的三倍,OSWorld 2.0 在所有成本档位上碾压所有对手。但真正让我觉得"不太一样"的,是一个被故意剥夺了看图能力的任务里,Opus 5 没有放弃——它自己写了一套计算机视觉管线,从原始像素里把几何信息硬生生抠了出来。这不是"答题答得好",这是遇到没有工具的局面,自己造了一个。
如果你只想知道核心结论,上面这段就够了。想看完整拆解——每一层跑分怎么读、那个"造工具"案例到底意味着什么、安全对齐怎么做、跟 GPT-5.6 和 Gemini 怎么比、以及我自己上手实操后的真实体感——往下翻。
又是一个被 Anthropic 选在半夜发布的模型。
说实话,这两年大模型发布会的节奏快得让人有点麻木。GPT-5 系列隔几周迭代一次,Gemini 从 2.5 一路飙到 3.5,DeepSeek 在开源赛道上一路狂追——整个 2026 年上半年,各家都在拼了命地往"最强"这个标签上贴。看多了,确实容易审美疲劳。
所以当 Claude Opus 5 的消息在 7 月 24 日深夜弹出来的时候,我的第一反应是:哦,Opus 4.8 的例行升级呗。版本号往上走一格,跑分涨几个点,定价不变,发条新闻,正常操作。
然后我点进了 Anthropic 的官方博客。
看到中间那个案例的时候,我坐直了。
那个案例我后面会展开细讲,但先打个底——它涉及的不是模型在某项测试里拿了多少分,而是模型在被刻意剥夺了某项能力之后,没有摊手说"我做不到",而是自己动手造了一个替代方案。这事在 AI 评测史上,至少在我个人的跟踪范围里,是第一次见到这么干净利落的示范。
当然,咱不能光讲一个"炸裂案例"就把整篇文章撑起来。Opus 5 值得被认真拆解的地方很多:它在 Anthropic 越来复杂的模型矩阵里到底卡在什么位置?定价策略背后的市场逻辑是什么?四层跑分数据到底该怎么读?安全对齐这块 Anthropic 做对了什么、还差什么?以及,作为一个每天在实际工作里用这些模型的普通用户,我到底该不该从 Sonnet 切到 Opus、什么时候切?
这篇文章,辛梓煜@词元二号站就跟你一起,把 Claude Opus 5 从头到尾拆一遍。
一、Anthropic 模型家族全貌:Opus 5 到底站在什么位置
要想真正看懂 Opus 5 这次发布的含金量,得先把 Anthropic 在 2026 年攒出来的这张模型矩阵看清楚。说实话,如果你中间有几个月没关注 Anthropic 的发布节奏,猛一回头看他们的产品线,大概率会懵——名字太多了,而且还分不同"等级"。
我在这里帮你理一理。
1.1 从 Claude 3 到 Claude 5:命名体系的演进
Anthropic 从 Claude 3 开始确立了"三档命名法":Haiku(轻量)、Sonnet(均衡)、Opus(旗舰)。这个体系一直沿用到 Claude 4 系列结束。
到了 2025 年底到 2026 年初,事情开始变复杂了。Anthropic 在 Opus 之上又开了一个新等级——Mythos-class。而 Mythos-class 的第一个"面向公众安全化"的版本,被命名为 Fable 5,于 2026 年 6 月 9 日发布。
所以到了 2026 年 7 月,Anthropic 的模型矩阵大概是这样的:
|
等级 |
模型名称 |
发布时间 |
定位 |
API 定价(输入/输出,每百万 token) |
|
轻量 |
Claude Haiku 4.5 |
2025年10月 |
快速、低成本、日常轻任务 |
|
|
均衡 |
Claude Sonnet 5 |
2026年6月30日 |
Free/Pro 默认模型,日常主力 |
|
|
高性能 |
Claude Opus 5 |
2026年7月24日 |
Max 默认、Pro 最强,性价比旗舰 |
|
|
旗舰 |
Claude Fable 5 |
2026年6月9日 |
最长、最复杂自主任务 |
|
|
顶级(受限) |
Claude Mythos 5 |
2026年6月9日 |
安全护栏部分解除,仅限 Project Glasswing 授权组织 |
不公开 |
这个表格里有一个非常关键的信息:Opus 5 的定价和上一代 Opus 4.8 完全一样,25 输出。但性能呢?Anthropic 的说法是"智能水平接近 Fable 5"——而 Fable 5 的定价是
50,正好是 Opus 5 的两倍。
1.2 为什么要有 Opus 5?——填补"中间地带"
在 Opus 5 发布之前,Anthropic 的产品线有一个明显的断层。
Sonnet 5(15)到 Fable 5(
50)之间,隔了差不多 3 倍的价差。对于很多开发者和企业来说,Sonnet 处理复杂任务不够用,但 Fable 又太贵——每天重度使用的话,成本会迅速膨胀。
Opus 5 就是来填这个坑的。
它的定位非常清晰:把 Fable 级的智能,装进 Opus 级的价格里。Anthropic 在官方博客里的原话是"approaching the intelligence of Fable 5 at half the price"——翻译过来就是,你用 Opus 5 干活的体感,已经很接近 Fable 5 了,但花的钱只有一半。
而且,Opus 5 现在是 Claude Max 订阅的默认模型,也是 Pro 订阅里能用到的最强模型。这意味着绝大多数付费用户,每天打开 Claude 用的就是它。
1.3 跟上一代 Opus 4.8 比,到底升级了什么
Opus 4.8 是 2026 年 5 月 28 日发布的,距离 Opus 5 不到两个月。这么短的迭代周期,Anthropic 到底改了啥?
从官方披露的信息来看,核心升级集中在三个方面:
第一,推理能力的大幅跃升。 这一点在 Frontier-Bench 上体现得最明显——Opus 5 的得分是 Opus 4.8 的两倍多。Frontier-Bench 不是传统的"刷题"评测,它考的是模型在真实软件工程任务里的表现,包括理解需求、写代码、调试、部署等一系列连贯动作。得分翻倍意味着模型在实际干活时的"靠谱程度"有了质的提升。
第二,自主性和"自我验证"能力。 Anthropic 反复强调 Opus 5 会"在交活之前先自己检查一遍"。这不是一句营销话术。在多个独立案例里——后面我们会详细拆解——Opus 5 展现出了主动怀疑自己的输出、然后想办法验证的行为模式。这个特质在实际工作中非常值钱,因为"模型自信满满地给出一个错误答案"是 AI 辅助工作流里最让人头疼的问题之一。
第三,思考模式默认开启。 Opus 4.6 引入了"自适应思考"(adaptive thinking),让模型自己决定什么时候需要深度推理。Opus 5 把这个机制进一步打磨——thinking 现在是默认开启的,effort 参数控制的是推理深度而不是开关。这意味着你不需要额外配置,模型自己会根据任务复杂度调整"思考量"。
1.4 整个 2026 年 Anthropic 的发布节奏——一次看全
为了方便你理解 Opus 5 在整个发布序列里的位置,我把 2026 年 Anthropic 的主要模型发布整理成了一条时间线:
|
日期 |
事件 |
|
2026年2月5日 |
Claude Opus 4.6 发布,引入自适应思考,ARC-AGI-2 得分 68.8% |
|
2026年2月17日 |
Claude Sonnet 4.6 发布,成为 Free/Pro 默认模型 |
|
2026年4月16日 |
Claude Opus 4.7 发布,软件工程和视觉能力提升 |
|
2026年5月28日 |
Claude Opus 4.8 发布,SWE-bench Verified 创新高 |
|
2026年6月9日 |
Claude Fable 5 + Mythos 5 发布,Mythos-class 首次公开 |
|
2026年6月30日 |
Claude Sonnet 5 发布,成为新一代默认模型 |
|
2026年7月24日 |
Claude Opus 5 发布 |
两个月内发了三个大模型(Opus 4.8 → Sonnet 5 → Opus 5),这个节奏放在两年前是不可想象的。整个行业都被拖进了一场"周更"式的军备竞赛。
但换个角度想,Opus 5 这个节点选得很有意思——它不是在 Sonnet 5 之前发,而是在之后。先让 Sonnet 5 把"日常主力"的位子站稳,再用 Opus 5 去打"高端性价比"的牌。这套组合拳的逻辑,我们下一章聊定价的时候会讲透。
二、定价策略深度拆解:花中杯的钱,喝到大杯的量
聊完定位,我们来说钱的事。Opus 5 的定价策略可能是这次发布里最值得企业用户和重度个人用户关注的部分——不是因为 Anthropic 降了价,恰恰相反,他们没降。
2.1 定价不变,但性价比翻倍
Opus 5 的 API 定价是:
- 输入:$5 / 百万 token
- 输出:$25 / 百万 token
- Fast 模式:
50 输出(约 2.5 倍速度,2 倍价格)
这个数字和 Opus 4.8 一模一样。但因为 Opus 5 的智能水平已经逼近 Fable 5(50),所以实际上你花同样的钱,买到了接近两倍价格级别的智能。
用星巴克做类比:你花中杯的钱,喝到的是大杯的量,而且这个大杯还差一口就到超大杯了。
为了让你对这个定价在整个市场里的位置有一个直观感受,我把 2026 年 7 月主流模型的 API 定价做了一个横向对比:
|
模型 |
厂商 |
输入 ($/百万token) |
输出 ($/百万token) |
定位 |
|
Claude Opus 5 |
Anthropic |
5 |
25 |
高性能性价比旗舰 |
|
Claude Fable 5 |
Anthropic |
10 |
50 |
顶级旗舰 |
|
Claude Sonnet 5 |
Anthropic |
3 |
15 |
日常主力 |
|
GPT-5.6 Luna |
OpenAI |
~2.5 |
~15 |
均衡旗舰 |
|
GPT-5.4 Pro |
OpenAI |
~2.5 |
~15 |
多功能旗舰 |
|
Gemini 3.5 Flash |
|
~0.15 |
~0.60 |
轻量低成本 |
|
Gemini 3.1 Pro |
|
~2 |
~12 |
推理性价比 |
|
DeepSeek V3.2 |
DeepSeek |
0.28 |
0.42 |
开源性价比之王 |
从这张表你能看出来,Opus 5 的定价处于一个"中高端"的位置——比 DeepSeek 和 Gemini Flash 贵不少,但比自家 Fable 5 便宜一半。而且它的核心竞争逻辑很简单:我用比 GPT-5.6 和 Gemini 3.1 Pro 稍贵一点的价格,给你 Fable 级别的体验。
2.2 Fast 模式:花两倍的钱,买 2.5 倍的速度
Opus 5 除了标准模式,还提供了一个 Fast 模式。这个模式的核心卖点是"快"——生成速度大约是标准模式的 2.5 倍,但价格翻倍。
什么场景适合开 Fast 模式?我自己的经验是:
- 实时交互场景——比如你在 Claude Chat 里跟模型来回对话,等 2 秒和等 5 秒的体感差距很大,Fast 模式值这个价。
- 批量处理但时效敏感——比如一天要处理 200 篇文档摘要,时间窗口只有 2 小时,那 Fast 模式能帮你卡住 deadline。
- 复杂推理不需要加速——如果你让模型花 30 秒深思熟虑一个架构设计问题,Fast 模式反而可能因为减少了思考时间而出次品,这种场景老老实实用标准模式。
一个省钱的小技巧:如果你在用 API,可以在同一个会话里按需切换 effort 参数。简单任务用 medium 甚至 low,遇到难题再切到 high 或 max。不要所有请求都无脑开 max——那样你的 token 账单会涨得很快,但产出质量未必线性提升。
2.3 为什么 Anthropic 选择不降价?
这个问题值得多想一步。2026 年上半年,整个 AI 行业的趋势是推理成本断崖式下降。DeepSeek V3.2 的定价低到 0.42,Gemini Flash 更夸张——
0.60,几乎等于白送。在这种"价格屠杀"的大环境下,Anthropic 为什么坚持 Opus 线
25 不降?
我觉得有三个原因。
第一,Anthropic 赌的是"贵但值"。 如果 Opus 5 在实际工作里的表现确实能打 Fable 5 的八成以上,那 25 这个价位就是划算的。他们不需要跟 DeepSeek 拼价格——那是 Haiku 的活。Opus 线的竞争策略是"用更好的质量说服你多付一点"。
第二,模型推理成本还没有降到可以随便定价的程度。 虽然 industry-wide 推理成本在降,但像 Opus 5 这种带默认 thinking 模式、能跑超长 agentic 任务的大模型,算力消耗仍然很大。Anthropic 的 tokenizer 在 Opus 4.8 时还做过一次调整——同样的文本映射到更多 token,实际成本隐性上涨了最多 35%。这说明底层推理成本的压力仍然存在。
第三,订阅制提供了缓冲。 对于通过 Claude Max 和 Pro 订阅使用 Opus 5 的用户来说,API 定价只是背景数字——他们关心的是"在这个订阅额度内我能做多少事"。Anthropic 把 Opus 5 设为 Max 默认模型,等于在订阅体系内给用户送了一个"免费升级包"。这种策略既维持了 API 定价的锚定效应,又让订阅用户体验到了实实在在的获得感。
2.4 对于不同用户类型的选型建议
聊完宏观策略,回到实操层面。如果你正在纠结该用哪个模型,这里给一个快速决策参考:
如果你每天的任务是:
├─ 日常问答、文档摘要、简单代码 → Sonnet 5(够用、省钱)
├─ 复杂调试、多文件重构、长文档分析 → Opus 5(性价比最优)
├─ 持续数小时的自主代理任务、超长推理链 → Fable 5(唯一选择)
└─ 大量简单请求、成本敏感 → Haiku 4.5 或 DeepSeek
我自己在词元二号站的后台处理文章素材的时候,99% 的场景 Sonnet 5 就搞定了。但遇到那种需要跨多个文档做深度交叉分析的活——比如对比三篇论文的研究方法差异——Opus 5 明显比 Sonnet 5 稳。关键判断标准其实就一个:当你连续两次觉得 Sonnet 的答案"好像不太对",就该切 Opus 了。
三、跑分数据逐层解读:从"新模型该有的样子"到"三倍离谱"
Anthropic 这次放出的跑分数据,我建议你按顺序看。因为它们是一层比一层离谱的——如果你跳着看,会错过那种"等等,刚才那个数字是认真的吗?"的递进感。
3.1 第一层:Frontier-Bench——开局就不讲武德
Frontier-Bench v0.1 是一个相对较新的评测基准,但它很重要——因为它不考"做题",考的是模型在真实软件工程任务里的表现。我们来看看各家模型的成绩:
|
模型 |
Frontier-Bench 得分 |
单任务成本(相对) |
|
Claude Opus 5 |
领先所有模型 |
低于 Opus 4.8 |
|
Claude Opus 4.8 |
约 50%(相对Opus 5) |
基准线 |
|
其他竞品 |
普遍落后 |
— |
Anthropic 官方的表述是 Opus 5 的得分"是 Opus 4.8 的两倍多"。如果你一直在追踪大模型评测,应该知道这种代际之间的翻倍式提升有多罕见——通常的迭代升级,跑分涨 10%-20% 就算不错了。涨 100%+ 意味着底层能力发生了结构性的变化,不是简单的"多堆了点数据"能解释的。
而且注意成本那一列——得分翻倍了,单任务成本反而更低了。这说明模型在完成任务时更高效——可能是少走了弯路、减少了对工具的错误调用次数、推理链路更短更准。对企业用户来说,这个"隐性降本"比显性的 API 定价更重要。
3.2 第二层:CursorBench——差 0.5%,像在调戏你
CursorBench 是一个专门评估模型在 Cursor 这类 AI 编程工具里表现的基准。开到最大 effort 的时候:
|
模型 |
CursorBench 峰值分数 |
API 定价(输入/输出) |
|
Claude Fable 5 |
最高 |
|
|
Claude Opus 5 |
仅次于 Fable 5,差距 0.5% |
|
差 0.5%。 说实话,在一个评测基准里,0.5% 的差距基本上可以视为"平手"——因为这个量级的差异可能只是评测本身的数据噪声。但关键在于:Fable 5 要花两倍的钱。
这就产生了一个非常现实的推论:如果你的工作流主要在 Cursor 这类工具里跑,Opus 5 和 Fable 5 的体验几乎拉不开差距,但你花的钱差了一倍。在大量日常编程场景里,Opus 5 就是 Fable 5 的平替。
3.3 第三层:ARC-AGI 3——三倍,这数字真的需要确认一下
ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是一个专门用来考模型"解新题"能力的评测。它的设计初衷就是防"背题家"——模型不可能靠训练数据里"见过类似的题"来拿分,因为每个题目都是全新的抽象推理挑战。
ARC-AGI 3 是这个系列的最新版。Anthropic 给出的数据是:
Opus 5 在 ARC-AGI 3 上的得分,是第二名的三倍。
这里我必须坦白说一句:第一眼看到这个数字的时候,我以为是排版错误。三倍?在一个专门防背题的评测上,第二名也是顶级模型,你告诉我你赢了人家三倍?
冷静下来之后,我重新读了一遍 Anthropic 的技术说明。他们在 Opus 5 上使用了最大 effort 设置,thinking 模式全程开启。ARC-AGI 这类抽象推理任务恰好是"深度思考"最能发挥作用的场景——模型花更多时间在推理链上推演,解题成功率会大幅提升。
但这仍然是一个非常夸张的数字。它传递的信号很明确:在"真正的、不依赖于记忆的抽象推理"这件事上,Opus 5 跟同期竞品拉开了一个数量级的差距。
3.4 第四层:OSWorld 2.0——不只是"赢",是"性价比碾压"
OSWorld 是一个特别有意思的评测——它不让模型"口嗨",而是真的去操作电脑:点鼠标、敲键盘、打开软件、执行任务。OSWorld 2.0 是这个系列的最新版。
这轮评测的结果更加"不讲理":
|
评测维度 |
Claude Opus 5 表现 |
|
所有成本档位 vs 所有对手 |
全胜 |
|
击败 Fable 5 最佳成绩时使用的成本 |
仅 Fable 5 的 1/3 多一点 |
|
相比 Opus 4.8 的提升 |
显著(具体数字未公开) |
全档位碾压——从最低成本到最高成本,Opus 5 在每个价位上都赢了所有对手。而且它用三分之一的钱,超过了 Fable 5 的最好成绩。
这个结果说明了两件事:
第一,Opus 5 在"实际操作电脑"这个能力上已经达到了一个新的级别。这不是"聊天聊得好",而是真的能动鼠标键盘干活。
第二,它的效率极高。同样的任务,Opus 5 花的 token 更少、步骤更少、成功率更高。这对于需要批量跑自动化任务的场景来说,就是真金白银的成本节省。
3.5 四层跑分看完,总结一下
如果你刚才跳着看,这里帮你串一遍:
第一层 Frontier-Bench:得分翻倍,成本更低 ← "嗯,不错"
第二层 CursorBench: 差 Fable 5 仅 0.5% ← "有点意思"
第三层 ARC-AGI 3: 第二名三倍 ← "???你再说一遍"
第四层 OSWorld 2.0: 全档位碾压 ← "好吧我服"
每一层都比上一层更"离谱",但真正让 Anthropic 这次发布从"一次不错的迭代"变成"值得写一篇长文"的事件,是下一章要讲的案例。跑分数字再漂亮,说到底也只是数字。案例才能告诉你,这个模型到底是怎么思考的。
四、那个让我坐直了的案例:当模型学会给自己造工具
好,终于到了我文章开头"先按住不讲"的那个案例。
先说场景。在 Frontier-Bench 的某个评测任务里,测试人员给了 Opus 5 一张机械零件的工程图纸,要求它写代码,在 FreeCAD(一款开源的 3D 建模软件)里把这个零件完整重建出来。
听着不难,对吧?看图建模。人类设计师天天干这个。
但这里有一个精心设计的"陷阱":测试人员故意剥夺了 Opus 5 直接查看这张图片的能力。 图就在那儿,它"看"不了。
4.1 正常剧本 vs Opus 5 的实际行动
按照正常的剧本,一个 AI 模型面对这种情况会怎么反应?
大概是这样:
模型:我尝试访问图片...
系统:无法访问该文件。
模型:让我再试一次...
系统:仍然无法访问。
模型:抱歉,我无法查看您提供的图片。请确保文件路径正确并重新上传。
事实上,在同样条件下,其他家的模型试了五次,全都没做出来。它们要么反复尝试访问失败后放弃,要么给出一个基于"猜测"的答案——因为看不到图嘛,只能猜零件长什么样。猜出来的结果当然不对。
那 Opus 5 做了什么?
它的行为链大概是这样的:
- 发现自己确实访问不了这张图片——常规路径走不通。
- 但它能访问这个文件在磁盘上的原始字节。
- 于是它自己写了一套计算机视觉(CV)处理管线——包括图像解码、边缘检测、几何特征提取等一系列操作,从原始像素数据里硬生生把零件的几何信息抠了出来。
- 然后它用抠出来的几何参数,在 FreeCAD 里把整个 3D 零件重建了。
而且不是"瞎猫碰上死耗子"——Anthropic 的官方博客明确说,这个行为是稳定复现的。
4.2 这意味着什么?——比任何跑分数字都重要
我在读 Anthropic 博客看到这段的时候,真的从椅子上坐直了。
因为我突然意识到,这已经不是在讨论"模型答题答得好不好"的问题了。这是在讨论一个完全不同层面的能力。
让我换个角度帮你理解这件事的分量。
在人类学里,判断智能起源的经典标志是什么?制造工具。 几百万年前,某个原始人捡起一块石头,砸开了一颗坚果——那一刻被我们追认为智慧行为的起点。不是因为那个原始人"知道"坚果可以吃,而是因为他在面对"牙齿咬不开"这个限制时,没有放弃,而是从环境里找到了一个替代方案——石头。
现在,Opus 5 在评测里被"掐断了眼睛"。它的反应不是"认输",不是"反复尝试同一个无效动作",也不是"基于训练数据猜一个答案"——而是自己给自己造了一双眼睛。
这和"模型在数学竞赛里拿了高分"有本质区别。解题是在一个已知的规则体系内寻找最优路径。但"造工具"是在发现当前规则体系内无解之后,自己扩展了规则体系的边界。
我承认这句话听起来有点宏大叙事了。让我把它拉回到实际——对于我们这些每天用 AI 干活的人来说,这个案例意味着什么?
它意味着在某些场景下,Opus 5 不会被困在它的工具集里。你给了它一套工具(比如文件读写、代码执行、API 调用),如果你不小心漏了什么——或者像这个案例里一样故意少给了什么——它不会傻等着你补,而是会尝试自己补。
在实际项目里,这种能力可以表现为:
- 你让它分析一个 CSV 文件,但忘了告诉它文件编码有问题。普通模型可能直接报错或输出乱码数据。Opus 5 可能会自己先检测编码,转换后再分析。
- 你让它爬一个网页的数据,但那个网页的结构跟你描述的不一样。普通模型可能会卡住。Opus 5 可能会自己分析页面 DOM 结构的变化,然后调整解析策略。
- 你在 Claude Code 里让它重构一段代码,但它发现缺少某个依赖的文档。普通模型可能基于猜测去写。Opus 5 可能会先从代码库的其他文件里推断接口定义,再动手重构。
这些场景听起来可能不如"写了一个 CV 管线"那么戏剧化,但在日常工作的体感上,就是"靠谱"和"不靠谱"之间的分界线。
4.3 用伪代码还原 Opus 5 在那个任务里的决策逻辑
虽然 Anthropic 没有公开 Opus 5 在那次任务里的完整代码,但我根据官方描述和我自己的理解,尝试用伪代码还原了一下它的决策链路:
任务:在 FreeCAD 中重建机械零件 3D 模型
输入:零件工程图纸(PNG 文件路径)
STEP 1: 尝试常规方法
image = load_image(filepath)
→ 错误:无法加载图片,可能缺少图像查看权限
STEP 2: 评估替代方案
IF 图片无法直接查看:
方案A: 放弃,报告无法完成 → 不可接受
方案B: 猜测零件形状 → 准确度不可控
方案C: 从原始字节中提取信息 → 可行但需要工具
STEP 3: 自建工具链(选择方案C)
# 读取原始文件字节
raw_bytes = read_file_bytes(filepath)
# 解析 PNG 文件头,获取图像参数
width, height, bit_depth, color_type = parse_png_header(raw_bytes)
# 解码像素数据
pixel_matrix = decode_png_pixels(raw_bytes, width, height)
# 边缘检测(如 Canny 算法)
edges = canny_edge_detection(pixel_matrix)
# 提取几何特征(直线、圆弧、圆等)
geometric_features = extract_features(edges)
# 返回:lines[], arcs[], circles[], dimensions{}
STEP 4: 参数化重建
# 将几何特征转换为 FreeCAD 建模指令
for feature in geometric_features:
IF feature.type == "line":
freecad.add_line(feature.start, feature.end)
ELIF feature.type == "arc":
freecad.add_arc(feature.center, feature.radius, feature.angle)
ELIF feature.type == "circle":
freecad.add_circle(feature.center, feature.radius)
# 按工程约束组装
freecad.extrude(profile, depth=extracted_dimensions.thickness)
freecad.fillet(edges, radius=extracted_dimensions.fillet_radius)
STEP 5: 验证
# 将生成的 3D 模型投影回 2D 对比原始图纸
projected = freecad.project_to_2d(model)
similarity = compare(projected, pixel_matrix)
IF similarity < threshold:
调整参数,回到 STEP 4
ELSE:
输出最终模型
这个伪代码当然是我根据官方描述"脑补"的——但它反映的行为模式,跟 Anthropic 描述的是一致的。关键不在于技术细节,而在于决策思路:遇到限制 → 评估替代方案 → 选择"自己造工具" → 验证结果 → 迭代修正。
这个思路,说实话,已经非常接近一个人类工程师面对类似困境时的做法了。
五、更多实操表现:修 Bug 和搭数据流背后的共同特质
"造工具"的案例很炸裂,但它会不会只是一个被精心挑选出来的"演示特例"?一个模型偶然"灵光一现"和"稳定表现出某种行为模式"是两回事。
好在 Anthropic 的官方博客里还放了另外两个案例。我读完之后的感受是——这三个案例指向的不是孤立的高光时刻,而是一种同一类型的行为特质。
5.1 案例二:修了一个社区补丁都漏掉的 Bug
第一个案例来自一个流行的开源包管理器(Anthropic 没有点名是哪个,但从描述来看很可能是 npm 或 pip 这类日常工具)。
场景是这样的:有一个真实存在的 bug——会导致在特定条件下依赖解析失败。社区已经发现了这个 bug,也打了一个补丁。按理说,问题解决了。
测试人员把这个 bug 的描述和代码库丢给 Opus 5,让它找出根因并修复。
Opus 5 不仅找到了根因,还在修复过程中发现:社区打的那个补丁漏掉了一个边缘情况。 在某些特殊参数组合下,补丁之后的代码仍然会出错。
它做了什么?它没有只把"社区补丁漏掉的那部分"补上就完事——它重新分析了整个相关模块的逻辑,然后提出了一个更彻底的修复方案,同时覆盖了原 bug 和那个边缘情况。
作为对比,同一个任务丢给某个竞品模型(Anthropic 没有点名,但暗示是 GPT-5 系列的某个版本),它是怎么做的?它找到了那个表面症状——依赖解析失败——然后把报错的那行代码改了一下,让它在那个特定输入下不再崩溃,然后汇报说"bug 已解决"。
这中间的差距,用一个类比来说就是:
- 竞品模型的做法 ≈ 咳嗽了,医生给你开了止咳糖浆。咳嗽暂时止住了。
- Opus 5 的做法 ≈ 咳嗽了,医生给你做了肺部 CT,发现是支气管炎,开了抗生素,还提醒你最近空气质量不好出门戴口罩。
5.2 案例三:自己搭测试环境验证自己的代码
第二个案例更贴近我们的日常工作场景。
某家交易公司的工程师,在一个会话里用 Opus 5 给一个新交易所搭建了整条市场数据流。这个任务的复杂度在于:
- 涉及多个数据源(行情数据、订单簿、成交记录等)
- 需要处理不同数据格式和协议
- 对实时性有要求
之前的模型(包括 Opus 4.8)拿到再详细的计划也干不完这个活——要么在半路卡住,要么产出的代码有逻辑漏洞。
但 Opus 5 不仅完成了,中间还有一个特别妙的细节。任务进行到一半的时候,工程师需要验证一段数据解析代码写没写对,但当时没有可用的实时数据流来做验证。正常的做法可能是:工程师自己去搞一个测试数据,或者等数据流通了再说。
Opus 5 的做法是:它自己搭了一个模拟测试环境——构造了符合预期格式的 mock 数据,跑了一遍解析逻辑,比对输出结果和预期,确认没问题之后,再继续往下搭真正的数据流。
你可以说这没什么大不了的,"mock 数据"本来就是开发者的常规操作。但重点在于:模型主动意识到了"这里需要验证"并在没有人提示的情况下自己完成了验证闭环。 这个"自己发现问题、自己想办法验证、验证通过再继续"的行为链条,跟上一个"造 CV 管线"的案例,底层的思维模式是一样的。
5.3 三个案例的共同点:不是更聪明,是更"自觉"
把这三个案例放在一起看:
|
案例 |
遇到的限制 |
Opus 5 的反应 |
普通模型会怎么做 |
|
FreeCAD 建模 |
看不到图 |
自己写 CV 管线提取信息 |
放弃或瞎猜 |
|
修 Bug |
社区补丁有漏洞 |
重新分析整个模块,给出彻底修复 |
糊上表面症状 |
|
搭数据流 |
没有实时数据验证 |
自己搭 mock 环境验证 |
跳过验证或等人提供数据 |
这三个案例的共同点,不是 Opus 5 比别的模型"更聪明"——聪明是一个很模糊的概念。更准确的说法是,Opus 5 展现了一种**"对自己输出的质量有自觉"**的行为模式:
- 它会在给出答案之前,先怀疑这个答案对不对。
- 如果发现缺少验证条件,它会自己创造条件去验证。
- 如果发现常规路径走不通,它会尝试构建替代路径。
Anthropic 在技术文档里反复提到"self-verification"(自我验证)和"checking its own work"(检查自己的工作),这三组案例就是最好的注脚。
说实话,我一直觉得大厂官方博客里的用户证言要打个七折听——都是挑最好的案例讲。但这三个案例从不同角度、不同场景展现了同一种行为特质,让我觉得这不是"精心挑选"能解释的。这更像是模型在基础能力上确实发生了一些质变,然后这个质变在不同的任务里自然表现了出来。
5.4 这对实际使用意味着什么
从实操角度看,这种"自觉"能力在两种场景下价值最大:
场景一:长链任务。 如果你让模型做的事需要经过 5 个以上的步骤,每一步的输出都是下一步的输入。普通模型在第三步可能就已经"偏了",但因为链条长,你很难第一时间发现。Opus 5 的自我验证机制意味着它在每一步都可能自己纠正偏差,整个链条的终点产出质量会有质的提升。
场景二:无人值守任务。 比如你下班前丢给模型一个活,让它自己跑几个小时,第二天早上来看结果。如果模型在中间某个环节卡住了或者走偏了,没有自我纠正能力的话,你第二天早上看到的就是一堆废料。Opus 5 在这类场景里的"靠谱指数"明显更高。
辛梓煜@词元二号站自己在用的是:复杂的数据分析、跨文档交叉比对、长代码重构——这三类任务,我会优先丢给 Opus 5。简单问答、格式转换、短摘要——Sonnet 5 完全够用。判断标准还是那句:当你开始担心"模型会不会搞错"的时候,就是该上 Opus 5 的时候。
六、安全与对齐:Anthropic 凭什么敢说这是"最对齐"的模型
聊完性能,必须单独开一章聊安全。不是因为"安全很重要"这种正确的废话,而是因为 Anthropic 在这次发布里放出了几个非常有信息量的数据——让我觉得他们在安全策略上确实走了一条跟 OpenAI 不太一样的