📍 词元二号站 开源解码 GPT-5.6 全家桶与 ChatGPT Work 深度拆解:当 AI 从「聊天框」变成「工作系统」

GPT-5.6 全家桶与 ChatGPT Work 深度拆解:当 AI 从「聊天框」变成「工作系统」

摘要:一篇讲透 OpenAI GPT-5.6(Sol/Terra/Luna)与 ChatGPT Work 的原创干货长文。涵盖三档模型定位与定价、编程能力真实边界、Programmatic Tool Calling 原理、ChatGPT Work 四阶段工作流、Codex 并入桌面端、AI 加速造 AI 的 RSI 评测,以及 METR 对评测可信度的警告,帮你看懂这场发布真正改变了什么。
字号 100%
行距 2.05
当前可见 60% 的内容
本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。

快速摘要(只想要结论的看这里)

2026 年 7 月 9 日,OpenAI 一次性做了三件事:把 GPT-5.6 三档模型(Sol 旗舰、Terra 均衡、Luna 轻量)推向全量可用;上线名叫 ChatGPT Work 的「干活型」智能体;把原本独立的 Codex 编程应用并进了统一的 ChatGPT 桌面端。这三件事看起来是三条新闻,本质上是一个动作——OpenAI 想让你打开 ChatGPT 不再是「问一个问题」,而是「交给它一个任务」。

几个能直接记住的硬数字:三档定价按每百万 token 计,Sol 是输入 5 美元、输出 30 美元;Terra 是 2.5 / 15 美元;Luna 是 1 / 6 美元。编程榜单上 Sol 在 Artificial Analysis Coding Agent Index 上拿到 80 分,比 Claude Fable 5 高约 2.8 分,还更省 token、更快。但在更接近真实工程环境的 SWE-Bench Pro 上,Sol 只有 64.6%,落后 Claude 阵营约 15 分——所以这不是「碾压」,而是「各有胜负」。

这篇文章我会把这次发布拆成十二块讲清楚:命名法怎么读、编程能力的真实边界、Programmatic Tool Calling 到底解决了什么、ChatGPT Work 的四个工作阶段、Codex 为什么「隐身」而不是「消失」、价格背后的成本账,以及最值得警惕的两点——OpenAI 开始用 AI 加速造 AI,而独立测评机构 METR 又对 Sol 的评测可信度拉了警报。

想看完整拆解,往下翻。


一、先把这次发布说清楚:不是一个模型,是一套「工作系统」

我盯 AI 圈的更新盯了挺久,见过太多「新模型刷新榜单」的发布。这一次不太一样。真正的重点不在于 Sol、Terra、Luna 这三个听起来像太阳系的名字有多酷,而在于 OpenAI 把「模型」「智能体」「桌面应用」三样东西塞进了同一个入口。

把时间线摊开看会更清楚。7 月 9 日,GPT-5.6 家族正式进入通用可用阶段(也就是普通付费用户排队就能用上,不再只对少数机构开放)。同一天,OpenAI 上线了 ChatGPT Work——官方把它定义成「ChatGPT 里的一个智能体」,它能跨你的应用和文件收集信息,围着一个项目连续跟进好几个小时,把一个目标拆成小步骤然后独立完成。也是同一天,独立的 Codex 桌面应用被并入了新的 ChatGPT 桌面端。

这三件事捆在一起,指向的是同一个判断:过去的 AI 产品是一个「聊天框」,你问一句它答一句;未来的 AI 产品是一个「工作系统」,你说清楚目标,它自己去查、去写、去跑、去改,最后把成品交回来。

我个人的体感是,这条分界线其实早就画好了,只是这次被 OpenAI 一次性摁实了。你可以把它类比成智能手机的演化:早期手机是「打电话+发短信」,后来变成「装什么 App 就能干什么事」的平台。ChatGPT 现在想走的,就是从「问答工具」升级成「任务平台」这一步。

官方给 GPT-5.6 的定位也很直接:每一个 token 都要榨出更多智能、更高性能、更低成本,还要在最难的任务上按需把能力拉满。这句话翻译成人话是——过去大家卷的是「谁更聪明」,现在开始卷的是「谁能把聪明变成可以交付的活儿」。这是本次发布真正的分水岭,后面每一节的细节,基本都是围绕这个主线展开的。

我再帮你把「为什么是这三件事」的逻辑捋一遍,你会发现它们其实是环环相扣的:没有更能干活、更省成本的模型(GPT-5.6),智能体跑长任务就又贵又不靠谱;没有一个能跨应用、拆步骤、交成品的外壳(ChatGPT Work),再强的模型也只是个更聪明的聊天框;而不把 Codex 那套「代码级执行」的能力并进来,这个外壳就干不了真正硬核的活儿。 三样缺一不可,凑齐了才叫「工作系统」。这也是为什么我一开始就说,把它们当三条新闻看会看漏重点——它们是一盘棋里的三步。

有意思的是,OpenAI 内部一位工程师在社交平台上开玩笑说,他们是在「把 ChatGPT 塞进 Codex,好让 Codex 能在 ChatGPT 里的 Codex 里」——话说得绕,但产品逻辑一点不绕:聊天助手和执行环境之间那道墙,正在被推倒。 过去这道墙很清楚,ChatGPT 是你问、你draft、你头脑风暴的地方,Codex 是开发者交任务、看 diff、让智能体在代码库里干活的地方。可一旦 AI 能跨文件推理、能操作工具、能记住项目上下文、能并行跑任务,「帮我写封邮件」「帮我修个 bug」「帮我准备一份发布清单」这几件事的差别,就更多是「权限」层面的,而不是「产品品类」层面的了。这才是这次合并背后真正的产品哲学。

二、先教你读懂新命名法:数字是「代」,后缀是「档」

新手最容易被劝退的一步,就是这一堆名字。我先花点篇幅把命名规则讲透,后面看数据才不会晕。

从 GPT-5.6 开始,OpenAI 换了一套命名逻辑:数字代表「代」(generation),也就是这一批模型的技术世代;Sol / Terra / Luna 代表「档」(capability tier),是可以各自按自己节奏往前迭代的能力层级。 换句话说,未来你可能会看到 GPT-5.7 Sol、GPT-6 Terra 这种组合,数字管「换代」,后缀管「定位」。

三个档位的分工,可以用一张表说清楚:

档位

定位

适合的活儿

一句话记忆

Sol

旗舰 / 最强推理

复杂编程、长任务、安全研究、科研

难题专用,贵但顶

Terra

均衡 / 日常主力

客服、内部工具、文档分析等高频量产

性价比担当

Luna

轻量 / 低成本

摘要、起草、常规自动化

又快又便宜

官方还给 Sol 单独留了一个更强的 Sol Pro,面向最难、跑得最久的工作流。在 ChatGPT 里,Plus、Pro、商业版、企业版用户能用到 Sol,Pro 和企业版还能选 Sol Pro;免费版和 Go 版则默认用 Terra。开发者通过 API 三档都能调。

价格这块我单独拎出来,因为它其实是这次发布的隐藏重点。按每百万 token 计费:

档位

输入(每百万 token)

输出(每百万 token)

Sol

5 美元

30 美元

Terra

2.5 美元

15 美元

Luna

1 美元

6 美元

这里有个小细节值得新手留意:大模型的「输出」几乎总是比「输入」贵好几倍。 原因是生成 token 要一个一个地算,算力消耗更大。所以当你让一个智能体跑长任务、反复修改、来回调工具时,真正烧钱的往往是它「说了多少话」,而不是你「喂了多少料」。这个认知,后面聊成本账的时候还会用到。辛梓煜的建议是:日常别一上来就抓着旗舰用,先想清楚这活儿到底配不配得上 Sol,把好钢用在刀刃上,这是把这套工具用出性价比的第一课。

三、编程能力:榜单确实第一,但别急着喊「碾压」

编程是这次官方主打的能力,也是最容易被标题党夸大的地方。我把数据和「坑」一起摆出来,你自己判断。

3.1 榜单上的确亮眼

OpenAI 称 Sol 是他们目前最强的编程模型。在 Artificial Analysis Coding Agent Index(一个衡量「编程智能体」综合能力的第三方榜单)上,Sol 拿到 80 分,比 Claude Fable 5 高约 2.8 分;更关键的是官方给的对照口径——同样的成绩,Sol 用的输出 token 不到对方一半,耗时不到一半,估算成本还低约三分之一。

在 Terminal-Bench 2.1(一个更贴近真实命令行工程环境的测试,简单说就是「把模型丢进终端里让它真刀真枪地干活」)上,Sol 达到 88.8%,开启 Ultra 模式后能冲到 91.9%。Sam Altman 对外还提了一句:在智能体式编程任务上,Sol 的 token 效率比上一代提升约 54%。

3.2 但 SWE-Bench Pro 这道坎绕不过去

榜单赢了就等于彻底碾压?并不是。同一批评测里,SWE-Bench Pro(一个以真实开源项目工程任务为主的高难度编程榜)上,Sol 只有 64.6%,而 Claude 阵营的 Mythos 5 是 80.3%——差了大约 15 分。在更综合的「智能与知识」类榜单上,Claude Fable 5 反而在部分指标上领先 Sol。

我把这两组数据放一起,是想给你一个更诚实的画面:

评测维度

GPT-5.6 Sol

Claude 阵营

谁占优

Coding Agent Index

80

Fable 5 ≈ 77.2

Sol

Terminal-Bench 2.1

88.8%(Ultra 91.9%)

约 83%–88%

Sol

SWE-Bench Pro

64.6%

Mythos 5 80.3%

Claude

综合智能指数

略低

Fable 5 略高

互有胜负

所以更准确的说法是:Sol 在「命令行 / 智能体式编程」这条线上确实拿了新高,但在「真实复杂工程项目」这条线上还追着 Claude 跑。 榜单能说明能力边界在扩张,不代表在所有场景都赢。你要是拿它去啃一个巨型老项目的 bug,别默认它一定比 Claude 强。

3.3 max 与 ultra:两种「更用力」的开关

GPT-5.6 新增了两个高能力设置,名字有点唬人,其实原理很朴素:

  • max:给模型更多的推理时间。你可以理解成「让它多想一会儿再答」,适合需要长链条推理的难题。
  • ultra:更激进,默认让 四个 agent 并行开工,把一个复杂任务拆给多个「分身」同时做,复杂场景下还能扩展到更多并发工作流。官方说在多项智能体式评测里,多 agent 并行能让结果更强、耗时更短。

3.4 别只盯着编程:长任务与浏览这两条线也值得看

编程之外,还有两个我认为更能代表「智能体时代」的评测维度,顺手也讲了。

一个是 Agents' Last Exam。这个测试专门评估「长时间运行的专业工作流」,覆盖 55 个领域,简单说就是「让模型像个真员工一样,把一个横跨多环节的专业活儿从头干到尾」。在这上面,Sol 拿到 53.6 分,创了新高,也明显领先 Claude 阵营。这个数字之所以重要,是因为它测的不是「答一道题」,而是「扛住一整条流程」——这恰恰是 ChatGPT Work 想解决的核心问题。

另一个是 BrowseComp,测的是模型用浏览器完成复杂检索与操作的能力。Sol 在 Ultra 模式下达到 92.2%。你可以把它理解成「让 AI 自己开浏览器上网查资料、点来点去把事办了」的能力——这也是为什么 OpenAI 敢把独立的 Atlas 浏览器关掉、把这套能力收进 ChatGPT 本体,因为模型自己的浏览能力已经够顶了。

不过这里我要多说一句提醒:这些高分几乎都来自官方或官方口径的评测。 有第三方(比如 Databricks 的私有编程基准、OpenAI 自己对 SWE-Bench Pro 的审计)已经指出,任务质量、评测框架设计、真实工作负载的形状,都可能把简单的排名整个推翻。所以我的态度一贯是:官方榜单是「开始测」的起点,不是「掏钱买」的终点。 真要上生产,拿你自己设计、自己能独立验证的任务去跑一遍,跟你自己的基线比,才算数。

一句话总结这一节:Sol 强,但强得有边界;max 和 ultra 是「愿意多花钱多花时间换更好结果」的旋钮,不是免费午餐;而在长任务和浏览这两条更贴近「干活」的线上,它的表现确实撑得起 ChatGPT Work 的野心。

四、Programmatic Tool Calling:让模型自己写代码去指挥工具

这是本次发布里技术含量最高、但最容易被普通读者忽略的一块。我尽量用大白话讲清楚。

先说「传统的工具调用」是什么样。过去模型想用外部工具(比如查天气、查数据库),流程大致是:模型说「我要调 A 工具」→ 系统去调 → 把结果塞回给模型 → 模型再决定下一步。一来一回,每一步都要经过模型「说一句话」,链条一长就又慢又贵。

Programmatic Tool Calling(可编程工具调用)换了个思路:直接让模型自己写一段 JavaScript 代码,在一个隔离的 V8 运行环境里跑,用代码来编排这些工具。 这个环境有两个关键约束——它是隔离沙箱,而且没有网络访问权限,这是出于安全考虑。在这段代码里,模型可以并行调用多个工具、写循环、写条件判断,还能先处理中间结果、再决定要不要返回最终答案。

我画个伪代码示意一下这两种模式的差别,你一眼就懂:

// 传统方式:每一步都要"模型说一句"
第1轮: 模型 -> "调 getPrice(A)"  -> 系统返回
第2轮: 模型 -> "调 getPrice(B)"  -> 系统返回
第3轮: 模型 -> "调 getPrice(C)"  -> 系统返回
第4轮: 模型 -> "对比三个价格,给结论"

// Programmatic Tool Calling:模型写一段代码,一次跑完
const items = ["A", "B", "C"];
const prices = await Promise.all(          // 并行,不用等一个再问一个
  items.map(name => getPrice(name))
);
const cheapest = prices                    // 循环 + 条件,直接在沙箱里算
  .map((p, i) => ({ name: items[i], price: p }))
  .sort((a, b) => a.price - b.price)[0];
return `最便宜的是 ${cheapest.name}`;       // 只把最终结果交回给模型

看出区别了吗?前者是「模型和系统来回聊了四轮」,后者是「模型写一次代码、系统跑一次、只把结论递回去」。 这意味着更少的模型轮次、更少的上下文占用,对于那种要调几十上百次工具的长任务,省下来的时间和成本相当可观。这也是为什么它和「智能体式工作」是天生一对——你要让 AI 独立干几小时的活儿,就必须让它学会「自己编排工具」,而不是每一步都回来请示。

这里有个容易被忽略的设计细节我想拎出来讲:那个 V8 沙箱「没有网络访问权限」,不是限制,反而是安全上的关键。 你想,如果让模型随手写的代码既能连外网又能碰你的数据,那风险面就大了。把执行环境关进一个断网的隔离盒子里,模型只能调用你明确授权的那些工具,写的代码也跑不出这个盒子——这等于给「让模型自己写代码执行」这件本来挺吓人的事,套上了一层护栏。能干活,又不至于乱来,这个平衡才是它敢大规模放出来的前提。

再补一个新手常问的问题:这跟「让模型自己写个脚本」有啥不一样?区别在于「谁来编排、在哪儿执行、结果怎么回收」。传统脚本是人写、人跑、人看结果;Programmatic Tool Calling 是模型在受控沙箱里自己写、自己跑、只把提炼后的结论带回自己的推理里继续用。它把「工具编排」这件原本要人来做的脏活,塞进了模型的一次内部动作里。对要跑长链条任务的智能体来说,这一步省下的,是大量本来要「回来请示」的模型轮次。

顺带一提,开发者还能通过 Responses API 里的多 agent 测试版,搭出类似「多个分身协作」的工作流。这两块拼在一起,才是 GPT-5.6「能干活」的底层地基。说到底,一个智能体要独立扛几小时的活儿,靠的从来不是「更会聊天」,而是「更会自己组织工具、自己管理中间结果」——GPT-5.6 在这块的进步,比它多刷的那几个榜单分,含金量高得多。

五、ChatGPT Work:从「回答问题」到「交付成品」

如果说 GPT-5.6 是发动机,那 ChatGPT Work 就是这次真正改变产品形态的车身。我认为它才是这场发布里最值得普通人关注的东西。

官方对它的定义很干脆:ChatGPT 里的一个智能体,能跨你的应用和文件收集信息,围着一个项目连续跟进几个小时,把目标拆成小步骤,然后独立完成。它的产出不是聊天记录,而是成品——表格、幻灯片、文档、可分享的网页应用。

我把它的运转拆成四个阶段,用一张流程图呈现会更直观:

flowchart LR
    A[你给一个目标<br/>例:整理竞品价格并周报] --> B[收集上下文<br/>跨应用+文件+1400+插件]
    B --> C[规划 Plan mode<br/>先给出步骤让你确认]
    C --> D[执行 Execute<br/>可即时/定时/事件触发/持续监控]
    D --> E[交付成品<br/>表格·幻灯片·文档·网页应用]
    E -->|敏感操作先过 Auto-review| F[你审阅/批准]

这四个阶段里,有几个设计我觉得特别关键,也特别适合新手理解「智能体和聊天机器人到底差在哪」:

  • Plan mode(计划模式):它不会闷头就干,而是先把「打算怎么做」的步骤列出来给你确认。这一步很重要——它把「黑箱执行」变成了「你能干预的流程」。
  • Auto-review(自动审查):涉及敏感动作时,系统会先检查再执行,相当于给智能体套了个安全带。
  • 连接器 + 插件:它能接入 Slack、Microsoft Teams、Google Drive、SharePoint、邮箱、日历、CRM、项目管理工具等,官方号称有 1400+ 插件。你可以理解成「让 AI 有了访问你日常工作台的钥匙」。

能产出什么?官方举的例子包括:生成可编辑的演示文稿、文档、电子表格、界面原型,还能根据模板和参考文件保持风格一致。伴随 Work 一起上线的还有一个 Sites(公测) 功能——它能把任务产出变成一个可分享、会随数据自动更新的网页应用或仪表盘。举个通俗场景:以前你要做一个「每周自动刷新的数据看板」,得东拼西凑好几个工具;现在理论上一句话交代清楚,它就能给你搭出来并持续更新。

5.1 对企业来说,治理比能力更要紧

如果你是替团队做决策的人,光看「它能干什么」是不够的,你更该看「它干活时你能不能管得住」。这一点 OpenAI 这次也补了不少东西。

企业版和教育版的管理员,可以通过集中控制来管理智能体能接入哪些工具、能碰哪些公司数据、能执行哪些动作。还有一个 Compliance API(合规接口),让组织能看到 ChatGPT Work 的对话和动作记录,便于审计与留痕。前面提过的 Auto-review,会在敏感动作真正执行前先检查一遍。这几样拼起来,指向的是同一件事——当一个智能体开始「替你动手」,它的边界就必须是可见、可控、可追溯的。

我特别想强调「信任边界」这个概念,因为它是这次产品形态变化里最被低估的风险点。过去第一代企业 AI,是「给现有流程加一个模型」:你打开文档、选中文字、让它总结、你看结果——模型的权力,在它「返回一段文字」的那一刻就结束了。而 ChatGPT Work 把这个关系反过来了:代码执行、文档、邮件、本地文件、浏览器会话、插件、有写入权限的工具,现在能在同一个智能体运行时里碰头。这意味着信任边界一下子变大了,权限和来源必须看得清楚。

落到实操,我总结了几条「接入前必问」的清单,分享给同样在评估的你:

该问的问题

为什么重要

这个智能体用的是谁的身份?

身份要跟着「人和任务」走,不能一个插件就拿到全工作区的管理员令牌

它能读到哪些数据?

「能读」不等于「能改」,读写权限要分开

哪些动作需要人工批准?

高影响的动作必须留人工确认这道闸

出错了怎么恢复、怎么追责?

失败恢复和责任归属,是模型解释不能替代的

成本怎么计量、结果怎么验收?

智能体的账要算得清,产出要有人能验

一句话:评估 ChatGPT Work,要像评估一个「运行时」,而不是像评估一个「聊天订阅」。 问题已经不只是「回答质量好不好」,而是「它以谁的身份、能碰什么、哪些动作要审批、怎么证明结果是对的」。

5.2 它到底能产出什么样的成品

再把「产出」这块说具体些,因为这决定了它对你有没有用。官方给的能力清单包括:可编辑的电子表格、幻灯片、文档、界面原型、可视化解释,以及前端网页原型;而且能根据模板和参考文件保持风格一致,生成更接近「可直接交付」状态的材料。

伴随上线的 Sites 公测,我上面提过——它能把任务产出变成一个可分享、会随底层数据自动更新的网页应用或仪表盘,面向 Plus、Pro、商业版、企业版用户,在网页、移动、桌面端都能用。对于那些原本要靠好几个工具东拼西凑、每周手动刷新的看板需求,Sites 是我建议第一个拿去试的功能——它能在数据变化时自动更新,不需要每次都找人重做。

我个人踩过的一个认知坑,也顺手提醒你:别把 ChatGPT Work 当成「更强的聊天」来用。 它的计费更像 API 用量——任务越复杂、跑得越久、调的工具越多,吃掉的额度就越多。所以真要用它接手团队流程,先小范围试、把单个任务的开销摸清楚,再谈规模化,别一上头就把所有活儿都甩给它。辛梓煜@词元二号站这边的原则一向是:先跑通一个最小可用的工作流,再往上叠。

六、Codex 没有死,它只是「隐身」成了背后的引擎

发布当天最容易被误读的一条新闻,就是「Codex 消失了」。我必须替它澄清一下:Codex 不是消失,是隐身。

先说事实。原本独立的 Codex 桌面应用,被并入了新的 ChatGPT 桌面端(Mac 和 Windows 都有)。新的桌面应用里,Chat(聊天)、Work(干活)、Codex(编程)变成了并排的三种模式,而且在包括免费版在内的所有套餐里都能用。原来那个老的 ChatGPT 桌面应用则被改名为 ChatGPT Classic。已经装了 Codex 应用的用户,照常更新就会变成新的统一桌面端。

那 Codex 到底变了什么、又保留了什么?

┌─────────────── 新的 ChatGPT 桌面端 ───────────────┐
│                                                    │
│   [ Chat ]        [ Work ]         [ Codex ]       │
│   聊天问答         干活交付          编程工作台       │
│      │               │                 │           │
│      └───────────────┴─────────────────┘           │
│              共享:项目 / 插件 / 浏览器 /            │
│              本地资源 / 定时任务 / 权限治理          │
└────────────────────────────────────────────────────┘

Codex 仍然是给开发者用的编程智能体,代码能力一个没少,还新增了几样:diff 里的行内编辑、侧边栏里的 PR(合并请求)审查、多仓库项目支持,以及由 GPT-5.6 驱动的更快的 Computer Use(让模型直接操作电脑界面)。OpenAI 高层也明确表态:Codex 是新工作产品的核心,它哪儿都不去。

所以更准确的理解是:Codex 从「一个独立的程序员工具」,变成了「ChatGPT 这个超级入口背后的执行引擎」。 这一步的意义在于——Codex 那套「读懂任务、追踪代码、跑命令、改 bug」的代码级执行能力,原本只服务程序员;现在通过 ChatGPT Work,这套能力被端给了不写代码的普通白领。你不一定会编程,但你可以让它整理销售线索、分析预算差异、更新项目看板、做会议准备、生成演示文稿。

还有一个我觉得很实用、但报道里常被一笔带过的点:你可以在手机上指挥桌面端干活。 通过 ChatGPT 移动 App,用户能在一台已连接的 Mac 或 Windows 主机上启动或继续任务、查看进度、批准动作。配对用的是一对一的二维码认证,安全性上做了考虑。这意味着一个跑几小时的长任务,你出门在外也能随时瞄一眼、点个批准,而不用一直守在电脑前。对我这种经常在外面跑、又放不下手头活儿的人来说,这个「远程盯梢」的能力比多几个榜单分实在多了。

顺带给个背景数据,帮你理解 OpenAI 为什么这么急着把 Codex 从「程序员工具」推向「所有人的引擎」:官方称每周有超过 500 万人在用 Codex,其中超过 100 万人已经在拿它做「非软件」的活儿。换句话说,把代码级执行能力端给普通白领,不是 OpenAI 拍脑袋的战略,而是用户已经在这么用了,产品顺势把它「扶正」而已。

同一波调整里,还有一个信号:OpenAI 的独立浏览器 Atlas 将在 8 月 9 日停止服务,它的「智能体式浏览」能力被吸收进了 ChatGPT 桌面端自带的浏览器和 Chrome 扩展里。把这几件事连起来看,OpenAI 的意图很明显——收拢产品边界,让 ChatGPT 成为你处理编程、研究、日常工作的唯一入口。 值得一提的是,这个「统一超级应用」的方向 OpenAI 其实铺垫了大半年,从年初把 Codex 桌面端定位成「智能体的指挥中心」,到这次一次性合龙,可以说是一条早就画好的路,只是这次走完了关键一步。

七、设计与交付审美:AI 开始「看自己做出来的东西」

有一个变化很容易被数据党忽略,但对创作者和小团队特别重要:这一代模型的「交付审美」明显往上走了一截。

官方强调,GPT-5.6 不只是会生成代码,还能检查自己渲染出来的界面,发现视觉和功能上的问题,然后自己动手修正。也就是说,它不再是「写完 HTML、CSS、JavaScript 就撒手」,而是开始有了成品意识——按钮是不是突兀、布局是不是乱、信息层级是不是清楚、最后这东西能不能直接拿给客户看。

在演示文稿这块更具体:它能从你给的参考稿里推断出一整套设计系统——版式、字体、间距、配色,乃至幻灯片母版(Slide Master)的规则,再把这套规则一致地套用到新内容上。

我用一张对比表说明这个变化对普通人意味着什么:

你想要的

以前 AI 给你的

现在 AI 尝试给你的

一个网页

一堆代码,自己去部署

一个能直接展示的页面

一份 PPT

文字堆进幻灯片

版式、节奏、图表层级都撑得住的成品

一份报告

大段文字

贴合模板、风格统一、接近可交付状态

对我这种做内容、常常要一个人身兼数职的人来说,这一点的价值比刷新几个榜单实在多了。以前让 AI 做视觉物料,得来回返工好几轮;现在它至少能先自己「照照镜子」,把明显丑的地方修一遍再交给你。当然,别指望它一次到位——审美这东西,人的最后一道把关短期内还是替不掉。

我想多补一句为什么这个「能自己看结果」的能力这么关键。过去 AI 生成视觉物料的最大痛点,不是「不会生成」,而是「生成完不知道自己做得丑」——它没有「回看」这一步,全靠你人肉挑错、来回喂反馈。现在把「渲染 → 检查 → 修正」这个闭环塞进模型自己的动作里,等于给它装了一只「眼睛」。对小团队来说,这意味着很多原本要专门找设计过一遍的物料,现在能先由 AI 自己收敛到「大差不差」的状态,人只需要在最后做审美和品牌层面的微调。省下的不是钱,是那些来回返工、反复对齐的碎时间——而对一个人干几个人活儿的创作者来说,时间往往比什么都金贵。

这也和前面 ChatGPT Work「交付成品」的定位对上了:一个真正能「交活」的智能体,光会写内容不够,还得会判断自己交出去的东西体不体面。GPT-5.6 在这块的进步,是让「AI 产出可以直接用」这句话,比上一代更接近真的。

八、价格结构背后的算盘:能力要打榜,成本要规模化

聊完能力,得算算账。我一直觉得,一个智能体强不强是「上限」问题,贵不贵才是「能不能落地」问题。

回顾一下三档定价(每百万 token):Sol 是输入 5 美元 / 输出 30 美元,Terra 是 2.5 / 15 美元,Luna 是 1 / 6 美元。这套结构释放的信号很清楚——OpenAI 不只想打旗舰性能,也想打规模化成本。

为什么成本这么关键?因为很多组织过去不是不想用高强度智能体,而是「用不起」。一个长任务跑下来,输入、输出、工具调用、反复修正,费用可能很快堆起来。一个粗略的单任务成本模型可以这样表示:

[

\text{单任务成本} \approx \text{输入tokens} \times \text{输入单价} + \text{输出tokens} \times \text{输出单价} + \text{工具调用与重试的额外开销}

]

举个直观的例子(数字仅为说明):假设一个中等复杂度的任务大约要处理 200 万输入 token、50 万输出 token。用 Sol 大致是 (2 \times 5 + 0.5 \times 30 = 25) 美元;换成 Terra 就是 (2 \times 2.5 + 0.5 \times 15 = 12.5) 美元;用 Luna 只要 (2 \times 1 + 0.5 \times 6 = 5) 美元。同一件事,三档之间差了整整五倍。这就是「分档」的真正用意:复杂难题交给 Sol,日常量产交给 Terra,高频轻活儿交给 Luna。

除了三档价格,GPT-5.6 还改了「提示词缓存」(prompt caching,简单说就是把重复用到的上下文缓存起来省钱)的计费方式:支持显式的缓存断点、缓存最短存活 30 分钟;缓存写入按未缓存输入单价的 1.25 倍计费,缓存读取则继续享受 90% 的折扣。这些细节对个人用户可能无感,但对要跑海量任务的团队,是实打实的成本杠杆。

缓存这块我再展开一句,因为它其实是省钱的「隐藏关卡」。所谓提示词缓存,就是把每次都要重

🔒
🔒 以下内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
👤
注册用户
可见 70%
社区精英
可见 100%
🛡️
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥5
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布4 篇
文章总数106 篇
昨日发布3 篇
本月发布14 篇
建站时间37 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站点公告

联系站长

微信:wyxs1638
AIGC技术社区
致力于解码 AIGC前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码