今天早上,

我们才刚写完:

Claude Opus 5.5

把一件 AI 工作的成本往下压。

到了今晚,

OpenAI 直接把同一场战争:

再往前推一步。

OpenAI 美国时间 9 月 22 日正式推出:

GPT-6 Sol

以及:

GPT-6 Luna。

如果只把它理解成:

「GPT-6 Astra 下面又多两个小模型。」

其实会错过真正重要的地方。

因为 OpenAI 这次主打的核心,

已经不是:

模型到底有多大。

而是:

同样一美元,究竟能完成多少真正的工作。

GPT-6 现在正式分成三个层级

最上面仍然是:

GPT-6 Astra。

OpenAI 目前仍把 Astra 定位成:

整个 GPT-6 Family

能力最完整的模型。

真正最困难、

最重要、

最不能妥协的工作,

仍然优先使用 Astra。

但问题是:

不是每封 Email、

每次文档整理、

每个 Bug

都需要:

Astra。

所以 OpenAI 往下补了两层。

中间:GPT-6 Sol

Sol 的定位是:

复杂日常工作。

例如:

Coding。

企业知识工作。

Computer Use。

跨 App Workflow。

长时间 Agent。

需要 Reasoning、

但又不值得每次都支付 Astra 成本的任务。

你可以把它理解成:

主力工作模型。

再往下:GPT-6 Luna

Luna 则更强调:

速度。

大量。

成本。

例如:

文档摘要。

数据抽取。

分类。

短问题。

大量 Clerical Work。

明确目标的重复任务。

也就是说,

GPT-6 Family 不再只回答:

「最强模型是哪一个?」

而开始回答:

「不同工作到底应该用哪一级能力?」

最直接的变化:Sol API 价格直接砍半

先看价格。

GPT-5.6 Sol:

每 100 万 Input Tokens:

4 美元。

Output:

20 美元。

GPT-6 Sol:

Input:

2 美元。

Output:

10 美元。

就是:

直接 50% 下修。

而且不是只有:

Input 便宜。

连通常比较昂贵的:

Output

也一起减半。

Luna 更便宜

GPT-5.6 Luna:

Input:

0.20 美元。

Output:

1.20 美元。

到了 GPT-6 Luna:

Input:

0.10 美元。

Output:

0.50 美元。

也就是说,

大量简单工作开始掉到:

非常低的 Token Cost。

这代表什么?

不是:

聊天变便宜一点。

而是原本企业可能觉得:

「这件工作每天跑几万次,用 AI 太贵。」

现在可能需要:

重新算一次。

OpenAI 为什么能再降价?

官方提到两个重要方向:

Inference Efficiency

以及:

Caching。

也就是:

不是单纯把模型价格表打折。

而是底层 Serving

也在努力让:

同一份 Compute

处理更多任务作。

Prompt 里已经处理过的 Context,

如果能更有效:

重复使用,

就不用每一次 Request

都重新算完整前缀。

这和今天 Claude Opus 5.5 讲的:

Prompt Cache

其实指向同一场战争。

AI 公司现在都开始发现:Context 重复计算太贵

Agent 工作愈来愈长。

一个 Agent 可能:

先读公司规则。

再读文档。

开网站。

做修改。

看结果。

重新修改。

每一轮都带着之前的 Context。

如果每一轮:

全部从头计算,

成本很快爆掉。

所以:

Cache

已经不再只是 API 工程师才会在意的小功能。

它正在变成:

AI Agent 能不能大规模商业化的核心。

OpenAI 甚至把 Benchmark 改成直接看 Cost per Task

这是今天最值得注意的地方。

以前模型发布最常看到:

Accuracy。

Score。

Pass Rate。

现在 OpenAI 开始直接告诉你:

这一件工作完成到底多少钱。

例如官方公布的:

AutomationBench。

这个测试让 AI Agent

跨:

Sales。

Marketing。

Operations。

Customer Support。

Finance。

HR

等实际企业工作,

使用:

47 种工具

完成 End-to-end Workflow。

GPT-6 Sol xhigh:一件任务约 0.27 美元

OpenAI 公布的结果中,

GPT-6 Sol:

xhigh Effort

在 AutomationBench 得分:

33.2%。

OpenAI 计算的:

Cost per Task

约:

0.27 美元。

同一张表里:

GPT-6 Astra Low

得分:

30.3%。

但每件工作的成本,

约为 Sol 的:

3.9 倍。

这并不是说:

Sol 全面比 Astra 强。

因为:

Effort Level 不同。

Benchmark 只代表:

这一组特定工作。

Astra 在其他最困难任务仍然是 OpenAI 的最高级模型。

但这个结果透露了一个很重要的产品策略:

不是每件工作都需要 Astra。

OpenAI 甚至直接拿 Claude 比

同一项 AutomationBench 中,

OpenAI 引用公开数据比较:

Claude Opus 5 Max:

26.9%。

成本约为 GPT-6 Sol xhigh:

11.1 倍。

Claude Fable 5.1

搭配 Opus 5 Fallback:

31.4%。

官方表示其成本:

超过 Sol 的:

8.9 倍。

但这里一定要非常小心。

这是:

OpenAI 自己发布的 Benchmark。

而且竞品:

模型版本。

Effort。

Fallback。

计费方式

都可能不同。

所以不能拿这张图直接下结论:

GPT-6 Sol 全面打败 Claude。

真正值得看的只是:

OpenAI 已经公开把竞争单位从:

Benchmark Score

拉向:

Score ÷ Cost。

早上的 Anthropic 其实也正在做完全相同的事

Claude Opus 5.5 今天最大的卖点之一,

就是:

典型工作负载成本

比 Opus 5 约降低:

40%。

Anthropic 甚至一直提醒:

不要只看:

Cost per Million Tokens。

要看:

Cost per Completed Task。

几个小时后,

OpenAI 也把:

Cost per Task

放进 GPT-6 的发布内核。

两家几乎同时传出:

同一个信号。

AI 的下一场模型战,开始变成经济学。

Coding 也开始比「能不能 Merge+要花多少钱」

OpenAI 添加的一项重点测试是:

FrontierCode。

它不是只问:

Code 能不能跑。

还会看:

Tests。

Scope Discipline。

Code Style。

Codebase Standards。

以及最后:

是不是接近:

可以 Merge。

因为真正企业 Coding Agent

最怕的不是:

AI 完全不会写。

而是:

Code 看起来可以,

结果人工还要花大量时间修。

如果模型便宜,

但每次都要 Senior Engineer

再花一小时,

仍然不便宜。

DeepSWE 上 Sol 已经逼近最高级 Claude

在 OpenAI 公布的:

DeepSWE 1.1

测试里,

GPT-6 Sol Max:

68.8%。

Claude Fable 5 xhigh:

69.9%。

差:

1.1 Percentage Points。

OpenAI 计算,

Sol 的 Cost per Task

约低:

80%。

同样,

这是 OpenAI 依公开竞品结果做出的比较,

不能直接推成:

所有 Coding Workload 都便宜 80%。

但它说明:

「较便宜模型只能做简单工作」

这个假设正在快速失效。

Luna 更有意思

GPT-6 Luna Max

在同一项 DeepSWE:

66.6%。

OpenAI 表示,

已经接近:

Claude Opus 5

与:

Claude Fable 5

部分 Medium Effort 表现。

但 Cost per Task

比 Opus 5:

低约 93%。

比 Fable 5:

低约 96%。

如果未来第三方测试能证明:

这类差距在真实工作也存在,

它的冲击可能非常大。

因为大量公司真正需要的,

根本不是:

「世界最强 Coding Model。」

而是:

「每天能便宜跑 1,000 次,而且大部分都够好。」

Computer Use 也进入价格战

GPT-6 Astra

目前仍然是 OpenAI 最强的:

Computer Use Model。

但是在:

OSWorld 2.0 Offline

这类模拟电脑操作测试里,

GPT-6 Sol xhigh:

60.5%。

Claude Opus 5 Medium:

60.3%。

OpenAI 表示,

Sol 每件任务成本大约低:

80%。

而 GPT-6 Luna Max

则能超过:

GPT-5.6 Sol Medium,

成本只有大约:

十分之一。

这表示未来 Computer Use

最重要的突破可能不是:

再多做一个 App。

而是:

让一个 Agent 每天操作几百次电脑也付得起。

Agent 真正普及,首先要解决「太贵」

假设 AI Agent 帮公司:

一天整理一封 Email。

成本几乎没人在乎。

但如果它:

一天处理:

10,000 张单据。

5,000 个 Leads。

2,000 个 Support Tickets。

几百个网站流程。

Cost per Task

只差:

0.10 美元,

一天可能就差:

上千美元。

一年:

几十万美元。

所以当 AI 从:

Chatbot

变成:

Digital Worker,

Price

就突然变成产品能力的一部分。

Factuality 也是另一个很重要的成本

模型答错,

不只是:

品质问题。

还是:

成本问题。

因为答错之后:

人要检查。

重新问。

补数据。

重跑一次。

所以 OpenAI 这次也特别强调:

GPT-6 Sol

在一套根据:

用户曾回报错误的真实 Conversation

创建的内部 Factuality Evaluation 中,

错误大约只有:

GPT-5.6 Sol 的:

一半。

但官方也明确提醒:

这些是刻意挑选曾经容易出错的 Conversation,

不是一般使用中:

整体错误率。

所以不能写成:

「GPT-6 Sol 幻觉减少 50%。」

比较准确的是:

在 OpenAI 这套特定错误诱发测试里,错误数约减半。

Luna 高 Effort 甚至逼近旧 Sol

OpenAI 还表示:

GPT-6 Luna

在较高 Effort 下,

这项 Factuality Test

可以接近:

GPT-5.6 Sol,

但成本只有:

大约百分之一。

如果成立,

这代表很多以前必须交给:

中高级模型

才能可靠处理的工作,

可能开始下放给:

更便宜的 Model Tier。

这才是真正的:

Model Compression 商业化。

不是模型文件变小而已。

而是:

同一能力层级的价格往下掉。

Sol 和 Luna 不是把 Astra 淘汰

这点非常重要。

OpenAI 官方说得很清楚:

GPT-6 Astra 仍然是整体最强模型。

真正最重要的 Project、

最困难的 Research、

最复杂 Computer Use、

最不能失败的任务,

Astra 仍然有位置。

新的策略比较像:

简单大量:

Luna。

复杂日常:

Sol。

极难少量:

Astra。

这和今天下午我们写 Claude 商业案例时,

讲的:

Model Routing

几乎完全一致。

模型管理开始像公司的人力配置

不会因为公司里有:

最资深工程师,

就让他每天:

整理 Excel。

找文件。

回所有简单 Email。

同样,

有 Astra

不代表:

每一件事都应该用 Astra。

未来企业可能会把 AI Task

自动 Routing:

分类:

Luna。

一般处理:

Sol。

遇到困难:

升 Astra。

完成:

再降下来。

AI Model Portfolio

开始变得像:

人力分级。

对一般 ChatGPT 用户会发生什么?

在发布时,

OpenAI 先让:

GPT-6 Sol

和:

GPT-6 Luna

进入:

ChatGPT Work。

Codex。

以及:

API。

符合资格的付费方案开始分批取得。

Free 与 Go 用户则可在 Desktop App

使用:

GPT-6 Luna。

一般 ChatGPT 界面则采:

逐步 Rollout。

所以:

如果今天还没看到,

不代表产品没有发布。

可能只是:

还没有 Roll 到你的帐号。

这次还有一个很实际的改变:Usage Limit 可以更高

模型 Serving

变便宜之后,

OpenAI 不只降低 API Price。

也代表:

同样 Compute Budget

可以让用户:

跑更多。

所以官方强调:

Sol/Luna

会带来:

Higher Usage Limits

以及:

More Room to Iterate。

这其实可能比:

Benchmark 多三分

更直接有感。

因为对真正每天使用 AI 的人来说,

最恼人的不是:

模型少会一道数学题。

而是:

工作做到一半撞 Usage Limit。

这也是为什么「50% 降价」比看起来更重要

如果一个模型只拿来:

每天聊十次,

Input 从 4 美元变 2 美元

你几乎感觉不到。

但如果一个公司:

把它放在 Agent Workflow

里一直跑,

就完全不同。

例如原本每月:

20 万美元 API Bill。

同样 Task Volume

理论上只因 List Price:

就可能大幅下降。

或者公司不省这笔钱,

而是:

让 AI 多做一倍工作。

这就是价格战真正产生的影响。

但现在还不能宣布「AI 成本直接减半」

因为 Token Price 降 50%

不等于:

你的 Final Task Cost

一定降 50%。

模型可能:

Thinking 更多。

Tool Call 更多。

Output 更多。

Workflow 不同。

甚至因为:

新模型能力更强,

公司反而开始交给它:

以前不敢交的更复杂任务。

最后帐单:

可能没有减少。

所以真正应该看的仍然是:

Cost per Completed Task。

这也是 OpenAI 和 Anthropic 今天最奇妙的共同点

Anthropic:

Opus 5.5。

OpenAI:

GPT-6 Sol/Luna。

两边的发布内容,

都花大量篇幅告诉你:

不要只看模型价格。

要看:

一件真正工作:

做完多少钱。

需要几轮。

会不会失败。

有没有重做。

多少 Context 可以 Cache。

这表示 Frontier AI

正在跨进新的成熟阶段。

以前:

能力第一。

现在:

能力/成本比。

这场价格战也会逼其他模型公司跟进

如果:

高级能力

可以越来越快往:

中价模型

甚至低价模型

下放,

竞争压力就会直接传到:

Google。

Meta。

Alibaba。

DeepSeek。

Mistral。

以及其他模型供应商。

因为企业采购最后会问:

不是:

「你 Benchmark 世界第几?」

而是:

「我每月有 500 万个 Tasks,你能多少钱完成?」

这个问题比:

Leaderboard

残酷很多。

开源模型也会感受到压力

Open-weight Model

很大一个吸引力是:

成本。

可以自己部署。

不用永远付 Frontier API 的高额价格。

但如果 Frontier Model API

一直降价,

企业就必须重新算:

自己买 GPU。

维护 Infrastructure。

更新 Model。

监控安全。

和:

直接付 API

哪个更便宜。

所以模型降价,

甚至可能改变:

Local AI。

Cloud AI。

Open-weight AI

彼此之间的经济平衡。

但最便宜不一定最后会赢

便宜只是:

一个维度。

企业还要看:

Reliability。

Latency。

Privacy。

Data Residency。

Security。

Tool Ecosystem。

Vendor Lock-in。

Availability。

Model Stability。

以及:

最重要的:

最后人工到底要修多少。

如果一个模型:

便宜 70%,

但员工每次都要花:

多 20 分钟 Review,

未必划算。

AI 采购开始变成:

真正的 Operations Question。

最后回头看今天早上,就会发现这一天很特别

今天早上:

Anthropic 告诉市场:

Claude Opus 5.5

每件工作成本可以大幅下降。

今天晚上:

OpenAI 又把:

GPT-6 Sol/Luna

直接往下砍价。

同一天,

两家前沿 AI 公司都没有把主要消息停在:

「我们更聪明。」

而是开始说:

「我们可以更便宜地完成工作。」

这可能是 AI 产业接下来最重要的转折之一。

当 Intelligence 本身变得愈来愈充足,

真正稀缺的就会变成:

每一美元能买到多少可靠工作。

所以 GPT-6 Sol/Luna

真正重要的地方,

不是 OpenAI 又多了两个 Model Name。

而是:

前沿 AI 正开始从:

能力竞赛

进入:

效率竞赛。

最后真正赢的,

未必只是:

Benchmark 最高的人。

而可能是:

能用最低的总成本,把最多真实工作稳定完成的人。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/09/13:GPT-6 Astra 进 ChatGPT Work/Codex,没有 API 的旧系统也能直接操作

AI 一分钟教学|2026/09/13:Astra 操作电脑前,先写「允许做/一定停/完成后回报」三格权限卡

AI 今日早报|2026/08/22:OpenAI 把 GPT-5.6 Sol API 降价逾 20%、AI 基建债务暴增至 2,200 亿美元、Nvidia 再投数据中心电力开发商