今天早上,
我们才刚写完:
Claude Opus 5.5
把一件 AI 工作的成本往下压。
到了今晚,
OpenAI 直接把同一场战争:
再往前推一步。
OpenAI 美国时间 9 月 22 日正式推出:
GPT-6 Sol
以及:
GPT-6 Luna。
如果只把它理解成:
「GPT-6 Astra 下面又多两个小模型。」
其实会错过真正重要的地方。
因为 OpenAI 这次主打的核心,
已经不是:
模型到底有多大。
而是:
同样一美元,究竟能完成多少真正的工作。
GPT-6 现在正式分成三个层级
最上面仍然是:
GPT-6 Astra。
OpenAI 目前仍把 Astra 定位成:
整个 GPT-6 Family
能力最完整的模型。
真正最困难、
最重要、
最不能妥协的工作,
仍然优先使用 Astra。
但问题是:
不是每封 Email、
每次文档整理、
每个 Bug
都需要:
Astra。
所以 OpenAI 往下补了两层。
中间:GPT-6 Sol
Sol 的定位是:
复杂日常工作。
例如:
Coding。
企业知识工作。
Computer Use。
跨 App Workflow。
长时间 Agent。
需要 Reasoning、
但又不值得每次都支付 Astra 成本的任务。
你可以把它理解成:
主力工作模型。
再往下:GPT-6 Luna
Luna 则更强调:
速度。
大量。
成本。
例如:
文档摘要。
数据抽取。
分类。
短问题。
大量 Clerical Work。
明确目标的重复任务。
也就是说,
GPT-6 Family 不再只回答:
「最强模型是哪一个?」
而开始回答:
「不同工作到底应该用哪一级能力?」
最直接的变化:Sol API 价格直接砍半
先看价格。
GPT-5.6 Sol:
每 100 万 Input Tokens:
4 美元。
Output:
20 美元。
GPT-6 Sol:
Input:
2 美元。
Output:
10 美元。
就是:
直接 50% 下修。
而且不是只有:
Input 便宜。
连通常比较昂贵的:
Output
也一起减半。
Luna 更便宜
GPT-5.6 Luna:
Input:
0.20 美元。
Output:
1.20 美元。
到了 GPT-6 Luna:
Input:
0.10 美元。
Output:
0.50 美元。
也就是说,
大量简单工作开始掉到:
非常低的 Token Cost。
这代表什么?
不是:
聊天变便宜一点。
而是原本企业可能觉得:
「这件工作每天跑几万次,用 AI 太贵。」
现在可能需要:
重新算一次。
OpenAI 为什么能再降价?
官方提到两个重要方向:
Inference Efficiency
以及:
Caching。
也就是:
不是单纯把模型价格表打折。
而是底层 Serving
也在努力让:
同一份 Compute
处理更多任务作。
Prompt 里已经处理过的 Context,
如果能更有效:
重复使用,
就不用每一次 Request
都重新算完整前缀。
这和今天 Claude Opus 5.5 讲的:
Prompt Cache
其实指向同一场战争。
AI 公司现在都开始发现:Context 重复计算太贵
Agent 工作愈来愈长。
一个 Agent 可能:
先读公司规则。
再读文档。
开网站。
做修改。
看结果。
重新修改。
每一轮都带着之前的 Context。
如果每一轮:
全部从头计算,
成本很快爆掉。
所以:
Cache
已经不再只是 API 工程师才会在意的小功能。
它正在变成:
AI Agent 能不能大规模商业化的核心。
OpenAI 甚至把 Benchmark 改成直接看 Cost per Task
这是今天最值得注意的地方。
以前模型发布最常看到:
Accuracy。
Score。
Pass Rate。
现在 OpenAI 开始直接告诉你:
这一件工作完成到底多少钱。
例如官方公布的:
AutomationBench。
这个测试让 AI Agent
跨:
Sales。
Marketing。
Operations。
Customer Support。
Finance。
HR
等实际企业工作,
使用:
47 种工具
完成 End-to-end Workflow。
GPT-6 Sol xhigh:一件任务约 0.27 美元
OpenAI 公布的结果中,
GPT-6 Sol:
xhigh Effort
在 AutomationBench 得分:
33.2%。
OpenAI 计算的:
Cost per Task
约:
0.27 美元。
同一张表里:
GPT-6 Astra Low
得分:
30.3%。
但每件工作的成本,
约为 Sol 的:
3.9 倍。
这并不是说:
Sol 全面比 Astra 强。
因为:
Effort Level 不同。
Benchmark 只代表:
这一组特定工作。
Astra 在其他最困难任务仍然是 OpenAI 的最高级模型。
但这个结果透露了一个很重要的产品策略:
不是每件工作都需要 Astra。
OpenAI 甚至直接拿 Claude 比
同一项 AutomationBench 中,
OpenAI 引用公开数据比较:
Claude Opus 5 Max:
26.9%。
成本约为 GPT-6 Sol xhigh:
11.1 倍。
Claude Fable 5.1
搭配 Opus 5 Fallback:
31.4%。
官方表示其成本:
超过 Sol 的:
8.9 倍。
但这里一定要非常小心。
这是:
OpenAI 自己发布的 Benchmark。
而且竞品:
模型版本。
Effort。
Fallback。
计费方式
都可能不同。
所以不能拿这张图直接下结论:
GPT-6 Sol 全面打败 Claude。
真正值得看的只是:
OpenAI 已经公开把竞争单位从:
Benchmark Score
拉向:
Score ÷ Cost。
早上的 Anthropic 其实也正在做完全相同的事
Claude Opus 5.5 今天最大的卖点之一,
就是:
典型工作负载成本
比 Opus 5 约降低:
40%。
Anthropic 甚至一直提醒:
不要只看:
Cost per Million Tokens。
要看:
Cost per Completed Task。
几个小时后,
OpenAI 也把:
Cost per Task
放进 GPT-6 的发布内核。
两家几乎同时传出:
同一个信号。
AI 的下一场模型战,开始变成经济学。
Coding 也开始比「能不能 Merge+要花多少钱」
OpenAI 添加的一项重点测试是:
FrontierCode。
它不是只问:
Code 能不能跑。
还会看:
Tests。
Scope Discipline。
Code Style。
Codebase Standards。
以及最后:
是不是接近:
可以 Merge。
因为真正企业 Coding Agent
最怕的不是:
AI 完全不会写。
而是:
Code 看起来可以,
结果人工还要花大量时间修。
如果模型便宜,
但每次都要 Senior Engineer
再花一小时,
仍然不便宜。
DeepSWE 上 Sol 已经逼近最高级 Claude
在 OpenAI 公布的:
DeepSWE 1.1
测试里,
GPT-6 Sol Max:
68.8%。
Claude Fable 5 xhigh:
69.9%。
差:
1.1 Percentage Points。
OpenAI 计算,
Sol 的 Cost per Task
约低:
80%。
同样,
这是 OpenAI 依公开竞品结果做出的比较,
不能直接推成:
所有 Coding Workload 都便宜 80%。
但它说明:
「较便宜模型只能做简单工作」
这个假设正在快速失效。
Luna 更有意思
GPT-6 Luna Max
在同一项 DeepSWE:
66.6%。
OpenAI 表示,
已经接近:
Claude Opus 5
与:
Claude Fable 5
部分 Medium Effort 表现。
但 Cost per Task
比 Opus 5:
低约 93%。
比 Fable 5:
低约 96%。
如果未来第三方测试能证明:
这类差距在真实工作也存在,
它的冲击可能非常大。
因为大量公司真正需要的,
根本不是:
「世界最强 Coding Model。」
而是:
「每天能便宜跑 1,000 次,而且大部分都够好。」
Computer Use 也进入价格战
GPT-6 Astra
目前仍然是 OpenAI 最强的:
Computer Use Model。
但是在:
OSWorld 2.0 Offline
这类模拟电脑操作测试里,
GPT-6 Sol xhigh:
60.5%。
Claude Opus 5 Medium:
60.3%。
OpenAI 表示,
Sol 每件任务成本大约低:
80%。
而 GPT-6 Luna Max
则能超过:
GPT-5.6 Sol Medium,
成本只有大约:
十分之一。
这表示未来 Computer Use
最重要的突破可能不是:
再多做一个 App。
而是:
让一个 Agent 每天操作几百次电脑也付得起。
Agent 真正普及,首先要解决「太贵」
假设 AI Agent 帮公司:
一天整理一封 Email。
成本几乎没人在乎。
但如果它:
一天处理:
10,000 张单据。
5,000 个 Leads。
2,000 个 Support Tickets。
几百个网站流程。
Cost per Task
只差:
0.10 美元,
一天可能就差:
上千美元。
一年:
几十万美元。
所以当 AI 从:
Chatbot
变成:
Digital Worker,
Price
就突然变成产品能力的一部分。
Factuality 也是另一个很重要的成本
模型答错,
不只是:
品质问题。
还是:
成本问题。
因为答错之后:
人要检查。
重新问。
补数据。
重跑一次。
所以 OpenAI 这次也特别强调:
GPT-6 Sol
在一套根据:
用户曾回报错误的真实 Conversation
创建的内部 Factuality Evaluation 中,
错误大约只有:
GPT-5.6 Sol 的:
一半。
但官方也明确提醒:
这些是刻意挑选曾经容易出错的 Conversation,
不是一般使用中:
整体错误率。
所以不能写成:
「GPT-6 Sol 幻觉减少 50%。」
比较准确的是:
在 OpenAI 这套特定错误诱发测试里,错误数约减半。
Luna 高 Effort 甚至逼近旧 Sol
OpenAI 还表示:
GPT-6 Luna
在较高 Effort 下,
这项 Factuality Test
可以接近:
GPT-5.6 Sol,
但成本只有:
大约百分之一。
如果成立,
这代表很多以前必须交给:
中高级模型
才能可靠处理的工作,
可能开始下放给:
更便宜的 Model Tier。
这才是真正的:
Model Compression 商业化。
不是模型文件变小而已。
而是:
同一能力层级的价格往下掉。
Sol 和 Luna 不是把 Astra 淘汰
这点非常重要。
OpenAI 官方说得很清楚:
GPT-6 Astra 仍然是整体最强模型。
真正最重要的 Project、
最困难的 Research、
最复杂 Computer Use、
最不能失败的任务,
Astra 仍然有位置。
新的策略比较像:
简单大量:
Luna。
复杂日常:
Sol。
极难少量:
Astra。
这和今天下午我们写 Claude 商业案例时,
讲的:
Model Routing
几乎完全一致。
模型管理开始像公司的人力配置
不会因为公司里有:
最资深工程师,
就让他每天:
整理 Excel。
找文件。
回所有简单 Email。
同样,
有 Astra
不代表:
每一件事都应该用 Astra。
未来企业可能会把 AI Task
自动 Routing:
分类:
Luna。
一般处理:
Sol。
遇到困难:
升 Astra。
完成:
再降下来。
AI Model Portfolio
开始变得像:
人力分级。
对一般 ChatGPT 用户会发生什么?
在发布时,
OpenAI 先让:
GPT-6 Sol
和:
GPT-6 Luna
进入:
ChatGPT Work。
Codex。
以及:
API。
符合资格的付费方案开始分批取得。
Free 与 Go 用户则可在 Desktop App
使用:
GPT-6 Luna。
一般 ChatGPT 界面则采:
逐步 Rollout。
所以:
如果今天还没看到,
不代表产品没有发布。
可能只是:
还没有 Roll 到你的帐号。
这次还有一个很实际的改变:Usage Limit 可以更高
模型 Serving
变便宜之后,
OpenAI 不只降低 API Price。
也代表:
同样 Compute Budget
可以让用户:
跑更多。
所以官方强调:
Sol/Luna
会带来:
Higher Usage Limits
以及:
More Room to Iterate。
这其实可能比:
Benchmark 多三分
更直接有感。
因为对真正每天使用 AI 的人来说,
最恼人的不是:
模型少会一道数学题。
而是:
工作做到一半撞 Usage Limit。
这也是为什么「50% 降价」比看起来更重要
如果一个模型只拿来:
每天聊十次,
Input 从 4 美元变 2 美元
你几乎感觉不到。
但如果一个公司:
把它放在 Agent Workflow
里一直跑,
就完全不同。
例如原本每月:
20 万美元 API Bill。
同样 Task Volume
理论上只因 List Price:
就可能大幅下降。
或者公司不省这笔钱,
而是:
让 AI 多做一倍工作。
这就是价格战真正产生的影响。
但现在还不能宣布「AI 成本直接减半」
因为 Token Price 降 50%
不等于:
你的 Final Task Cost
一定降 50%。
模型可能:
Thinking 更多。
Tool Call 更多。
Output 更多。
Workflow 不同。
甚至因为:
新模型能力更强,
公司反而开始交给它:
以前不敢交的更复杂任务。
最后帐单:
可能没有减少。
所以真正应该看的仍然是:
Cost per Completed Task。
这也是 OpenAI 和 Anthropic 今天最奇妙的共同点
Anthropic:
Opus 5.5。
OpenAI:
GPT-6 Sol/Luna。
两边的发布内容,
都花大量篇幅告诉你:
不要只看模型价格。
要看:
一件真正工作:
做完多少钱。
需要几轮。
会不会失败。
有没有重做。
多少 Context 可以 Cache。
这表示 Frontier AI
正在跨进新的成熟阶段。
以前:
能力第一。
现在:
能力/成本比。
这场价格战也会逼其他模型公司跟进
如果:
高级能力
可以越来越快往:
中价模型
甚至低价模型
下放,
竞争压力就会直接传到:
Google。
Meta。
Alibaba。
DeepSeek。
Mistral。
以及其他模型供应商。
因为企业采购最后会问:
不是:
「你 Benchmark 世界第几?」
而是:
「我每月有 500 万个 Tasks,你能多少钱完成?」
这个问题比:
Leaderboard
残酷很多。
开源模型也会感受到压力
Open-weight Model
很大一个吸引力是:
成本。
可以自己部署。
不用永远付 Frontier API 的高额价格。
但如果 Frontier Model API
一直降价,
企业就必须重新算:
自己买 GPU。
维护 Infrastructure。
更新 Model。
监控安全。
和:
直接付 API
哪个更便宜。
所以模型降价,
甚至可能改变:
Local AI。
Cloud AI。
Open-weight AI
彼此之间的经济平衡。
但最便宜不一定最后会赢
便宜只是:
一个维度。
企业还要看:
Reliability。
Latency。
Privacy。
Data Residency。
Security。
Tool Ecosystem。
Vendor Lock-in。
Availability。
Model Stability。
以及:
最重要的:
最后人工到底要修多少。
如果一个模型:
便宜 70%,
但员工每次都要花:
多 20 分钟 Review,
未必划算。
AI 采购开始变成:
真正的 Operations Question。
最后回头看今天早上,就会发现这一天很特别
今天早上:
Anthropic 告诉市场:
Claude Opus 5.5
每件工作成本可以大幅下降。
今天晚上:
OpenAI 又把:
GPT-6 Sol/Luna
直接往下砍价。
同一天,
两家前沿 AI 公司都没有把主要消息停在:
「我们更聪明。」
而是开始说:
「我们可以更便宜地完成工作。」
这可能是 AI 产业接下来最重要的转折之一。
当 Intelligence 本身变得愈来愈充足,
真正稀缺的就会变成:
每一美元能买到多少可靠工作。
所以 GPT-6 Sol/Luna
真正重要的地方,
不是 OpenAI 又多了两个 Model Name。
而是:
前沿 AI 正开始从:
能力竞赛
进入:
效率竞赛。
最后真正赢的,
未必只是:
Benchmark 最高的人。
而可能是:
能用最低的总成本,把最多真实工作稳定完成的人。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/09/13:GPT-6 Astra 进 ChatGPT Work/Codex,没有 API 的旧系统也能直接操作
AI 一分钟教学|2026/09/13:Astra 操作电脑前,先写「允许做/一定停/完成后回报」三格权限卡
AI 今日早报|2026/08/22:OpenAI 把 GPT-5.6 Sol API 降价逾 20%、AI 基建债务暴增至 2,200 亿美元、Nvidia 再投数据中心电力开发商