今天早上,
我們才剛寫完:
Claude Opus 5.5
把一件 AI 工作的成本往下壓。
到了今晚,
OpenAI 直接把同一場戰爭:
再往前推一步。
OpenAI 美國時間 9 月 22 日正式推出:
GPT-6 Sol
以及:
GPT-6 Luna。
如果只把它理解成:
「GPT-6 Astra 下面又多兩個小模型。」
其實會錯過真正重要的地方。
因為 OpenAI 這次主打的核心,
已經不是:
模型到底有多大。
而是:
同樣一美元,究竟能完成多少真正的工作。
GPT-6 現在正式分成三個層級
最上面仍然是:
GPT-6 Astra。
OpenAI 目前仍把 Astra 定位成:
整個 GPT-6 Family
能力最完整的模型。
真正最困難、
最重要、
最不能妥協的工作,
仍然優先使用 Astra。
但問題是:
不是每封 Email、
每次文件整理、
每個 Bug
都需要:
Astra。
所以 OpenAI 往下補了兩層。
中間:GPT-6 Sol
Sol 的定位是:
複雜日常工作。
例如:
Coding。
企業知識工作。
Computer Use。
跨 App Workflow。
長時間 Agent。
需要 Reasoning、
但又不值得每次都支付 Astra 成本的任務。
你可以把它理解成:
主力工作模型。
再往下:GPT-6 Luna
Luna 則更強調:
速度。
大量。
成本。
例如:
文件摘要。
資料抽取。
分類。
短問題。
大量 Clerical Work。
明確目標的重複任務。
也就是說,
GPT-6 Family 不再只回答:
「最強模型是哪一個?」
而開始回答:
「不同工作到底應該用哪一級能力?」
最直接的變化:Sol API 價格直接砍半
先看價格。
GPT-5.6 Sol:
每 100 萬 Input Tokens:
4 美元。
Output:
20 美元。
GPT-6 Sol:
Input:
2 美元。
Output:
10 美元。
就是:
直接 50% 下修。
而且不是只有:
Input 便宜。
連通常比較昂貴的:
Output
也一起減半。
Luna 更便宜
GPT-5.6 Luna:
Input:
0.20 美元。
Output:
1.20 美元。
到了 GPT-6 Luna:
Input:
0.10 美元。
Output:
0.50 美元。
也就是說,
大量簡單工作開始掉到:
非常低的 Token Cost。
這代表什麼?
不是:
聊天變便宜一點。
而是原本企業可能覺得:
「這件工作每天跑幾萬次,用 AI 太貴。」
現在可能需要:
重新算一次。
OpenAI 為什麼能再降價?
官方提到兩個重要方向:
Inference Efficiency
以及:
Caching。
也就是:
不是單純把模型價格表打折。
而是底層 Serving
也在努力讓:
同一份 Compute
處理更多工作。
Prompt 裡已經處理過的 Context,
如果能更有效:
重複使用,
就不用每一次 Request
都重新算完整前綴。
這和今天 Claude Opus 5.5 講的:
Prompt Cache
其實指向同一場戰爭。
AI 公司現在都開始發現:Context 重複計算太貴
Agent 工作愈來愈長。
一個 Agent 可能:
先讀公司規則。
再讀文件。
開網站。
做修改。
看結果。
重新修改。
每一輪都帶著之前的 Context。
如果每一輪:
全部從頭計算,
成本很快爆掉。
所以:
Cache
已經不再只是 API 工程師才會在意的小功能。
它正在變成:
AI Agent 能不能大規模商業化的核心。
OpenAI 甚至把 Benchmark 改成直接看 Cost per Task
這是今天最值得注意的地方。
以前模型發布最常看到:
Accuracy。
Score。
Pass Rate。
現在 OpenAI 開始直接告訴你:
這一件工作完成到底多少錢。
例如官方公布的:
AutomationBench。
這個測試讓 AI Agent
跨:
Sales。
Marketing。
Operations。
Customer Support。
Finance。
HR
等實際企業工作,
使用:
47 種工具
完成 End-to-end Workflow。
GPT-6 Sol xhigh:一件任務約 0.27 美元
OpenAI 公布的結果中,
GPT-6 Sol:
xhigh Effort
在 AutomationBench 得分:
33.2%。
OpenAI 計算的:
Cost per Task
約:
0.27 美元。
同一張表裡:
GPT-6 Astra Low
得分:
30.3%。
但每件工作的成本,
約為 Sol 的:
3.9 倍。
這並不是說:
Sol 全面比 Astra 強。
因為:
Effort Level 不同。
Benchmark 只代表:
這一組特定工作。
Astra 在其他最困難任務仍然是 OpenAI 的最高階模型。
但這個結果透露了一個很重要的產品策略:
不是每件工作都需要 Astra。
OpenAI 甚至直接拿 Claude 比
同一項 AutomationBench 中,
OpenAI 引用公開數據比較:
Claude Opus 5 Max:
26.9%。
成本約為 GPT-6 Sol xhigh:
11.1 倍。
Claude Fable 5.1
搭配 Opus 5 Fallback:
31.4%。
官方表示其成本:
超過 Sol 的:
8.9 倍。
但這裡一定要非常小心。
這是:
OpenAI 自己發布的 Benchmark。
而且競品:
模型版本。
Effort。
Fallback。
計費方式
都可能不同。
所以不能拿這張圖直接下結論:
GPT-6 Sol 全面打敗 Claude。
真正值得看的只是:
OpenAI 已經公開把競爭單位從:
Benchmark Score
拉向:
Score ÷ Cost。
早上的 Anthropic 其實也正在做完全相同的事
Claude Opus 5.5 今天最大的賣點之一,
就是:
典型工作負載成本
比 Opus 5 約降低:
40%。
Anthropic 甚至一直提醒:
不要只看:
Cost per Million Tokens。
要看:
Cost per Completed Task。
幾個小時後,
OpenAI 也把:
Cost per Task
放進 GPT-6 的發布核心。
兩家幾乎同時傳出:
同一個訊號。
AI 的下一場模型戰,開始變成經濟學。
Coding 也開始比「能不能 Merge+要花多少錢」
OpenAI 新增的一項重點測試是:
FrontierCode。
它不是只問:
Code 能不能跑。
還會看:
Tests。
Scope Discipline。
Code Style。
Codebase Standards。
以及最後:
是不是接近:
可以 Merge。
因為真正企業 Coding Agent
最怕的不是:
AI 完全不會寫。
而是:
Code 看起來可以,
結果人工還要花大量時間修。
如果模型便宜,
但每次都要 Senior Engineer
再花一小時,
仍然不便宜。
DeepSWE 上 Sol 已經逼近最高階 Claude
在 OpenAI 公布的:
DeepSWE 1.1
測試裡,
GPT-6 Sol Max:
68.8%。
Claude Fable 5 xhigh:
69.9%。
差:
1.1 Percentage Points。
OpenAI 計算,
Sol 的 Cost per Task
約低:
80%。
同樣,
這是 OpenAI 依公開競品結果做出的比較,
不能直接推成:
所有 Coding Workload 都便宜 80%。
但它說明:
「較便宜模型只能做簡單工作」
這個假設正在快速失效。
Luna 更有意思
GPT-6 Luna Max
在同一項 DeepSWE:
66.6%。
OpenAI 表示,
已經接近:
Claude Opus 5
與:
Claude Fable 5
部分 Medium Effort 表現。
但 Cost per Task
比 Opus 5:
低約 93%。
比 Fable 5:
低約 96%。
如果未來第三方測試能證明:
這類差距在真實工作也存在,
它的衝擊可能非常大。
因為大量公司真正需要的,
根本不是:
「世界最強 Coding Model。」
而是:
「每天能便宜跑 1,000 次,而且大部分都夠好。」
Computer Use 也進入價格戰
GPT-6 Astra
目前仍然是 OpenAI 最強的:
Computer Use Model。
但是在:
OSWorld 2.0 Offline
這類模擬電腦操作測試裡,
GPT-6 Sol xhigh:
60.5%。
Claude Opus 5 Medium:
60.3%。
OpenAI 表示,
Sol 每件任務成本大約低:
80%。
而 GPT-6 Luna Max
則能超過:
GPT-5.6 Sol Medium,
成本只有大約:
十分之一。
這表示未來 Computer Use
最重要的突破可能不是:
再多做一個 App。
而是:
讓一個 Agent 每天操作幾百次電腦也付得起。
Agent 真正普及,首先要解決「太貴」
假設 AI Agent 幫公司:
一天整理一封 Email。
成本幾乎沒人在乎。
但如果它:
一天處理:
10,000 張單據。
5,000 個 Leads。
2,000 個 Support Tickets。
幾百個網站流程。
Cost per Task
只差:
0.10 美元,
一天可能就差:
上千美元。
一年:
幾十萬美元。
所以當 AI 從:
Chatbot
變成:
Digital Worker,
Price
就突然變成產品能力的一部分。
Factuality 也是另一個很重要的成本
模型答錯,
不只是:
品質問題。
還是:
成本問題。
因為答錯之後:
人要檢查。
重新問。
補資料。
重跑一次。
所以 OpenAI 這次也特別強調:
GPT-6 Sol
在一套根據:
使用者曾回報錯誤的真實 Conversation
建立的內部 Factuality Evaluation 中,
錯誤大約只有:
GPT-5.6 Sol 的:
一半。
但官方也明確提醒:
這些是刻意挑選曾經容易出錯的 Conversation,
不是一般使用中:
整體錯誤率。
所以不能寫成:
「GPT-6 Sol 幻覺減少 50%。」
比較準確的是:
在 OpenAI 這套特定錯誤誘發測試裡,錯誤數約減半。
Luna 高 Effort 甚至逼近舊 Sol
OpenAI 還表示:
GPT-6 Luna
在較高 Effort 下,
這項 Factuality Test
可以接近:
GPT-5.6 Sol,
但成本只有:
大約百分之一。
如果成立,
這代表很多以前必須交給:
中高階模型
才能可靠處理的工作,
可能開始下放給:
更便宜的 Model Tier。
這才是真正的:
Model Compression 商業化。
不是模型檔案變小而已。
而是:
同一能力層級的價格往下掉。
Sol 和 Luna 不是把 Astra 淘汰
這點非常重要。
OpenAI 官方說得很清楚:
GPT-6 Astra 仍然是整體最強模型。
真正最重要的 Project、
最困難的 Research、
最複雜 Computer Use、
最不能失敗的任務,
Astra 仍然有位置。
新的策略比較像:
簡單大量:
Luna。
複雜日常:
Sol。
極難少量:
Astra。
這和今天下午我們寫 Claude 商業案例時,
講的:
Model Routing
幾乎完全一致。
模型管理開始像公司的人力配置
不會因為公司裡有:
最資深工程師,
就讓他每天:
整理 Excel。
找檔案。
回所有簡單 Email。
同樣,
有 Astra
不代表:
每一件事都應該用 Astra。
未來企業可能會把 AI Task
自動 Routing:
分類:
Luna。
一般處理:
Sol。
遇到困難:
升 Astra。
完成:
再降下來。
AI Model Portfolio
開始變得像:
人力分級。
對一般 ChatGPT 使用者會發生什麼?
在發布時,
OpenAI 先讓:
GPT-6 Sol
和:
GPT-6 Luna
進入:
ChatGPT Work。
Codex。
以及:
API。
符合資格的付費方案開始分批取得。
Free 與 Go 使用者則可在 Desktop App
使用:
GPT-6 Luna。
一般 ChatGPT 介面則採:
逐步 Rollout。
所以:
如果今天還沒看到,
不代表產品沒有發布。
可能只是:
還沒有 Roll 到你的帳號。
這次還有一個很實際的改變:Usage Limit 可以更高
模型 Serving
變便宜之後,
OpenAI 不只降低 API Price。
也代表:
同樣 Compute Budget
可以讓使用者:
跑更多。
所以官方強調:
Sol/Luna
會帶來:
Higher Usage Limits
以及:
More Room to Iterate。
這其實可能比:
Benchmark 多三分
更直接有感。
因為對真正每天使用 AI 的人來說,
最惱人的不是:
模型少會一道數學題。
而是:
工作做到一半撞 Usage Limit。
這也是為什麼「50% 降價」比看起來更重要
如果一個模型只拿來:
每天聊十次,
Input 從 4 美元變 2 美元
你幾乎感覺不到。
但如果一個公司:
把它放在 Agent Workflow
裡一直跑,
就完全不同。
例如原本每月:
20 萬美元 API Bill。
同樣 Task Volume
理論上只因 List Price:
就可能大幅下降。
或者公司不省這筆錢,
而是:
讓 AI 多做一倍工作。
這就是價格戰真正產生的影響。
但現在還不能宣布「AI 成本直接減半」
因為 Token Price 降 50%
不等於:
你的 Final Task Cost
一定降 50%。
模型可能:
Thinking 更多。
Tool Call 更多。
Output 更多。
Workflow 不同。
甚至因為:
新模型能力更強,
公司反而開始交給它:
以前不敢交的更複雜任務。
最後帳單:
可能沒有減少。
所以真正應該看的仍然是:
Cost per Completed Task。
這也是 OpenAI 和 Anthropic 今天最奇妙的共同點
Anthropic:
Opus 5.5。
OpenAI:
GPT-6 Sol/Luna。
兩邊的發布內容,
都花大量篇幅告訴你:
不要只看模型價格。
要看:
一件真正工作:
做完多少錢。
需要幾輪。
會不會失敗。
有沒有重做。
多少 Context 可以 Cache。
這表示 Frontier AI
正在跨進新的成熟階段。
以前:
能力第一。
現在:
能力/成本比。
這場價格戰也會逼其他模型公司跟進
如果:
高階能力
可以越來越快往:
中價模型
甚至低價模型
下放,
競爭壓力就會直接傳到:
Google。
Meta。
Alibaba。
DeepSeek。
Mistral。
以及其他模型供應商。
因為企業採購最後會問:
不是:
「你 Benchmark 世界第幾?」
而是:
「我每月有 500 萬個 Tasks,你能多少錢完成?」
這個問題比:
Leaderboard
殘酷很多。
開源模型也會感受到壓力
Open-weight Model
很大一個吸引力是:
成本。
可以自己部署。
不用永遠付 Frontier API 的高額價格。
但如果 Frontier Model API
一直降價,
企業就必須重新算:
自己買 GPU。
維護 Infrastructure。
更新 Model。
監控安全。
和:
直接付 API
哪個更便宜。
所以模型降價,
甚至可能改變:
Local AI。
Cloud AI。
Open-weight AI
彼此之間的經濟平衡。
但最便宜不一定最後會贏
便宜只是:
一個維度。
企業還要看:
Reliability。
Latency。
Privacy。
Data Residency。
Security。
Tool Ecosystem。
Vendor Lock-in。
Availability。
Model Stability。
以及:
最重要的:
最後人工到底要修多少。
如果一個模型:
便宜 70%,
但員工每次都要花:
多 20 分鐘 Review,
未必划算。
AI 採購開始變成:
真正的 Operations Question。
最後回頭看今天早上,就會發現這一天很特別
今天早上:
Anthropic 告訴市場:
Claude Opus 5.5
每件工作成本可以大幅下降。
今天晚上:
OpenAI 又把:
GPT-6 Sol/Luna
直接往下砍價。
同一天,
兩家前沿 AI 公司都沒有把主要訊息停在:
「我們更聰明。」
而是開始說:
「我們可以更便宜地完成工作。」
這可能是 AI 產業接下來最重要的轉折之一。
當 Intelligence 本身變得愈來愈充足,
真正稀缺的就會變成:
每一美元能買到多少可靠工作。
所以 GPT-6 Sol/Luna
真正重要的地方,
不是 OpenAI 又多了兩個 Model Name。
而是:
前沿 AI 正開始從:
能力競賽
進入:
效率競賽。
最後真正贏的,
未必只是:
Benchmark 最高的人。
而可能是:
能用最低的總成本,把最多真實工作穩定完成的人。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
今日 AI 工具|2026/09/13:GPT-6 Astra 進 ChatGPT Work/Codex,沒有 API 的舊系統也能直接操作
AI 一分鐘教學|2026/09/13:Astra 操作電腦前,先寫「允許做/一定停/完成後回報」三格權限卡
AI 今日早報|2026/08/22:OpenAI 把 GPT-5.6 Sol API 降價逾 20%、AI 基建債務暴增至 2,200 億美元、Nvidia 再投資料中心電力開發商