Claude Sonnet 5.5 發布後,有一個數字很容易讓人直接理解錯:

「每件任務最高省 30%。」

那是不是代表:

以前 Claude 一個月花 100 美元,

換成 Sonnet 5.5 後,就會變成 70 美元?

不一定。

因為 Anthropic 並沒有把 Sonnet 的 Token 單價直接打七折。

Sonnet 5.5 的 Token 單價其實沒變

Claude Sonnet 5.5 目前的 API 價格是:

  • Input:每百萬 Token 2 美元
  • Output:每百萬 Token 10 美元
  • Cache Read:每百萬 Token 0.20 美元

這和 Sonnet 5 是一樣的。

所以:

不是同樣用了 100 萬 Token,現在只收你 70%。

Anthropic 說的「最高省 30%」,指的是另外一件事。

真正省的是:完成同一件事可能用比較少資源

假設以前完成一個工作,需要:

讀很多 Context,

思考很多輪,

呼叫很多次工具,

最後又輸出很長的結果。

Sonnet 5.5 如果可以:

  • 更快理解問題
  • 少走幾個錯誤步驟
  • 少呼叫幾次工具
  • 用更少 Token 完成
  • 不需要反覆重做

那麼:

雖然每個 Token 價格一樣,最後整件工作的總成本還是會下降。

這才是「Cost per Task」的概念。

用便當來想就很簡單

假設一個零件還是 10 元。

以前完成一個產品需要 10 個零件。

成本就是 100 元。

新版流程只需要 7 個零件。

那就變成 70 元。

不是零件變便宜。

而是:

完成同一件事情需要的零件變少。

Sonnet 5.5 的「最高省 30%」比較接近這種情況。

為什麼每個人省的不會一樣?

因為你的 AI 工作不是固定規格的產品。

同樣叫 Claude 幫忙,

差異可能非常大。

第一個變數:你的工作本來有多複雜?

如果你只是叫 Claude:

「幫我把這三段文字整理成五點。」

原本消耗的資源就不多。

新版模型再有效率,也不一定有很大的絕對差距。

但如果是:

  • 長時間 Coding
  • 大量文件處理
  • Agent 多步驟任務
  • 多次 Tool Call
  • 長 Context 分析

少掉幾輪執行後,差距就可能更明顯。

第二個變數:Effort 設多高?

Anthropic 現在讓同一個模型使用不同 Effort。

較低 Effort:

模型回答比較快,通常也使用比較少 Token。

較高 Effort:

模型會花更多時間推理與檢查。

Anthropic 官方目前把:

Claude App 與 Claude Code 的預設設成 Medium。

Claude Platform 預設則是 High。

所以即使兩個人都使用 Sonnet 5.5,

一個拿大量簡單任務跑較低 Effort,

另一個每天跑高 Effort 的複雜 Agent,

成本結構本來就不同。

第三個變數:Prompt 有多大?

模型變有效率,

並不代表你送進去的資料會自動縮小。

如果每一次工作都把:

  • 幾百頁文件
  • 大型 Repository
  • 完整聊天紀錄
  • 大量工具定義

重新送進去,

Input 成本仍然存在。

因此不能看到「模型省 30%」,

就忽略 Context 本身有多大。

第四個變數:Output 到底有多長?

Output Token 比 Input Token 貴。

Sonnet 5.5 的 Output 目前是:

每百萬 Token 10 美元。

如果你的工作習慣是:

「越完整越好,全部展開寫。」

即使模型內部執行變有效率,

最後輸出仍然很長,

實際成本下降幅度也可能被吃掉。

第五個變數:Agent 做了幾輪?

這對 Coding Agent 特別重要。

你表面上只下了一個指令:

「幫我修這個 Bug。」

背後可能其實跑了:

搜尋檔案 → 看 Code → 執行測試 → 修改 → 再測 → 發現問題 → 再修改。

Anthropic 表示,早期測試裡 Sonnet 5.5 比 Sonnet 5 更常把 Tool Call 批次處理,因此可能用較少步驟完成。

這才是 Agent 工作真正可能省錢的地方。

不是:

一個 Tool Call 變便宜 30%。

而是:

原本可能要 10 次,現在更少次就做完。

第六個變數:Cache 有沒有真的用到?

如果你每天重複讓 Claude 讀:

相同的公司規則、

相同的大型 Codebase、

相同工具定義,

Prompt Cache 可以讓部分重複 Context 用較低價格讀取。

但 Cache Hit 很高,也不能單獨代表總成本一定低。

因為帳單仍然還有:

  • 新 Input
  • Output
  • Cache Write
  • Tool 執行
  • 多輪 Agent 工作

所以「模型效率」和「你的 Workflow 效率」其實是兩件事。

Anthropic 自己公布的企業測試也不是人人剛好 30%

這一點很重要。

Anthropic 公開的 Early Tester 結果,本身就能看出差異。

Slack 表示,在自己的離線測試裡,Sonnet 5.5 比 Sonnet 5 使用約 14% 更少 Output Token。

Box 表示,自己的測試中總 Token 大約少 12%。

另一個金融工作測試裡,Balyasny Asset Management 則觀察到更大的 Token 差距。

這些都不是矛盾。

反而說明:

成本改善幅度和工作內容有關。

所以「最高 30%」不能改寫成:

「所有使用者固定省 30%。」

那要怎麼知道自己到底有沒有省?

最實際的方法不是猜。

拿你自己的工作比。

例如選 20 個真的會做的任務:

  • 5 個簡單整理
  • 5 個文件工作
  • 5 個 Coding 任務
  • 5 個較複雜 Agent 工作

然後比較:

1. 有沒有完成?

便宜但做錯,不算省。

2. 總 Token

不要只看 Input Token。

Input、Output、Cache 都要算。

3. Tool/Agent 執行次數

新版是不是更少繞路?

4. 人工修改時間

模型少花 20%,結果卻多花半小時人工修正,也不划算。

5. Cost per Successful Task

最後才算:

真正完成一件可用工作,到底多少錢?

這才是最重要的數字。

所以答案是什麼?

Claude Sonnet 5.5 的確可能讓很多工作變便宜。

但原因不是:

Token 單價直接降 30%。

而是:

同一件工作可能用更少 Token、更少步驟、更少 Tool Call 完成。

最後你的實際成本到底少:

5%?

15%?

30%?

甚至某些工作幾乎沒有差?

要看你的真實 Workflow。

所以看到 AI 公司寫:

「最高省 30%」

下一個問題不要只問:

「便宜多少?」

而應該問:

「它是把單價降了,還是把完成一件工作的用量降了?」

這兩件事,差非常多。

推薦閱讀

AI 一分鐘教學|2026/09/23:Claude Code 跑完別只看答案,輸入 /usage 用「Cache/Output/Turns」找出哪裡在燒錢

AI 快問快答|2026/09/02:Claude Prompt Cache Hit 很高,就代表這個 AI 工作一定比較便宜嗎?

AI 一分鐘教學|2026/08/04:換成便宜 AI 模型前,先用同一組 20 題做「成本、正確率、修改時間」測試