Claude Sonnet 5.5 发布后,有一个数字很容易让人直接理解错:

「每件任务最高省 30%。」

那是不是代表:

以前 Claude 一个月花 100 美元,

换成 Sonnet 5.5 后,就会变成 70 美元?

不一定。

因为 Anthropic 并没有把 Sonnet 的 Token 单价直接打七折。

Sonnet 5.5 的 Token 单价其实没变

Claude Sonnet 5.5 目前的 API 价格是:

  • Input:每百万 Token 2 美元
  • Output:每百万 Token 10 美元
  • Cache Read:每百万 Token 0.20 美元

这和 Sonnet 5 是一样的。

所以:

不是同样用了 100 万 Token,现在只收你 70%。

Anthropic 说的「最高省 30%」,指的是另外一件事。

真正省的是:完成同一件事可能用比较少资源

假设以前完成一个工作,需要:

读很多 Context,

思考很多轮,

调用很多次工具,

最后又输出很长的结果。

Sonnet 5.5 如果可以:

  • 更快理解问题
  • 少走几个错误步骤
  • 少调用几次工具
  • 用更少 Token 完成
  • 不需要反复重做

那么:

虽然每个 Token 价格一样,最后整件工作的总成本还是会下降。

这才是「Cost per Task」的概念。

用便当来想就很简单

假设一个零件还是 10 元。

以前完成一个产品需要 10 个零件。

成本就是 100 元。

新版流程只需要 7 个零件。

那就变成 70 元。

不是零件变便宜。

而是:

完成同一件事情需要的零件变少。

Sonnet 5.5 的「最高省 30%」比较接近这种情况。

为什么每个人省的不会一样?

因为你的 AI 工作不是固定规格的产品。

同样叫 Claude 帮忙,

差异可能非常大。

第一个变量:你的工作本来有多复杂?

如果你只是叫 Claude:

「帮我把这三段文字整理成五点。」

原本消耗的资源就不多。

新版模型再有效率,也不一定有很大的绝对差距。

但如果是:

  • 长时间 Coding
  • 大量文档处理
  • Agent 多步骤任务
  • 多次 Tool Call
  • 长 Context 分析

少掉几轮运行后,差距就可能更明显。

第二个变量:Effort 设多高?

Anthropic 现在让同一个模型使用不同 Effort。

较低 Effort:

模型回答比较快,通常也使用比较少 Token。

较高 Effort:

模型会花更多时间推理与检查。

Anthropic 官方目前把:

Claude App 与 Claude Code 的预设设成 Medium。

Claude Platform 预设则是 High。

所以即使两个人都使用 Sonnet 5.5,

一个拿大量简单任务跑较低 Effort,

另一个每天跑高 Effort 的复杂 Agent,

成本结构本来就不同。

第三个变量:Prompt 有多大?

模型变有效率,

并不代表你送进去的数据会自动缩小。

如果每一次工作都把:

  • 几百页文档
  • 大型 Repository
  • 完整聊天纪录
  • 大量工具定义

重新送进去,

Input 成本仍然存在。

因此不能看到「模型省 30%」,

就忽略 Context 本身有多大。

第四个变量:Output 到底有多长?

Output Token 比 Input Token 贵。

Sonnet 5.5 的 Output 目前是:

每百万 Token 10 美元。

如果你的工作习惯是:

「越完整越好,全部展开写。」

即使模型内部运行变有效率,

最后输出仍然很长,

实际成本下降幅度也可能被吃掉。

第五个变量:Agent 做了几轮?

这对 Coding Agent 特别重要。

你表面上只下了一个指令:

「帮我修这个 Bug。」

背后可能其实跑了:

搜索文件 → 看 Code → 运行测试 → 修改 → 再测 → 发现问题 → 再修改。

Anthropic 表示,早期测试里 Sonnet 5.5 比 Sonnet 5 更常把 Tool Call 批量处理,因此可能用较少步骤完成。

这才是 Agent 工作真正可能省钱的地方。

不是:

一个 Tool Call 变便宜 30%。

而是:

原本可能要 10 次,现在更少次就做完。

第六个变量:Cache 有没有真的用到?

如果你每天重复让 Claude 读:

相同的公司规则、

相同的大型 Codebase、

相同工具定义,

Prompt Cache 可以让部分重复 Context 用较低价格读取。

但 Cache Hit 很高,也不能单独代表总成本一定低。

因为帐单仍然还有:

  • 新 Input
  • Output
  • Cache Write
  • Tool 运行
  • 多轮 Agent 工作

所以「模型效率」和「你的 Workflow 效率」其实是两件事。

Anthropic 自己公布的企业测试也不是人人刚好 30%

这一点很重要。

Anthropic 公开的 Early Tester 结果,本身就能看出差异。

Slack 表示,在自己的脱机测试里,Sonnet 5.5 比 Sonnet 5 使用约 14% 更少 Output Token。

Box 表示,自己的测试中总 Token 大约少 12%。

另一个金融工作测试里,Balyasny Asset Management 则观察到更大的 Token 差距。

这些都不是矛盾。

反而说明:

成本改善幅度和工作内容有关。

所以「最高 30%」不能改写成:

「所有用户固定省 30%。」

那要怎么知道自己到底有没有省?

最实际的方法不是猜。

拿你自己的工作比。

例如选 20 个真的会做的任务:

  • 5 个简单整理
  • 5 个文档工作
  • 5 个 Coding 任务
  • 5 个较复杂 Agent 工作

然后比较:

1. 有没有完成?

便宜但做错,不算省。

2. 总 Token

不要只看 Input Token。

Input、Output、Cache 都要算。

3. Tool/Agent 运行次数

新版是不是更少绕路?

4. 人工修改时间

模型少花 20%,结果却多花半小时人工修正,也不划算。

5. Cost per Successful Task

最后才算:

真正完成一件可用工作,到底多少钱?

这才是最重要的数字。

所以答案是什么?

Claude Sonnet 5.5 的确可能让很多任务作变便宜。

但原因不是:

Token 单价直接降 30%。

而是:

同一件工作可能用更少 Token、更少步骤、更少 Tool Call 完成。

最后你的实际成本到底少:

5%?

15%?

30%?

甚至某些工作几乎没有差?

要看你的真实 Workflow。

所以看到 AI 公司写:

「最高省 30%」

下一个问题不要只问:

「便宜多少?」

而应该问:

「它是把单价降了,还是把完成一件工作的用量降了?」

这两件事,差非常多。

推荐阅读

AI 一分钟教学|2026/09/23:Claude Code 跑完别只看答案,输入 /usage 用「Cache/Output/Turns」找出哪里在烧钱

AI 快问快答|2026/09/02:Claude Prompt Cache Hit 很高,就代表这个 AI 工作一定比较便宜吗?

AI 一分钟教学|2026/08/04:换成便宜 AI 模型前,先用同一组 20 题做「成本、正确率、修改时间」测试