Claude Sonnet 5.5 发布后,有一个数字很容易让人直接理解错:
「每件任务最高省 30%。」
那是不是代表:
以前 Claude 一个月花 100 美元,
换成 Sonnet 5.5 后,就会变成 70 美元?
不一定。
因为 Anthropic 并没有把 Sonnet 的 Token 单价直接打七折。
Sonnet 5.5 的 Token 单价其实没变
Claude Sonnet 5.5 目前的 API 价格是:
- Input:每百万 Token 2 美元
- Output:每百万 Token 10 美元
- Cache Read:每百万 Token 0.20 美元
这和 Sonnet 5 是一样的。
所以:
不是同样用了 100 万 Token,现在只收你 70%。
Anthropic 说的「最高省 30%」,指的是另外一件事。
真正省的是:完成同一件事可能用比较少资源
假设以前完成一个工作,需要:
读很多 Context,
思考很多轮,
调用很多次工具,
最后又输出很长的结果。
Sonnet 5.5 如果可以:
- 更快理解问题
- 少走几个错误步骤
- 少调用几次工具
- 用更少 Token 完成
- 不需要反复重做
那么:
虽然每个 Token 价格一样,最后整件工作的总成本还是会下降。
这才是「Cost per Task」的概念。
用便当来想就很简单
假设一个零件还是 10 元。
以前完成一个产品需要 10 个零件。
成本就是 100 元。
新版流程只需要 7 个零件。
那就变成 70 元。
不是零件变便宜。
而是:
完成同一件事情需要的零件变少。
Sonnet 5.5 的「最高省 30%」比较接近这种情况。
为什么每个人省的不会一样?
因为你的 AI 工作不是固定规格的产品。
同样叫 Claude 帮忙,
差异可能非常大。
第一个变量:你的工作本来有多复杂?
如果你只是叫 Claude:
「帮我把这三段文字整理成五点。」
原本消耗的资源就不多。
新版模型再有效率,也不一定有很大的绝对差距。
但如果是:
- 长时间 Coding
- 大量文档处理
- Agent 多步骤任务
- 多次 Tool Call
- 长 Context 分析
少掉几轮运行后,差距就可能更明显。
第二个变量:Effort 设多高?
Anthropic 现在让同一个模型使用不同 Effort。
较低 Effort:
模型回答比较快,通常也使用比较少 Token。
较高 Effort:
模型会花更多时间推理与检查。
Anthropic 官方目前把:
Claude App 与 Claude Code 的预设设成 Medium。
Claude Platform 预设则是 High。
所以即使两个人都使用 Sonnet 5.5,
一个拿大量简单任务跑较低 Effort,
另一个每天跑高 Effort 的复杂 Agent,
成本结构本来就不同。
第三个变量:Prompt 有多大?
模型变有效率,
并不代表你送进去的数据会自动缩小。
如果每一次工作都把:
- 几百页文档
- 大型 Repository
- 完整聊天纪录
- 大量工具定义
重新送进去,
Input 成本仍然存在。
因此不能看到「模型省 30%」,
就忽略 Context 本身有多大。
第四个变量:Output 到底有多长?
Output Token 比 Input Token 贵。
Sonnet 5.5 的 Output 目前是:
每百万 Token 10 美元。
如果你的工作习惯是:
「越完整越好,全部展开写。」
即使模型内部运行变有效率,
最后输出仍然很长,
实际成本下降幅度也可能被吃掉。
第五个变量:Agent 做了几轮?
这对 Coding Agent 特别重要。
你表面上只下了一个指令:
「帮我修这个 Bug。」
背后可能其实跑了:
搜索文件 → 看 Code → 运行测试 → 修改 → 再测 → 发现问题 → 再修改。
Anthropic 表示,早期测试里 Sonnet 5.5 比 Sonnet 5 更常把 Tool Call 批量处理,因此可能用较少步骤完成。
这才是 Agent 工作真正可能省钱的地方。
不是:
一个 Tool Call 变便宜 30%。
而是:
原本可能要 10 次,现在更少次就做完。
第六个变量:Cache 有没有真的用到?
如果你每天重复让 Claude 读:
相同的公司规则、
相同的大型 Codebase、
相同工具定义,
Prompt Cache 可以让部分重复 Context 用较低价格读取。
但 Cache Hit 很高,也不能单独代表总成本一定低。
因为帐单仍然还有:
- 新 Input
- Output
- Cache Write
- Tool 运行
- 多轮 Agent 工作
所以「模型效率」和「你的 Workflow 效率」其实是两件事。
Anthropic 自己公布的企业测试也不是人人刚好 30%
这一点很重要。
Anthropic 公开的 Early Tester 结果,本身就能看出差异。
Slack 表示,在自己的脱机测试里,Sonnet 5.5 比 Sonnet 5 使用约 14% 更少 Output Token。
Box 表示,自己的测试中总 Token 大约少 12%。
另一个金融工作测试里,Balyasny Asset Management 则观察到更大的 Token 差距。
这些都不是矛盾。
反而说明:
成本改善幅度和工作内容有关。
所以「最高 30%」不能改写成:
「所有用户固定省 30%。」
那要怎么知道自己到底有没有省?
最实际的方法不是猜。
拿你自己的工作比。
例如选 20 个真的会做的任务:
- 5 个简单整理
- 5 个文档工作
- 5 个 Coding 任务
- 5 个较复杂 Agent 工作
然后比较:
1. 有没有完成?
便宜但做错,不算省。
2. 总 Token
不要只看 Input Token。
Input、Output、Cache 都要算。
3. Tool/Agent 运行次数
新版是不是更少绕路?
4. 人工修改时间
模型少花 20%,结果却多花半小时人工修正,也不划算。
5. Cost per Successful Task
最后才算:
真正完成一件可用工作,到底多少钱?
这才是最重要的数字。
所以答案是什么?
Claude Sonnet 5.5 的确可能让很多任务作变便宜。
但原因不是:
Token 单价直接降 30%。
而是:
同一件工作可能用更少 Token、更少步骤、更少 Tool Call 完成。
最后你的实际成本到底少:
5%?
15%?
30%?
甚至某些工作几乎没有差?
要看你的真实 Workflow。
所以看到 AI 公司写:
「最高省 30%」
下一个问题不要只问:
「便宜多少?」
而应该问:
「它是把单价降了,还是把完成一件工作的用量降了?」
这两件事,差非常多。
推荐阅读
AI 一分钟教学|2026/09/23:Claude Code 跑完别只看答案,输入 /usage 用「Cache/Output/Turns」找出哪里在烧钱
AI 快问快答|2026/09/02:Claude Prompt Cache Hit 很高,就代表这个 AI 工作一定比较便宜吗?