Claude 又出新模型了。
但这次真正值得看的,
不是:
Benchmark 又高多少。
而是:
同一件 AI 工作,到底能不能少花一点钱做完。
Anthropic 9 月 22 日正式推出:
Claude Opus 5.5。
它是新的 Claude 5.5 Family 第一个成员。
Anthropic 对它的定位很直接:
多数工作能力接近更高级的:
Claude Fable 5.1。
但是运行成本,
比上一代:
Claude Opus 5
低很多。
Opus 5.5 到底改了什么?
先看最直接的 API 价格。
Claude Opus 5:
Input:
5 美元/100 万 Tokens
Output:
25 美元/100 万 Tokens
到了 Claude Opus 5.5:
Input:
4 美元/100 万 Tokens
Output:
20 美元/100 万 Tokens
两边都是:
便宜 20%。
如果只看这里,
你可能会想:
那不就是打八折?
但真正变化最大的,
其实还不是这两个价格。
Cache Read 从 0.50 美元降到 0.20 美元
对:
Claude Code。
Coding Agent。
长时间 Agent。
反复读同一个 Project Context
的人来说,
更重要的是:
Cache Read。
Opus 5 原本每百万 Cached Tokens:
约:
0.50 美元。
Opus 5.5:
0.20 美元。
也就是:
下降 60%。
这个差别,
对一句话问答可能没有那么巨大。
但如果 AI 正在:
读 Repository。
修 Code。
跑 Tests。
再读结果。
再修改。
再跑一次。
成本结构就完全不同。
为什么 Agent 特别吃 Cache?
假设你让 Claude Code 修改一个功能。
第一轮,
它先读:
CLAUDE.md。
项目规则。
API。
Controller。
Tests。
相关 Components。
这些内容可能已经累积:
10 万 Tokens。
下一轮它跑 Test。
再思考。
它并不是只读:
最新 Test Result。
整段 Conversation Context
还要一起带进去。
第三轮又一样。
所以一个 Session:
画面上可能永远没有超过 12 万 Tokens。
但整场工作加总起来,
实际处理的 Input:
可能是几百万 Tokens。
因为同样 Context 被:
反复读取。
Prompt Cache 的作用,
就是让已经看过的那一大段内容,
不要每次都按 Fresh Input 的价格重新计费。
Anthropic 自己的例子很直观
Anthropic 用一个假设的 Claude Code Task 说明:
Session 最后 Context 成长到:
12 万 Tokens。
如果总共跑:
40 Turns,
整个工作实际可能处理约:
280 万 Input Tokens。
如果其中:
90%
可以从 Cache 读,
Input Cost 约:
1.62 美元。
如果同样工作只需要:
25 Turns,
成本又可以降到约:
1.02 美元。
这里真正重要的不是这两个金额。
而是:
AI 多绕一次路,也要钱。
所以「Token 便宜」只是第一层
Anthropic 对 Opus 5.5 的说法是:
在 Default Settings 下,
典型工作负载相较 Opus 5:
约便宜 40%。
为什么不是只有 20%?
因为它认为新模型除了:
Token Price 比较低,
还可能:
用更少 Turns。
少一些错误方向。
少一些重做。
少一些 Output Tokens
完成相同工作。
但这个:
40%
是 Anthropic 自己根据 Typical Workloads 得出的估计。
不是保证你的工作一定少 40%。
真正要算的是 Cost per Task
这是 Opus 5.5 最值得学的一个概念。
一般人很容易比较:
模型 A:
Input 4 美元。
模型 B:
Input 2 美元。
所以模型 B:
一定比较便宜。
不一定。
假设模型 B:
先改错一次。
再查另一个文件。
重新修改。
再跑 Test。
又漏掉一个 Caller。
总共跑:
20 Turns。
模型 A:
一次先找到全部相依性,
10 Turns 完成。
最后:
单价高的模型
反而可能:
总成本比较低。
所以真正要看的是:
Cost per Completed Task。
不是:
Cost per Million Tokens。
Anthropic 甚至直接提醒:Retry 也有成本
如果你为了省 Token,
把 Effort 降太低,
结果 AI:
没想完整。
漏掉文件。
第一次修失败。
接着再跑一次,
你原本省下的 Thinking Tokens,
可能一下就被:
Retry
吃回去。
所以使用 Opus 5.5,
不是永远:
Effort 越低越好。
而是:
简单工作少想。
困难工作多想一点。
避免整个任务重新来一次。
Opus 5.5 有不同 Effort Levels
在 Claude Code 里,
Opus 5.5 可以调整:
Low。
Medium。
High。
XHigh。
另外还有一次 Session 可使用的:
Max。
Anthropic 自己的建议是:
一般范围清楚的日常工作,
可以先从:
Medium
开始。
例如:
改一个 Feature。
Debug 几个相关文件。
Code Review。
如果发现:
只修到一层。
没有追完整相依关系。
再往:
High
提高。
Low 适合什么?
例如:
把同一个名称改到多个文件。
按照既有 Pattern 做 Mechanical Edit。
查 Log。
找某个 Function 在哪里定义。
这些工作不一定需要:
大量 Thinking。
如果每一个 Rename
都开最高 Effort,
你是在花钱让 AI:
想一件根本不用想那么久的事。
High 又什么时候值得?
例如:
API Field 已经改名。
Backend 改好了。
但还有:
Frontend。
Mobile。
Tests。
旧 Client。
Documentation
可能依赖它。
这种工作如果 AI 只看到:
眼前 File,
很容易:
局部成功。
整体失败。
提高 Effort 的目的,
不是让答案看起来比较长。
而是让 AI 愿意先:
找更多相依关系。
还有一个更省钱的方法:让 AI 自己验证
Anthropic 给了一个很实际的建议:
不要只叫 AI:
「改完。」
最好让它有:
可以自己确认结果的方法。
例如:
Unit Test。
Build。
Lint。
API Test。
Validation Script。
原因很简单。
如果模型改错,
但自己可以立即跑 Test 发现,
它可能:
同一个 Session 直接修掉。
如果没有验证方法,
它可能很有自信地告诉你:
Done。
你隔天才发现:
坏了。
然后:
重开 Context。
重新解释。
重新读 Code。
重新修。
那才真正贵。
Opus 5.5 和 Fable 5.1 怎么选?
这可能是现在 Claude 用户最实际的问题。
Anthropic 自己在 Claude Code Cost Guide 里,
把两者分工讲得很清楚。
Opus 5.5:
比较适合:
你会持续看着它工作的任务。
Feature Development。
Debugging。
Code Review。
几个 Files 之间的修改。
Interactive Work。
因为:
速度较快。
价格较低。
你也可以在它偏掉时:
立即介入。
Fable 5.1 留给真正最难的工作
Anthropic 建议,
如果:
任务结果比 Token Price 更重要。
你不会一直监督。
问题没有既有 Pattern。
需要多个 Subagents 协调。
是非常大型的改动。
或者:
Opus 5.5 High 已经在同一个问题:
卡两次。
这时再换:
Fable 5.1。
Fable 5.1 的 API List Price:
Input:
10 美元。
Output:
50 美元。
相当于 Opus 5.5 的:
2.5 倍。
所以最简单不是:
「Fable 最强,所以全部用 Fable。」
而是:
一般复杂工作先 Opus 5.5。
真的撞墙:
再升 Fable。
问题解完:
再切回来。
小任务甚至不一定需要 Opus
反过来也是一样。
如果只是:
Search。
读 Logs。
找文件。
整理 Test Output。
简单 Lookup。
Anthropic 建议可以让:
Sonnet
或:
Haiku
负责。
尤其 Multi-agent Workflow 里,
每个 Subagent
如果全部继承昂贵模型,
最后帐单很容易放大。
比较合理的是:
便宜模型找数据。
Opus 5.5 做主要工作。
Fable 5.1 解真正困难问题。
这才叫:
Model Routing。
Cache 很便宜,但也不是永远存在
Opus 5.5 的 Cache Read:
每百万 Tokens:
0.20 美元。
只有 Fresh Input 的:
5%。
听起来非常便宜。
但 Cache 并不是:
建一次永久免费读。
Claude Code 不同付款方式下,
Cache Lifetime 也可能不同。
如果 Session 长时间停住,
下一次回来:
Cache 可能需要重新写入。
而:
Cache Write
本身反而比 Fresh Input 更贵。
所以一个很实际的技巧是:
同一件工作尽量集中完成。
不要:
跑两轮。
去喝咖啡很久。
回来重新热 Cache。
再跑两轮。
切换 Model/Effort 也可能让 Cache 重建
另一个很容易忽略的地方是:
Changing Effort。
Thinking Settings。
甚至切换 Model,
都有可能让:
原来的 Cache
无法继续直接使用。
所以不要每两分钟:
Medium。
High。
Low。
再 High。
每次切换,
都可能带来新的 Context Cost。
比较好的方法是:
做到一个:
Natural Break
再换。
例如:
Planning 完成。
准备进 Implementation。
或者:
现在这个问题确认 Opus 解不掉,
才升级。
Opus 5.5 还添加一个很实际的 Prompt Audit 概念
Anthropic 甚至提醒:
旧模型留下来的 Prompt,
可能让新模型:
做很多不必要的事。
例如你以前为了让模型可靠,
写了:
一定要跑六个步骤。
每次都 Verify Twice。
每一轮都重新读完整规则。
一定要输出 Scratchpad。
到了新版模型,
这些 Ritual Instructions
反而可能造成:
更多 Output。
更多 Tool Calls。
更多重复工作。
Claude Code 现在可以利用:
Prompt Audit
检查这类:
过时。
重复。
互相冲突
的 Instruction。
Anthropic 自己测了一个 44 Ticket Workflow
Anthropic 用一组:
44 个 Customer Support Tickets
做内部测试。
从 Opus 4.8 换到:
Opus 5.5 Low Effort,
成本约下降:
18%。
再清理 Prompt 中不必要的:
六步固定流程。
Scratchpad Rule。
Verify-twice Rule。
互相冲突的 Instructions
之后,
又多下降约:
9%。
最后相较原本:
约降低 25%。
这只是:
Anthropic 自己的一个 Benchmark Example。
不是说:
清 Prompt 就保证省 25%。
但它提醒一件很重要的事:
模型升级,Prompt 也要跟着整理。
最重要的工具反而可能是 /usage
如果你真的在 Claude Code 里工作,
不要猜:
「感觉这版比较省。」
Anthropic 建议直接在 Session 结束后:
看:
/usage
或:
/cost。
你可以看到:
Input。
Output。
Cache。
Estimated Cost。
再拿:
同一种真实工作
分别跑:
Opus 5。
Opus 5.5。
比较:
用了几个 Turns?
Output Tokens 多少?
Cache Hit 多高?
总成本多少?
不要拿一个玩具 Prompt 比模型
如果你的真实工作是:
修改 Laravel Project。
分析 20 份文档。
跑一个长 Agent Workflow。
那就拿:
真的工作
比较。
不要只问:
「写一首关于猫的诗。」
然后根据一次 Token Count
决定公司往后模型策略。
真正应该做的是:
挑:
3~5 个每天会重复发生的 Task。
记录:
Completion Rate。
Turns。
Review Time。
Tokens。
Cost。
最后才知道:
哪个 Model 真正比较划算。
安全方面也有一个明显变化
Opus 5.5 是 Anthropic 公开谈:
Pacing the Frontier
之后的重要新模型。
所以这次发布前,
Anthropic 找了:
METR。
Frontier Design
等外部团队进行测试。
公司自己的 Containment Evaluation 显示,
Opus 5.5 尝试绕过既定 System Boundary 的情况,
比:
Opus 5
与:
Mythos 5.1
约少:
85%。
但一定要注意:
这不是:
「Claude 安全性提高 85%。」
它只是:
某一类特定安全评测结果。
高风险工作仍然不是因为模型新版就能全部放手
即使:
Benchmark 提升。
Safety Evaluation 变好。
也不代表:
Production Deploy。
付款。
删除数据。
安全设置。
客户承诺。
医疗。
法律。
金融决策
就可以:
完全不看。
模型越能自己跑完整任务,
反而越需要清楚知道:
哪个 Step:
可以自己做。
哪个 Step:
一定停。
Opus 5.5 的成本降低,
最合理的用途是:
让更多适合交给 AI 的工作变得经济可行。
不是:
把所有决策都交给 AI。
哪些人最值得试 Opus 5.5?
第一类:
Claude Code 重度用户。
尤其是:
Session 很长。
Repository Context 很大。
Cache Read 很多。
60% Cache Read 降价最容易感受到。
第二类:
原本觉得 Fable 太贵的人。
如果你的工作不需要每次都用最高级模型,
Opus 5.5 可能提供:
更合理的能力/成本位置。
第三类:
企业 Agent Workflow。
每个 Task 一天跑:
几十次。
几百次。
甚至几千次
时,
每 Task 少:
几毛钱。
累积起来就会变成:
真正的预算差。
哪些人其实不用特别在意?
如果你只是:
每天偶尔问几个问题。
摘要一段文字。
写一封 Email。
做简单 Brainstorm。
你真正的 Bottleneck
可能根本不是:
Opus 5.5 比 Opus 5
一百万 Token 便宜几美元。
这种工作,
甚至未必需要:
Opus。
不要因为:
「最新」
就永远选最强模型。
AI 工具真正成熟的使用方式,
不是:
所有任务都上最高级。
而是:
每一种工作用刚好够用的能力。
最后只记一个判断方式
不要问:
「Opus 5.5 每个 Token 有没有比较便宜?」
答案很简单:
有。
真正应该问:
「我的这件工作,最后做完花多少?」
所以测试 Opus 5.5 时,
看四个东西就够:
Turns
跑了几轮?
Output
想了、写了多少?
Cache
多少旧 Context 被便宜重用?
Retry
有没有因为第一次失败又重新做?
最后比较:
Cost per Completed Task。
这才是 Opus 5.5 真正值得看的地方。
AI 模型开始进入一个更成熟的竞争阶段:
不是只问:
谁最聪明。
而是:
谁能用更少资源,把真正的工作可靠地做完。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/07/25:Claude Opus 5,适合处理长时间研究、复杂文档与需要反复检查的工作
今日 AI 工具|2026/09/02:Claude Fable 5.1 上线,长时间 Coding/研究更强,重复读取项目 Context 成本降 75%
AI 一分钟教学|2026/09/02:用 Claude Fable 5.1 前,先把 Prompt 拆成「固定背景+今天添加」,别每次整包重读