Claude 又出新模型了。

但这次真正值得看的,

不是:

Benchmark 又高多少。

而是:

同一件 AI 工作,到底能不能少花一点钱做完。

Anthropic 9 月 22 日正式推出:

Claude Opus 5.5。

它是新的 Claude 5.5 Family 第一个成员。

Anthropic 对它的定位很直接:

多数工作能力接近更高级的:

Claude Fable 5.1。

但是运行成本,

比上一代:

Claude Opus 5

低很多。

Opus 5.5 到底改了什么?

先看最直接的 API 价格。

Claude Opus 5:

Input:

5 美元/100 万 Tokens

Output:

25 美元/100 万 Tokens

到了 Claude Opus 5.5:

Input:

4 美元/100 万 Tokens

Output:

20 美元/100 万 Tokens

两边都是:

便宜 20%。

如果只看这里,

你可能会想:

那不就是打八折?

但真正变化最大的,

其实还不是这两个价格。

Cache Read 从 0.50 美元降到 0.20 美元

对:

Claude Code。

Coding Agent。

长时间 Agent。

反复读同一个 Project Context

的人来说,

更重要的是:

Cache Read。

Opus 5 原本每百万 Cached Tokens:

约:

0.50 美元。

Opus 5.5:

0.20 美元。

也就是:

下降 60%。

这个差别,

对一句话问答可能没有那么巨大。

但如果 AI 正在:

读 Repository。

修 Code。

跑 Tests。

再读结果。

再修改。

再跑一次。

成本结构就完全不同。

为什么 Agent 特别吃 Cache?

假设你让 Claude Code 修改一个功能。

第一轮,

它先读:

CLAUDE.md。

项目规则。

API。

Controller。

Tests。

相关 Components。

这些内容可能已经累积:

10 万 Tokens。

下一轮它跑 Test。

再思考。

它并不是只读:

最新 Test Result。

整段 Conversation Context

还要一起带进去。

第三轮又一样。

所以一个 Session:

画面上可能永远没有超过 12 万 Tokens。

但整场工作加总起来,

实际处理的 Input:

可能是几百万 Tokens。

因为同样 Context 被:

反复读取。

Prompt Cache 的作用,

就是让已经看过的那一大段内容,

不要每次都按 Fresh Input 的价格重新计费。

Anthropic 自己的例子很直观

Anthropic 用一个假设的 Claude Code Task 说明:

Session 最后 Context 成长到:

12 万 Tokens。

如果总共跑:

40 Turns,

整个工作实际可能处理约:

280 万 Input Tokens。

如果其中:

90%

可以从 Cache 读,

Input Cost 约:

1.62 美元。

如果同样工作只需要:

25 Turns,

成本又可以降到约:

1.02 美元。

这里真正重要的不是这两个金额。

而是:

AI 多绕一次路,也要钱。

所以「Token 便宜」只是第一层

Anthropic 对 Opus 5.5 的说法是:

在 Default Settings 下,

典型工作负载相较 Opus 5:

约便宜 40%。

为什么不是只有 20%?

因为它认为新模型除了:

Token Price 比较低,

还可能:

用更少 Turns。

少一些错误方向。

少一些重做。

少一些 Output Tokens

完成相同工作。

但这个:

40%

是 Anthropic 自己根据 Typical Workloads 得出的估计。

不是保证你的工作一定少 40%。

真正要算的是 Cost per Task

这是 Opus 5.5 最值得学的一个概念。

一般人很容易比较:

模型 A:

Input 4 美元。

模型 B:

Input 2 美元。

所以模型 B:

一定比较便宜。

不一定。

假设模型 B:

先改错一次。

再查另一个文件。

重新修改。

再跑 Test。

又漏掉一个 Caller。

总共跑:

20 Turns。

模型 A:

一次先找到全部相依性,

10 Turns 完成。

最后:

单价高的模型

反而可能:

总成本比较低。

所以真正要看的是:

Cost per Completed Task。

不是:

Cost per Million Tokens。

Anthropic 甚至直接提醒:Retry 也有成本

如果你为了省 Token,

把 Effort 降太低,

结果 AI:

没想完整。

漏掉文件。

第一次修失败。

接着再跑一次,

你原本省下的 Thinking Tokens,

可能一下就被:

Retry

吃回去。

所以使用 Opus 5.5,

不是永远:

Effort 越低越好。

而是:

简单工作少想。

困难工作多想一点。

避免整个任务重新来一次。

Opus 5.5 有不同 Effort Levels

在 Claude Code 里,

Opus 5.5 可以调整:

Low。

Medium。

High。

XHigh。

另外还有一次 Session 可使用的:

Max。

Anthropic 自己的建议是:

一般范围清楚的日常工作,

可以先从:

Medium

开始。

例如:

改一个 Feature。

Debug 几个相关文件。

Code Review。

如果发现:

只修到一层。

没有追完整相依关系。

再往:

High

提高。

Low 适合什么?

例如:

把同一个名称改到多个文件。

按照既有 Pattern 做 Mechanical Edit。

查 Log。

找某个 Function 在哪里定义。

这些工作不一定需要:

大量 Thinking。

如果每一个 Rename

都开最高 Effort,

你是在花钱让 AI:

想一件根本不用想那么久的事。

High 又什么时候值得?

例如:

API Field 已经改名。

Backend 改好了。

但还有:

Frontend。

Mobile。

Tests。

旧 Client。

Documentation

可能依赖它。

这种工作如果 AI 只看到:

眼前 File,

很容易:

局部成功。

整体失败。

提高 Effort 的目的,

不是让答案看起来比较长。

而是让 AI 愿意先:

找更多相依关系。

还有一个更省钱的方法:让 AI 自己验证

Anthropic 给了一个很实际的建议:

不要只叫 AI:

「改完。」

最好让它有:

可以自己确认结果的方法。

例如:

Unit Test。

Build。

Lint。

API Test。

Validation Script。

原因很简单。

如果模型改错,

但自己可以立即跑 Test 发现,

它可能:

同一个 Session 直接修掉。

如果没有验证方法,

它可能很有自信地告诉你:

Done。

你隔天才发现:

坏了。

然后:

重开 Context。

重新解释。

重新读 Code。

重新修。

那才真正贵。

Opus 5.5 和 Fable 5.1 怎么选?

这可能是现在 Claude 用户最实际的问题。

Anthropic 自己在 Claude Code Cost Guide 里,

把两者分工讲得很清楚。

Opus 5.5:

比较适合:

你会持续看着它工作的任务。

Feature Development。

Debugging。

Code Review。

几个 Files 之间的修改。

Interactive Work。

因为:

速度较快。

价格较低。

你也可以在它偏掉时:

立即介入。

Fable 5.1 留给真正最难的工作

Anthropic 建议,

如果:

任务结果比 Token Price 更重要。

你不会一直监督。

问题没有既有 Pattern。

需要多个 Subagents 协调。

是非常大型的改动。

或者:

Opus 5.5 High 已经在同一个问题:

卡两次。

这时再换:

Fable 5.1。

Fable 5.1 的 API List Price:

Input:

10 美元。

Output:

50 美元。

相当于 Opus 5.5 的:

2.5 倍。

所以最简单不是:

「Fable 最强,所以全部用 Fable。」

而是:

一般复杂工作先 Opus 5.5。

真的撞墙:

再升 Fable。

问题解完:

再切回来。

小任务甚至不一定需要 Opus

反过来也是一样。

如果只是:

Search。

读 Logs。

找文件。

整理 Test Output。

简单 Lookup。

Anthropic 建议可以让:

Sonnet

或:

Haiku

负责。

尤其 Multi-agent Workflow 里,

每个 Subagent

如果全部继承昂贵模型,

最后帐单很容易放大。

比较合理的是:

便宜模型找数据。

Opus 5.5 做主要工作。

Fable 5.1 解真正困难问题。

这才叫:

Model Routing。

Cache 很便宜,但也不是永远存在

Opus 5.5 的 Cache Read:

每百万 Tokens:

0.20 美元。

只有 Fresh Input 的:

5%。

听起来非常便宜。

但 Cache 并不是:

建一次永久免费读。

Claude Code 不同付款方式下,

Cache Lifetime 也可能不同。

如果 Session 长时间停住,

下一次回来:

Cache 可能需要重新写入。

而:

Cache Write

本身反而比 Fresh Input 更贵。

所以一个很实际的技巧是:

同一件工作尽量集中完成。

不要:

跑两轮。

去喝咖啡很久。

回来重新热 Cache。

再跑两轮。

切换 Model/Effort 也可能让 Cache 重建

另一个很容易忽略的地方是:

Changing Effort。

Thinking Settings。

甚至切换 Model,

都有可能让:

原来的 Cache

无法继续直接使用。

所以不要每两分钟:

Medium。

High。

Low。

再 High。

每次切换,

都可能带来新的 Context Cost。

比较好的方法是:

做到一个:

Natural Break

再换。

例如:

Planning 完成。

准备进 Implementation。

或者:

现在这个问题确认 Opus 解不掉,

才升级。

Opus 5.5 还添加一个很实际的 Prompt Audit 概念

Anthropic 甚至提醒:

旧模型留下来的 Prompt,

可能让新模型:

做很多不必要的事。

例如你以前为了让模型可靠,

写了:

一定要跑六个步骤。

每次都 Verify Twice。

每一轮都重新读完整规则。

一定要输出 Scratchpad。

到了新版模型,

这些 Ritual Instructions

反而可能造成:

更多 Output。

更多 Tool Calls。

更多重复工作。

Claude Code 现在可以利用:

Prompt Audit

检查这类:

过时。

重复。

互相冲突

的 Instruction。

Anthropic 自己测了一个 44 Ticket Workflow

Anthropic 用一组:

44 个 Customer Support Tickets

做内部测试。

从 Opus 4.8 换到:

Opus 5.5 Low Effort,

成本约下降:

18%。

再清理 Prompt 中不必要的:

六步固定流程。

Scratchpad Rule。

Verify-twice Rule。

互相冲突的 Instructions

之后,

又多下降约:

9%。

最后相较原本:

约降低 25%。

这只是:

Anthropic 自己的一个 Benchmark Example。

不是说:

清 Prompt 就保证省 25%。

但它提醒一件很重要的事:

模型升级,Prompt 也要跟着整理。

最重要的工具反而可能是 /usage

如果你真的在 Claude Code 里工作,

不要猜:

「感觉这版比较省。」

Anthropic 建议直接在 Session 结束后:

看:

/usage

或:

/cost。

你可以看到:

Input。

Output。

Cache。

Estimated Cost。

再拿:

同一种真实工作

分别跑:

Opus 5。

Opus 5.5。

比较:

用了几个 Turns?

Output Tokens 多少?

Cache Hit 多高?

总成本多少?

不要拿一个玩具 Prompt 比模型

如果你的真实工作是:

修改 Laravel Project。

分析 20 份文档。

跑一个长 Agent Workflow。

那就拿:

真的工作

比较。

不要只问:

「写一首关于猫的诗。」

然后根据一次 Token Count

决定公司往后模型策略。

真正应该做的是:

挑:

3~5 个每天会重复发生的 Task。

记录:

Completion Rate。

Turns。

Review Time。

Tokens。

Cost。

最后才知道:

哪个 Model 真正比较划算。

安全方面也有一个明显变化

Opus 5.5 是 Anthropic 公开谈:

Pacing the Frontier

之后的重要新模型。

所以这次发布前,

Anthropic 找了:

METR。

Frontier Design

等外部团队进行测试。

公司自己的 Containment Evaluation 显示,

Opus 5.5 尝试绕过既定 System Boundary 的情况,

比:

Opus 5

与:

Mythos 5.1

约少:

85%。

但一定要注意:

这不是:

「Claude 安全性提高 85%。」

它只是:

某一类特定安全评测结果。

高风险工作仍然不是因为模型新版就能全部放手

即使:

Benchmark 提升。

Safety Evaluation 变好。

也不代表:

Production Deploy。

付款。

删除数据。

安全设置。

客户承诺。

医疗。

法律。

金融决策

就可以:

完全不看。

模型越能自己跑完整任务,

反而越需要清楚知道:

哪个 Step:

可以自己做。

哪个 Step:

一定停。

Opus 5.5 的成本降低,

最合理的用途是:

让更多适合交给 AI 的工作变得经济可行。

不是:

把所有决策都交给 AI。

哪些人最值得试 Opus 5.5?

第一类:

Claude Code 重度用户。

尤其是:

Session 很长。

Repository Context 很大。

Cache Read 很多。

60% Cache Read 降价最容易感受到。

第二类:

原本觉得 Fable 太贵的人。

如果你的工作不需要每次都用最高级模型,

Opus 5.5 可能提供:

更合理的能力/成本位置。

第三类:

企业 Agent Workflow。

每个 Task 一天跑:

几十次。

几百次。

甚至几千次

时,

每 Task 少:

几毛钱。

累积起来就会变成:

真正的预算差。

哪些人其实不用特别在意?

如果你只是:

每天偶尔问几个问题。

摘要一段文字。

写一封 Email。

做简单 Brainstorm。

你真正的 Bottleneck

可能根本不是:

Opus 5.5 比 Opus 5

一百万 Token 便宜几美元。

这种工作,

甚至未必需要:

Opus。

不要因为:

「最新」

就永远选最强模型。

AI 工具真正成熟的使用方式,

不是:

所有任务都上最高级。

而是:

每一种工作用刚好够用的能力。

最后只记一个判断方式

不要问:

「Opus 5.5 每个 Token 有没有比较便宜?」

答案很简单:

有。

真正应该问:

「我的这件工作,最后做完花多少?」

所以测试 Opus 5.5 时,

看四个东西就够:

Turns

跑了几轮?

Output

想了、写了多少?

Cache

多少旧 Context 被便宜重用?

Retry

有没有因为第一次失败又重新做?

最后比较:

Cost per Completed Task。

这才是 Opus 5.5 真正值得看的地方。

AI 模型开始进入一个更成熟的竞争阶段:

不是只问:

谁最聪明。

而是:

谁能用更少资源,把真正的工作可靠地做完。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

今日 AI 工具|2026/07/25:Claude Opus 5,适合处理长时间研究、复杂文档与需要反复检查的工作

今日 AI 工具|2026/09/02:Claude Fable 5.1 上线,长时间 Coding/研究更强,重复读取项目 Context 成本降 75%

AI 一分钟教学|2026/09/02:用 Claude Fable 5.1 前,先把 Prompt 拆成「固定背景+今天添加」,别每次整包重读