如果你只是问 AI:
「帮我改这封 Email。」
Claude Fable 5.1 不一定是你最需要的模型。
但如果你的工作是:
读完整个大型程序项目。
研究几十份文档。
一路做到几个小时。
中间还要:
找数据。
用工具。
修改。
测试。
失败后重新规划。
再继续下一步。
Anthropic 9 月 1 日推出的:
Claude Fable 5.1
就是特别往这种工作走。
Claude Fable 5.1 是什么?
Fable 5.1 是 Anthropic 最新推出、目前一般用户可以取得的高能力 Claude 模型。
Anthropic 把它定位成:
最适合高难度 Coding、Knowledge Work 与长时间异步工作的 Claude。
它不是只拿来:
回答一个问题。
而是更强调:
一个工作做很久。
跨很多步骤。
使用多个工具。
遇到问题后自己重新规划。
最后把结果交回来让人审查。
所以它真正值得看的地方,
不是:
「今天 Benchmark 又多几分。」
而是:
AI 可以承接多长、多复杂的一整段工作。
一般人在哪里可以用?
Anthropic 目前表示,
Claude Fable 5.1 已提供给:
Pro。
Max。
Team。
Enterprise。
用户。
开发者则可以透过:
Claude Platform。
Amazon Web Services。
Google Cloud。
Microsoft Foundry。
使用。
所以这不是:
研究室里还不能碰的 Preview。
Fable 5.1 已经是 Generally Available 的正式模型。
它和 Mythos 5.1 是两个不同能力的模型吗?
不是。
Anthropic 同时发布:
Claude Fable 5.1。
以及:
Claude Mythos 5.1。
两者其实是:
同一个底层模型。
主要差异在:
Safeguards。
也就是安全限制。
Fable 5.1 是一般可取得版本。
Mythos 5.1 则只透过受审核的 Trusted Access Programs 提供,
主要给特定:
Cybersecurity。
Life Sciences。
用途。
所以一般用户看到今天的新模型,
真正要关心的是:
Fable 5.1。
不是想办法找 Mythos。
Fable 5.1 最大的改变之一:更能做长时间工作
Anthropic 现在把 Fable 5.1 的 Agent 用途写得很直接。
它适合:
做几个小时的工作。
跨多个应用。
处理 Cowork 里的工作清单。
在 Claude Tag 里接 Slack 任务。
操作 Browser。
或者作为 Managed Agent 长时间运行。
它可以:
规划工作。
使用工具。
某一步失败后恢复。
再继续。
而且在运行过程中持续更新进度。
这和一般聊天 AI 最大的差别是:
聊天 AI 比较像:
「给我答案。」
这一类模型开始变成:
「把这个项目做到可以让我验收。」
Coding 也是主要使用场景
Anthropic 把 Fable 5.1 定位为目前自己最强的 Coding 模型。
适合处理:
跨整个 Codebase 的功能。
Code Review。
性能问题。
大型 Debug。
多日自主 Coding Session。
甚至可以替自己的修改创建测试,
再用测试检查结果。
这里真正值得小团队注意的,
不是:
「以后工程师可以不用看。」
而是:
过去很多 Coding Agent 最容易在长任务中发生:
前面理解对。
做到后面忘掉原始需求。
修一个问题又弄坏另一个地方。
Fable 5.1 的产品方向,
就是尽量让模型在:
长、多步骤工作
里比较不容易失去整体脉络。
但今天真正很实际的改变,是 Prompt Cache 变便宜
Fable 5.1 的一般 API 价格目前是:
每百万 Input Tokens:
10 美元。
每百万 Output Tokens:
50 美元。
单看这两个数字,
和 Fable 5 相比并没有突然变成便宜模型。
真正大幅下降的是:
Cache Read。
现在每百万 Token:
0.25 美元。
Fable 5 原本是:
1 美元。
等于:
下降 75%。
Prompt Cache 到底是什么?
假设你让 AI 帮忙维护一个大型网站。
每一次工作都需要知道:
整份 Coding Standard。
数据库结构。
项目说明。
Tool Definitions。
重要代码背景。
共 10 万 Token。
今天你问:
「修登录错误。」
明天:
「检查付款页。」
后天:
「添加一个报表。」
很多内容其实完全没变。
如果每一次都把这 10 万 Token 当成全新的输入重新处理,
就会一直付:
重新读同样数据的成本。
Prompt Caching 的概念则是:
这部分我之前已经读过。
先保存起来。
下一次工作直接重复使用。
所以 Cache Read 便宜 75% 有什么意义?
一次性聊天:
影响可能很小。
因为你根本没有大量重复 Context。
但是 Agent 不一样。
一个长时间工作的 Agent,
可能一直重复需要知道:
公司的工作规则。
整个 Codebase 背景。
Tool Definitions。
项目 Context。
产品规格。
客户限制。
如果这些 Stable Context 可以一直从 Cache 读取,
成本就可能明显下降。
Anthropic 自己用实际工作负载估算:
一般 Fable 工作,
Fable 5.1 的成本大约可以比 Fable 5:
低 25%。
高度 Agentic 的工作,
则可能:
最高低约 45%。
注意:
不是所有使用 Fable 5.1 的帐单都自动少 75%。
为什么不是全部便宜 75%?
因为只有:
Cache Read
这一个价格下降 75%。
新的 Input 没有一起降 75%。
Output 也没有。
你每天送进去的新数据,
还是要按照正常 Input 计价。
AI 新生成的答案,
也按照正常 Output 计价。
所以如果你的工作每一次都是:
完全新的 Prompt。
完全新的文档。
完全新的数据。
几乎没有任何 Context 可以重复使用,
Cache 降价就不会帮你省那么多。
真正受益最大的,
反而是:
同一个项目一直做下去的人。
可以把它理解成「不用每次重新把整间办公室搬进来」
想像你每天请一位顾问来公司。
第一天,
你先花两小时跟他解释:
公司做什么。
有哪些产品。
客户是谁。
项目规则。
哪些事情不能动。
第二天顾问又来,
如果又要重新解释两小时,
非常浪费。
比较合理的是:
顾问已经知道公司的固定背景。
你今天只告诉他:
「新的问题是这个。」
Prompt Cache 就有一点像这个概念。
不是让 AI 永远记住所有事情。
而是让某些:
重复又稳定的 Context
可以更便宜地重复使用。
哪些工作最适合这次更新?
第一种:
大型 Coding Project。
模型每天都要反复理解同一个 Codebase。
第二种:
长期研究。
例如固定一批:
研究文档。
背景数据。
分析规则。
每次添加的是新的问题或新数据。
第三种:
企业 Agent。
系统 Prompt。
公司规则。
Tool Schema。
操作边界。
可能每一次都一样。
第四种:
长文档工作。
例如:
法律。
财务。
产品规格。
技术文档。
同一套文档需要反复查找与比较。
共同特征都是:
固定背景很多,新工作只占一部分。
Google Cloud 版本甚至支持很大的 Context
Google Cloud 的 Fable 5.1 文档目前列出:
最高 Input:
100 万 Tokens。
最高 Output:
128,000 Tokens。
同时支持:
Text。
Image。
PDF。
Computer Use。
Web Search。
Prompt Caching。
Function Calling。
这表示它确实是按照:
大型文档+工具+长工作流程
这类使用情境设计。
但这里要注意:
这是 Google Cloud 上的模型规格。
不能直接拿来说:
每一个 Claude App 订阅方案都一定给你完全相同的 Context Limit。
不同产品入口可能有不同限制。
它是不是做任何事情都比其他 Claude 划算?
不一定。
如果只是:
改 Email。
摘要短文。
翻译几段文字。
写一篇普通贴文。
使用最高能力模型可能反而没有必要。
就像:
你不会为了去便利商店,
特别叫一台大型货车。
Fable 5.1 真正适合的是:
工作够难,而且够长。
如果任务很简单,
速度。
成本。
日常额度。
反而可能比最高能力更重要。
Claude.ai 里还有一个容易忽略的 Effort 差别
Anthropic 表示,
Fable 5.1 在不同产品里有不同的预设 Effort。
Claude Code:
预设 High。
Claude Cowork 与 Claude.ai:
预设 Medium。
Anthropic 也表示,
Fable 5.1 在 Low 或 Medium Effort 下,
部分任务就可以达到接近或超过 Fable 5 的结果,
同时降低成本。
这代表:
模型变强之后,不一定每件工作都要开到最大推理。
未来选 AI 的方式可能更像:
模型选哪个。
Effort 开多少。
Context 有多少可以 Cache。
三个一起算。
Anthropic 的 Benchmark 看起来进步很大,可以直接相信吗?
可以当参考。
但不要把厂商 Benchmark 当成:
你的工作一定会提升多少。
例如 Anthropic 报告:
Fable 5.1 在 Terminal-Bench-Science 0.1 的测试结果为:
52.6%。
Fable 5:
24.7%。
在 Agentic Coding、Knowledge Work 与 Computer Use 的多项测试也有提升。
这些结果说明:
模型能力确实值得测。
但最后真正重要的还是:
你的工作有没有变好。
所以如果公司原本使用 Fable 5,
最实际的测试不是看排行榜。
而是拿:
10 个真正做过的 Coding Task。
10 个真正的研究工作。
10 个真正的长流程。
同时跑新旧版本。
比较:
成功率。
人工修改时间。
Token。
完成时间。
总成本。
Fable 5.1 也不是「安全限制全部变少」
Anthropic 同时调整了 Cybersecurity 与 Biology Safeguards。
例如一般 Fable 5.1 现在可以协助:
发现软件漏洞。
但并不代表一般用户就能取得完整:
Exploit Development
能力。
部分被安全系统判定为高风险的要求,
仍可能转到其他 Claude 模型或受到限制。
Mythos 5.1 才是提供给经过审核的特定专业组织,
使用不同 Safeguard 条件的版本。
所以:
模型能力变强
和:
所有能力全部无限制开放
不是同一件事。
数据保存也要注意
Anthropic 表示,
Fable 5.1 的使用预设需要:
30 天数据保存
用于安全监控。
部分符合资格的企业客户,
目前可以使用 Zero Data Retention。
Anthropic 另外准备推出:
Enterprise Frontier Safeguards。
让相关安全监控数据保存在客户自己控制的 Cloud Infrastructure,
预计今年秋季开始分阶段推出。
因此企业若准备把:
敏感代码。
研究数据。
客户数据。
放进 Fable 5.1,
不能只看:
「模型很强。」
数据治理条件也要一起确认。
一般用户今天到底该怎么判断要不要用?
可以先问三个问题。
第一:
这件事会不会做很久?
如果只是三分钟完成,
不一定需要 Fable。
第二:
它是不是需要一直记住大量固定背景?
如果同一份:
代码。
规则。
文档。
项目数据。
会反复使用,
Fable 5.1 和 Cache Pricing 就开始有意义。
第三:
做错一次的人工修改成本高不高?
如果一个复杂 Coding Task,
AI 做错后你要花三小时重查,
更高能力模型即使单次比较贵,
最后也可能比较便宜。
真正要看的不是:
每百万 Token 谁最便宜。
而是:
一件完整工作做到可以用,总共花多少。
今天最值得记住的不是 Fable 5.1 又变聪明
更重要的是:
AI 的成本计算正在改变。
以前大家习惯比较:
Input Token 多少钱。
Output Token 多少钱。
但 Agent 真正开始长时间工作后,
新的问题变成:
这 20 万 Token 里,有多少其实昨天已经读过?
如果大量 Context 每次都相同,
真正值得优化的就不是:
一直换更便宜的模型。
而可能是:
不要一直付钱让 AI 重读同一件事情。
Fable 5.1 这次把 Cache Read 降到原本四分之一,
真正透露的就是:
AI 正从一次性聊天,
走向:
同一个项目持续工作。
而到了这个阶段,
真正省成本的方法,
不再只是:
「用最便宜的模型。」
而是:
让模型把钱花在新的问题上,不要一直重新理解已经知道的背景。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
今日 AI 工具|2026/08/18:Notion AI Model Picker,不必永远用最强模型,直接比较速度、能力与成本再选