AI 安全以前最常讨论的一个问题是:
模型会不会回答危险问题?
例如有人直接问:
怎么做武器?
怎么入侵系统?
怎么制造危险物质?
模型拒绝。
看起来:
安全机制有效。
但 Anthropic 最新公开的 Threat Intelligence Report,开始让问题变得更麻烦。
因为真正有意图的人:
不一定会直接问完整的危险问题。
他可以把一件事:
拆成很多小任务。
分散到很多次 Session。
换不同帐号。
隐藏真正目的。
让每一段看起来:
都没有那么危险。
最后再把所有结果:
拼回同一个现实世界计划。
Anthropic 说,过去八个月已经看到这种事情真正发生
Anthropic 最新报告涵盖:
2025 年 12 月到 2026 年 8 月。
公司表示:
这段时间发现并中止多起利用 Claude 进行恶意活动的案例。
范围包括:
Cyber Operations。
Surveillance。
Influence Operations。
Scams and Fraud。
Biological Misuse。
Conventional Weapons。
Illicit Distillation。
也就是:
已经不只是:
AI 帮忙写钓鱼 Email。
而是开始进入:
更长时间。
更多步骤。
更专业。
甚至和真实军事、情报与武器工作连在一起的使用方式。
最值得注意的是「传统武器」这一类
Anthropic 这次特别公开:
六组和传统武器有关的案例。
公司表示:
其中一些用户利用 Claude:
协助开发武器软件。
另一些则用来:
搜集情报。
研究供应链。
或准备技术数据。
Anthropic 公开的案例类型包括:
导引火箭相关软件。
无人机群控制软件。
反鱼雷系统设计提案。
电子战与防空压制相关目标软件。
以及武器供应链情报搜集。
这里要特别注意:
并不是 Anthropic 说 Claude 自己制造出一件完整武器。
很多行动本来就有:
具备专业背景的人。
现成硬件。
其他工程工具。
既有军事或工程知识。
Claude 扮演的是:
加速部分研究、设计、程序与数据整理工作的工具。
这个差别非常重要。
其中一个案例甚至真的进行了火箭测试
Anthropic 描述:
有一组行动持续利用 Claude:
协助开发导引武器相关软件。
相关人员后来:
真的进行一次导引火箭实地测试。
但 Anthropic 没有说:
这项计划成功部署成可用武器。
相反地:
公司表示那次测试看起来失败了。
而且在测试后几个小时:
相关用户又回到 Claude:
继续分析问题。
所以比较准确的描述不是:
「Claude 成功做出飞弹。」
而是:
AI 已经被放进真实武器研发与测试流程里。
这本身就已经是很大的转折。
无人机案例也出现相同模式
另一批行动涉及:
无人机群软件。
Anthropic 表示:
相关程序已经进行模拟测试。
部分 Code 也曾加载:
真实硬件板。
这不代表:
一整套自主武器已经实战部署。
但它代表:
AI 产生或协助修改的内容:
已经不只停留在:
文字。
报告。
Idea。
而开始接近:
真正可以跑在硬件上的工程流程。
这和以前「AI 告诉我一些知识」差很多
假设 AI 回答:
飞行控制的一般原理。
那是一件事。
但如果同一个用户持续要求:
写一段模块。
改一段控制逻辑。
排除模拟错误。
分析测试结果。
再修改。
AI 扮演的角色就变了。
它不只是:
Knowledge Source。
开始变成:
Engineering Assistant。
甚至:
Agentic Workflow 里的一部分。
这就是前沿 AI 安全现在真正紧张的地方。
更大的问题是:危险工作可以被切碎
Anthropic 明确提到:
一些行动者会把工作:
分散到很多 Session。
目的就是:
不要让任何单一对话:
暴露完整企图。
这对传统 Content Filter 是一个很大的问题。
因为如果只看一个 Prompt:
它可能只是:
「帮我修改这个控制程序。」
看起来:
非常普通。
另一个 Session:
「帮我分析这个 Sensor 的误差。」
也很普通。
再一个:
「这段模拟为什么不稳定?」
单独看:
仍然像工程问题。
只有把:
用户。
帐号。
时间。
任务。
历史行为。
一起连起来:
才可能发现:
原来所有小工作:
属于同一个高风险计划。
所以 AI 安全开始从 Prompt Safety 变成 Campaign Detection
以前我们会问:
这句 Prompt:
该不该回答?
现在还要多问:
这个用户这几周到底在做什么?
这就是完全不同层级的问题。
它更像:
银行反洗钱。
信用卡 Fraud Detection。
资安 SOC。
单笔交易:
可能完全正常。
但是:
20 笔交易放在一起:
模式就不正常。
前沿 AI 平台也开始走到同一种情况。
单一请求:
也许合理。
但是:
很多请求串起来:
可能完全改变风险。
Anthropic 自己承认:防护挡住很多,但没有全部挡住
这可能是整份报告最值得注意的一句。
Anthropic 表示:
它的 Safeguards:
阻止了很多危险请求。
但不是全部。
行动者会使用各种方式:
隐藏最终目的。
把工作拆开。
使用多个 Session。
避开地区限制。
或让每次要求:
看起来像一般工程、研究工作。
所以不能把:
「模型有 Safety Filter」
理解成:
「危险使用因此不可能发生。」
这和我们平常谈 AI Agent 是一样的。
Prompt Rule:
是防线。
不是绝对安全锁。
Anthropic 后来怎么处理?
当 Threat Intelligence Team 把行动串起来后:
Anthropic 表示:
会禁用相关帐户。
创建新的侦测方式。
把已知的行为 Pattern:
做进 Safeguards。
必要时也会:
向政府。
科技公司。
其他安全合作伙伴。
分享 Threat Intelligence。
在武器相关案例后:
Anthropic 也添加了更专门的 Classifier:
用来侦测高爆炸药与武器开发相关活动。
所以:
Safety 不是一套规则上线后:
永远不变。
而是:
对手找到新方法 → 平台看到 → 再加新防线。
本质上就是:
攻防竞赛。
但最大的问题是:有些工作脱机后就不再需要 Claude
Anthropic 在其中一个武器案例里:
还提到一个很麻烦的现象。
相关行动者已经创建:
自己的 Offline Simulation Toolkit。
也就是:
就算平台后来把帐号停掉:
对方前面已经取得的:
程序。
方法。
工具。
数据。
可能还是可以继续使用。
这和一般内容平台:
删除帐号。
差很多。
如果有人利用 AI:
写一篇垃圾文章。
帐号停掉:
事情可能就结束。
如果 AI 已经帮他:
创建一套本地软件。
那么平台停止服务之后:
能力可能留下来。
这会让防护更加困难。
Anthropic 也开始创建新的「军事能力 Benchmark」
这次公司不只公布滥用案例。
Anthropic 的 Frontier Red Team 还创建:
新的 Evaluation。
专门测:
Tactical Intelligence Targeting。
以及:
Conventional Weapons Development。
例如:
模型能不能根据零碎信息:
找到某个目标位置。
或者:
能不能帮助改善某些武器系统的工程问题。
Anthropic 表示:
测试结果显示:
AI 在这类任务上的能力:
持续提升。
甚至部分军事与情报任务:
模型已能做到过去通常需要:
少数高度专业人才。
才能完成的工作。
这句话真正值得警惕的不是:
「AI 已经比军事专家厉害。」
Anthropic没有这样说。
真正重要的是:
某些过去因为专家很少而难以扩张的能力,可能因 AI 变得更容易取得。
这叫做 Capability Uplift
Anthropic 在报告里使用一个概念:
Uplift。
可以简单理解成:
有了 AI 之后:
一个人的能力:
到底增加多少?
如果原本就是世界级专家:
AI 帮他提高 5%。
是一种风险。
如果原本只有一般程度:
AI 让他能完成以前完全做不到的事:
又是另一种风险。
所以 AI Safety 真正要看的:
不是:
模型「知道多少」。
而是:
它把谁提升到了什么能力。
这也解释了为什么昨天美国参议院开始谈「Duty of Care」
今天早报我们才看到:
美国参议院正在协商:
让最前沿 AI Developer 承担:
Duty of Care。
也就是:
注意义务。
讨论的重大风险:
就包括:
Cyberattack。
Biological Weapon。
Nuclear-related Capability。
而 Anthropic 最新这份 Threat Report:
刚好提供另一个现实面。
制度还在讨论:
但真实世界已经有人:
拿 AI 往军事。
情报。
武器。
生物研究。
方向使用。
这就是为什么政策速度:
很难跟模型能力同步。
但也不要把报告解读成「Claude 已经变成武器」
这样会过度放大。
目前公开信息支持的是:
不同地区、不同类型的用户:
曾经尝试把 Claude:
放进高风险工作流程。
部分案例确实进到:
真实工程与测试阶段。
但很多计划:
是否真正成功部署。
是否真的提高实战能力。
提高多少。
外界都还不知道。
而且 Anthropic 公布的案例:
主要来自公司自己掌握的平台数据与调查。
所以最合理的态度是:
重视。
但不要:
夸大。
更值得看的,是 AI 安全架构正在被迫改变
第一代安全:
Dangerous Prompt → Refuse。
第二代:
模型运行 Agent Task → 限制 Tool/Permission。
现在第三层正在出现:
跨 Session、跨帐号、跨时间侦测完整行动。
未来可能还需要第四层:
不同 AI 公司之间:
分享 Threat Indicator。
因为一个人被:
A 平台封掉。
完全可以转到:
B 平台。
甚至改用:
Open-weight Model。
只靠单一公司:
很难完全阻止。
Open-weight AI 会让这件事更复杂
Anthropic 可以:
禁用 Claude Account。
更新 Classifier。
限制特定请求。
但如果模型:
可以完整下载到本地。
平台就不存在:
帐户停权。
Server-side Monitoring。
集中式 Safeguard。
这不代表:
Open-weight AI 本身等于危险。
它同时有:
研究。
透明度。
客制化。
成本。
自主控制。
等重要价值。
但在高风险能力出现后:
治理方法一定会和:
Closed Model。
不一样。
这也是未来政策最难处理的问题之一。
一般用户为什么需要知道这件事?
因为同一个安全原理:
其实也适用我们每天用的 Agent。
不要只问:
「这一个 Action 安不安全?」
还要问:
「很多安全的小 Action 串起来,最后会变成什么?」
例如 Agent:
读一封 Email。
正常。
找一个联系人。
正常。
查一份付款数据。
正常。
开一个外部网站。
正常。
准备一封信。
也正常。
但全部串起来:
可能变成:
把敏感数据寄给外部的人。
单一步骤都没越界。
完整工作流却越界。
这就是今天这份报告最值得一般人理解的地方。
所以停止条件也不能只写在「最后一步」
很多人设置 AI Agent:
「付款前一定问我。」
很好。
但如果前面已经:
把数据送出去。
创建帐号。
授权外部 App。
下载敏感数据。
那到付款才停:
已经太晚。
安全真正要看:
整条 Chain。
哪一步开始:
风险已不可逆?
这也是为什么:
Agent Testing。
Audit Log。
Least Privilege。
Sandbox。
跨 Session Monitoring。
会越来越重要。
AI 真正变强之后,安全不可能只靠一句「不要做坏事」
今天 Anthropic 的案例最清楚地证明:
真正想绕过规则的人:
会适应。
Safety Model:
也必须适应。
而且当 AI 从:
回答问题。
变成:
写程序。
跑研究。
调整系统。
分析测试。
连接工具。
安全问题自然不再只是:
它说了什么?
而是:
它帮谁完成了什么?
这也是前沿 AI 下一阶段真正的压力测试
Benchmark 可以告诉我们:
模型数学多强。
Coding 多强。
Research 多强。
但社会最后还需要另一种 Benchmark:
当有人刻意:
分拆任务。
隐藏目的。
跨多次 Session。
利用工具。
反复调整。
模型与平台:
能不能发现:
这不是普通工作。
这会比:
一次拒绝一个明显危险 Prompt。
困难很多。
所以今晚真正值得记住的不是「Claude 被拿去做武器」
更重要的是:
AI 安全正在从一句 Prompt 的安全,进入完整行动链的安全。
以前:
看问题。
现在:
要看人。
看历史。
看工具。
看行为。
看很多次 Session 之间的关系。
因为真正高风险的用户:
不会永远把完整目的:
一次打进聊天框。
而模型能力愈强:
这种碎片化工作:
就愈可能被重新组合成现实能力。
Anthropic 这次真正揭示的:
不是 AI 已经无法控制。
而是:
「有安全机制」和「安全问题已经解决」,完全是两回事。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
武器已经愈来愈能自己找目标,为什么联合国现在坚持「杀不杀人」不能交给机器?
今日 AI 工具|2026/08/08:Inspect AI,把 AI Agent 放进可重复测试与沙箱,先看它会怎么失败再上线