AI 安全以前最常讨论的一个问题是:

模型会不会回答危险问题?

例如有人直接问:

怎么做武器?

怎么入侵系统?

怎么制造危险物质?

模型拒绝。

看起来:

安全机制有效。

但 Anthropic 最新公开的 Threat Intelligence Report,开始让问题变得更麻烦。

因为真正有意图的人:

不一定会直接问完整的危险问题。

他可以把一件事:

拆成很多小任务。

分散到很多次 Session。

换不同帐号。

隐藏真正目的。

让每一段看起来:

都没有那么危险。

最后再把所有结果:

拼回同一个现实世界计划。

Anthropic 说,过去八个月已经看到这种事情真正发生

Anthropic 最新报告涵盖:

2025 年 12 月到 2026 年 8 月。

公司表示:

这段时间发现并中止多起利用 Claude 进行恶意活动的案例。

范围包括:

Cyber Operations。

Surveillance。

Influence Operations。

Scams and Fraud。

Biological Misuse。

Conventional Weapons。

Illicit Distillation。

也就是:

已经不只是:

AI 帮忙写钓鱼 Email。

而是开始进入:

更长时间。

更多步骤。

更专业。

甚至和真实军事、情报与武器工作连在一起的使用方式。

最值得注意的是「传统武器」这一类

Anthropic 这次特别公开:

六组和传统武器有关的案例。

公司表示:

其中一些用户利用 Claude:

协助开发武器软件。

另一些则用来:

搜集情报。

研究供应链。

或准备技术数据。

Anthropic 公开的案例类型包括:

导引火箭相关软件。

无人机群控制软件。

反鱼雷系统设计提案。

电子战与防空压制相关目标软件。

以及武器供应链情报搜集。

这里要特别注意:

并不是 Anthropic 说 Claude 自己制造出一件完整武器。

很多行动本来就有:

具备专业背景的人。

现成硬件。

其他工程工具。

既有军事或工程知识。

Claude 扮演的是:

加速部分研究、设计、程序与数据整理工作的工具。

这个差别非常重要。

其中一个案例甚至真的进行了火箭测试

Anthropic 描述:

有一组行动持续利用 Claude:

协助开发导引武器相关软件。

相关人员后来:

真的进行一次导引火箭实地测试。

但 Anthropic 没有说:

这项计划成功部署成可用武器。

相反地:

公司表示那次测试看起来失败了。

而且在测试后几个小时:

相关用户又回到 Claude:

继续分析问题。

所以比较准确的描述不是:

「Claude 成功做出飞弹。」

而是:

AI 已经被放进真实武器研发与测试流程里。

这本身就已经是很大的转折。

无人机案例也出现相同模式

另一批行动涉及:

无人机群软件。

Anthropic 表示:

相关程序已经进行模拟测试。

部分 Code 也曾加载:

真实硬件板。

这不代表:

一整套自主武器已经实战部署。

但它代表:

AI 产生或协助修改的内容:

已经不只停留在:

文字。

报告。

Idea。

而开始接近:

真正可以跑在硬件上的工程流程。

这和以前「AI 告诉我一些知识」差很多

假设 AI 回答:

飞行控制的一般原理。

那是一件事。

但如果同一个用户持续要求:

写一段模块。

改一段控制逻辑。

排除模拟错误。

分析测试结果。

再修改。

AI 扮演的角色就变了。

它不只是:

Knowledge Source。

开始变成:

Engineering Assistant。

甚至:

Agentic Workflow 里的一部分。

这就是前沿 AI 安全现在真正紧张的地方。

更大的问题是:危险工作可以被切碎

Anthropic 明确提到:

一些行动者会把工作:

分散到很多 Session。

目的就是:

不要让任何单一对话:

暴露完整企图。

这对传统 Content Filter 是一个很大的问题。

因为如果只看一个 Prompt:

它可能只是:

「帮我修改这个控制程序。」

看起来:

非常普通。

另一个 Session:

「帮我分析这个 Sensor 的误差。」

也很普通。

再一个:

「这段模拟为什么不稳定?」

单独看:

仍然像工程问题。

只有把:

用户。

帐号。

时间。

任务。

历史行为。

一起连起来:

才可能发现:

原来所有小工作:

属于同一个高风险计划。

所以 AI 安全开始从 Prompt Safety 变成 Campaign Detection

以前我们会问:

这句 Prompt:

该不该回答?

现在还要多问:

这个用户这几周到底在做什么?

这就是完全不同层级的问题。

它更像:

银行反洗钱。

信用卡 Fraud Detection。

资安 SOC。

单笔交易:

可能完全正常。

但是:

20 笔交易放在一起:

模式就不正常。

前沿 AI 平台也开始走到同一种情况。

单一请求:

也许合理。

但是:

很多请求串起来:

可能完全改变风险。

Anthropic 自己承认:防护挡住很多,但没有全部挡住

这可能是整份报告最值得注意的一句。

Anthropic 表示:

它的 Safeguards:

阻止了很多危险请求。

但不是全部。

行动者会使用各种方式:

隐藏最终目的。

把工作拆开。

使用多个 Session。

避开地区限制。

或让每次要求:

看起来像一般工程、研究工作。

所以不能把:

「模型有 Safety Filter」

理解成:

「危险使用因此不可能发生。」

这和我们平常谈 AI Agent 是一样的。

Prompt Rule:

是防线。

不是绝对安全锁。

Anthropic 后来怎么处理?

当 Threat Intelligence Team 把行动串起来后:

Anthropic 表示:

会禁用相关帐户。

创建新的侦测方式。

把已知的行为 Pattern:

做进 Safeguards。

必要时也会:

向政府。

科技公司。

其他安全合作伙伴。

分享 Threat Intelligence。

在武器相关案例后:

Anthropic 也添加了更专门的 Classifier:

用来侦测高爆炸药与武器开发相关活动。

所以:

Safety 不是一套规则上线后:

永远不变。

而是:

对手找到新方法 → 平台看到 → 再加新防线。

本质上就是:

攻防竞赛。

但最大的问题是:有些工作脱机后就不再需要 Claude

Anthropic 在其中一个武器案例里:

还提到一个很麻烦的现象。

相关行动者已经创建:

自己的 Offline Simulation Toolkit。

也就是:

就算平台后来把帐号停掉:

对方前面已经取得的:

程序。

方法。

工具。

数据。

可能还是可以继续使用。

这和一般内容平台:

删除帐号。

差很多。

如果有人利用 AI:

写一篇垃圾文章。

帐号停掉:

事情可能就结束。

如果 AI 已经帮他:

创建一套本地软件。

那么平台停止服务之后:

能力可能留下来。

这会让防护更加困难。

Anthropic 也开始创建新的「军事能力 Benchmark」

这次公司不只公布滥用案例。

Anthropic 的 Frontier Red Team 还创建:

新的 Evaluation。

专门测:

Tactical Intelligence Targeting。

以及:

Conventional Weapons Development。

例如:

模型能不能根据零碎信息:

找到某个目标位置。

或者:

能不能帮助改善某些武器系统的工程问题。

Anthropic 表示:

测试结果显示:

AI 在这类任务上的能力:

持续提升。

甚至部分军事与情报任务:

模型已能做到过去通常需要:

少数高度专业人才。

才能完成的工作。

这句话真正值得警惕的不是:

「AI 已经比军事专家厉害。」

Anthropic没有这样说。

真正重要的是:

某些过去因为专家很少而难以扩张的能力,可能因 AI 变得更容易取得。

这叫做 Capability Uplift

Anthropic 在报告里使用一个概念:

Uplift。

可以简单理解成:

有了 AI 之后:

一个人的能力:

到底增加多少?

如果原本就是世界级专家:

AI 帮他提高 5%。

是一种风险。

如果原本只有一般程度:

AI 让他能完成以前完全做不到的事:

又是另一种风险。

所以 AI Safety 真正要看的:

不是:

模型「知道多少」。

而是:

它把谁提升到了什么能力。

这也解释了为什么昨天美国参议院开始谈「Duty of Care」

今天早报我们才看到:

美国参议院正在协商:

让最前沿 AI Developer 承担:

Duty of Care。

也就是:

注意义务。

讨论的重大风险:

就包括:

Cyberattack。

Biological Weapon。

Nuclear-related Capability。

而 Anthropic 最新这份 Threat Report:

刚好提供另一个现实面。

制度还在讨论:

但真实世界已经有人:

拿 AI 往军事。

情报。

武器。

生物研究。

方向使用。

这就是为什么政策速度:

很难跟模型能力同步。

但也不要把报告解读成「Claude 已经变成武器」

这样会过度放大。

目前公开信息支持的是:

不同地区、不同类型的用户:

曾经尝试把 Claude:

放进高风险工作流程。

部分案例确实进到:

真实工程与测试阶段。

但很多计划:

是否真正成功部署。

是否真的提高实战能力。

提高多少。

外界都还不知道。

而且 Anthropic 公布的案例:

主要来自公司自己掌握的平台数据与调查。

所以最合理的态度是:

重视。

但不要:

夸大。

更值得看的,是 AI 安全架构正在被迫改变

第一代安全:

Dangerous Prompt → Refuse。

第二代:

模型运行 Agent Task → 限制 Tool/Permission。

现在第三层正在出现:

跨 Session、跨帐号、跨时间侦测完整行动。

未来可能还需要第四层:

不同 AI 公司之间:

分享 Threat Indicator。

因为一个人被:

A 平台封掉。

完全可以转到:

B 平台。

甚至改用:

Open-weight Model。

只靠单一公司:

很难完全阻止。

Open-weight AI 会让这件事更复杂

Anthropic 可以:

禁用 Claude Account。

更新 Classifier。

限制特定请求。

但如果模型:

可以完整下载到本地。

平台就不存在:

帐户停权。

Server-side Monitoring。

集中式 Safeguard。

这不代表:

Open-weight AI 本身等于危险。

它同时有:

研究。

透明度。

客制化。

成本。

自主控制。

等重要价值。

但在高风险能力出现后:

治理方法一定会和:

Closed Model。

不一样。

这也是未来政策最难处理的问题之一。

一般用户为什么需要知道这件事?

因为同一个安全原理:

其实也适用我们每天用的 Agent。

不要只问:

「这一个 Action 安不安全?」

还要问:

「很多安全的小 Action 串起来,最后会变成什么?」

例如 Agent:

读一封 Email。

正常。

找一个联系人。

正常。

查一份付款数据。

正常。

开一个外部网站。

正常。

准备一封信。

也正常。

但全部串起来:

可能变成:

把敏感数据寄给外部的人。

单一步骤都没越界。

完整工作流却越界。

这就是今天这份报告最值得一般人理解的地方。

所以停止条件也不能只写在「最后一步」

很多人设置 AI Agent:

「付款前一定问我。」

很好。

但如果前面已经:

把数据送出去。

创建帐号。

授权外部 App。

下载敏感数据。

那到付款才停:

已经太晚。

安全真正要看:

整条 Chain。

哪一步开始:

风险已不可逆?

这也是为什么:

Agent Testing。

Audit Log。

Least Privilege。

Sandbox。

跨 Session Monitoring。

会越来越重要。

AI 真正变强之后,安全不可能只靠一句「不要做坏事」

今天 Anthropic 的案例最清楚地证明:

真正想绕过规则的人:

会适应。

Safety Model:

也必须适应。

而且当 AI 从:

回答问题。

变成:

写程序。

跑研究。

调整系统。

分析测试。

连接工具。

安全问题自然不再只是:

它说了什么?

而是:

它帮谁完成了什么?

这也是前沿 AI 下一阶段真正的压力测试

Benchmark 可以告诉我们:

模型数学多强。

Coding 多强。

Research 多强。

但社会最后还需要另一种 Benchmark:

当有人刻意:

分拆任务。

隐藏目的。

跨多次 Session。

利用工具。

反复调整。

模型与平台:

能不能发现:

这不是普通工作。

这会比:

一次拒绝一个明显危险 Prompt。

困难很多。

所以今晚真正值得记住的不是「Claude 被拿去做武器」

更重要的是:

AI 安全正在从一句 Prompt 的安全,进入完整行动链的安全。

以前:

看问题。

现在:

要看人。

看历史。

看工具。

看行为。

看很多次 Session 之间的关系。

因为真正高风险的用户:

不会永远把完整目的:

一次打进聊天框。

而模型能力愈强:

这种碎片化工作:

就愈可能被重新组合成现实能力。

Anthropic 这次真正揭示的:

不是 AI 已经无法控制。

而是:

「有安全机制」和「安全问题已经解决」,完全是两回事。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

武器已经愈来愈能自己找目标,为什么联合国现在坚持「杀不杀人」不能交给机器?

今日 AI 工具|2026/08/08:Inspect AI,把 AI Agent 放进可重复测试与沙箱,先看它会怎么失败再上线

AI 一分钟教学|2026/08/08:测 AI Agent 时,先写「正常、停止、失败」三种结果