AI 安全以前最常討論的一個問題是:

模型會不會回答危險問題?

例如有人直接問:

怎麼做武器?

怎麼入侵系統?

怎麼製造危險物質?

模型拒絕。

看起來:

安全機制有效。

但 Anthropic 最新公開的 Threat Intelligence Report,開始讓問題變得更麻煩。

因為真正有意圖的人:

不一定會直接問完整的危險問題。

他可以把一件事:

拆成很多小任務。

分散到很多次 Session。

換不同帳號。

隱藏真正目的。

讓每一段看起來:

都沒有那麼危險。

最後再把所有結果:

拼回同一個現實世界計畫。

Anthropic 說,過去八個月已經看到這種事情真正發生

Anthropic 最新報告涵蓋:

2025 年 12 月到 2026 年 8 月。

公司表示:

這段時間發現並中止多起利用 Claude 進行惡意活動的案例。

範圍包括:

Cyber Operations。

Surveillance。

Influence Operations。

Scams and Fraud。

Biological Misuse。

Conventional Weapons。

Illicit Distillation。

也就是:

已經不只是:

AI 幫忙寫釣魚 Email。

而是開始進入:

更長時間。

更多步驟。

更專業。

甚至和真實軍事、情報與武器工作連在一起的使用方式。

最值得注意的是「傳統武器」這一類

Anthropic 這次特別公開:

六組和傳統武器有關的案例。

公司表示:

其中一些使用者利用 Claude:

協助開發武器軟體。

另一些則用來:

蒐集情報。

研究供應鏈。

或準備技術資料。

Anthropic 公開的案例類型包括:

導引火箭相關軟體。

無人機群控制軟體。

反魚雷系統設計提案。

電子戰與防空壓制相關目標軟體。

以及武器供應鏈情報蒐集。

這裡要特別注意:

並不是 Anthropic 說 Claude 自己製造出一件完整武器。

很多行動本來就有:

具備專業背景的人。

現成硬體。

其他工程工具。

既有軍事或工程知識。

Claude 扮演的是:

加速部分研究、設計、程式與資料整理工作的工具。

這個差別非常重要。

其中一個案例甚至真的進行了火箭測試

Anthropic 描述:

有一組行動持續利用 Claude:

協助開發導引武器相關軟體。

相關人員後來:

真的進行一次導引火箭實地測試。

但 Anthropic 沒有說:

這項計畫成功部署成可用武器。

相反地:

公司表示那次測試看起來失敗了。

而且在測試後幾個小時:

相關使用者又回到 Claude:

繼續分析問題。

所以比較準確的描述不是:

「Claude 成功做出飛彈。」

而是:

AI 已經被放進真實武器研發與測試流程裡。

這本身就已經是很大的轉折。

無人機案例也出現相同模式

另一批行動涉及:

無人機群軟體。

Anthropic 表示:

相關程式已經進行模擬測試。

部分 Code 也曾載入:

真實硬體板。

這不代表:

一整套自主武器已經實戰部署。

但它代表:

AI 產生或協助修改的內容:

已經不只停留在:

文字。

報告。

Idea。

而開始接近:

真正可以跑在硬體上的工程流程。

這和以前「AI 告訴我一些知識」差很多

假設 AI 回答:

飛行控制的一般原理。

那是一件事。

但如果同一個使用者持續要求:

寫一段模組。

改一段控制邏輯。

排除模擬錯誤。

分析測試結果。

再修改。

AI 扮演的角色就變了。

它不只是:

Knowledge Source。

開始變成:

Engineering Assistant。

甚至:

Agentic Workflow 裡的一部分。

這就是前沿 AI 安全現在真正緊張的地方。

更大的問題是:危險工作可以被切碎

Anthropic 明確提到:

一些行動者會把工作:

分散到很多 Session。

目的就是:

不要讓任何單一對話:

暴露完整企圖。

這對傳統 Content Filter 是一個很大的問題。

因為如果只看一個 Prompt:

它可能只是:

「幫我修改這個控制程式。」

看起來:

非常普通。

另一個 Session:

「幫我分析這個 Sensor 的誤差。」

也很普通。

再一個:

「這段模擬為什麼不穩定?」

單獨看:

仍然像工程問題。

只有把:

使用者。

帳號。

時間。

任務。

歷史行為。

一起連起來:

才可能發現:

原來所有小工作:

屬於同一個高風險計畫。

所以 AI 安全開始從 Prompt Safety 變成 Campaign Detection

以前我們會問:

這句 Prompt:

該不該回答?

現在還要多問:

這個使用者這幾週到底在做什麼?

這就是完全不同層級的問題。

它更像:

銀行反洗錢。

信用卡 Fraud Detection。

資安 SOC。

單筆交易:

可能完全正常。

但是:

20 筆交易放在一起:

模式就不正常。

前沿 AI 平台也開始走到同一種情況。

單一請求:

也許合理。

但是:

很多請求串起來:

可能完全改變風險。

Anthropic 自己承認:防護擋住很多,但沒有全部擋住

這可能是整份報告最值得注意的一句。

Anthropic 表示:

它的 Safeguards:

阻止了很多危險請求。

但不是全部。

行動者會使用各種方式:

隱藏最終目的。

把工作拆開。

使用多個 Session。

避開地區限制。

或讓每次要求:

看起來像一般工程、研究工作。

所以不能把:

「模型有 Safety Filter」

理解成:

「危險使用因此不可能發生。」

這和我們平常談 AI Agent 是一樣的。

Prompt Rule:

是防線。

不是絕對安全鎖。

Anthropic 後來怎麼處理?

當 Threat Intelligence Team 把行動串起來後:

Anthropic 表示:

會停用相關帳戶。

建立新的偵測方式。

把已知的行為 Pattern:

做進 Safeguards。

必要時也會:

向政府。

科技公司。

其他安全合作夥伴。

分享 Threat Intelligence。

在武器相關案例後:

Anthropic 也新增了更專門的 Classifier:

用來偵測高爆炸藥與武器開發相關活動。

所以:

Safety 不是一套規則上線後:

永遠不變。

而是:

對手找到新方法 → 平台看到 → 再加新防線。

本質上就是:

攻防競賽。

但最大的問題是:有些工作離線後就不再需要 Claude

Anthropic 在其中一個武器案例裡:

還提到一個很麻煩的現象。

相關行動者已經建立:

自己的 Offline Simulation Toolkit。

也就是:

就算平台後來把帳號停掉:

對方前面已經取得的:

程式。

方法。

工具。

資料。

可能還是可以繼續使用。

這和一般內容平台:

刪除帳號。

差很多。

如果有人利用 AI:

寫一篇垃圾文章。

帳號停掉:

事情可能就結束。

如果 AI 已經幫他:

建立一套本地軟體。

那麼平台停止服務之後:

能力可能留下來。

這會讓防護更加困難。

Anthropic 也開始建立新的「軍事能力 Benchmark」

這次公司不只公布濫用案例。

Anthropic 的 Frontier Red Team 還建立:

新的 Evaluation。

專門測:

Tactical Intelligence Targeting。

以及:

Conventional Weapons Development。

例如:

模型能不能根據零碎資訊:

找到某個目標位置。

或者:

能不能幫助改善某些武器系統的工程問題。

Anthropic 表示:

測試結果顯示:

AI 在這類任務上的能力:

持續提升。

甚至部分軍事與情報任務:

模型已能做到過去通常需要:

少數高度專業人才。

才能完成的工作。

這句話真正值得警惕的不是:

「AI 已經比軍事專家厲害。」

Anthropic沒有這樣說。

真正重要的是:

某些過去因為專家很少而難以擴張的能力,可能因 AI 變得更容易取得。

這叫做 Capability Uplift

Anthropic 在報告裡使用一個概念:

Uplift。

可以簡單理解成:

有了 AI 之後:

一個人的能力:

到底增加多少?

如果原本就是世界級專家:

AI 幫他提高 5%。

是一種風險。

如果原本只有一般程度:

AI 讓他能完成以前完全做不到的事:

又是另一種風險。

所以 AI Safety 真正要看的:

不是:

模型「知道多少」。

而是:

它把誰提升到了什麼能力。

這也解釋了為什麼昨天美國參議院開始談「Duty of Care」

今天早報我們才看到:

美國參議院正在協商:

讓最前沿 AI Developer 承擔:

Duty of Care。

也就是:

注意義務。

討論的重大風險:

就包括:

Cyberattack。

Biological Weapon。

Nuclear-related Capability。

而 Anthropic 最新這份 Threat Report:

剛好提供另一個現實面。

制度還在討論:

但真實世界已經有人:

拿 AI 往軍事。

情報。

武器。

生物研究。

方向使用。

這就是為什麼政策速度:

很難跟模型能力同步。

但也不要把報告解讀成「Claude 已經變成武器」

這樣會過度放大。

目前公開資訊支持的是:

不同地區、不同類型的使用者:

曾經嘗試把 Claude:

放進高風險工作流程。

部分案例確實進到:

真實工程與測試階段。

但很多計畫:

是否真正成功部署。

是否真的提高實戰能力。

提高多少。

外界都還不知道。

而且 Anthropic 公布的案例:

主要來自公司自己掌握的平台資料與調查。

所以最合理的態度是:

重視。

但不要:

誇大。

更值得看的,是 AI 安全架構正在被迫改變

第一代安全:

Dangerous Prompt → Refuse。

第二代:

模型執行 Agent Task → 限制 Tool/Permission。

現在第三層正在出現:

跨 Session、跨帳號、跨時間偵測完整行動。

未來可能還需要第四層:

不同 AI 公司之間:

分享 Threat Indicator。

因為一個人被:

A 平台封掉。

完全可以轉到:

B 平台。

甚至改用:

Open-weight Model。

只靠單一公司:

很難完全阻止。

Open-weight AI 會讓這件事更複雜

Anthropic 可以:

停用 Claude Account。

更新 Classifier。

限制特定請求。

但如果模型:

可以完整下載到本地。

平台就不存在:

帳戶停權。

Server-side Monitoring。

集中式 Safeguard。

這不代表:

Open-weight AI 本身等於危險。

它同時有:

研究。

透明度。

客製化。

成本。

自主控制。

等重要價值。

但在高風險能力出現後:

治理方法一定會和:

Closed Model。

不一樣。

這也是未來政策最難處理的問題之一。

一般使用者為什麼需要知道這件事?

因為同一個安全原理:

其實也適用我們每天用的 Agent。

不要只問:

「這一個 Action 安不安全?」

還要問:

「很多安全的小 Action 串起來,最後會變成什麼?」

例如 Agent:

讀一封 Email。

正常。

找一個聯絡人。

正常。

查一份付款資料。

正常。

開一個外部網站。

正常。

準備一封信。

也正常。

但全部串起來:

可能變成:

把敏感資料寄給外部的人。

單一步驟都沒越界。

完整工作流卻越界。

這就是今天這份報告最值得一般人理解的地方。

所以停止條件也不能只寫在「最後一步」

很多人設定 AI Agent:

「付款前一定問我。」

很好。

但如果前面已經:

把資料送出去。

建立帳號。

授權外部 App。

下載敏感資料。

那到付款才停:

已經太晚。

安全真正要看:

整條 Chain。

哪一步開始:

風險已不可逆?

這也是為什麼:

Agent Testing。

Audit Log。

Least Privilege。

Sandbox。

跨 Session Monitoring。

會越來越重要。

AI 真正變強之後,安全不可能只靠一句「不要做壞事」

今天 Anthropic 的案例最清楚地證明:

真正想繞過規則的人:

會適應。

Safety Model:

也必須適應。

而且當 AI 從:

回答問題。

變成:

寫程式。

跑研究。

調整系統。

分析測試。

連接工具。

安全問題自然不再只是:

它說了什麼?

而是:

它幫誰完成了什麼?

這也是前沿 AI 下一階段真正的壓力測試

Benchmark 可以告訴我們:

模型數學多強。

Coding 多強。

Research 多強。

但社會最後還需要另一種 Benchmark:

當有人刻意:

分拆任務。

隱藏目的。

跨多次 Session。

利用工具。

反覆調整。

模型與平台:

能不能發現:

這不是普通工作。

這會比:

一次拒絕一個明顯危險 Prompt。

困難很多。

所以今晚真正值得記住的不是「Claude 被拿去做武器」

更重要的是:

AI 安全正在從一句 Prompt 的安全,進入完整行動鏈的安全。

以前:

看問題。

現在:

要看人。

看歷史。

看工具。

看行為。

看很多次 Session 之間的關係。

因為真正高風險的使用者:

不會永遠把完整目的:

一次打進聊天框。

而模型能力愈強:

這種碎片化工作:

就愈可能被重新組合成現實能力。

Anthropic 這次真正揭示的:

不是 AI 已經無法控制。

而是:

「有安全機制」和「安全問題已經解決」,完全是兩回事。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

武器已經愈來愈能自己找目標,為什麼聯合國現在堅持「殺不殺人」不能交給機器?

今日 AI 工具|2026/08/08:Inspect AI,把 AI Agent 放進可重複測試與沙箱,先看它會怎麼失敗再上線

AI 一分鐘教學|2026/08/08:測 AI Agent 時,先寫「正常、停止、失敗」三種結果