AI 安全以前最常討論的一個問題是:
模型會不會回答危險問題?
例如有人直接問:
怎麼做武器?
怎麼入侵系統?
怎麼製造危險物質?
模型拒絕。
看起來:
安全機制有效。
但 Anthropic 最新公開的 Threat Intelligence Report,開始讓問題變得更麻煩。
因為真正有意圖的人:
不一定會直接問完整的危險問題。
他可以把一件事:
拆成很多小任務。
分散到很多次 Session。
換不同帳號。
隱藏真正目的。
讓每一段看起來:
都沒有那麼危險。
最後再把所有結果:
拼回同一個現實世界計畫。
Anthropic 說,過去八個月已經看到這種事情真正發生
Anthropic 最新報告涵蓋:
2025 年 12 月到 2026 年 8 月。
公司表示:
這段時間發現並中止多起利用 Claude 進行惡意活動的案例。
範圍包括:
Cyber Operations。
Surveillance。
Influence Operations。
Scams and Fraud。
Biological Misuse。
Conventional Weapons。
Illicit Distillation。
也就是:
已經不只是:
AI 幫忙寫釣魚 Email。
而是開始進入:
更長時間。
更多步驟。
更專業。
甚至和真實軍事、情報與武器工作連在一起的使用方式。
最值得注意的是「傳統武器」這一類
Anthropic 這次特別公開:
六組和傳統武器有關的案例。
公司表示:
其中一些使用者利用 Claude:
協助開發武器軟體。
另一些則用來:
蒐集情報。
研究供應鏈。
或準備技術資料。
Anthropic 公開的案例類型包括:
導引火箭相關軟體。
無人機群控制軟體。
反魚雷系統設計提案。
電子戰與防空壓制相關目標軟體。
以及武器供應鏈情報蒐集。
這裡要特別注意:
並不是 Anthropic 說 Claude 自己製造出一件完整武器。
很多行動本來就有:
具備專業背景的人。
現成硬體。
其他工程工具。
既有軍事或工程知識。
Claude 扮演的是:
加速部分研究、設計、程式與資料整理工作的工具。
這個差別非常重要。
其中一個案例甚至真的進行了火箭測試
Anthropic 描述:
有一組行動持續利用 Claude:
協助開發導引武器相關軟體。
相關人員後來:
真的進行一次導引火箭實地測試。
但 Anthropic 沒有說:
這項計畫成功部署成可用武器。
相反地:
公司表示那次測試看起來失敗了。
而且在測試後幾個小時:
相關使用者又回到 Claude:
繼續分析問題。
所以比較準確的描述不是:
「Claude 成功做出飛彈。」
而是:
AI 已經被放進真實武器研發與測試流程裡。
這本身就已經是很大的轉折。
無人機案例也出現相同模式
另一批行動涉及:
無人機群軟體。
Anthropic 表示:
相關程式已經進行模擬測試。
部分 Code 也曾載入:
真實硬體板。
這不代表:
一整套自主武器已經實戰部署。
但它代表:
AI 產生或協助修改的內容:
已經不只停留在:
文字。
報告。
Idea。
而開始接近:
真正可以跑在硬體上的工程流程。
這和以前「AI 告訴我一些知識」差很多
假設 AI 回答:
飛行控制的一般原理。
那是一件事。
但如果同一個使用者持續要求:
寫一段模組。
改一段控制邏輯。
排除模擬錯誤。
分析測試結果。
再修改。
AI 扮演的角色就變了。
它不只是:
Knowledge Source。
開始變成:
Engineering Assistant。
甚至:
Agentic Workflow 裡的一部分。
這就是前沿 AI 安全現在真正緊張的地方。
更大的問題是:危險工作可以被切碎
Anthropic 明確提到:
一些行動者會把工作:
分散到很多 Session。
目的就是:
不要讓任何單一對話:
暴露完整企圖。
這對傳統 Content Filter 是一個很大的問題。
因為如果只看一個 Prompt:
它可能只是:
「幫我修改這個控制程式。」
看起來:
非常普通。
另一個 Session:
「幫我分析這個 Sensor 的誤差。」
也很普通。
再一個:
「這段模擬為什麼不穩定?」
單獨看:
仍然像工程問題。
只有把:
使用者。
帳號。
時間。
任務。
歷史行為。
一起連起來:
才可能發現:
原來所有小工作:
屬於同一個高風險計畫。
所以 AI 安全開始從 Prompt Safety 變成 Campaign Detection
以前我們會問:
這句 Prompt:
該不該回答?
現在還要多問:
這個使用者這幾週到底在做什麼?
這就是完全不同層級的問題。
它更像:
銀行反洗錢。
信用卡 Fraud Detection。
資安 SOC。
單筆交易:
可能完全正常。
但是:
20 筆交易放在一起:
模式就不正常。
前沿 AI 平台也開始走到同一種情況。
單一請求:
也許合理。
但是:
很多請求串起來:
可能完全改變風險。
Anthropic 自己承認:防護擋住很多,但沒有全部擋住
這可能是整份報告最值得注意的一句。
Anthropic 表示:
它的 Safeguards:
阻止了很多危險請求。
但不是全部。
行動者會使用各種方式:
隱藏最終目的。
把工作拆開。
使用多個 Session。
避開地區限制。
或讓每次要求:
看起來像一般工程、研究工作。
所以不能把:
「模型有 Safety Filter」
理解成:
「危險使用因此不可能發生。」
這和我們平常談 AI Agent 是一樣的。
Prompt Rule:
是防線。
不是絕對安全鎖。
Anthropic 後來怎麼處理?
當 Threat Intelligence Team 把行動串起來後:
Anthropic 表示:
會停用相關帳戶。
建立新的偵測方式。
把已知的行為 Pattern:
做進 Safeguards。
必要時也會:
向政府。
科技公司。
其他安全合作夥伴。
分享 Threat Intelligence。
在武器相關案例後:
Anthropic 也新增了更專門的 Classifier:
用來偵測高爆炸藥與武器開發相關活動。
所以:
Safety 不是一套規則上線後:
永遠不變。
而是:
對手找到新方法 → 平台看到 → 再加新防線。
本質上就是:
攻防競賽。
但最大的問題是:有些工作離線後就不再需要 Claude
Anthropic 在其中一個武器案例裡:
還提到一個很麻煩的現象。
相關行動者已經建立:
自己的 Offline Simulation Toolkit。
也就是:
就算平台後來把帳號停掉:
對方前面已經取得的:
程式。
方法。
工具。
資料。
可能還是可以繼續使用。
這和一般內容平台:
刪除帳號。
差很多。
如果有人利用 AI:
寫一篇垃圾文章。
帳號停掉:
事情可能就結束。
如果 AI 已經幫他:
建立一套本地軟體。
那麼平台停止服務之後:
能力可能留下來。
這會讓防護更加困難。
Anthropic 也開始建立新的「軍事能力 Benchmark」
這次公司不只公布濫用案例。
Anthropic 的 Frontier Red Team 還建立:
新的 Evaluation。
專門測:
Tactical Intelligence Targeting。
以及:
Conventional Weapons Development。
例如:
模型能不能根據零碎資訊:
找到某個目標位置。
或者:
能不能幫助改善某些武器系統的工程問題。
Anthropic 表示:
測試結果顯示:
AI 在這類任務上的能力:
持續提升。
甚至部分軍事與情報任務:
模型已能做到過去通常需要:
少數高度專業人才。
才能完成的工作。
這句話真正值得警惕的不是:
「AI 已經比軍事專家厲害。」
Anthropic沒有這樣說。
真正重要的是:
某些過去因為專家很少而難以擴張的能力,可能因 AI 變得更容易取得。
這叫做 Capability Uplift
Anthropic 在報告裡使用一個概念:
Uplift。
可以簡單理解成:
有了 AI 之後:
一個人的能力:
到底增加多少?
如果原本就是世界級專家:
AI 幫他提高 5%。
是一種風險。
如果原本只有一般程度:
AI 讓他能完成以前完全做不到的事:
又是另一種風險。
所以 AI Safety 真正要看的:
不是:
模型「知道多少」。
而是:
它把誰提升到了什麼能力。
這也解釋了為什麼昨天美國參議院開始談「Duty of Care」
今天早報我們才看到:
美國參議院正在協商:
讓最前沿 AI Developer 承擔:
Duty of Care。
也就是:
注意義務。
討論的重大風險:
就包括:
Cyberattack。
Biological Weapon。
Nuclear-related Capability。
而 Anthropic 最新這份 Threat Report:
剛好提供另一個現實面。
制度還在討論:
但真實世界已經有人:
拿 AI 往軍事。
情報。
武器。
生物研究。
方向使用。
這就是為什麼政策速度:
很難跟模型能力同步。
但也不要把報告解讀成「Claude 已經變成武器」
這樣會過度放大。
目前公開資訊支持的是:
不同地區、不同類型的使用者:
曾經嘗試把 Claude:
放進高風險工作流程。
部分案例確實進到:
真實工程與測試階段。
但很多計畫:
是否真正成功部署。
是否真的提高實戰能力。
提高多少。
外界都還不知道。
而且 Anthropic 公布的案例:
主要來自公司自己掌握的平台資料與調查。
所以最合理的態度是:
重視。
但不要:
誇大。
更值得看的,是 AI 安全架構正在被迫改變
第一代安全:
Dangerous Prompt → Refuse。
第二代:
模型執行 Agent Task → 限制 Tool/Permission。
現在第三層正在出現:
跨 Session、跨帳號、跨時間偵測完整行動。
未來可能還需要第四層:
不同 AI 公司之間:
分享 Threat Indicator。
因為一個人被:
A 平台封掉。
完全可以轉到:
B 平台。
甚至改用:
Open-weight Model。
只靠單一公司:
很難完全阻止。
Open-weight AI 會讓這件事更複雜
Anthropic 可以:
停用 Claude Account。
更新 Classifier。
限制特定請求。
但如果模型:
可以完整下載到本地。
平台就不存在:
帳戶停權。
Server-side Monitoring。
集中式 Safeguard。
這不代表:
Open-weight AI 本身等於危險。
它同時有:
研究。
透明度。
客製化。
成本。
自主控制。
等重要價值。
但在高風險能力出現後:
治理方法一定會和:
Closed Model。
不一樣。
這也是未來政策最難處理的問題之一。
一般使用者為什麼需要知道這件事?
因為同一個安全原理:
其實也適用我們每天用的 Agent。
不要只問:
「這一個 Action 安不安全?」
還要問:
「很多安全的小 Action 串起來,最後會變成什麼?」
例如 Agent:
讀一封 Email。
正常。
找一個聯絡人。
正常。
查一份付款資料。
正常。
開一個外部網站。
正常。
準備一封信。
也正常。
但全部串起來:
可能變成:
把敏感資料寄給外部的人。
單一步驟都沒越界。
完整工作流卻越界。
這就是今天這份報告最值得一般人理解的地方。
所以停止條件也不能只寫在「最後一步」
很多人設定 AI Agent:
「付款前一定問我。」
很好。
但如果前面已經:
把資料送出去。
建立帳號。
授權外部 App。
下載敏感資料。
那到付款才停:
已經太晚。
安全真正要看:
整條 Chain。
哪一步開始:
風險已不可逆?
這也是為什麼:
Agent Testing。
Audit Log。
Least Privilege。
Sandbox。
跨 Session Monitoring。
會越來越重要。
AI 真正變強之後,安全不可能只靠一句「不要做壞事」
今天 Anthropic 的案例最清楚地證明:
真正想繞過規則的人:
會適應。
Safety Model:
也必須適應。
而且當 AI 從:
回答問題。
變成:
寫程式。
跑研究。
調整系統。
分析測試。
連接工具。
安全問題自然不再只是:
它說了什麼?
而是:
它幫誰完成了什麼?
這也是前沿 AI 下一階段真正的壓力測試
Benchmark 可以告訴我們:
模型數學多強。
Coding 多強。
Research 多強。
但社會最後還需要另一種 Benchmark:
當有人刻意:
分拆任務。
隱藏目的。
跨多次 Session。
利用工具。
反覆調整。
模型與平台:
能不能發現:
這不是普通工作。
這會比:
一次拒絕一個明顯危險 Prompt。
困難很多。
所以今晚真正值得記住的不是「Claude 被拿去做武器」
更重要的是:
AI 安全正在從一句 Prompt 的安全,進入完整行動鏈的安全。
以前:
看問題。
現在:
要看人。
看歷史。
看工具。
看行為。
看很多次 Session 之間的關係。
因為真正高風險的使用者:
不會永遠把完整目的:
一次打進聊天框。
而模型能力愈強:
這種碎片化工作:
就愈可能被重新組合成現實能力。
Anthropic 這次真正揭示的:
不是 AI 已經無法控制。
而是:
「有安全機制」和「安全問題已經解決」,完全是兩回事。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
武器已經愈來愈能自己找目標,為什麼聯合國現在堅持「殺不殺人」不能交給機器?
今日 AI 工具|2026/08/08:Inspect AI,把 AI Agent 放進可重複測試與沙箱,先看它會怎麼失敗再上線