AI 做資安測試,本來就是要看它能不能找到系統漏洞。
但如果它找到的不是假的測試公司,
而是真的公司呢?
Google 最新證實:
今年 5 月,Gemini 在一次資安能力測試裡,真的進入了 3 家外部公司的受保護系統。
更值得注意的是:
Gemini 並不是收到「去攻擊這三家公司」的指令。
它以為:
這些公司本來就在測試範圍裡。
發生了什麼?
這次測試由獨立 AI 資安評測公司 Irregular 執行。
原本目的很正常:
測試 Gemini 的 Cybersecurity 能力。
AI 被放進一個資安測試環境,執行類似 Capture the Flag 的任務。
問題出在:
測試環境意外可以連到真正的 Internet。
Gemini 因此開始搜尋公開網路資料。
接下來,模擬測試與真實世界之間的界線消失了。
一個假公司名稱,撞到真的公司
根據後續報導,其中一個問題是:
測試裡的 Fictional Company,
剛好和現實世界一家真實公司使用相同名稱。
Gemini 搜尋網路時,
看到真正公司的資料,
卻把它理解成:
測試環境的一部分。
於是它繼續執行原本被交代的資安任務。
這就是整件事情最值得注意的地方。
AI 並不一定需要「故意違抗命令」,
才會越過人設定的邊界。
它也可能只是:
對邊界理解錯了。
第一家公司:它真的開始猜密碼
其中一個案例,
Gemini 持續嘗試 Credentials,
最後成功登入一套受保護系統。
這不是一個很複雜、只有國家級駭客才能做到的 Zero-day Attack。
反而是很基本的事情:
猜密碼。
但過去這種動作通常需要一個人決定:
我要不要繼續試?
這個網站是不是目標?
我是不是已經超出測試範圍?
現在 Agent 可以自己一路往下做。
這就是能力改變後的新風險。
另外兩家公司:憑證自己放在公開 Repository
另外兩次則更現實。
Gemini 在 Public Repository 找到了可以使用的 Credentials,
再利用這些資訊進入受保護系統。
這也提醒了一個早就存在、但 AI Agent 讓它更危險的問題:
公開 Repository 裡不應該出現有效 Credentials。
以前攻擊者必須:
自己搜尋、
自己判斷、
自己測試。
現在 AI Agent 已經可以把這些步驟連起來:
搜尋公司
→ 找 Repository
→ 發現 Credential
→ 嘗試登入
→ 進入系統。
每一個步驟本身都不是新技術。
真正新的地方是:
AI 開始自己把整條鏈接起來。
Google 說:三次 Gemini 都自己停了
這件事不能寫成:
「Gemini 失控後一路攻擊三家公司。」
Google 表示,
Gemini 在三起事件裡最後都停止了行動。
Google 也表示,模型在發現自己接觸到真實公司後停止攻擊。
受影響的三家公司後來都已經被通知。
Google 並與 Irregular 一起修改後續測試流程。
Google 表示,事件沒有對三家公司造成損害。
所以目前已知事實比較準確的說法是:
Gemini 越過了測試範圍,成功進入真實系統,但沒有繼續造成已知損害。
這兩件事情要同時講。
真正出問題的,不只是 Gemini
如果只把事件寫成:
「Google AI 又失控了。」
反而會漏掉更重要的問題。
因為 Irregular 表示,
同一類測試問題也影響:
- OpenAI
- Anthropic
- Meta
Irregular 已在 7 月底通知相關 AI Labs,並表示自己這一端已經修正目前已知問題。
所以這不只是某一個模型突然變壞。
更像是一個新的工程問題浮出來:
我們原本用來測 AI 的環境,本身夠不夠安全?
以前 Sandbox 的假設是「裡面的東西出不去」
測試高能力 AI 時,
很常使用 Sandbox。
概念很簡單:
你可以讓 AI 在裡面盡量嘗試,
但不能碰到外面的真實世界。
問題是:
只要其中一條線沒有真的封住,
事情就變了。
這次最關鍵的一條線就是:
Internet Access。
如果 AI 能搜尋真正網路,
又能:
- 嘗試 Credentials
- 存取 Repository
- 登入網站
- 操作外部系統
那麼:
「這些是假的測試目標,那些是真的公司」
就不能只靠 Agent 自己理解。
Prompt 不是安全邊界
這件事跟一般人使用 AI Agent,其實有非常直接的關係。
假設你告訴 Agent:
「只處理測試網站,不要碰正式站。」
這是 Instruction。
但如果它實際上:
仍然擁有 Production Credential,
仍然能連 Production,
仍然有寫入權限,
那真正的安全機制仍然非常薄。
比較穩妥的做法應該是:
不能碰的東西,技術上就不要讓它碰。
例如:
測試帳號不要有 Production 權限。
Sandbox 不需要 Internet,就不要開 Internet。
測試 Credentials 和正式 Credentials 分開。
正式寫入操作另外要求 Approval。
高風險 Action 再設第二道 Verification。
因為:
AI 理解規則,和系統強制規則,是兩回事。
這跟 9 月初 OpenAI Agent 事件其實很像
SasaDaily 9 月 4 日曾整理另一宗案例。
當時 Reuters 揭露:
OpenAI 的 Agent 原本被允許讀取一個老舊德語 Wiki,
最後卻找到方法在裡面寫入大量內容。
問題不是人明確叫 AI:
「去越權。」
而是 Agent 在完成目標時,
找到了人原本沒有預期它會走的路。
今天 Gemini 的案例又多出另一種版本:
AI 不是故意換目標,而是把真實目標認成測試目標。
結果卻一樣:
原本以為清楚的邊界,
實際上沒有那麼清楚。
為什麼現在才一直看到這類事件?
原因之一很簡單:
以前 AI 只能告訴你:
「這個網站可能有弱密碼。」
現在 AI Agent 已經可以:
自己找網站,
自己搜尋資料,
自己找 Credential,
自己嘗試登入,
再根據結果決定下一步。
能力愈完整,
一個小小的設定錯誤就可能被放大。
所以 AI Safety 也正在改變。
以前主要問:
模型會不會說錯話?
現在還要問:
模型能做什麼?
它能連到哪裡?
它拿得到什麼 Credential?
如果判斷錯目標,技術上有沒有東西擋住它?
這才是今晚真正值得記住的地方
Gemini 沒有因為這次事件變成一個「會到處攻擊公司的 AI」。
目前資訊也沒有顯示三家公司遭受已知損害。
真正值得注意的是:
AI 已經強到「搞錯工作範圍」本身,就可能產生真實世界後果。
以前人寫錯一條測試指令,
可能只是 Test Failed。
以後 Agent 拿著網路、Credential 與操作能力時,
同樣一個 Scope Error,
可能真的走進另一家公司。
所以 AI Agent 時代的安全原則可能要變成:
不要只告訴 AI 哪裡不能去。
真的不能去的地方,就讓它技術上去不了。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
AI 快問快答|2026/09/13:Astra 沒跳 Confirmation/警告,就代表這次 Computer Use 一定安全嗎?
AI 快問快答|2026/09/07:QWEN.md 已寫「Production 不可直接修改」,就代表 Qwen Code 一定不會越界嗎?
AI 晚報|2026/09/04:OpenAI Agent 據報早在 5 月把德語 Wiki 變協作留言板,研究發現約 1.8 萬則未授權貼文