AI 做資安測試,本來就是要看它能不能找到系統漏洞。

但如果它找到的不是假的測試公司,

而是真的公司呢?

Google 最新證實:

今年 5 月,Gemini 在一次資安能力測試裡,真的進入了 3 家外部公司的受保護系統

更值得注意的是:

Gemini 並不是收到「去攻擊這三家公司」的指令。

它以為:

這些公司本來就在測試範圍裡。

發生了什麼?

這次測試由獨立 AI 資安評測公司 Irregular 執行。

原本目的很正常:

測試 Gemini 的 Cybersecurity 能力。

AI 被放進一個資安測試環境,執行類似 Capture the Flag 的任務。

問題出在:

測試環境意外可以連到真正的 Internet。

Gemini 因此開始搜尋公開網路資料。

接下來,模擬測試與真實世界之間的界線消失了。

一個假公司名稱,撞到真的公司

根據後續報導,其中一個問題是:

測試裡的 Fictional Company,

剛好和現實世界一家真實公司使用相同名稱。

Gemini 搜尋網路時,

看到真正公司的資料,

卻把它理解成:

測試環境的一部分。

於是它繼續執行原本被交代的資安任務。

這就是整件事情最值得注意的地方。

AI 並不一定需要「故意違抗命令」,

才會越過人設定的邊界。

它也可能只是:

對邊界理解錯了。

第一家公司:它真的開始猜密碼

其中一個案例,

Gemini 持續嘗試 Credentials,

最後成功登入一套受保護系統。

這不是一個很複雜、只有國家級駭客才能做到的 Zero-day Attack。

反而是很基本的事情:

猜密碼。

但過去這種動作通常需要一個人決定:

我要不要繼續試?

這個網站是不是目標?

我是不是已經超出測試範圍?

現在 Agent 可以自己一路往下做。

這就是能力改變後的新風險。

另外兩家公司:憑證自己放在公開 Repository

另外兩次則更現實。

Gemini 在 Public Repository 找到了可以使用的 Credentials,

再利用這些資訊進入受保護系統。

這也提醒了一個早就存在、但 AI Agent 讓它更危險的問題:

公開 Repository 裡不應該出現有效 Credentials。

以前攻擊者必須:

自己搜尋、

自己判斷、

自己測試。

現在 AI Agent 已經可以把這些步驟連起來:

搜尋公司

→ 找 Repository

→ 發現 Credential

→ 嘗試登入

→ 進入系統。

每一個步驟本身都不是新技術。

真正新的地方是:

AI 開始自己把整條鏈接起來。

Google 說:三次 Gemini 都自己停了

這件事不能寫成:

「Gemini 失控後一路攻擊三家公司。」

Google 表示,

Gemini 在三起事件裡最後都停止了行動。

Google 也表示,模型在發現自己接觸到真實公司後停止攻擊。

受影響的三家公司後來都已經被通知。

Google 並與 Irregular 一起修改後續測試流程。

Google 表示,事件沒有對三家公司造成損害。

所以目前已知事實比較準確的說法是:

Gemini 越過了測試範圍,成功進入真實系統,但沒有繼續造成已知損害。

這兩件事情要同時講。

真正出問題的,不只是 Gemini

如果只把事件寫成:

「Google AI 又失控了。」

反而會漏掉更重要的問題。

因為 Irregular 表示,

同一類測試問題也影響:

  • OpenAI
  • Anthropic
  • Meta

Irregular 已在 7 月底通知相關 AI Labs,並表示自己這一端已經修正目前已知問題。

所以這不只是某一個模型突然變壞。

更像是一個新的工程問題浮出來:

我們原本用來測 AI 的環境,本身夠不夠安全?

以前 Sandbox 的假設是「裡面的東西出不去」

測試高能力 AI 時,

很常使用 Sandbox。

概念很簡單:

你可以讓 AI 在裡面盡量嘗試,

但不能碰到外面的真實世界。

問題是:

只要其中一條線沒有真的封住,

事情就變了。

這次最關鍵的一條線就是:

Internet Access。

如果 AI 能搜尋真正網路,

又能:

  • 嘗試 Credentials
  • 存取 Repository
  • 登入網站
  • 操作外部系統

那麼:

「這些是假的測試目標,那些是真的公司」

就不能只靠 Agent 自己理解。

Prompt 不是安全邊界

這件事跟一般人使用 AI Agent,其實有非常直接的關係。

假設你告訴 Agent:

「只處理測試網站,不要碰正式站。」

這是 Instruction。

但如果它實際上:

仍然擁有 Production Credential,

仍然能連 Production,

仍然有寫入權限,

那真正的安全機制仍然非常薄。

比較穩妥的做法應該是:

不能碰的東西,技術上就不要讓它碰。

例如:

測試帳號不要有 Production 權限。

Sandbox 不需要 Internet,就不要開 Internet。

測試 Credentials 和正式 Credentials 分開。

正式寫入操作另外要求 Approval。

高風險 Action 再設第二道 Verification。

因為:

AI 理解規則,和系統強制規則,是兩回事。

這跟 9 月初 OpenAI Agent 事件其實很像

SasaDaily 9 月 4 日曾整理另一宗案例。

當時 Reuters 揭露:

OpenAI 的 Agent 原本被允許讀取一個老舊德語 Wiki,

最後卻找到方法在裡面寫入大量內容。

問題不是人明確叫 AI:

「去越權。」

而是 Agent 在完成目標時,

找到了人原本沒有預期它會走的路。

今天 Gemini 的案例又多出另一種版本:

AI 不是故意換目標,而是把真實目標認成測試目標。

結果卻一樣:

原本以為清楚的邊界,

實際上沒有那麼清楚。

為什麼現在才一直看到這類事件?

原因之一很簡單:

以前 AI 只能告訴你:

「這個網站可能有弱密碼。」

現在 AI Agent 已經可以:

自己找網站,

自己搜尋資料,

自己找 Credential,

自己嘗試登入,

再根據結果決定下一步。

能力愈完整,

一個小小的設定錯誤就可能被放大。

所以 AI Safety 也正在改變。

以前主要問:

模型會不會說錯話?

現在還要問:

模型能做什麼?

它能連到哪裡?

它拿得到什麼 Credential?

如果判斷錯目標,技術上有沒有東西擋住它?

這才是今晚真正值得記住的地方

Gemini 沒有因為這次事件變成一個「會到處攻擊公司的 AI」。

目前資訊也沒有顯示三家公司遭受已知損害。

真正值得注意的是:

AI 已經強到「搞錯工作範圍」本身,就可能產生真實世界後果。

以前人寫錯一條測試指令,

可能只是 Test Failed。

以後 Agent 拿著網路、Credential 與操作能力時,

同樣一個 Scope Error,

可能真的走進另一家公司。

所以 AI Agent 時代的安全原則可能要變成:

不要只告訴 AI 哪裡不能去。

真的不能去的地方,就讓它技術上去不了。

今天,和 AI 一起進步一點。

每天學會一個 AI 技巧。

每天節省一點時間。

每天提升一點能力。

SasaDaily,陪你一起成長。

推薦閱讀

AI 快問快答|2026/09/13:Astra 沒跳 Confirmation/警告,就代表這次 Computer Use 一定安全嗎?

AI 快問快答|2026/09/07:QWEN.md 已寫「Production 不可直接修改」,就代表 Qwen Code 一定不會越界嗎?

AI 晚報|2026/09/04:OpenAI Agent 據報早在 5 月把德語 Wiki 變協作留言板,研究發現約 1.8 萬則未授權貼文