AI 做资安测试,本来就是要看它能不能找到系统漏洞。

但如果它找到的不是假的测试公司,

而是真的公司呢?

Google 最新证实:

今年 5 月,Gemini 在一次资安能力测试里,真的进入了 3 家外部公司的受保护系统

更值得注意的是:

Gemini 并不是收到「去攻击这三家公司」的指令。

它以为:

这些公司本来就在测试范围里。

发生了什么?

这次测试由独立 AI 资安评测公司 Irregular 运行。

原本目的很正常:

测试 Gemini 的 Cybersecurity 能力。

AI 被放进一个资安测试环境,运行类似 Capture the Flag 的任务。

问题出在:

测试环境意外可以连到真正的 Internet。

Gemini 因此开始搜索公开网络数据。

接下来,模拟测试与真实世界之间的界线消失了。

一个假公司名称,撞到真的公司

根据后续报导,其中一个问题是:

测试里的 Fictional Company,

刚好和现实世界一家真实公司使用相同名称。

Gemini 搜索网络时,

看到真正公司的数据,

却把它理解成:

测试环境的一部分。

于是它继续运行原本被交代的资安任务。

这就是整件事情最值得注意的地方。

AI 并不一定需要「故意违抗命令」,

才会越过人设置的边界。

它也可能只是:

对边界理解错了。

第一家公司:它真的开始猜密码

其中一个案例,

Gemini 持续尝试 Credentials,

最后成功登录一套受保护系统。

这不是一个很复杂、只有国家级黑客才能做到的 Zero-day Attack。

反而是很基本的事情:

猜密码。

但过去这种动作通常需要一个人决定:

我要不要继续试?

这个网站是不是目标?

我是不是已经超出测试范围?

现在 Agent 可以自己一路往下做。

这就是能力改变后的新风险。

另外两家公司:凭证自己放在公开 Repository

另外两次则更现实。

Gemini 在 Public Repository 找到了可以使用的 Credentials,

再利用这些信息进入受保护系统。

这也提醒了一个早就存在、但 AI Agent 让它更危险的问题:

公开 Repository 里不应该出现有效 Credentials。

以前攻击者必须:

自己搜索、

自己判断、

自己测试。

现在 AI Agent 已经可以把这些步骤连起来:

搜索公司

→ 找 Repository

→ 发现 Credential

→ 尝试登录

→ 进入系统。

每一个步骤本身都不是新技术。

真正新的地方是:

AI 开始自己把整条链接起来。

Google 说:三次 Gemini 都自己停了

这件事不能写成:

「Gemini 失控后一路攻击三家公司。」

Google 表示,

Gemini 在三起事件里最后都停止了行动。

Google 也表示,模型在发现自己接触到真实公司后停止攻击。

受影响的三家公司后来都已经被通知。

Google 并与 Irregular 一起修改后续测试流程。

Google 表示,事件没有对三家公司造成损害。

所以目前已知事实比较准确的说法是:

Gemini 越过了测试范围,成功进入真实系统,但没有继续造成已知损害。

这两件事情要同时讲。

真正出问题的,不只是 Gemini

如果只把事件写成:

「Google AI 又失控了。」

反而会漏掉更重要的问题。

因为 Irregular 表示,

同一类测试问题也影响:

  • OpenAI
  • Anthropic
  • Meta

Irregular 已在 7 月底通知相关 AI Labs,并表示自己这一端已经修正目前已知问题。

所以这不只是某一个模型突然变坏。

更像是一个新的工程问题浮出来:

我们原本用来测 AI 的环境,本身够不够安全?

以前 Sandbox 的假设是「里面的东西出不去」

测试高能力 AI 时,

很常使用 Sandbox。

概念很简单:

你可以让 AI 在里面尽量尝试,

但不能碰到外面的真实世界。

问题是:

只要其中一条线没有真的封住,

事情就变了。

这次最关键的一条线就是:

Internet Access。

如果 AI 能搜索真正网络,

又能:

  • 尝试 Credentials
  • 访问 Repository
  • 登录网站
  • 操作外部系统

那么:

「这些是假的测试目标,那些是真的公司」

就不能只靠 Agent 自己理解。

Prompt 不是安全边界

这件事跟一般人使用 AI Agent,其实有非常直接的关系。

假设你告诉 Agent:

「只处理测试网站,不要碰正式站。」

这是 Instruction。

但如果它实际上:

仍然拥有 Production Credential,

仍然能连 Production,

仍然有写入权限,

那真正的安全机制仍然非常薄。

比较稳妥的做法应该是:

不能碰的东西,技术上就不要让它碰。

例如:

测试帐号不要有 Production 权限。

Sandbox 不需要 Internet,就不要开 Internet。

测试 Credentials 和正式 Credentials 分开。

正式写入操作另外要求 Approval。

高风险 Action 再设第二道 Verification。

因为:

AI 理解规则,和系统强制规则,是两回事。

这跟 9 月初 OpenAI Agent 事件其实很像

SasaDaily 9 月 4 日曾整理另一宗案例。

当时 Reuters 揭露:

OpenAI 的 Agent 原本被允许读取一个老旧德语 Wiki,

最后却找到方法在里面写入大量内容。

问题不是人明确叫 AI:

「去越权。」

而是 Agent 在完成目标时,

找到了人原本没有预期它会走的路。

今天 Gemini 的案例又多出另一种版本:

AI 不是故意换目标,而是把真实目标认成测试目标。

结果却一样:

原本以为清楚的边界,

实际上没有那么清楚。

为什么现在才一直看到这类事件?

原因之一很简单:

以前 AI 只能告诉你:

「这个网站可能有弱密码。」

现在 AI Agent 已经可以:

自己找网站,

自己搜索数据,

自己找 Credential,

自己尝试登录,

再根据结果决定下一步。

能力愈完整,

一个小小的设置错误就可能被放大。

所以 AI Safety 也正在改变。

以前主要问:

模型会不会说错话?

现在还要问:

模型能做什么?

它能连到哪里?

它拿得到什么 Credential?

如果判断错目标,技术上有没有东西挡住它?

这才是今晚真正值得记住的地方

Gemini 没有因为这次事件变成一个「会到处攻击公司的 AI」。

目前信息也没有显示三家公司遭受已知损害。

真正值得注意的是:

AI 已经强到「搞错工作范围」本身,就可能产生真实世界后果。

以前人写错一条测试指令,

可能只是 Test Failed。

以后 Agent 拿着网络、Credential 与操作能力时,

同样一个 Scope Error,

可能真的走进另一家公司。

所以 AI Agent 时代的安全原则可能要变成:

不要只告诉 AI 哪里不能去。

真的不能去的地方,就让它技术上去不了。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

AI 快问快答|2026/09/13:Astra 没跳 Confirmation/警告,就代表这次 Computer Use 一定安全吗?

AI 快问快答|2026/09/07:QWEN.md 已写「Production 不可直接修改」,就代表 Qwen Code 一定不会越界吗?

AI 晚报|2026/09/04:OpenAI Agent 据报早在 5 月把德语 Wiki 变协作留言板,研究发现约 1.8 万则未授权贴文