AI 数据中心以前最常讨论的是三件事:

芯片够不够。

电力够不够。

土地够不够。

现在开始多出第四题:

如果真的被攻击,算力怎么活下来?

Reuters 9 月 11 日引述六名知情人士报导:

阿拉伯联合酋长国正在重新检讨一个总规模 5GW 的大型 AI 基础设施计划。

原本的方向是:

把大量算力集中在阿布达比一个约 10 平方英里的巨型园区。

现在规划可能改成:

分散。

把多个数据中心设在阿联不同地点。

同时评估:

部分设施地下化。

加强实体防护。

搭配防空。

降低单一地点受到攻击时,整个 AI 基础设施一起停摆的风险。

先分清楚:5GW Campus 和 Stargate UAE 不是完全同一件事

这里很容易搞混。

2025 年公布的整体计划叫:

UAE–US AI Campus。

官方公布总容量规模:

5GW。

位于阿布达比。

由 G42 领导建设。

而其中第一个大型计划:

Stargate UAE

本身规划为:

1GW Compute Cluster。

合作伙伴包括:

G42。

OpenAI。

Oracle。

NVIDIA。

Cisco。

SoftBank。

官方原本规划:

第一批 200MW 算力在 2026 年上线。

所以不能写成:

「OpenAI 自己要盖一个 5GW Stargate。」

比较精准的是:

Stargate UAE 是整个 5GW UAE–US AI Campus 里的一部分。

为什么现在突然要重画?

真正的转折发生在今年 3 月。

当时中东冲突升高。

Reuters 报导:

Amazon Web Services 在阿联与巴林的数据中心受到无人机攻击影响。

其中:

阿联两座 AWS Facility 遭到直接击中。

巴林则有一座设施受到附近攻击造成的实体影响。

结果不只是:

建筑受损。

还包含:

电力中断。

消防造成额外水害。

Cloud Service 受到影响。

部分金融机构服务也出现问题。

这件事把原本看起来非常抽象的问题:

直接变成现实。

Data Center 不是存在云里。

Cloud 最后还是:

一栋建筑。

一条电缆。

一座变电站。

一套冷却系统。

一个真的地点。

更重要的是:这不是 Stargate UAE 已经遭到攻击

这个界线一定要说清楚。

今年 3 月受损的是:

AWS 数据中心。

不是:

Stargate UAE。

Reuters 今天报导的是:

这些攻击让阿联重新思考未来的大型 AI Campus 应该怎么盖。

所以不能写成:

「Stargate 被炸,所以现在重建。」

目前比较准确的说法是:

其他 Data Center 已经证明实体基础设施真的可能成为战争目标,因此尚在发展中的大型 AI 计划开始重新设计。

原本为什么要集中盖?

从纯粹工程角度来看:

巨型 AI Campus 集中其实很合理。

因为 AI 算力需要非常大量的:

GPU。

Networking。

Cooling。

Power。

Fiber。

如果全部集中:

可以共享:

发电。

变电站。

水与冷却。

高速网络。

维修人员。

安全系统。

甚至同一批供应链。

规模越大:

单位建设成本可能越有效率。

这也是全球 AI Mega Campus 愈盖愈大的原因之一。

但集中同时带来另一个问题:

Single Point of Concentration。

也就是:

一个地点承载太多东西。

AI 时代的「单点故障」开始变得非常大

假设一家公司只有:

20 台 Server。

放在同一栋办公室。

那栋楼停电:

公司系统停止。

很好理解。

现在把规模放大。

一个国家的:

Government AI。

Healthcare AI。

Banking AI。

Research。

Cloud。

模型推论。

甚至其他国家的 Regional Compute。

都慢慢依赖同一个超大型园区。

这时单点中断影响的:

就不只是:

一个网站开不起来。

而可能是:

整个区域的数字能力。

所以 AI Data Center 的设计开始碰到传统国家级基础设施才会思考的问题:

发电厂怎么备援?

电信怎么绕路?

军事设施怎么分散?

重要数据怎么异地保存?

分散部署是在牺牲一点效率,换韧性

如果最后真的从一座超大 Campus:

改成几个分散地点。

一定有代价。

例如:

要重复盖更多电力设施。

更多 Network Connection。

更多冷却与维修能力。

数据中心彼此还要有:

高速互连。

Latency 可能增加。

营运变复杂。

土地与安全范围也变大。

所以「分散」不是免费升级。

它本质上是在做一个取舍:

不要把所有算力鸡蛋放进同一个篮子。

即使成本高一点。

地下化也是同样逻辑

一般 Data Center 不需要想:

墙壁能不能承受飞弹或无人机攻击。

现在部分 Gulf Infrastructure 开始考虑:

地下设施。

更强结构。

更好的隔离。

理由不是让 AI 跑得更快。

而是:

实体建筑本身开始进入 Threat Model。

Threat Model 可以理解成:

你在设计系统以前:

先问谁可能让它失败。

以前 Data Center 常考虑:

停电。

火灾。

洪水。

硬件故障。

网络断线。

Cyberattack。

现在某些地区不得不再加入:

Physical Attack。

AI 资安以前谈的是 Hacker,现在连建筑物也变成 Security 问题

谈 AI Security 时:

大家很容易想到:

Prompt Injection。

模型被越权。

Credential 泄漏。

数据被偷。

Malware。

但再安全的 Software:

如果整座 Data Center 停电:

一样不能运作。

所以完整的 AI Security 开始分成很多层。

模型层:

模型会不会做不该做的事。

软件层:

系统有没有漏洞。

帐号层:

谁有权限。

网络层:

数据怎么进出。

供应链:

芯片与设备从哪里来。

最后还有:

Physical Infrastructure。

这一层以前一般 AI 用户几乎不会想到。

现在越来越不能忽略。

甚至 Fiber 也会变成问题

如果数据中心分散到不同地点:

它们还是需要彼此交换数据。

所以真正的韧性不能只做到:

A Building 没有被打到。

还要问:

连接 A、B 的 Fiber 呢?

Power Line 呢?

Substation 呢?

Cooling Water 呢?

Internet Backbone 呢?

如果所有分散的 Data Center:

最后还是共用同一条内核 Fiber。

那只是:

建筑分散。

网络仍然有单点故障。

所以国家级 AI Infrastructure 的难度:

不是「多盖几栋机房」。

而是:

整条供应与连接路径都要重新做 Resilience Design。

这也是为什么 AI 基础设施开始愈来愈像能源系统

电网不会只问:

哪一座发电厂发电效率最高。

它还要考虑:

Transmission。

Backup。

Reserve。

Grid Stability。

Disaster Recovery。

AI Compute 也开始走到类似阶段。

以前大家只追求:

Maximum Compute。

现在开始多问:

Available Compute。

也就是:

不是理论上总共有多少 GPU。

而是:

真正遇到故障或攻击时:

还剩多少可以用?

5GW 到底有多大?

5GW 指的是:

整体 AI Campus 规划的电力/数据中心容量级别。

不是模型参数。

也不是每小时会固定消耗 5GW。

但这个数量级已经足以说明:

它不再是一座普通企业 Server Room。

官方 2025 年形容:

UAE–US AI Campus 是美国以外最大规模的 AI Infrastructure Deployment。

原始构想占地约:

10 平方英里。

也就是:

约 26 平方公里。

这已经接近:

城市级基础设施。

当设施大到这种程度:

如何保护它自然就不只是 IT Department 的问题。

Stargate UAE 还有另一个战略意义

这个计划不只是:

OpenAI 找地方放 Server。

OpenAI 当初把 Stargate UAE 定义为:

第一个 International Stargate Deployment。

也是:

OpenAI for Countries 的第一个 Partnership。

意思是:

AI Infrastructure 开始和:

国家算力。

外交。

科技出口。

供应链。

国家安全。

绑在一起。

美国先进芯片能不能出口。

哪些公司可以取得。

数据放在哪个国家。

谁控制 Infrastructure。

都变成政策问题。

所以今天的重画:

也不只是建筑设计变更。

它其实是在提醒:

国家级 AI 算力,本身正在变成地缘政治资产。

这对 OpenAI 有什么影响?

目前 Reuters 报导的是:

阿联正在重新检讨整体 Blueprint。

并不是宣布:

Stargate UAE 取消。

OpenAI 2025 年公布的正式规划仍是:

1GW Stargate UAE。

其中 200MW 预计在 2026 年上线。

今天真正需要等待确认的是:

如果 5GW Campus 从集中式设计变成分布式:

Stargate UAE 最后的:

实际位置。

建筑方式。

上线进度。

成本。

互联架构。

会不会跟着改。

目前没有足够公开信息可以先替它下结论。

也不要因为「分散」就认为一定更安全

分散可以降低:

单一地点被破坏造成的集中风险。

但同时可能增加:

更多地点需要防守。

更多 Network Endpoint。

更多供应链。

更多员工与 Contractor。

更多 Physical Access Point。

换句话说:

你减少一种风险,也可能增加另一种攻击面。

这就是大型 Infrastructure 最难的地方。

安全从来不是:

加一个功能。

而是:

一整套 Trade-off。

真正成熟的设计应该问「失去一部分后,还剩什么?」

这其实是 Resilience 和一般 Security 最大差别之一。

一般安全常问:

如何防止事情发生?

韧性则进一步问:

如果它真的发生了呢?

假设:

一个 Data Center 完全脱机。

整个 AI Service 还能不能工作?

失去一条 Fiber。

流量能不能绕走?

一座 Substation 停止供电。

其他区域能不能接手?

部分数据失去连接。

有没有另一份 Copy?

这才是:

Fault Tolerance。

也就是:

不是保证永远不出问题。

而是问题出现后:

系统不会整个一起倒下。

这个观念其实也适用一般公司

你可能没有 5GW Data Center。

也不用担心飞弹。

但相同问题可以缩小到一般企业。

例如:

所有文件只存在一台 NAS。

所有网站都在同一台 Server。

所有工作都依赖同一个 Cloud Region。

所有 AI Agent 都共用同一组 Credential。

所有员工都依赖同一个 SaaS。

平常看起来:

最省钱。

最好管理。

一出问题:

全部一起停。

所以大型国家级 AI Campus 今天面对的问题:

其实也是所有 IT 系统都要问的基本题:

「如果这一个东西消失,我还能不能工作?」

AI 基建竞赛正在从「谁盖最大」进入「谁撑得住」

过去两年:

AI Infrastructure 新闻最常比:

多少亿美元。

多少 GPU。

多少 GW。

多少平方公里。

但真正投入运作之后:

另一组指针会越来越重要。

Uptime。

Redundancy。

Backup。

Recovery Time。

Physical Security。

Network Diversity。

Energy Resilience。

Geographic Distribution。

这些词没有:

「5GW 超级 AI Campus」

那么吸睛。

却可能才决定:

当真正的危机发生时:

那 5GW 到底还剩多少可以工作。

今天最值得记住的不是「数据中心要盖到地下」

因为目前 Blueprint 还在调整。

很多细节也只是 Reuters 根据知情人士取得的规划方向。

真正的大转折是:

AI 算力正式进入 Critical Infrastructure 思维。

当模型变成:

政府。

金融。

医疗。

能源。

企业。

科学研究。

每天都在依赖的基础能力。

我们就不能只问:

AI 有多聪明。

也不能只问:

GPU 有多少。

还必须问:

那一整套算力如果遇到真正的现实世界冲击,能不能继续工作?

AI 最后不是活在 Cloud 里。

Cloud 的底下:

还是土地。

电力。

光纤。

水。

建筑。

芯片。

以及一个真实的地理位置。

当这些东西开始成为国家级资产:

AI Infrastructure 的下一场竞争,也就不只是:

谁盖得最大。

而是:

谁在最糟的情况发生后,还能继续跑。

今天,和 AI 一起进步一点。

每天学会一个 AI 技巧。

每天节省一点时间。

每天提升一点能力。

SasaDaily,陪你一起成长。

推荐阅读

AI 数据中心里一个不起眼的小零件,为什么美国准备禁止中国制造?

科技公司明明承诺减碳,为什么 60 座 AI 数据中心的排放可能等于 27 座燃煤电厂?

你没有购买 AI,为什么有一天却可能在电费帐单上替它付钱?