AI 数据中心以前最常讨论的是三件事:
芯片够不够。
电力够不够。
土地够不够。
现在开始多出第四题:
如果真的被攻击,算力怎么活下来?
Reuters 9 月 11 日引述六名知情人士报导:
阿拉伯联合酋长国正在重新检讨一个总规模 5GW 的大型 AI 基础设施计划。
原本的方向是:
把大量算力集中在阿布达比一个约 10 平方英里的巨型园区。
现在规划可能改成:
分散。
把多个数据中心设在阿联不同地点。
同时评估:
部分设施地下化。
加强实体防护。
搭配防空。
降低单一地点受到攻击时,整个 AI 基础设施一起停摆的风险。
先分清楚:5GW Campus 和 Stargate UAE 不是完全同一件事
这里很容易搞混。
2025 年公布的整体计划叫:
UAE–US AI Campus。
官方公布总容量规模:
5GW。
位于阿布达比。
由 G42 领导建设。
而其中第一个大型计划:
Stargate UAE
本身规划为:
1GW Compute Cluster。
合作伙伴包括:
G42。
OpenAI。
Oracle。
NVIDIA。
Cisco。
SoftBank。
官方原本规划:
第一批 200MW 算力在 2026 年上线。
所以不能写成:
「OpenAI 自己要盖一个 5GW Stargate。」
比较精准的是:
Stargate UAE 是整个 5GW UAE–US AI Campus 里的一部分。
为什么现在突然要重画?
真正的转折发生在今年 3 月。
当时中东冲突升高。
Reuters 报导:
Amazon Web Services 在阿联与巴林的数据中心受到无人机攻击影响。
其中:
阿联两座 AWS Facility 遭到直接击中。
巴林则有一座设施受到附近攻击造成的实体影响。
结果不只是:
建筑受损。
还包含:
电力中断。
消防造成额外水害。
Cloud Service 受到影响。
部分金融机构服务也出现问题。
这件事把原本看起来非常抽象的问题:
直接变成现实。
Data Center 不是存在云里。
Cloud 最后还是:
一栋建筑。
一条电缆。
一座变电站。
一套冷却系统。
一个真的地点。
更重要的是:这不是 Stargate UAE 已经遭到攻击
这个界线一定要说清楚。
今年 3 月受损的是:
AWS 数据中心。
不是:
Stargate UAE。
Reuters 今天报导的是:
这些攻击让阿联重新思考未来的大型 AI Campus 应该怎么盖。
所以不能写成:
「Stargate 被炸,所以现在重建。」
目前比较准确的说法是:
其他 Data Center 已经证明实体基础设施真的可能成为战争目标,因此尚在发展中的大型 AI 计划开始重新设计。
原本为什么要集中盖?
从纯粹工程角度来看:
巨型 AI Campus 集中其实很合理。
因为 AI 算力需要非常大量的:
GPU。
Networking。
Cooling。
Power。
Fiber。
如果全部集中:
可以共享:
发电。
变电站。
水与冷却。
高速网络。
维修人员。
安全系统。
甚至同一批供应链。
规模越大:
单位建设成本可能越有效率。
这也是全球 AI Mega Campus 愈盖愈大的原因之一。
但集中同时带来另一个问题:
Single Point of Concentration。
也就是:
一个地点承载太多东西。
AI 时代的「单点故障」开始变得非常大
假设一家公司只有:
20 台 Server。
放在同一栋办公室。
那栋楼停电:
公司系统停止。
很好理解。
现在把规模放大。
一个国家的:
Government AI。
Healthcare AI。
Banking AI。
Research。
Cloud。
模型推论。
甚至其他国家的 Regional Compute。
都慢慢依赖同一个超大型园区。
这时单点中断影响的:
就不只是:
一个网站开不起来。
而可能是:
整个区域的数字能力。
所以 AI Data Center 的设计开始碰到传统国家级基础设施才会思考的问题:
发电厂怎么备援?
电信怎么绕路?
军事设施怎么分散?
重要数据怎么异地保存?
分散部署是在牺牲一点效率,换韧性
如果最后真的从一座超大 Campus:
改成几个分散地点。
一定有代价。
例如:
要重复盖更多电力设施。
更多 Network Connection。
更多冷却与维修能力。
数据中心彼此还要有:
高速互连。
Latency 可能增加。
营运变复杂。
土地与安全范围也变大。
所以「分散」不是免费升级。
它本质上是在做一个取舍:
不要把所有算力鸡蛋放进同一个篮子。
即使成本高一点。
地下化也是同样逻辑
一般 Data Center 不需要想:
墙壁能不能承受飞弹或无人机攻击。
现在部分 Gulf Infrastructure 开始考虑:
地下设施。
更强结构。
更好的隔离。
理由不是让 AI 跑得更快。
而是:
实体建筑本身开始进入 Threat Model。
Threat Model 可以理解成:
你在设计系统以前:
先问谁可能让它失败。
以前 Data Center 常考虑:
停电。
火灾。
洪水。
硬件故障。
网络断线。
Cyberattack。
现在某些地区不得不再加入:
Physical Attack。
AI 资安以前谈的是 Hacker,现在连建筑物也变成 Security 问题
谈 AI Security 时:
大家很容易想到:
Prompt Injection。
模型被越权。
Credential 泄漏。
数据被偷。
Malware。
但再安全的 Software:
如果整座 Data Center 停电:
一样不能运作。
所以完整的 AI Security 开始分成很多层。
模型层:
模型会不会做不该做的事。
软件层:
系统有没有漏洞。
帐号层:
谁有权限。
网络层:
数据怎么进出。
供应链:
芯片与设备从哪里来。
最后还有:
Physical Infrastructure。
这一层以前一般 AI 用户几乎不会想到。
现在越来越不能忽略。
甚至 Fiber 也会变成问题
如果数据中心分散到不同地点:
它们还是需要彼此交换数据。
所以真正的韧性不能只做到:
A Building 没有被打到。
还要问:
连接 A、B 的 Fiber 呢?
Power Line 呢?
Substation 呢?
Cooling Water 呢?
Internet Backbone 呢?
如果所有分散的 Data Center:
最后还是共用同一条内核 Fiber。
那只是:
建筑分散。
网络仍然有单点故障。
所以国家级 AI Infrastructure 的难度:
不是「多盖几栋机房」。
而是:
整条供应与连接路径都要重新做 Resilience Design。
这也是为什么 AI 基础设施开始愈来愈像能源系统
电网不会只问:
哪一座发电厂发电效率最高。
它还要考虑:
Transmission。
Backup。
Reserve。
Grid Stability。
Disaster Recovery。
AI Compute 也开始走到类似阶段。
以前大家只追求:
Maximum Compute。
现在开始多问:
Available Compute。
也就是:
不是理论上总共有多少 GPU。
而是:
真正遇到故障或攻击时:
还剩多少可以用?
5GW 到底有多大?
5GW 指的是:
整体 AI Campus 规划的电力/数据中心容量级别。
不是模型参数。
也不是每小时会固定消耗 5GW。
但这个数量级已经足以说明:
它不再是一座普通企业 Server Room。
官方 2025 年形容:
UAE–US AI Campus 是美国以外最大规模的 AI Infrastructure Deployment。
原始构想占地约:
10 平方英里。
也就是:
约 26 平方公里。
这已经接近:
城市级基础设施。
当设施大到这种程度:
如何保护它自然就不只是 IT Department 的问题。
Stargate UAE 还有另一个战略意义
这个计划不只是:
OpenAI 找地方放 Server。
OpenAI 当初把 Stargate UAE 定义为:
第一个 International Stargate Deployment。
也是:
OpenAI for Countries 的第一个 Partnership。
意思是:
AI Infrastructure 开始和:
国家算力。
外交。
科技出口。
供应链。
国家安全。
绑在一起。
美国先进芯片能不能出口。
哪些公司可以取得。
数据放在哪个国家。
谁控制 Infrastructure。
都变成政策问题。
所以今天的重画:
也不只是建筑设计变更。
它其实是在提醒:
国家级 AI 算力,本身正在变成地缘政治资产。
这对 OpenAI 有什么影响?
目前 Reuters 报导的是:
阿联正在重新检讨整体 Blueprint。
并不是宣布:
Stargate UAE 取消。
OpenAI 2025 年公布的正式规划仍是:
1GW Stargate UAE。
其中 200MW 预计在 2026 年上线。
今天真正需要等待确认的是:
如果 5GW Campus 从集中式设计变成分布式:
Stargate UAE 最后的:
实际位置。
建筑方式。
上线进度。
成本。
互联架构。
会不会跟着改。
目前没有足够公开信息可以先替它下结论。
也不要因为「分散」就认为一定更安全
分散可以降低:
单一地点被破坏造成的集中风险。
但同时可能增加:
更多地点需要防守。
更多 Network Endpoint。
更多供应链。
更多员工与 Contractor。
更多 Physical Access Point。
换句话说:
你减少一种风险,也可能增加另一种攻击面。
这就是大型 Infrastructure 最难的地方。
安全从来不是:
加一个功能。
而是:
一整套 Trade-off。
真正成熟的设计应该问「失去一部分后,还剩什么?」
这其实是 Resilience 和一般 Security 最大差别之一。
一般安全常问:
如何防止事情发生?
韧性则进一步问:
如果它真的发生了呢?
假设:
一个 Data Center 完全脱机。
整个 AI Service 还能不能工作?
失去一条 Fiber。
流量能不能绕走?
一座 Substation 停止供电。
其他区域能不能接手?
部分数据失去连接。
有没有另一份 Copy?
这才是:
Fault Tolerance。
也就是:
不是保证永远不出问题。
而是问题出现后:
系统不会整个一起倒下。
这个观念其实也适用一般公司
你可能没有 5GW Data Center。
也不用担心飞弹。
但相同问题可以缩小到一般企业。
例如:
所有文件只存在一台 NAS。
所有网站都在同一台 Server。
所有工作都依赖同一个 Cloud Region。
所有 AI Agent 都共用同一组 Credential。
所有员工都依赖同一个 SaaS。
平常看起来:
最省钱。
最好管理。
一出问题:
全部一起停。
所以大型国家级 AI Campus 今天面对的问题:
其实也是所有 IT 系统都要问的基本题:
「如果这一个东西消失,我还能不能工作?」
AI 基建竞赛正在从「谁盖最大」进入「谁撑得住」
过去两年:
AI Infrastructure 新闻最常比:
多少亿美元。
多少 GPU。
多少 GW。
多少平方公里。
但真正投入运作之后:
另一组指针会越来越重要。
Uptime。
Redundancy。
Backup。
Recovery Time。
Physical Security。
Network Diversity。
Energy Resilience。
Geographic Distribution。
这些词没有:
「5GW 超级 AI Campus」
那么吸睛。
却可能才决定:
当真正的危机发生时:
那 5GW 到底还剩多少可以工作。
今天最值得记住的不是「数据中心要盖到地下」
因为目前 Blueprint 还在调整。
很多细节也只是 Reuters 根据知情人士取得的规划方向。
真正的大转折是:
AI 算力正式进入 Critical Infrastructure 思维。
当模型变成:
政府。
金融。
医疗。
能源。
企业。
科学研究。
每天都在依赖的基础能力。
我们就不能只问:
AI 有多聪明。
也不能只问:
GPU 有多少。
还必须问:
那一整套算力如果遇到真正的现实世界冲击,能不能继续工作?
AI 最后不是活在 Cloud 里。
Cloud 的底下:
还是土地。
电力。
光纤。
水。
建筑。
芯片。
以及一个真实的地理位置。
当这些东西开始成为国家级资产:
AI Infrastructure 的下一场竞争,也就不只是:
谁盖得最大。
而是:
谁在最糟的情况发生后,还能继续跑。
今天,和 AI 一起进步一点。
每天学会一个 AI 技巧。
每天节省一点时间。
每天提升一点能力。
SasaDaily,陪你一起成长。
推荐阅读
AI 数据中心里一个不起眼的小零件,为什么美国准备禁止中国制造?