AI驱动下的数据中心瓶颈:供应链、能源与政治压力全解析

AI算力需求激增正使数据中心建设陷入多重困境。先进封装产能不足、HBM供应紧张、电网基础设施老化以及光互连激光器短缺,构成四大供应链瓶颈。电力问题尤为突出,数据中心耗电量远超电网承载能力,小型核反应堆正成为新选项。

本文来自至顶网(www.zhiding.cn)。

AI算力需求激增正使数据中心建设陷入多重困境。先进封装产能不足、HBM供应紧张、电网基础设施老化以及光互连激光器短缺,构成四大供应链瓶颈。电力问题尤为突出,数据中心耗电量远超电网承载能力,小型核反应堆正成为新选项。与此同时,七成美国民众反对在社区附近建设AI数据中心,多州已立法要求超大规模运营商承担电网扩容费用并强制披露资源消耗数据。在专业化方面,各大云服务商正转向定制ASIC芯片,对英伟达市场地位构成潜在威胁。

人工智能对算力的旺盛需求正在推动数据中心建设热潮,科技巨头们全力支持在美国建设更多数据中心,然而整个行业面临的障碍却不在少数。

超大规模云服务商(以下简称"超大规模商")正积极筹建顶尖服务器集群,却遭遇日益强烈的政治阻力和公众反对,原因在于新建设施对地区电网、水资源及生态环境的潜在影响引发了广泛担忧。AI驱动的未来究竟由怎样的基础设施来支撑、由谁来建造、何时能够落地,目前仍是未知数。

AI带来的供应链瓶颈

算力需求的急剧攀升催生了数据中心建设的四大供应链瓶颈,且在过去一年内均显著加剧:

先进制程晶圆代工与封装产能有限;

HBM(高带宽存储器)供应紧张,同时其他DRAM产能被大量转移至HBM生产;

电力供应问题,尤其集中于电网基础薄弱、老化严重的地区;

光互联所需的激光器——这是实现机架内及机架间高速数据传输的关键器件。

科技咨询顾问杰夫·泰特(Geoff Tate)表示:"一年前,台积电在AI加速器领域几乎是垄断供应商,但彼时他们的表态还是'基本能跟上需求',而近期的说法则变成了'已经无法满足需求'。一年前,存储器并不在大多数人的瓶颈清单上,但如今形势已大相径庭。电力供应问题在一年前就已是明显的痛点。激光器当时也不在大多数人的视野里,因为向光互联的过渡尚不明朗,但这一情况在过去半年里发生了根本性转变。"

上述任何一个瓶颈都会对AI算力的扩张速度产生重大影响。泰特指出:"这些瓶颈相互关联——最薄弱的一环会制约其他所有环节的需求。AI要持续增长,就必须同步突破所有瓶颈技术,缺少其中任何一项,数据中心都无法正常运转。"

能源供应挑战

Endura Technologies执行副总裁兼首席产品官达乌德·亚兹达尼(Davood Yazdani)表示,传统电源管理方案已难以满足当前AI时代的需求,数据中心运营商正积极寻求能提升每瓦Token生成效率的新型设计方案。

"归根结底,数据中心最核心的指标是每瓦能产生多少Token,"亚兹达尼说,"实现这一目标的路径有两条:一是提升能效,能效提升意味着可用功率增加,进而生成更多Token;二是在能效相对较低的情况下,通过提高末级稳压电路的工作频率来加快响应速度,让处理器以最高效的方式运行,满足Token生成的需求,这种方案的综合效益更为显著。"

亚兹达尼认为,集成稳压器(IVR)的研发将是超大规模商追求能效的关键技术方向之一。

他补充道:"数据中心的用电增速与电网的供电能力完全不在同一量级,功率上限始终存在,因此必须在给定功耗预算内最大化吞吐量。这正是当前业界普遍看好IVR的原因——尽管这项技术尚处于市场导入阶段,落地需要时间,但对任何数据中心而言,功率上限都是无法回避的现实。"

电力供应问题与公众反对数据中心的核心诉求高度重叠——超大规模商的大规模建设被认为会推高普通用户的电费。

"地方政治是最重要的非技术挑战,"泰特说,"在美国许多地区,选民和政客正在采取行动限制数据中心扩张,因为他们认为数据中心是电价上涨的幕后推手。精明的运营商会尽量避开公共电网,转而自建离网发电设施。"

在这样的政治背景下,以小型反应堆为核心的核能发电方案重新进入了人们的视野。

亚兹达尼表示:"在发电方式上,核能会成为很多人认真考量的选项,因为常规电网扩张已难以为继,数据中心从业者都在关注微型反应堆和小型核电站。"

不过,微型反应堆目前尚未真正应用于数据中心供电,并非每座采用核能的数据中心都会直接配备一台微型反应堆。

NANO Nuclear Energy首席执行官詹姆斯·沃克(James Walker)解释道:"微型反应堆目前还没有投入使用,因为新技术正在经历许可申请和示范验证阶段。有些人想当然地认为每个数据中心最终都会配备自己的微型反应堆,但我并不这么看。有些设施接入电网永远是更合理的选择,尤其是在发电和输电容量本就充裕的地区。但也有一些地方,开发商正在为获取足够电力而苦苦挣扎,或者被告知要等上数年电网才能支撑新园区,在这些场景下,先进反应堆就显得颇具吸引力。"

核能在数据中心运营商中备受关注,还因为其技术可靠性。沃克表示:"已有的用电需求规模,以及预测中的未来用电量,完全是另一个量级,电力公司正在想方设法满足这些需求,同时又不能损害电网对其他用户的供电。如果一个设施需要全天候运行,就需要不依赖天气和时段的发电方式,能够提供基础负荷电力、部署选址灵活,且全年计划外停机时间可预期且极短。这正是核能频繁出现在各类讨论中的原因。现有核电站今天就能提供这种稳定电力,而先进反应堆还能赋予运营商在选址和供电安全方面更大的灵活性。五年前完全不谈核能的企业如今纷纷与核电运营商签署长期协议,这绝非偶然。"

公众认知与政策压力

然而,这一切都建立在超大规模商能够如愿推进的前提下。盖洛普最新民调显示,约70%的美国人表示反对AI数据中心落户本地社区。与此同时,不论红州还是蓝州,立法者均开始力推对超大规模商实施新的限制措施。

政策分析机构MultiState副总裁摩根·斯卡尔博罗(Morgan Scarboro)指出:"这个话题早已不再局限于政策圈,人们在餐桌上就会谈起AI,谈起数据中心,它已经完全进入了公众的日常认知。当你看到一段关于数据中心的引语,根本分不清说话的是史蒂夫·班农还是伯尼·桑德斯——这句话最能说明问题。我们追踪数千个政策议题,想不出还有哪个议题在立法走向上如此呈现出完美的圆圈:佛罗里达通过的法律竟然与纽约正在力推的内容如出一辙,这真的让人震惊。"

纽约州已对新建超大规模数据中心的部分环境许可暂停审批,期限最长一年,但全面叫停施工的议案仍在争议之中。斯卡尔博罗梳理了过去一年各州立法机构推动的三类常见法案:

"费用自担"法案,要求超大规模商/AI企业自行承担因其用电需求引发的电网扩建费用,或缴纳费率附加税以抵消电费上涨对普通用户的影响;

强制信息披露要求,要求数据中心运营商追踪并定期报告用水量、用电量及噪声水平;

暂停对数据中心运营商的税收优惠,或对其用电征收专项税。

尽管如此,地方官员仍在努力平衡民众对数据中心的担忧与其带来的经济机遇。斯卡尔博罗表示:"我不羡慕那些既要招商引资、又要面对选民强烈反对声音的政策制定者,毕竟其他行业的投资机会极为有限。"

Iceotope产品与计算业务负责人凯尔·伊尔根(Kyle Illgen)认为,公众对数据中心运营商的不信任正在迅速使这一行业变得更加复杂,但也让负责任地运营成为项目落地成功的前提条件。"数据中心管理在不到24个月内,从一个相对小众的领域一跃成为最复杂的议题之一。更重要的是,孟菲斯'巨像'(Colossus)等事件发生后,社区和监管机构对新项目的审查力度大幅提升。用电需求、水资源消耗、噪声影响和环境代价已成为规划决策的核心议题,数十亿美元的项目因地方反对而被迫延期或取消。这意味着可持续发展已不再是一项企业战略目标,而是扩张的必要前提。"

热管理技术的研发与落地,是整个行业在应对外界环境和电网担忧时面临的另一重要挑战。

"热管理与所有关于能耗和水资源的抗议直接挂钩,"伊尔根说,"AI基础设施今天面临的每一项重大挑战——性能、运营成本、可持续性、用水量、社区认可度、部署灵活性和未来可扩展性——都与热管理息息相关。而随着每一代新硬件的推出,热管理的难度也在持续攀升。"

数据中心专业化趋势

正如AI流程的日趋复杂催生了供应链瓶颈,这一趋势也促使大型运营商在数据中心建设中走向高度专业化。Synopsys混合信号PHY IP产品管理总监曼米特·沃利亚(Manmeet Walia)表示,这种专业化正在导致半导体IP生态系统日趋碎片化。

"云服务商和超大规模商的体量已经足够庞大,可以自成一体,他们的规模足以支撑自己的需求,"沃利亚说,"他们追求的是高度定制化的解决方案。因此,他们在算力和AI方面的需求各有不同,机架架构各异,进而决定了所需的存储类型与容量,以及对接口速率和性能指标的要求。他们正在进行裸片拆分,所有这些解决方案都在催生各类IP,整个生态愈发碎片化。"

与此同时,供应链问题也在对这种碎片化趋势形成制约。DRAM短缺正在影响系统设计方向。

Synopsys杰出工程师丹·威尔金森(Dan Wilkinson)表示:"在所有超大规模商的共同驱动因素中,HBM是其中之一。随着每一代新品面世、速度持续提升,他们都在密切跟踪;尽管各家的工作负载存在差异,但最终都在使用同一套存储生态。速度提升后,计算端也需要跟上,进而需要更高带宽来整合各个组件。我认为存储问题是横跨所有超大规模商的核心驱动力。"

超大规模商正在寻求传统架构之外的变通方案。过去几年,许多方案依赖英伟达GPU和CUDA等标准组件来加快上市速度,并辅以内部设计的专用加速器。但随着算力规模大幅跃升,数据的移动与存储成本已成为比以往更突出的挑战,由此催生了对更高度定制化方案的需求——这些方案可能仍会包含GPU,但也会融入其他元素,尤其是随着智能体AI的推出。

"选项一是选择英伟达,获得最高的原始性能,并确保按时交付,"沃利亚说,"选项二是走ASIC路线,或者采用COT(客户自有工具)路线自研芯片。这条路的好处在于成本更低、掌控自身命运,并能针对自身工作负载和机架架构进行深度优化。这正是Synopsys可以介入的空间——提供IP,与聚合商或ASIC厂商合作,直接与各大超大规模商合作开发其主要SoC,这些都是专门为特定SoC类型定制的IP。"

亚兹达尼认为,如果足够多的主要厂商走上定制ASIC路线,将对英伟达的市场领导地位构成实质威胁。

"英伟达在GPU领域目前排名第一,但这种格局不会一成不变,因为所有超大规模商都有掌控自身命运的雄心。他们希望拥有更贴合应用场景的优化方案,这对英伟达来说无疑是一种威胁,"亚兹达尼说,"英伟达的GPU非常适合特定类型的矩阵运算,对某些模型而言几乎是完美之选,但未必是针对Meta、谷歌或AWS工作负载的最优解。这正是他们纷纷启动自研芯片的原因。他们目前仍然依赖英伟达,但随着时间推移,会逐步推出自己的产品。以谷歌为例,他们已经有了自研的TPU,且出货量在快速增长。英伟达目前超过80%至85%的市场份额,未来还能维持吗?"

话虽如此,英伟达并不会就此退出历史舞台。"英伟达正领跑这场在2029至2030年实现1兆瓦机架的竞赛,"沃利亚说,"而实现这一目标的路径,是层层递进的高度集成——不仅仅是多芯片方案,这些多芯片方案还将以3D、3.5D乃至4D等形式实现堆叠集成。这额外的一个自由度将为我们打开全新的可能性,也带来全新层次的复杂性。"

Q&A

Q1:数据中心建设目前面临哪些主要供应链瓶颈?

A:目前数据中心建设面临四大供应链瓶颈:一是先进制程晶圆代工与封装产能不足;二是HBM供应紧张,其他DRAM产能也被大量转移至HBM;三是电力供应问题,尤其在电网老化地区尤为突出;四是光互联所需的激光器短缺。这四个瓶颈相互关联,任何一环的不足都会制约整体AI算力的扩张速度。

Q2:为什么越来越多的数据中心运营商开始考虑核能?

A:核能之所以受到数据中心运营商的关注,主要原因有两点:一是技术可靠性高,核电不依赖天气和时段,能提供稳定的基础负荷电力,且年计划外停机时间极短;二是公共电网扩张速度已无法跟上数据中心的用电增速,部分地区开发商被告知需等待数年电网才能满足需求,小型核反应堆因此成为可行替代方案。

Q3:各州政府对数据中心扩张采取了哪些限制措施?

A:过去一年,各州主要推动了三类立法:一是"费用自担"法案,要求超大规模商承担因其用电引发的电网扩建费用或缴纳附加税;二是强制信息披露要求,追踪并报告用水量、用电量及噪声水平;三是暂停税收优惠或对用电征收专项税。纽约州还对新建超大规模数据中心的部分环境许可暂停审批长达一年。

THEEND

最新评论(评论仅代表用户观点)

更多
暂无评论