
当一台服务器的热量越来越集中在几颗芯片上,数据中心面临的问题就不只是“空调够不够冷”。热量能否及时从芯片表面带走,会直接影响设备能否持续运行、机柜能装入多少算力,以及整座数据中心需要多少电力和水。
这也是液冷受到关注的原因。不过“液冷将取代风冷”和“浸没式最终将取代冷板式”,都是过于简单的判断。目前的实际格局是:多数普通数据中心仍以空气冷却为基础;高密度AI机柜加快采用芯片级液冷,其中冷板式最具规模化条件;浸没式已经有商业应用,但尚未成为通用选择。未来的方向更可能是按芯片、服务器、机柜和园区的实际需求组合多种技术。
一、先看全局:液冷正在增长,风冷也仍在运行
讨论液冷时,首先要分清两个范围:所有数据中心与新建高密度AI机柜。

Uptime Institute的2025年冷却系统调查显示,在回答相关问题的受访者中,75%表示所在组织使用机房周边空气冷却,22%表示使用直接液冷。该调查允许多选,统计的是受访组织是否采用某种技术,不能理解为“全球75%的机柜风冷、22%的机柜液冷”。它说明的是:液冷应用正在扩展,但整个存量市场仍由空气冷却支撑。调查同时发现,受访者考虑液冷可行性时,最看重的是能否方便地融入现有基础设施。
高密度AI机柜则是另一番景象。英伟达GB200 NVL72把72颗Blackwell GPU与36颗Grace CPU集成在一个机柜级系统中,官方明确将其定义为液冷设计。英伟达公开的设计资料指出,该机柜需要处理约120千瓦的冷却负荷,采用直接液冷并配备液冷歧管与连接结构。
但芯片型号不能直接等同于冷却方式。以用户材料中提到的HGX H100、H200为例,它们有不同整机配置,市场上存在风冷和液冷产品;不能说这些平台“均采用冷板液冷”。更准确的表述是:随着机柜功率和芯片热流密度升高,先进AI系统越来越需要液冷,而具体方案取决于整机设计和部署条件。
因此判断一种散热方式是否“主流”,必须说明比较对象。在全球全部在运行的数据中心里,空气冷却仍十分普遍;在新一代高功率AI机柜的液冷方案中,冷板式是当前更常见、工程体系更成熟的路线。两句话可以同时成立。
二、冷板与浸没,区别究竟在哪里?
冷板式液冷,是把金属冷板安装在GPU、CPU等主要发热器件上。冷却液流过冷板内部通道,通过金属和热界面材料带走芯片热量,液体通常不直接接触电路板。在行业术语中,这种把液体送到发热器件附近的方式常称为“直接液冷”或“芯片级液冷”;这里的“直接”,并不意味着冷却液直接接触裸露电路。

浸没式液冷则将经过适配的IT设备置于绝缘冷却液中,让液体接触服务器中的更多元器件。单相浸没的液体在工作过程中保持液态;两相浸没利用液体汽化、蒸汽冷凝的相变过程搬运热量。浸没能覆盖冷板未直接接触的部件,但设备、液体、材料和维护流程必须作为一个系统共同设计。
两条路线的差别,不能用“谁散热能力打几颗星”概括。芯片表面的温度,还取决于热界面、冷板流道或浸没液流动、进液温度、泵送能力等设计。浸没式的突出特点是可以接触更多部件、减少部分风扇需求;冷板式的突出特点是能优先处理最集中的芯片热量,同时保留较多现有服务器与机柜的使用方式。某一项目采用哪条路线,应看完整系统的散热表现、可靠性和全生命周期成本。
此外,机房里还有后门换热器等方案:它让液体在机柜后门换热器中流动,带走服务器排出的热空气,并未把液体送到芯片。它常用于存量机房升级,也可能与冷板共同使用。把“机房里有水管”都称作芯片液冷,会掩盖这些重要差异。
三、为什么现阶段冷板式更容易规模化?
第一,冷板可以优先解决最紧迫的热点问题。AI服务器的热量并非平均分布在整个机箱内,GPU、CPU及部分高速部件是重点。冷板将换热能力集中到这些位置,其余部件继续由空气或其他方式散热,形成常见的“液冷加风冷”混合架构。英伟达的GB200相关参考资料也描述了直接液冷与空气冷却并用的系统设计。
第二,冷板更容易接入既有产业链。服务器仍可沿用较熟悉的机箱、机柜、搬运和更换方式,运维人员也不必将每一次维护都改为“设备出液、排液、清洁、复装”的流程。当然,“较容易改造”不等于“装上冷板即可投运”:机房仍须校核供水温度、流量、压差、管路、冷却液分配单元(CDU)、漏液监测、供电和承重等条件。
第三,采购和责任边界相对清晰。芯片、服务器、冷板、连接器、CDU与机房设施可以通过接口规范逐步协同。接口尚未完全统一,是现实难题,但也正是标准化正在着力解决的方向。中国信通院关于冷板液冷快速接头的研究指出,冷板式已成为当前主流液冷散热方式之一,同时需要解决连接器互换与解耦问题。
第四,需求本身支持分步升级。不是每个机柜都会立即达到百千瓦级功率。数据中心通常同时运行通用计算、存储、网络设备和AI加速服务器。为高功率区域建设液冷能力,让其他区域继续采用合适的风冷方案,往往比一次性重建全站更符合交付周期与资金安排。
Uptime Institute的调查也印证了这一选择逻辑:在2025年受访者中,46%将“容易改造既有基础设施”列为判断直接液冷方案是否可行的重要因素;在已经使用或考虑液冷的路线中,水基冷板仍居前列。
四、国内数据中心:冷板扩张,浸没也已落地
国内市场有两个同时存在的特点:一方面,新建智算中心和高密度集群推动冷板式应用;另一方面,浸没式并非停留在实验室。
在冷板方向,中国移动的2024年可持续发展报告明确提到推动冷板液冷和智能集群控制等节能技术应用;中国电信介绍其安徽智算中心时,也列出冷板式液冷技术。中国信通院2024年发布的冷板式液冷研究报告,将其描述为成熟度和应用广度较高的液冷路线。这些资料共同反映出,冷板已经进入国内运营商与智算中心的工程选择范围。
浸没方向,阿里巴巴较早开展了实际部署。其碳中和行动报告披露,浙江仁和数据中心使用将服务器浸入绝缘液体的方案,报告给出的项目PUE最低值为1.09。这里应注意:这是特定项目的披露结果,不能推导出“所有浸没式数据中心都能达到1.09”。中国信通院2025年的产业研究也列举了国内多家推出浸没式服务器的厂商,说明这一方向已有产品和应用实践。
政策提供了另一层背景。国家发展改革委等部门2024年印发的《数据中心绿色低碳发展专项行动计划》提出:到2025年底,新建及改扩建大型、超大型数据中心PUE降至1.25以内,国家枢纽节点数据中心项目PUE不得高于1.2,并要求加强节水评价。政策关注的是项目整体能效与资源利用,并未规定“达到某个PUE只能使用某一种液冷”。自然冷源、供配电效率、设备利用率、液冷设计与运维质量都会影响结果。
国内项目为什么会同时保留两条路线?原因很务实:冷板更便于与当前主流AI服务器和交付体系结合;浸没适合部分专门设计、能够统一设备规格和运维流程的项目。对于大量既有机房而言,改造能否按时完成,常常与最高理论散热能力同样重要。
五、海外数据中心:同样没有“唯一答案”
海外头部运营商的公开实践,也指向多路线并行。
微软在介绍其AI数据中心时表示,使用封闭循环液冷让液体进入服务器带走热量,并在部分现有数据中心借助换热设备支持液冷工作负载。微软还在2021年披露过生产环境中的两相浸没式试验。这说明:即便已经验证浸没技术的企业,规模建设仍会同时采用与设施条件相匹配的芯片级液冷方案。

谷歌为TPU建设了长期演进的液冷系统。其2025年发布的Ironwood TPU资料称,一个大规模系统可连接9216颗液冷芯片;这一做法体现了芯片与数据中心共同设计的价值。Meta公开的Catalina机柜则基于英伟达Blackwell平台,采用液冷架构。Meta还披露,在缺少设施级液冷的传统数据中心部署相关机柜时,使用空气辅助液冷设备配合,显示存量设施会影响最终方案。

欧洲案例又增加了“热如何利用”的视角。芬兰LUMI超级计算机采用循环液冷,并把回收的热量送入当地供热网络。法国OVHcloud长期使用芯片级水冷,也研发过将芯片水冷与单相浸没结合的混合方案。它们表明:未来未必是在冷板与浸没之间二选一,也可能在同一系统里分工:高热芯片由冷板处理,其他部件由液体或空气承担。
这些案例不能简单按国家排序。美国、中国和欧洲都存在不同气候、不同电价和水资源条件、不同服务器代际的设施。真正决定路线的,是工作负载与机房条件,而非项目所在国家。
六、散热技术正在朝哪些方向发展?
方向一:从“给机房降温”转向“把冷量送到热源”。过去依赖机房空气循环,再由服务器风扇把热量带出;现在更多高密度设计把液体送至芯片附近。芯片热量越集中,越需要缩短从热源到冷却介质的传热路径。冷板流道、热界面材料、泵、连接器和监测系统因此一起升级。未来的竞争,将更多发生在整条热路径的协同设计上。
方向二:从纯风冷或纯液冷,转向按部件分配散热任务。一台服务器内,各部件的发热水平和维护要求不同。GPU可用冷板,其他元器件保留风冷;某些专门设计的设备则考虑全浸没。机房也可以让风冷区和液冷区共存。这种混合方式并非过渡期的“凑合方案”,而是能够适应异构设备、不同更新周期的长期工程选择。
方向三:提高冷却液温度,并审慎设计室外排热。如果服务器允许更高的进液温度,部分气候条件下可增加自然冷却机会,减少机械制冷需求;排出的热也更有利用价值。ASHRAE已按允许的供液温度对液冷设备划分不同等级,并把热回收、干冷器、水资源效率纳入AI数据中心的系统设计讨论。不过,进液温度不能一味提高:芯片性能、可靠性与当地气候必须共同校核。
方向四:把漏液、材料相容性和可维护性变成设计起点。液冷规模扩大后,一套系统往往跨越服务器厂商、连接器厂商、CDU厂商与机房运营商。接头是否互换、液体是否腐蚀材料、故障时能否隔离单台设备,会直接影响长期可用性。OCP与ASHRAE在2025年宣布围绕数据中心液冷标准及实践开展合作,覆盖机房水系统、设备冷却回路、冷板和浸没等环节。
方向五:同时计算电、水、碳与可回收热量。低PUE并不自动意味着低用水,也不能单独代表全生命周期环境表现。国际能源署指出,制冷与环境控制在不同类型数据中心中的耗电占比差异很大:高效超大规模数据中心约为总耗电的7%,效率较低的企业数据中心可超过30%。因此,项目应分别看PUE、用水、供电结构、设备利用率和热回收条件。
七、浸没式为什么尚未成为通用答案?
浸没式的吸引力很直观:液体接触更多器件,可能减少机箱风扇,并为高密度部署提供新的布局空间。但其投入与运维问题也必须完整计算。
首先是设备适配。普通服务器中的线缆、连接器、塑料、密封件和存储设备,未必都适合长期接触某种冷却液。OCP在浸没液规格文件中指出,设备及零部件需要验证与液体的材料兼容性和设计寿命;液体品种越多,验证工作越复杂。
其次是维护流程。浸没设备通常需要适配专用容器和起吊、排液、检查、清洁等作业方式。对设备型号统一、更新节奏可控的集群,这些流程有机会被标准化;对租户多、设备代际混杂、频繁增减服务器的数据中心,组织成本可能明显上升。
再次是冷却液选择。两相浸没常涉及特殊绝缘液体,必须评价成本、供应稳定性、材料兼容性及环境影响。3M在2022年宣布于2025年底前退出包括氟化液在内的PFAS制造,并在后续披露中表示已完成退出。这一变化提醒行业:不能只依据换热性能选择液体,还要考虑长期供应和环境要求。
最后,浸没式并不保证任何项目都比冷板式更省电或更可靠。比较时必须明确同样的IT负载、室外气候、冗余等级、供液温度和统计边界。把某个示范项目的最低PUE,与另一座商业数据中心的全年平均PUE直接比较,无法得出技术优劣结论。
八、未来五到十年:会出现什么样的路线图?
近中期,高密度AI区域将继续推动冷板式和混合冷却扩张。这一判断依据的是已发布机柜的设计、既有机房的改造需求,以及运营商对交付速度和维护兼容性的重视。风冷不会退出数据中心,它仍将服务大量通用计算设备,并承担部分液冷服务器的剩余散热任务。
浸没式将沿着适合自身的场景继续发展。设备规格统一、可从头设计服务器和运维体系、需要减少风扇或处理更多分散热源的项目,具有采用单相浸没的条件。两相浸没及其他相变技术有研发价值,但其规模化速度取决于冷却液、材料、环境要求、可靠性和全生命周期成本,不能仅凭芯片功率上升就预设某个年份会全面普及。
更长期的变化,是散热从机电配套变为算力系统设计的一部分。芯片封装、服务器结构、供电、机柜连接、机房冷源、工作负载调度和余热利用将被一起考虑。一个高密度机柜的设计,可能从芯片层开始决定冷板形式,再倒推液体流量、CDU容量、管路布置以及室外排热方式。对于园区运营者,长期竞争力也将体现在能否用相同的电力与水资源,稳定交付更多有效算力。
因此,如果一定要给出“最终方向”,它并不是某一种冷却液或某一种机柜形态,而是:热量在产生处被高效捕获,在设备与设施之间安全输送,在园区端以尽可能低的电耗和水耗排出或利用。冷板、浸没、风冷和后门换热器都可能在这个系统中找到位置;具体比例将随芯片设计、设备价格、能源与水资源条件持续变化。
从“选技术”走向“算全账”
液冷正在成为高功率算力系统的重要基础设施,但它不会让数据中心建设变成一道单选题。当前,冷板式更适合大规模、快速部署的高密度AI机柜;浸没式已具备实际应用,适合能够围绕它重新设计设备和运维的场景;风冷仍支撑庞大的存量设备,并与液冷长期协作。
项目决策者真正需要回答的,是一组更具体的问题:未来五年机柜功率如何变化?现有机房能提供什么温度和流量的冷却回路?设备由谁维护?故障能否隔离?当地电价、水资源和余热利用条件如何?只有把这些因素放进同一张账本,才能选出适合本项目的散热路线。
AI算力的下一阶段,争夺的不只是芯片性能,也包括把芯片产生的每一份热量可靠带走的能力。















