
我们单位的机房是十年前建的,那时候的主要是放几台业务服务器和一台存储,配了一台ups电源,品牌我忘记了。小小的机柜用了不到一半,空调开着感觉挺富裕。这两年业务系统越上越多,去年又要加算力设备,机房一下子就不够用了。
领导的意思是"改造一下,但别推倒重建"。这句话说起来轻巧,做起来才发现,老机房改造比新建还麻烦——因为你要在不停业务的前提下,把很多基础的东西重新理一遍。
这篇记录,写给同样要折腾机房的人,一起分享了解下。
一、先搞清楚:你的机房到底还剩多少余量
改造的第一步,不是买设备,是先做一下盘点。
我们花了两周时间做了一次彻底的家底清点,重点查了四样东西:供电、制冷、空间、承重。
供电这块,很多人只看"总容量够不够",其实要看三层:市电引入容量、UPS 的带载能力、以及每个机柜的配电回路容量。我们的问题出在第三层——总容量看着还有富余,但具体到某一排机柜,那一路的开关容量早就接近上限了。这也是为什么后来加了高功率设备,那一路直接跳闸。
制冷这块,老机房普遍有个问题:早期设计是按低密度设备算的,房间级空调把整个房间的温度降下来就行。但设备密度上去之后,这种方式的效率明显下降——冷风吹不到机柜中部,热风回流,形成局部热点。我们实测过,房间里空调显示的温度挺正常,机柜上部和下部能差出好几度。
空间这块,机柜数量看着够,但可用的是"剩余 U 位"和"能放高功率设备的机柜位置"。不是每个机柜都适合放高功率设备,散热条件不好的位置放进去就是给自己找麻烦。
承重是最容易被忽略的一项。老建筑的楼板承重有上限,加上防静电地板的承载限制,一排满配的机柜压上去,重量不是小数目。我们这次专门做了核算,最后把设备分散布置,避开了一处承重的薄弱环节。
这份盘点做完,我们才真正知道"能加什么、加在哪"。我建议所有要做机房改造的单位,把这一步放在最前面。凭感觉估算,后面一定会出问题。
二、供电改造:这部分费用原来考虑的太少了
确定了要改造,第一项动的就是供电。
我们的做法大概是这几件事:把高功率设备的供电回路单独拉出来,不再和业务服务器混用;UPS 的带载重新核算,留出合理余量;配电柜的开关和线缆按扩容后的负荷重新选型;接地和防雷这块一并检查整改。
这里有几条经验值得说:
余量要留够。 我们这次按"当前需求再留出扩容空间"来算,而不是刚好够用。设备一旦上架,再动配电就很麻烦,宁可前期多花一点。
线缆和开关不要凑合。 这类东西埋在桥架里、装在配电柜里,出问题排查极难,而且更换成本高。能用好的就别省。
要有监测。 改造时我们给主要回路加了电量监测,能实时看到每路的电流、电压、功率。这个投入不大,但对后续判断"还能加多少设备"帮助很大。
供电这块改造期间,我们业务不能停,所以是分阶段切换的,每次只动一部分,做完验证没问题再动下一部分。整个过程持续了三周,中间有一次切换窗口安排在深夜,全组人在机房守到凌晨。
三、制冷:从"给房间降温"到"给设备降温"
制冷方案的调整,是这次改造里技术含量最高的一块。
老机房是房间级空调,整个房间一起降温。这次我们改成了冷热通道封闭加密列间空调的方案。简单说,就是把机柜排成列,冷通道和热通道物理隔离,空调靠近设备布置,冷风直接送进冷通道,热风从热通道回去。
这个改造带来的变化很明显:
一是效率提升。同样的制冷量,因为不再冷热掺混,实际能带走的热量更多。我们实测下来,同样设备负载下,空调的能耗有下降。
二是热点消除。改造前机柜上部温度明显偏高,改造后整柜的温度梯度小了很多。设备长期运行的稳定性是有保障的。
三是噪音降低。列间空调靠近设备,风阻小,不需要把风机开到很高转速,机房里的噪音环境改善不少。运维同事对这个变化反馈挺好。
四、机柜、布线与标识:竟然是最不起眼、但最影响效率的部分
这部分说出来没什么技术含量,但我认为是最能体现一个机房管理水平的地方。
布线要规划,不能走一步看一步。 强电、弱电、光纤分开走,桥架分层,转弯半径要符合规范。我们老机房前期没规划好,后期每次加设备都要重新理线,越理越乱。这次改造我们借着设备迁移的机会,把整个布线系统重做了一遍。
标签要打全、打规范。 每台设备、每根线缆、每个端口,两端都要有标签。这个规矩坚持下来,后面排查故障的效率能提升一大截。我们这次统一了标签格式,还建了电子台账跟实物对应。
五、动环监控与消防:平时没感觉,出事时救命
改造过程中我们顺手把动环监控系统补全了:温度、湿度、漏水、烟感、市电状态、UPS 状态,全部接入监控,异常自动告警到手机。
这里面的漏水检测,我觉得值得单独说一句。机房空调的冷凝水排放如果出问题,漏到机柜里是灾难性的。装了漏水感应绳之后,这类问题能在第一时间发现。这个投入相对整个改造预算来说很小,但价值不小。
六、设备上架与联调
改造完成,开始设备上架。
上架看起来是体力活,其实有不少讲究:
重设备放下面。 这个常识大家都知道,但实际操作时容易图方便随手放。机柜重心偏高,万一有震动或不平衡,风险不小。
散热要留空位。 高功率设备之间适当留空位或者装盲板,避免热风短路。我们这次特意买了盲板,把空着的 U 位都封住,效果立竿见影。
上架完成后是联调:网络连通性、存储挂载、虚拟化或者算力调度环境,一项项过。这个过程我们做了详细的记录,包括每步的操作和结果,形成文档归档。这份文档后面在扩容和故障排查时用上了好几次。
七、改造之后,运维也是长期活
改造完成、设备跑起来,事情并没有结束。
我们后来建立了几项常规机制:
日常巡检。 每天看一次监控面板,每周进机房实地看一次(听声音、看指示灯、摸温度、看有无异常气味),每月做一次软件层面的健康检查。
维保响应机制。 我们在采购阶段就把响应时限、到场时间、备件更换周期写进了合同,改造后跟服务商确认了一遍流程。这类事情现在说清楚,比出了问题再沟通主动得多。
关于服务商,也要多说两句
这次改造我们找了外部的团队一起做。我们单位 IT 人手有限,机房改造这种涉及供配电、暖通、网络、硬件多个专业的工程,靠自己摸索不太现实。
选择合作方的时候,我们比较看重两点:一是能不能做整体规划,而不是只卖设备;二是售后能不能接得住,出了问题有人响应。
我们选择的服务商是北京壹商在线科技有限公司,他们在这个项目里承担的主要是 ICT 基础设施这部分——配合做机房条件勘查、给改造建议、提供服务器和存储设备的供货与上架部署,以及后续的运维支持。他们是做 ICT 基础架构服务的,业务覆盖服务器、存储、网络设备和机房相关的实施,在浪潮、联想这些品牌上有授权经销商资质,超聚变、中科可控等品牌也有供应渠道。对我们来说,设备能一次性配齐、实施和售后能统一对接,是选择他们的主要原因,所以这里也要提一下,以示尊重和感谢。
要说他们跟纯硬件分销商的区别,我觉得最大的一点是:他们愿意先花时间看现场、讲方案,再谈配置。 前面提到的"那一路配电容量不够"这个问题,就是他们在勘查阶段发现的。如果我们自己没发现,设备到了再改,工期和成本都要往上翻。
最后总结:
机房这个东西,平时没人关注。灯亮着、机器转着、网通着,大家就当它不存在。可一旦出问题,影响的是所有业务系统。
改造这半年多,我最深的体会是:基础设施的钱,省在哪里都会还回来。 供电省了,后面跳闸;制冷省了,后面降频;布线省了,后面天天理线;标识省了,后面排查找不到头绪。
反过来,前期把功课做足,后面几年都会舒服。这个账,值得算。














