把四千张卡“拼”成一台机器,国产算力这回走对了吗?(4张是400还是4000) ypxx.net

上海这场发布,最扎眼的是规模

九月十七日,华为全联接大会在上海启幕。副董事长、轮值董事长汪涛在主题演讲里发布了昇腾九六零超节点。会上讲了很多,最扎眼的是规模:一个超节点里的算力卡,从上一代的一千零二十四张涨到四千零九十六张。

四千多张卡连成一台机器,本身就不轻松。看热闹的人爱盯着某张卡快了多少,难的地方在别处。

打个比方,划龙舟。船想快,先靠加人,一把桨的力气总有上限。人加到几十上百个,麻烦就来了:动作齐不齐,全看鼓点和口令。

算力卡就是桨,能不能划成一条线,看的是口令。国产算力这次把力气大多花在了口令上。

这一周到底发布了什么

先说最直观的。单个超节点的算力卡从一千零二十四张升到四千零九十六张。它对外提供八 EFLOPS 的算力,在更低精度档位下可以达到十六 EFLOPS,高带宽内存容量高达一 PB。

再说怎么把它们连起来。设计上用一套协议平等连接集群里所有组件,支持跨物理服务器的内存访问,走近铜远光的互联方式,并基于灵衢总线实现内存统一编址。翻译成龙舟的话,就是所有桨手听同一套口令。

光在这套设计里分量很重。光引擎 Hi-ONE 单引擎传输容量七点二 T,是业界首个量产的近封装光学产品,也是目前传输能力最大、唯一实现内置光源的一款。华为把它定位成高带宽、高可靠与低时延、低功耗的结合体。

最硬的一组对照在这儿。一个超节点里用五千五百个 Hi-ONE 光引擎,替代了原本需要的四万八千颗八百G光模块,功耗降低超过五百五十千瓦,无故障运行时间提升一倍,可用度达到百分之九十九点八。

规模还能往上叠。多个昇腾九六零超节点用灵衢网络或 RoCE 连接,通过二层 CLOS 四平面组网,最大集群可达五十一点二万卡;结合多轨道拓扑技术,最大可支持一百万卡。

数字看着眼花,说的其实是同一件事:桨更多,口令统一,桨身也轻了。

真正的门槛,落在“连”上

为什么连比单张卡更值得看?单张卡有差距时,堆规模是最直接的补法。可规模一大,通信就成了新瓶颈。人多了,光是喊口令的工夫就够呛,桨手之间还容易互相打到。

所以门槛落在两处:协议和光引擎。协议定的是口令,光引擎定的是桨的重量。桨太重,人越多越划不动;传统光模块就有这个毛病,数量一多,功耗和故障点一起涨。

五千五百个光引擎换掉四万八千颗光模块,省下超过五百五十千瓦的功耗。省下的电,决定集群能不能长期开着跑,算力和电力本来就是一件事的两面。机器买得起,长期养不养得起是另一回事。

可用度也是同一个道理。无故障运行时间提升一倍,可用度达到百分之九十九点八,意思是一条船不容易划到一半散架。几千张卡一起干活,任何一处出问题都可能让整队停下。

桨多、口令齐、桨身轻、船不散,这才是把四千张卡当一台机器用的真本事。

落到两类人身上,分别意味着什么

对普通用户,好处间接,但实在。国产模型可以原生在国产算力上训练,模型迭代不必排在别人的队尾,新能力会来得更早。集群更稳,你用的服务也不容易被故障打断。

对从业者和企业,选型要看的就不止单卡跑分。互联协议、工具链成熟度、迁移成本,同样是硬门槛。这次 CANN 全面开源开放,已进入常态化社区运营,等于把上手的第一道坎压低了一截,但好不好用,得靠开发者用脚投票。

配套也一起发了。鲲鹏超节点基于灵衢全光组网,最大支持四千零九十六节点,形成二百五十六 TB 的统一内存池;面向长上下文的 KV 缓存多级方案,命中率超过百分之九十;面向数据中心的十二点八万卡超节点集群,用极简组网可以降低三成总体拥有成本。

冷静的地方也要说。昇腾九六零芯片研发进度超预期,性能实现倍增;九六零DT 比原计划提前三个季度,明年一季度就绪;九六零PR 提前一个季度,明年三季度就绪;往后一年一代,后年与大后年陆续推出昇腾九七零与九八零,整机的风冷与液冷版本会先后面市。时间表大多指向明年,现在只算路线被确认。跨越生态拐点出自华为自己的说法,还要时间验证。已经落地的有:更早的昇腾九一零系列超节点累计部署超过一千套,昇腾九五零超节点已商用。

对普通人,是能力来得更早;对从业者,是判断标准变了。两边都要等时间表兑现。

三个判断标准,和那个问题

落到判断上,有三条可以记。

看规模,更要看协同效率。 卡数翻倍只是起点,决定产出的是互联效率和稳定性,这两项跟不上,桨多会更乱。

看数字,更要看时间表。 八 EFLOPS、一百万卡、百分之九十九点八,都得追问一句什么时候能用上。

看硬件,更要看生态。 开源是把门槛降下来,生态能不能成,得看有多少人真在上面写东西、跑任务。

回到标题那个问题:国产算力这回走对了吗?从这周发布看,方向是对的。它把力气花在口令、桨身和船的稳定性上,这恰恰是大规模算力最难过的一关。剩下的悬念在节奏:路线已确定,兑现要等明年。

写在最后

四千张卡拼成一台机器,拼的其实是协同的能力。这条线记住就够:算力的下半场,比的是一整条船划得齐不齐,单把桨的力气已经排到后面。