
华为:昇腾中国市场份额已超英伟达 统一总线技术引领未来。在2026年9月17日举行的华为全连接大会上,华为轮值董事长徐直军与海思首席科学家廖恒博士与多家媒体机构的记者进行了问答环节,讨论了华为面向人工智能时代的Peerium计算架构以及UnifiedBus(UB,灵衢总线)。

去年的华为全连接大会上,徐直军发表了主题演讲,发布了昇腾芯片及其路线图(包括950、960、970,以及SuperPoD和SuperCluster),并宣布了UnifiedBus协议的开放发布。今年的华为全连接大会上,华为发布了昇腾950和Atlas 950 SuperPoD。当业界都在谈论SuperPoD或超级节点时,实现这些产品的方式却有着巨大差异。SuperPoD的关键在于让数千甚至数万个处理器像一台计算机一样工作。
Atlas 950 SuperPoD由华为首创的新计算架构驱动。这一架构如今可以让一百万个处理器像一台计算机一样工作。该架构被称为Peerium,它通过嵌套并行、统一内存寻址和对等互连,实现了百万处理器级别的强扩展。它通过引入嵌套BSP(嵌套批量同步并行)扩展了图灵的并行范式。该架构还扩展了冯·诺依曼单机架构,超越了数十年来盛行的主从设计范式。鉴于业界现有技术无法支持这一架构,华为发明了一项关键互连技术——UnifiedBus。最终,一百万个处理器能够真正像一台更大的计算机一样工作。
UnifiedBus是一种高速总线,采用开放协议,可无限扩展,用于连接CPU、NPU、内存、SSD、接口卡和交换机。借助UnifiedBus,实现了跨计算、存储和网络的对等互连。这从根本上超越了传统的主从架构。Atlas 950 SuperPoD是基于Peerium计算架构构建的产品。目前,一个拥有25.6万张计算卡的SuperCluster正在部署和测试中。
采访实录如下:
问:廖博士,您的论文提到了一款由25.6万张卡组成的SuperPoD。这是你们技术的上限吗?能否进一步谈谈市场对你们产品的需求?
廖恒表示,25.6万这个数字不是随意选择的。大型集群的目的是用于训练,能够支持基础模型训练的硬件基础设施,而如今的基础模型已经达到5万亿参数的规模。未来两年,中国大约会有6到7家前沿AI实验室,它们都将致力于训练规模在10万亿到40万亿参数之间的基础语言模型。这些数字大致与内存容量和SuperPoD的规模相匹配。在中国,大多数数据中心在电网方面都有国家规划,因此20万是一个相对保守的数字。
问:你们有什么计划鼓励中国的模型提供商使用昇腾芯片进行训练?
徐直军表示,对于昇腾950,他们首先向市场推出了950PR,主要用于AI推理。基于昇腾950DT的SuperPoD主要用于AI训练,目前正在测试中,大规模供应将在今年年底或明年年初开始。他们正在与AI模型提供商进行广泛的对话和讨论,使用昇腾950DT进行训练的测试结果相当不错。从明年开始,大量AI模型训练将基于使用昇腾950DT的SuperPoD。
问:华为对美国领先AI模型提供商近期呼吁放缓AI开发有何看法?
徐直军认为,需要看中国和美国AI发展的水平和节奏。中国的AI模型主要是开源模型,进展相对透明。美国的主流模型提供商拥有更多算力,所以只有他们自己知道其模型的复杂程度处于什么水平。中国市场对AI风险的感觉可能比美国弱。中国的模型提供商需要加快步伐,达到他们也能感受到AI发展风险的水平。需要在推动AI发展和管控AI风险之间取得平衡,确保AI向善。
问:华为是否有计划将Atlas 950 SuperPoD推向中国以外的其他市场?如果有,你们的目标市场是哪些?能否分享你们在中国市场份额的数据?你对中国推动芯片自给自足有何看法?
徐直军表示,由于产能不足,没有计划全面拓展国际市场,但确实有几个国家有非常强劲的需求。他们正在进行一些测试,并向这些国家提供一些供应,但数量相当有限。根据收集的数据,昇腾已经超越了英伟达。中国推动芯片自给自足是必然的前进道路,不会接受由别人决定是否能获得某些产品的未来。即使芯片不那么先进,至少供应是有保障的。
问:你们的UnifiedBus互连技术源自你们在计算和通信领域的长期优势。UnifiedBus有多少来自你们的网络部门?
徐直军解释,UnifiedBus不仅仅源自业务的网络部分,而是整合了不同的互连协议,开发出一个统一的协议。网络更多地与IP协议相关,延迟较高。计算互连更多地与总线相关,应提供低延迟和高速度。UnifiedBus由计算机架构师构思,但由网络团队养大。
问:UnifiedBus同时适用于横向扩展和纵向扩展,而英伟达分别用NVLink和InfiniBand应对这两种场景。那么华为将协议统一为一个UnifiedBus同时支持纵向和横向扩展,是出于什么考虑?与类似解决方案相比,UnifiedBus有哪些优势?
徐直军指出,英伟达最新的NVL72解决方案在机架内通信带宽高达1.8 TB/s,但一旦使用InfiniBand进行机架间通信,带宽降至0.2 TB/s。如此低的机架间通信带宽,无法让一百万个处理器像一台计算机一样工作。UnifiedBus可以在所有层级实现高速互连,基于UnifiedBus可以实现高达800 GB/s的机架间通信带宽。华为开发了搭载384个910C处理器的SuperPoD解决方案,已出货1000多套。廖恒补充说,单一协议可以减少协议转换开销,提高效率。
问:在采用UnifiedBus的Atlas 950 SuperPoD中,有多少纵向扩展是通过电信号实现的,有多少是通过光信号实现的?你认为光学最终会占据整个机架吗?最大的障碍是什么?
徐直军介绍,华为发布的Hi-ONE模块是一个NPO模块,支持7.2T带宽,距离主芯片仅5厘米。使用铜线连接这两者,其余全部是光学。华为能够开发和量产这个模块,是因为在光子学方面有多年的经验。廖恒提到,光学传输距离短、衰减小,但量产困难,因为温度变化会影响二极管的物理特性。最大的采用障碍是对可靠性的担忧。
问:你提到昇腾芯片在中国大陆的产能和供应有限。那么阻碍中国大陆产能提升的最大障碍是什么?到什么时候华为能够确保大规模稳定供应?
徐直军表示,瓶颈基本与全球相同,全球产业没有为AI激增做好准备。只有当供需达到平衡时,瓶颈才能解决。全球范围内的供需平衡将在2029年左右实现。在中国大陆,可能还会更慢。华为目前向市场的供应量已经可以称为“规模化供应”,但如果与AI基础设施的需求相比,仍然很少。
问:有报道称马来西亚正在考虑将华为昇腾910C加速器作为其主权AI计划的核心。你如何平衡国内和国外客户的需求?
徐直军表示,满足国内客户和国际客户需求之间的平衡很简单:优先考虑对算力有迫切需求的中国客户;在中国以外,只向非常有限的客户供应,这些客户要么无法获得替代解决方案,要么想要一个替代解决方案。
问:当华为决定选择NPO而非CPO时,华为内部最重大的反对意见是什么?
徐直军表示,华为内部似乎没有就此进行辩论。华为从事光器件、光模块和昇腾芯片,知道哪个是最佳选择。NPO在工程实施、成本、可维护性和良率等多个角度来看都是最佳选择。行业参与者也逐渐认识到NPO的好处,OIF的40家厂商现在都支持NPO。
问:关于使用950DT进行训练,你们从模型提供商那里收到了哪些关于需要改进的领域和问题的反馈?你们做了哪些改变来让昇腾上的预训练更好?
廖恒表示,昇腾遇到的第一个障碍是生态障碍,主要是软件障碍。过去18个月发生了巨大变化,模型数学的复杂程度增加,编程复杂度也相应增加。新的编译器语言出现,取代并逐渐平衡CUDA的障碍。芯片本身也有优势,如UnifiedBus和嵌套BSP模型,使得编程大量芯片变得便捷。昇腾正在缩小与英伟达之间的差距。
问:下周,中国领导人将会见美国总统,AI将是他们讨论的一部分。作为中国企业家,你对那次会晤有什么样的合作期待?
徐直军表示,中国企业希望在市场竞争中和平共处,不受政府干预。华为依靠创新在市场上赢得了一席之地,累计研发投入超过1.8万亿元人民币。AI也是一样,华为只是走一条擅长的道路,建立面向未来的竞争力。
问:考虑到中国大陆无法获得先进制程节点,UnifiedBus是中国大陆的独特路径吗?还是整个行业迟早都需要它?英伟达可能会朝你们的方向发展吗?
徐直军认为,UnifiedBus是一条创新之路,也是AI计算的未来之路。只有借助UnifiedBus互连技术,才能构建一台拥有百万处理器的巨型计算机。相信在未来几年,其他参与者肯定会跟进。这也是将UnifiedBus协议开放的原因,期待全行业共同努力,迈向通用人工智能(AGI)。















