2026年9月17日,华为在全联接大会2026上发布基于“灵衢+Hi-ONE”的昇腾960超节点。它的意义不只是把更多NPU装进一个系统,而是尝试通过统一互联、内存统一编址、近封装光互联和分层组网,缓解万卡集群中计算单元等待通信、存储访问路径过长以及故障点增多等问题。相关发布信息已获华为官方资料与新华网报道交叉印证。[1][2]
万卡集群的瓶颈为何不只在芯片
集群扩展并非简单叠加计算卡。训练过程中,梯度同步、参数交换、激活值搬运和故障恢复都会占用时间。华为在9月17日披露的材料中称,传统架构下十万卡集群的实际模型算力利用率约为20%,大量算力处于等待通信完成的状态。这是厂商给出的场景判断,并非适用于所有集群的通用实测结论,但它点出了一个关键问题:规模越大,互联效率、拓扑设计和软件调度越可能决定有效产出。[3][1]
灵衢架构如何减少通信等待
灵衢的核心思路是将原本分散的多种互联方式收敛到统一协议,并引入内存语义,使CPU、NPU、内存和SSD能够更直接地交换数据。按照华为公布的数据,其互联带宽由百GB级提升至TB级,往返通信时延由7微秒降至2微秒,同时支持超节点内的全局内存统一编址。对分布式训练而言,这有望减少协议转换和多级转发,使跨卡访问更接近统一系统内的资源调用。上述指标来自厂商发布,实际效果仍需结合模型结构、并行策略和负载类型验证。[3][2]
灵衢还采用柜内、跨柜和集群三级互联。柜内侧减少电缆与电路损耗,跨柜设备提供176个1.6T端口及单机280T全光互联能力,集群侧的UBG交换机则通过高扇出连接更大规模节点。分层设计的价值在于让高频、低时延通信尽量停留在更近的层级,而将跨域流量交给上层网络,从而降低所有数据都挤向同一交换层的压力。[3][1]
昇腾960超节点怎样形成计算单元
昇腾960超节点采用正交架构和全液冷设计,基于灵衢实现内存统一编址,单个超节点可扩展至4096卡。华为公布的峰值能力为8 EFLOPS FP8和16 EFLOPS FP4。对于万卡部署,这意味着可以先把数千张卡组织成通信距离更短、管理边界更清晰的超节点,再将多个超节点连接成更大集群,而不是把所有卡当作结构完全扁平的资源池。[1][2]
光互联是这一方案的另一重点。昇腾960采用Hi-ONE NPO近封装光引擎,华为称单引擎传输容量为7.2T,一个超节点使用5500个Hi-ONE,可替代原方案中的4.8万颗800G光模块,降低超过550千瓦功耗,并将系统可用度提升至99.8%。这些数字展示了减少独立光模块数量后,在能耗、布线和潜在故障点方面的设计收益,但仍属于华为公布的产品指标,不能直接等同于任意数据中心的最终运营结果。[1][2]
从4096卡扩展到万卡的关键路径
多个昇腾960超节点可通过灵衢网络或RoCE连接,并采用二层CLOS四平面组网。华为公布的规划上限为51.2万卡,结合多轨道拓扑可进一步支持百万卡级集群。对现实中的万卡项目而言,更值得关注的并非理论规模上限,而是四平面设计能否提供流量隔离和冗余路径,以及故障发生后是否能够缩小影响范围、重新调度任务并保持训练连续性。[1][2]
落地时应重点核验的指标
- 有效算力:不要只看FP8或FP4峰值,应使用目标模型测量MFU、跨节点集合通信效率和训练吞吐。
- 扩展效率:分别测试单超节点、双超节点与万卡规模,观察卡数增加后吞吐是否接近线性增长。
- 可靠性:验证光引擎、交换设备或计算卡故障时的任务隔离、检查点恢复和网络收敛时间。
- 能效成本:将NPU、互联、液冷和存储纳入整体核算,比较单位有效训练量的耗电与综合成本。
- 软件适配:检查CANN、训练框架、算子、并行策略及监控工具是否覆盖现有模型与运维流程。
总结
灵衢架构与昇腾960超节点提升万卡集群效率的逻辑,可以概括为“先把数千卡组织成统一编址、低时延的超节点,再通过分层光网络扩展为大集群”。灵衢侧重协议统一、资源直连和分级组网,昇腾960则通过4096卡超节点、NPO光互联与全液冷承载具体算力。其潜在收益集中在减少通信等待、缩短数据路径、降低互联功耗和改善系统可用性,但项目方仍应通过真实模型、故障注入和长期运行数据核验,而不宜仅以峰值算力或最大卡数判断实际效率。
事件及资料日期:产品发布与灵衢架构资料发布于2026年9月17日;新华网交叉报道发布于2026年9月18日。
资料来源:华为:昇腾960超节点发布信息;华为:灵衢互联架构说明;新华网:昇腾960超节点报道。