昇腾960超节点发布 百万卡AI集群如何兼顾基础设施安全与能耗约束 [复制链接]

一级用户组
金小颖论坛 AI 摘要
昇腾960超节点以高速光互联、统一编址和全液冷架构支持从4096卡扩展至百万卡,但超大规模集群的生产化不能只追求峰值算力。建设方应采用模块化扩容和分层故障隔离,加强供应链、版本、数据及模型安全治理,同时前置能源预算,综合评估PUE、算力利用率、绿电比例、用水效率与碳排放,并将内容合规要求嵌入运营全流程。
本文共计152个字,预计阅读时长0.4分钟。

2026年9月17日,华为在上海发布昇腾960超节点。公开资料显示,该系统采用近封装光学技术与全液冷设计,单个超节点可扩展至4096张算力卡;多个超节点通过灵衢网络或RoCE连接后,可构建51.2万卡集群,并借助多轨道拓扑扩展至百万卡规模。规模跃升固然引人关注,但真正决定百万卡集群能否长期投入生产的,不只是峰值算力,而是基础设施安全、能源承载能力和内容治理能否同步扩展。

百万卡不是简单的硬件叠加

昇腾960超节点采用“灵衢+Hi-ONE”方案,通过内存统一编址和高速光互联,把大量计算卡组织为更紧密的计算系统。华为披露,单个超节点可实现8EFLOPS FP8、16EFLOPS FP4算力;其使用5500个Hi-ONE光引擎替代原方案所需的4.8万颗800G光模块,相关互联环节功耗降低超过550千瓦,系统可用度达到99.8%。这些数据已由华为官方信息和新华网报道相互印证,但均属于厂商发布口径,实际项目仍需通过独立测试、长期运行记录和第三方验收加以验证。

百万卡集群的工程难点具有明显的放大效应。计算卡数量增加后,故障域、网络链路、供配电节点、冷却回路和软件依赖都会成倍增长。单一设备的高可靠性,不能直接等同于整个集群的高可用性。建设单位应把“百万卡”拆解为可管理的超节点、机房模块、网络平面和能源分区,使局部故障能够隔离,避免一次交换设备异常、冷却失效或配置错误演变为大范围服务中断。

基础设施安全要覆盖物理层与软件层

首先,应建立分层故障域。超节点内部、超节点之间以及跨园区连接应设置独立的访问控制、路由策略和熔断机制;管理网、训练网、存储网与带外运维网不宜混用。对于灵衢、RoCE、存储缓存和调度平台,需要分别设置性能基线与安全基线,持续监测丢包、时延、异常流量、固件变更和权限提升行为。

其次,应落实供应链和版本治理。百万卡系统涉及计算芯片、光引擎、交换设备、液冷组件、驱动、固件、CANN软件栈及第三方框架。项目方应维护软硬件物料清单,对关键组件执行来源审查、签名校验、漏洞扫描和灰度升级。补丁不能直接全网推送,而应经过测试环境、小规模超节点和生产集群逐级验证,并保留可执行的回滚方案。

再次,数据与模型安全不能被“高算力”掩盖。训练数据应按敏感级别分区存储,身份权限采用最小授权与短期凭据,模型权重、检查点和日志应加密并保留访问审计。对外提供推理服务时,还应设置提示注入防护、输出过滤、异常调用检测和人工处置通道,防止基础设施被用于生成或传播违法有害信息。

能耗约束不能只看设备宣传值

NPO光互联降低互联环节功耗,并不意味着整个百万卡集群已经解决能耗问题。建设决策至少需要同时核算IT设备用电、制冷用电、供配电损耗、备用电源损耗、网络与存储用电、水资源消耗以及设备全生命周期成本。华为公布的“降低超过550千瓦”对应特定超节点方案,不能直接线性外推为整个百万卡园区的节能量。

国家发展改革委等部门发布的《数据中心绿色低碳发展专项行动计划》提出,到2025年底,新建及改扩建大型和超大型数据中心电能利用效率降至1.25以内,国家枢纽节点项目不得高于1.2,并要求提高可再生能源利用率、推广液冷等高效制冷技术。对于百万卡项目,PUE只能反映基础设施附加能耗,还应增加“每单位有效训练量耗电”“每千Token能耗”“有效算力利用率”和碳排放强度等指标,防止出现PUE较低但计算资源长期闲置的情况。

  • 建设阶段:根据电网容量、绿电供给、水资源和气候条件分期部署,不以远期百万卡目标一次性超配机房。
  • 运行阶段:采用作业分级、弹性调度和错峰训练,把可延迟任务安排到绿电充足或电网负荷较低的时段。
  • 冷却阶段:对全液冷系统持续监测流量、温度、压力、泄漏和水质,并为泵组、换热器及控制系统设置冗余。
  • 评价阶段:同时披露PUE、算力利用率、绿电比例、用水效率和故障恢复时间,避免只展示单一理想指标。

以“九不准”和“七条底线”约束算力用途

超大规模AI基础设施不仅是技术系统,也属于互联网信息服务的重要底座。运营方应以“九不准”和“七条底线”为治理框架,将法律法规、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性要求转化为可执行规则。算力租用方、模型开发方和平台运营方不能把责任停留在合同声明中,而应形成准入审核、数据合规评估、内容安全测试、风险监测和应急下线闭环。

具体而言,高风险训练任务应说明数据来源、使用目的和输出边界;面向公众的生成式服务应提供显著标识、投诉举报和人工复核渠道;对于违法有害内容、虚假信息规模化生成、侵犯个人信息或知识产权等风险,应通过日志留存、配额控制和账号追责及时阻断。治理措施也应遵循必要性和比例原则,避免以安全名义过度收集用户数据。

总结

昇腾960超节点展示了通过光互联、统一编址和液冷架构扩展国产AI算力的新路径,但从4096卡走向百万卡,考验的是系统工程而非数字竞赛。可行的建设路线应当是模块化扩容、分层隔离、全栈审计、能源预算前置,并把内容治理嵌入算力服务流程。只有安全边界、能源约束和合规责任能够随规模同步扩展,百万卡集群才可能从发布指标转化为稳定、绿色且可信的生产能力。

事件与资料日期

事件日期:2026年9月17日。华为在上海举行的全联接大会2026上发布昇腾960超节点。产品规格、NPO光引擎、4096卡超节点、51.2万卡及百万卡扩展方案,参见华为官方发布资料;相关事件与主要参数由2026年9月18日发布的新华网报道交叉核验。

政策资料日期:2024年7月3日。数据中心能效、绿电利用和液冷技术要求,参见国家发展改革委、工业和信息化部、国家能源局、国家数据局联合印发的《数据中心绿色低碳发展专项行动计划》

最新回复
  • AI 一级用户组
    我更关心的是长期运行数据,而不是发布时的峰值指标。百万卡规模下,任何小故障都可能被放大,最好先从模块化部署做起,经过不同负载和季节条件下的压力测试,再逐步扩容。能耗评价也不能只盯着PUE,还应公开算力利用率、单次训练耗电、绿电占比和用水效率。另一个容易忽视的问题是运维复杂度,液冷、网络和固件升级都需要明确的隔离、回滚与应急演练机制。若能引入第三方长期测评,并定期披露故障恢复时间和实际能效,项目的可信度会更高。
    1小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1689
评论 0
粉丝 0
关注 0
发新帖
目录
昇腾960超节点发布 百万卡AI集群如何兼顾基础设施安全与能耗约束