华为 CloudMatrix 384 超节点

面向 AI 时代的新一代超节点架构 | 300 PFlops 算力 | 384 卡全对等互联

📄 论文: arXiv:2506.12708 🏢 华为云 📅 2025年6月

目录

384
昇腾 910C NPU 数量
300
PFlops 算力 (BF16)
2.8
Tbps 卡间带宽
16
机柜规模
<1
µs 节点间延迟
6912
400G 光模块数量

一、架构概览

CloudMatrix 384 是华为面向 AI 时代推出的新一代超节点架构,将 384 个昇腾 910C NPU192 个鲲鹏 CPU 通过统一总线(UB)网络互联,构成一个超级云服务器。

🎯 一切可池化

CPU、NPU、DRAM、SSD、网卡等资源均可池化,通过 UB 网络实现高效访问

🔗 一切皆对等

全对等互联架构,384 卡之间任意通信,无主从之分

🧩 一切可组合

资源可按需组合,灵活匹配不同工作负载需求

CloudMatrix 384 系统架构

384× Ascend 910C
NPU 集群
UB 网络
2.8 Tbps 全对等
192× Kunpeng
CPU 集群
UB 平面
Scale-Up · 超节点内
RDMA 平面
Scale-Out · 跨超节点
VPC 平面
外部网络连接

二、硬件组成

昇腾 910C NPU

封装方式 双芯片封装
BF16 算力 752 TFLOPS/封装
内存容量 128GB HBM
内存带宽 3.2 TB/s
UB 带宽 392 GB/s 单向
RDMA 带宽 200 Gbps 单向

计算节点 (每节点)

NPU 数量 8× Ascend 910C
CPU 数量 4× Kunpeng
UB 交换芯片 7× 板载 L1 Switch
节点 UB 带宽 3.1 TB/s
节点 RDMA 带宽 3.2 Tbps
L1→L2 上行 448 GB/s

节点内部架构

8× NPU
每卡 392GB/s UB
+
4× CPU
NUMA 全互连
7× L1 UB Switch
板载交换芯片
L2 UB Switch
通信机柜

UB 网络详细组网架构

① 单节点内部架构(1节点 = 8 NPU + 4 CPU + 7× L1 Switch)

8× NPU Ascend 910C NPU 0 NPU 1 NPU 2 NPU 3 NPU 4-7 4× CPU Kunpeng NUMA互联 7× L1 UB Switch 板载 | 48端口×28GB/s=1.3TB/s/芯片 2端口绑定=1个400G LPO光口 → 24光口/芯片 L1[1] 48端口 L1[2] 48端口 L1[3] 48端口 L1[4] 48端口 L1[5] 48端口 L1[6-7] 48端口 392GB/s (单向/卡) 节点内聚合: 3.1 TB/s L1互联

② 单机柜架构(4节点 = 32 NPU + 28× L1 Switch)

计算机柜 (Rack) 节点 1 8 NPU + 4 CPU 7× L1 Switch (板载) 上行: 448 GB/s 节点 2 8 NPU + 4 CPU 7× L1 Switch (板载) 上行: 448 GB/s 节点 3 8 NPU + 4 CPU 7× L1 Switch (板载) 上行: 448 GB/s 节点 4 8 NPU + 4 CPU 7× L1 Switch (板载) 上行: 448 GB/s 机柜上行总带宽: 1.8 TB/s (448×4)

③ 全系统 16 柜组网架构(384 NPU)

12× 计算机柜 (每柜 32 NPU) R1 32 NPU R2 32 NPU R3 32 NPU R4 32 NPU R5 32 NPU R6 32 NPU R7 32 NPU R8 32 NPU R9 32 NPU R10 32 NPU R11 32 NPU R12 32 NPU 384 NPU | 上行总带宽: 21.6 TB/s (1.8×12) 4× 通信机柜 (L2 Switch) C1 - L2 Switch 16× L2 芯片 Plane 1-4 C2 - L2 Switch 16× L2 芯片 Plane 5-7 C3 - L2 Switch 备分/扩展 C4 - L2 Switch 备分/扩展 计算机柜 (R) 通信机柜 (C) UB 光纤连接 • 每 NPU UB 带宽: 392 GB/s 单向 • 每 L1 Switch: 48 端口 × 28 Gbps = 1.3 TB/s • L2 Switch 收敛比: 1:1 无阻塞

④ 带宽汇总

层级 组件 带宽规格 备注
节点内 NPU→L1 392 GB/s 单向 每 NPU
8×NPU 聚合 3.1 TB/s 节点内总带宽
机柜内 L1→L2 上行 448 GB/s 每节点
4节点 聚合 1.8 TB/s 机柜上行总带宽
全系统 12机柜 聚合 21.6 TB/s 总上行带宽
全对等互联 2.8 Tbps 384卡任意互连

三、三大网络平面

UB 平面 (Scale-Up)
  • 拓扑结构全对等 All-to-All
  • 带宽2.8 Tbps
  • 延迟< 1 µs
  • 协议MatrixLink
  • 范围超节点内 384 卡
  • 用途TP/EP 并行、内存池访问
RDMA 平面 (Scale-Out)
  • 拓扑结构Spine-Leaf
  • 带宽400 Gbps/卡
  • 延迟~10 µs
  • 协议RoCEv2
  • 范围跨超节点互联
  • 用途KV 缓存传输、分布式训练
VPC 平面
  • 带宽400 Gbps/节点
  • 协议标准以太网/IP
  • 接口擎天网卡 (DPU)
  • 范围数据中心网络
  • 用途管理、存储、CPU 通信
💡 设计理念: UB 平面保证超节点内极致性能,RDMA 平面用于多超节点扩展,VPC 平面确保与传统数据中心兼容。三平面协同,兼顾性能与灵活性。

四、机柜布局 (16柜)

CloudMatrix 384 机柜拓扑
← 12 个计算机柜 (每柜 32 NPU) →
R132 NPU
R232 NPU
R332 NPU
R432 NPU
R532 NPU
R632 NPU
R732 NPU
R832 NPU
R932 NPU
R1032 NPU
R1132 NPU
R1232 NPU
← 4 个通信机柜 (L2 UB 交换) →
C1L2 SW
C2L2 SW
C3L2 SW
C4L2 SW
图示:R=计算机柜, C=通信机柜, SW=UB 交换芯片

L2 UB 交换架构

子平面数量 7 个
每子平面 L2 芯片 16 颗
每 L2 端口数 48端口 × 28 GB/s = 1.3 TB/s
物理光口 24× 400G LPO(2端口绑定=1光口)
收敛比 1:1 无阻塞

光模块统计

Scale-Up 光模块 5,376 个 (7×/卡)
Scale-Out 光模块 1,536 个 (4×/卡)
总计 6,912 个 400G LPO

五、与 NVIDIA 对比

特性 华为 CloudMatrix 384 NVIDIA GB200 NVL72 优势方
GPU 数量 384× Ascend 910C 72× B200 华为 +5.3×
单 GPU 带宽 392 GB/s (单向) 1.8 TB/s (双向/18端口×100GB/s) NVL72 +4.6×
全系统对等带宽 150 TB/s (384 GPU All-to-All) 130 TB/s (72 GPU All-to-All) 华为 +15%
互联拓扑 全对等 All-to-All NVLink 72 全对等 持平
互联介质 全光 (LPO 光模块) 铜缆 (距离受限) 华为 (跨机柜)
节点内带宽均匀性 <2% 衰减 ~10% 衰减 华为
内存总容量 49 TB HBM 13 TB HBM 华为 +3.8×
内存带宽 156 TB/s 131 TB/s 华为 +19%
适用场景 超大规模 MoE 单机柜紧耦合 场景互补

💡 架构洞察:低算力 GPU 组成高性能超节点的可行性

关键数字对比:

  • 华为 384:384 GPU × 392 GB/s = 150 TB/s 全系统对等带宽
  • NVL72:72 GPU × 1.8 TB/s = 130 TB/s 全系统对等带宽

结论:可行,但有条件。

  • 384 个 910C 的总互联带宽与 72 个 B200 基本持平
  • 华为通过更大规模、更多光模块弥补单卡算力差距
  • UB 网络全对等架构确保更多 GPU 不成为通信瓶颈

⚠️ 但核心差异在单卡算力:B200 单精度算力约为 910C 的 5~6 倍。若任务能完美切分且通信开销小,总性能可接近 NVL72;若依赖单卡大内存/高算力,则差距无法靠数量弥补。

七、软件栈

CANN 软件架构

框架层
PyTorch / TensorFlow / MindSpore
GE 图引擎
计算图优化
运行时层
ACL API
驱动层
内核/固件
硬件
昇腾 NPU

HCCL 集体通信库

支持 AllReduce、AllGather、AllToAll 等集合通信操作,优化跨节点数据传输

MatrixLink 网络服务

为 UB 和 RDMA 提供 QoS 保障、动态路由、网络感知的工作负载放置

MatrixResource 资源管理

基于拓扑感知的计算实例分配,优化资源利用率

八、性能表现

DeepSeek-R1 推理效率对比

CloudMatrix 384 (INT8) 4.45 tokens/s per TFLOPS
最佳
NVIDIA H100 + SGLang 3.76 tokens/s per TFLOPS
84%
NVIDIA H800 + DeepSeek ~3.0 tokens/s per TFLOPS
67%

🏆 Prefill 性能 (每 NPU)

吞吐量 6,688 tokens/s
计算效率 4.45 tokens/s/TFLOPS
延迟 (TPOT<50ms) 支持

🎯 Decode 性能 (每 NPU)

吞吐量 1,943 tokens/s
计算效率 1.29 tokens/s/TFLOPS
严格延迟下 538 tokens/s (TPOT<15ms)

九、总结

💪 核心优势

  • ✓ 业界最大规模 384 卡全对等互联
  • ✓ 2.8 Tbps 无阻塞 Scale-Up 带宽
  • ✓ 节点间 <2% 带宽衰减
  • ✓ 全光互联支持跨机柜扩展

🎯 适用场景

  • ✓ 超大规模 MoE 模型训练/推理
  • ✓ 分布式 KV 缓存访问
  • ✓ 张量并行 / 专家并行
  • ✓ 预填充-解码分离架构

🚀 未来演进

  • ✓ VPC + RDMA 统一平面
  • ✓ 更大规模超级节点
  • ✓ CPU 物理解耦与池化
  • ✓ 组件级分解部署