面向 AI 时代的新一代超节点架构 | 300 PFlops 算力 | 384 卡全对等互联
CloudMatrix 384 是华为面向 AI 时代推出的新一代超节点架构,将 384 个昇腾 910C NPU 和 192 个鲲鹏 CPU 通过统一总线(UB)网络互联,构成一个超级云服务器。
CPU、NPU、DRAM、SSD、网卡等资源均可池化,通过 UB 网络实现高效访问
全对等互联架构,384 卡之间任意通信,无主从之分
资源可按需组合,灵活匹配不同工作负载需求
| 层级 | 组件 | 带宽规格 | 备注 |
|---|---|---|---|
| 节点内 | NPU→L1 | 392 GB/s 单向 | 每 NPU |
| 8×NPU 聚合 | 3.1 TB/s | 节点内总带宽 | |
| 机柜内 | L1→L2 上行 | 448 GB/s | 每节点 |
| 4节点 聚合 | 1.8 TB/s | 机柜上行总带宽 | |
| 全系统 | 12机柜 聚合 | 21.6 TB/s | 总上行带宽 |
| 全对等互联 | 2.8 Tbps | 384卡任意互连 |
| 特性 | 华为 CloudMatrix 384 | NVIDIA GB200 NVL72 | 优势方 |
|---|---|---|---|
| GPU 数量 | 384× Ascend 910C | 72× B200 | 华为 +5.3× |
| 单 GPU 带宽 | 392 GB/s (单向) | 1.8 TB/s (双向/18端口×100GB/s) | NVL72 +4.6× |
| 全系统对等带宽 | 150 TB/s (384 GPU All-to-All) | 130 TB/s (72 GPU All-to-All) | 华为 +15% |
| 互联拓扑 | 全对等 All-to-All | NVLink 72 全对等 | 持平 |
| 互联介质 | 全光 (LPO 光模块) | 铜缆 (距离受限) | 华为 (跨机柜) |
| 节点内带宽均匀性 | <2% 衰减 | ~10% 衰减 | 华为 |
| 内存总容量 | 49 TB HBM | 13 TB HBM | 华为 +3.8× |
| 内存带宽 | 156 TB/s | 131 TB/s | 华为 +19% |
| 适用场景 | 超大规模 MoE | 单机柜紧耦合 | 场景互补 |
关键数字对比:
结论:可行,但有条件。
⚠️ 但核心差异在单卡算力:B200 单精度算力约为 910C 的 5~6 倍。若任务能完美切分且通信开销小,总性能可接近 NVL72;若依赖单卡大内存/高算力,则差距无法靠数量弥补。
支持 AllReduce、AllGather、AllToAll 等集合通信操作,优化跨节点数据传输
为 UB 和 RDMA 提供 QoS 保障、动态路由、网络感知的工作负载放置
基于拓扑感知的计算实例分配,优化资源利用率