🔥 GTC 2026 最新发布

CPO(Co-Packaged Optics)
光模块与计算芯片直接封装 · Kyber NVL576

英伟达投资 40 亿美元布局硅光子技术,2027 年实现 GPU 侧 CPO

70%
功耗降低
$40亿
CPO 投资
576
GPU / 机架
600kW
单架功耗
🔥 GTC 2026 特别更新

Jensen Huang 公布重磅路线图

2026年3月 GTC 大会,英伟达 CPO 技术正式从交换机扩展至 GPU 封装

💰

40 亿美元战略投资

英伟达向 Lumentum 和 Coherent 各投资 $20 亿,确保 CPO 光学组件的未来产能与技术授权

已完成
🖥️

Rubin Ultra NVL576

576 GPU 单机架系统,144 个 4-die 封装,2027 H2 目标 15 exaflops FP4 推理

GTC 2026 发布
🔗

Feynman NVL1152

多机架系统,1152 GPU 互联,构建超大规模 AI 计算集群

全新发布
💡

CPO 规模扩展

光学网络 TAM 从 2026 年 $150 亿增长至 2028 年 $1540 亿

市场爆发
产品/系统 发布时间 核心规格 状态
Quantum-X Photonics GTC 2025 144 × 800G 端口,InfiniBand,硅光子 已发布
Spectrum-X Photonics GTC 2025 128-512 × 800G 端口,以太网 已发布
Rubin Ultra NVL576 GTC 2026 576 GPU,144×4-die,600kW,2027 H2 出货 2027 H2
Feynman NVL1152 GTC 2026 1152 GPU,多机架扩展 远期规划
GPU 侧 CPO 2027 CPO 从交换机扩展至 GPU 封装层 开发中
01 — 技术核心

从"插拔"到"封装"

CPO 技术彻底重构了数据中心的光电互联架构,将光引擎直接集成于芯片封装内部

⛔ 传统可插拔方案
🔌

可插拔光模块

数据从芯片出发,经过 10-20cm 的 PCB 电路板才到达光模块,信号损耗巨大、功耗高昂

单端口功耗 20-30W
✅ CPO 共封装方案
📦

芯片级光互联

光引擎与 ASIC/GPU 直接封装于同一基板,电信号传输距离仅 1-2mm,功耗大幅降低

单端口功耗 ≈ 5W(CPO 5×能效提升)
📐

物理集成

将光引擎(负责光电转换)直接与交换芯片(ASIC)或 GPU 封装在同一个基板上,消除了传统插拔接口的物理限制。

距离革命

电信号传输距离从传统的 10-20 厘米缩短至 1-2 毫米,实现真正的"芯片级光互联",信号完整性大幅提升。

▼ 传统方案信号路径

🧠
计算芯片
📏
PCB 10-20cm
🔌
可插拔光模块
💡
光纤网络

▼ CPO 方案信号路径

🧠
计算芯片
📦
1-2mm 共封装
💡
光纤网络
02 — 核心优势

解决 AI 工厂的四大痛点

面向千兆瓦级 AI 工厂,CPO 在功耗、带宽、可靠性、延迟四个维度带来颠覆性提升

性能维度 传统方案 CPO 方案 提升效果
⚡ 功耗 单端口 20-30W 单端口 ≈ 5W ↓ 降低 5× (80%)
📶 带宽密度 端口密度 ≤ 64×400G 端口密度 512×800G ↑ 带宽提升 16 倍
🛡️ 可靠性 插拔易受污染/故障 减少组件数量 ↑ AI 应用运行时提升 5×
⏱️ 延迟 信号路径长(200Gb/s 损耗 22dB) 路径极短(1-2mm) ↓ 降低 50%

📊 功耗对比

传统方案25W / 端口
CPO 方案5W / 端口
节省 80% 能耗

📊 信号路径长度

传统方案150mm(15cm)
CPO 方案1.5mm
缩短 100 倍
🔋

极致节能

单端口功耗从 25W 降至 5W,5× 能效提升,助力千兆瓦级 AI 工厂

🚀

超高带宽

原生支持 800G/1.6T 速率,总交换带宽可达 409.6 Tb/s

🛡️

高可靠性

消除插拔接口,5× AI 应用运行时提升,网络弹性增强

超低延迟

信号路径缩短 100 倍,端到端延迟降低 50%

03 — 产品布局

英伟达 CPO 产品矩阵

覆盖以太网与 InfiniBand 双架构,构建"数据中心即计算机"的 AI 基础设施

🏭
AI 工厂
🌐
CPO 网络层
📡
Spectrum-X / Quantum-X
🧠
GPU 集群互联
Spectrum-X Photonics
Ethernet 以太网

面向以太网架构的 CPO 交换平台,专为生成式 AI 大规模集群设计,实现超高密度光互联

  • 128 至 512 个 800Gb/s 端口
  • 总交换带宽高达 409.6 Tb/s
  • 200G SerDes 技术
  • 支持 RoCE v2 高性能以太网
  • 与 NVIDIA BlueField DPU 深度集成
🎯 定位:大规模多租户 AI 云
Quantum-X Photonics
InfiniBand

面向 InfiniBand 架构的 CPO 交换平台,采用硅光引擎与液冷技术,追求极致性能

  • 144 个 800Gb/s 端口
  • 采用硅光子(Silicon Photonics)引擎
  • 200G SerDes 技术
  • 超低延迟 InfiniBand 互联
  • 英伟达首款 CPO 交换机
🎯 定位:超大规模 AI 训练集群
对比项 Spectrum-X Photonics Quantum-X Photonics
网络协议 以太网 (Ethernet) InfiniBand
端口数量 128 – 512 × 800G 144 × 800G
总带宽 409.6 Tb/s 115.2 Tb/s
SerDes 200G 200G
光引擎 CPO 光模块 硅光子引擎
散热方式 风冷 / 液冷 液冷
典型场景 多租户 AI 云 / 推理 大规模 AI 训练
04 — 上市时间表

2026-2028:CPO 规模部署路线图

英伟达 CPO 技术发展路线图(含 NVL576/NVL1152 分层架构)

Quantum-X Photonics

已发布

InfiniBand 架构 · 英伟达首款 CPO 交换机

📅 发布时间
GTC 2025(2025年3月)
🚀 规模部署
2026 年上半年(CoreWeave、Lambda 等)

Spectrum-X Photonics

已发布

Ethernet 架构 · 面向多租户 AI 云

📅 发布时间
GTC 2025(2025年3月)
🚀 规模部署
2026 年下半年

▼ CPO 技术发展路线图

2025 Q1

GTC 2025 正式发布

Quantum-X Photonics 与 Spectrum-X Photonics 在 GTC 大会亮相,标志着英伟达 CPO 技术正式进入产品化阶段

已完成
2025 H2

小规模验证部署

合作伙伴开始小规模试用 Quantum-X,验证 CPO 在真实 AI 训练场景中的性能与可靠性

已完成
2026 H1

Quantum-X 规模部署

CoreWeave、Lambda 等合作伙伴大规模部署 InfiniBand CPO 交换机,CPO 商用正式启动

即将到来
2026 H2

Spectrum-X 开始出货

以太网 CPO 交换机量产出货,覆盖多租户 AI 云和大规模推理场景

计划中
2026 Q1

GTC 2026 发布 Rubin Ultra

Jensen Huang 公布 Rubin Ultra NVL576 和 Feynman NVL1152 系统,CPO 扩展至 GPU 封装

已完成
2027 H2

GPU 侧 CPO · Kyber NVL576

⚠️ 延期风险:SemiAnalysis 报告延期至2028年,英伟达官方辟谣称 roadmap intact。详见下方供货时间详解。

待确认
2028

Feynman GPU + NVL1152 Kyber CPO

Feynman 是继 Rubin Ultra 之后的下一代架构,将全面采用 CPO 共封装光学;NVL1152 = 8×Kyber NVL144,1,152 GPU 全光互联全域,功耗降低 70%+

远期规划

📋 NVL576 两套架构供货时间详解(2026年7月最新)

对比项 方案A:Oberon 8机架 NVL576 方案B:Kyber 单机架 NVL576
机架架构 8 × Oberon 机架(NVL72) 1 × Kyber 单机架
GPU 芯片 标准 Rubin GPU(非 Ultra) Rubin Ultra(2-die 版本,4-die 已取消)
机柜内互连 铜线 NVLink(标准 Oberon 架构) 铜线 Kyber 正交中板(延期风险)
跨柜组网 Spectrum-X CPO 交换机胖树组网 CPO 交换机(配套受限)
量产状态 Rubin 已全面量产 延期待确认
样品交付 2026 Q3(已确认) 2027 下半年(乐观)/ 2028(悲观)
批量供货 2026 Q4 起持续放量 2028 年(供应链口径)

🔴 供应链延期口径(SemiAnalysis/瑞银)

  • 78 层正交 PCB 中板良率不达标
  • 特种玻璃基材量产工艺困难
  • Kyber NVL144 延至 2028 年
  • Kyber NVL576 集群 2027 年仅测试样机
  • CPO 跨柜互联 2027 年只能实验室验证
延期超 12 个月

🟢 英伟达官方口径(7月6日)

  • 官方回应:"Our roadmap is intact"
  • Rubin Ultra 仍计划 2027 年出货
  • Kyber 仅是内部架构设计优化调整
  • 会推出过渡替代方案(多 Oberon 机架)
  • 不耽误 NVL576 业务落地
路线图不变

💡 采购建议

2026-2027 年急需
选择方案A:8台 Oberon + CPO
2028 年后新建
可规划方案B:Kyber 单机架

🔗 NVL1152 架构详解(Feynman 时代 Kyber CPO 方案)

NVL1152 = 8 台 Kyber NVL144 机架 × CPO 全光互联

Feynman 是 2028 年继 Rubin Ultra 之后的下一代 GPU 架构,NVL1152 将是首个全面采用 CPO 的超大规模系统

配置层级 GPU 数量 机架类型 互连方式 CPO
单机架基础 144 GPU Kyber NVL144 PCB 中板铜缆 ❌ 柜内无光
中规模组合 288 GPU 2 × Kyber 铜缆直连 ❌ 纯铜
Rubin Ultra 阶段最大域 576 GPU 8 × Oberon NVL72 铜缆 + CPO 交换机 ✅ 跨柜光互联
Feynman 超大域 1,152 GPU 8 × Kyber NVL144 CPO 两层全光互联 ✅✅ 全域光
🗄️
8 × Kyber NVL144
单机架 144 GPU × 8 = 1,152 GPU
💡
CPO 两层全光互联
NVLink 光交换,柜间全对全
🌐
单一 NVLink 域
1,152 GPU 全互联

📊 NVL576 vs NVL1152 一句话对比

NVL576(Rubin Ultra)
8 台 Oberon 机架
单柜 72 GPU × 8 = 576 GPU
NVL1152(Feynman Kyber CPO)
8 台 Kyber 机架
单柜 144 GPU × 8 = 1,152 GPU

⚠️ 供货时间补充: Kyber NVL144 单机架 2027 下半年少量工程样机,2028 年批量; 完整 NVL1152(8台 Kyber + CPO 交换机整套集群)规划为 2028 年中后期 才规模化商用交付,2027 年仅实验室验证样机。

05 — 技术演进

光互联技术演进图谱

从传统可插拔到 LPO/NPO/CPO 的渐进式演进,以及关键术语辨析

📖 关键术语辨析:传统可插拔 ≠ LPO ≠ NPO ≠ CPO

术语 全称 核心特征 功耗
传统可插拔 Pluggable Optics(带 DSP) 独立模块,插拔式,DSP 芯片信号处理 高(20-30W/端口)
LPO Linear Pluggable Optics(线性直驱) 移除 DSP,线性驱动架构,仍为插拔式 中低(~10W/端口)
NPO Near-Packaged Optics(近封装) 光引擎紧邻芯片放置,未完全集成 低(~7W/端口)
CPO Co-Packaged Optics(共封装) 光引擎与 ASIC 同封装,极短距离 极低(~5W/端口)

结论:传统可插拔光模块(Pluggable)不是LPO。LPO 是在传统可插拔架构基础上移除 DSP 的优化方案,功耗更低但兼容性下降。

▼ 光互联技术演进路径

阶段 1
🔌

传统可插拔

Pluggable(带 DSP)

独立模块,DSP 芯片均衡补偿,电信号需经 10-20cm PCB

现有数据中心主流
阶段 2

线性直驱 LPO

Linear Pluggable

移除 DSP,线性驱动,仍为插拔式,功耗降低但兼容性下降

过渡优化 · 2024-2026
阶段 3
📍

近封装 NPO

Near-Packaged

光引擎紧邻芯片放置,未完全集成,CPO 过渡形态

过渡方案 · 2025
阶段 4
📦

共封装 CPO

Co-Packaged

光引擎与 ASIC 同封装,1-2mm 极短距离,功耗降低 80%

目标方案 · 2026-2028
Pluggable
DSP,10-20cm
LPO
无 DSP,插拔
NPO
紧邻芯片
CPO
同封装 1-2mm
XPU 侧 CPO
GPU 集成
🔮
2027 展望

下一步:GPU 侧 CPO — Kyber NVL576

CPO 技术从网络交换机侧扩展至 GPU 封装。GTC 2026 正式发布的 Rubin Ultra NVL576 将采用该技术,实现单机架 576 GPU 的超密度计算。

▼ Kyber NVL576 单机架架构(GTC 2026 展示)
Canister 1
18 刀片 × 8 GPU
144
Canister 2
18 刀片 × 8 GPU
144
Canister 3
18 刀片 × 8 GPU
144
Canister 4
18 刀片 × 8 GPU
144
单机架合计:4 × 144 = 576 颗 Rubin Ultra GPU (144 × 4-die 封装)
90%
机架内互连成本降低
72%
互连功耗降低
600kW
单机架功耗 · 全液冷
15 EF
FP4 推理算力(目标 2027 H2)
▼ 单颗 Rubin Ultra GPU 性能等效估算

基于 NVIDIA 路线图各代 AI 算力提升趋势(H100 → B200: ~2.5× → B300: ~2× → Rubin: ~2× → Rubin Ultra: ~2×),累计约 20× 提升

GPU 型号 FP8 (TFLOPS) 显存 1 颗 Rubin Ultra ≈
H100 SXM ~3,958 80GB HBM3 ≈ 20~30 颗 H100
H800 ~3,958(NVLink 削减) 80GB HBM3 ≈ 20~30 颗 H800
H200 ~3,958 141GB HBM3e ≈ 20~30 颗 H200(算力维度)
▼ GPU 显存代际演进
GPU 代际 显存类型 单颗容量 内存带宽
H100 HBM3 80 GB 3.35 TB/s
H200 HBM3e 141 GB 4.8 TB/s
B200 (Blackwell) HBM3e 192 GB ~8 TB/s
B300 (Blackwell Ultra) HBM3e 288 GB ~12 TB/s
GB300 NVL72 HBM4e ~500 GB ~15 TB/s
Rubin Ultra HBM4e ~512 GB(估) ~20+ TB/s(估)
▼ Kyber NVL576 整体算力与显存
纯 FLOPS 等效
~11,520
颗 H100 / H800
576 × 20 = 11,520
考虑互联效率后
15,000~20,000+
颗 H800 等效
NVLink 统一内存域加成
总统一显存池
~288 TB
576 × 512GB
HBM4e 统一内存域
▸ 系统级显存对比
DGX H100 (8卡)
640 GB
GB200 NVL72
~13.5 TB
Kyber NVL576
~288 TB

💡 为何实际等效更高? NVL576 通过 CPO + NVLink 实现 576 颗 GPU 的统一内存域,扩展效率远超传统 InfiniBand/以太网集群(大规模训练通信开销可降低 50% 以上)。

⚠️ 注:每个 canister 后端还配备 6 个 NVLink Switch 刀片 + 2 个管理刀片。Feynman NVL1152 为多机架扩展方案。以上性能等效为基于路线图趋势的估算,实际数据以 NVIDIA 官方发布为准。

06 — 总结

光电共舞,算力无疆

🔴 额外更新:Rubin Ultra 4-die 版本取消

据 SemiAnalysis 报告,Rubin Ultra 4-die 封装方案因 TSMC CoWoS-L 封装工艺已达物理极限(光刻曝光场限制约 858mm²)而取消。

2027 年实际出货的 Rubin Ultra 将为 2-die 版本,性能约为原 4-die 目标的一半。替代方案 CoPoS 预计 2028 年底才能量产。

CPO 是英伟达应对 AI 算力指数级增长的关键武器

通过"光电共封装"的方式,CPO 技术从根本上解决了高速数据传输中的能耗与物理瓶颈,是构建下一代千兆瓦级 AI 工厂不可或缺的底层技术。

🔬
技术突破
芯片级光互联 电信号路径缩短 100 倍
🌱
绿色节能
功耗降低 80% 助力可持续 AI 基础设施
📦
产品就绪
2026-2027 规模部署 双平台产品矩阵
🚀
持续演进
从交换机到 GPU 2027 实现 XPU 侧 CPO
现在能买到吗?
Spectrum/Quantum-X 已发布
Kyber NVL576 目标 2027 H2 出货
市场前景
TAM 从 $150亿 → $1540亿
2026-2028 年增长 10 倍