40 亿美元战略投资
英伟达向 Lumentum 和 Coherent 各投资 $20 亿,确保 CPO 光学组件的未来产能与技术授权
英伟达投资 40 亿美元布局硅光子技术,2027 年实现 GPU 侧 CPO
2026年3月 GTC 大会,英伟达 CPO 技术正式从交换机扩展至 GPU 封装
英伟达向 Lumentum 和 Coherent 各投资 $20 亿,确保 CPO 光学组件的未来产能与技术授权
576 GPU 单机架系统,144 个 4-die 封装,2027 H2 目标 15 exaflops FP4 推理
GTC 2026 发布多机架系统,1152 GPU 互联,构建超大规模 AI 计算集群
全新发布光学网络 TAM 从 2026 年 $150 亿增长至 2028 年 $1540 亿
市场爆发| 产品/系统 | 发布时间 | 核心规格 | 状态 |
|---|---|---|---|
| Quantum-X Photonics | GTC 2025 | 144 × 800G 端口,InfiniBand,硅光子 | 已发布 |
| Spectrum-X Photonics | GTC 2025 | 128-512 × 800G 端口,以太网 | 已发布 |
| Rubin Ultra NVL576 | GTC 2026 | 576 GPU,144×4-die,600kW,2027 H2 出货 | 2027 H2 |
| Feynman NVL1152 | GTC 2026 | 1152 GPU,多机架扩展 | 远期规划 |
| GPU 侧 CPO | 2027 | CPO 从交换机扩展至 GPU 封装层 | 开发中 |
CPO 技术彻底重构了数据中心的光电互联架构,将光引擎直接集成于芯片封装内部
数据从芯片出发,经过 10-20cm 的 PCB 电路板才到达光模块,信号损耗巨大、功耗高昂
光引擎与 ASIC/GPU 直接封装于同一基板,电信号传输距离仅 1-2mm,功耗大幅降低
将光引擎(负责光电转换)直接与交换芯片(ASIC)或 GPU 封装在同一个基板上,消除了传统插拔接口的物理限制。
电信号传输距离从传统的 10-20 厘米缩短至 1-2 毫米,实现真正的"芯片级光互联",信号完整性大幅提升。
面向千兆瓦级 AI 工厂,CPO 在功耗、带宽、可靠性、延迟四个维度带来颠覆性提升
| 性能维度 | 传统方案 | CPO 方案 | 提升效果 |
|---|---|---|---|
| ⚡ 功耗 | 单端口 20-30W | 单端口 ≈ 5W | ↓ 降低 5× (80%) |
| 📶 带宽密度 | 端口密度 ≤ 64×400G | 端口密度 512×800G | ↑ 带宽提升 16 倍 |
| 🛡️ 可靠性 | 插拔易受污染/故障 | 减少组件数量 | ↑ AI 应用运行时提升 5× |
| ⏱️ 延迟 | 信号路径长(200Gb/s 损耗 22dB) | 路径极短(1-2mm) | ↓ 降低 50% |
单端口功耗从 25W 降至 5W,5× 能效提升,助力千兆瓦级 AI 工厂
原生支持 800G/1.6T 速率,总交换带宽可达 409.6 Tb/s
消除插拔接口,5× AI 应用运行时提升,网络弹性增强
信号路径缩短 100 倍,端到端延迟降低 50%
覆盖以太网与 InfiniBand 双架构,构建"数据中心即计算机"的 AI 基础设施
面向以太网架构的 CPO 交换平台,专为生成式 AI 大规模集群设计,实现超高密度光互联
面向 InfiniBand 架构的 CPO 交换平台,采用硅光引擎与液冷技术,追求极致性能
| 对比项 | Spectrum-X Photonics | Quantum-X Photonics |
|---|---|---|
| 网络协议 | 以太网 (Ethernet) | InfiniBand |
| 端口数量 | 128 – 512 × 800G | 144 × 800G |
| 总带宽 | 409.6 Tb/s | 115.2 Tb/s |
| SerDes | 200G | 200G |
| 光引擎 | CPO 光模块 | 硅光子引擎 |
| 散热方式 | 风冷 / 液冷 | 液冷 |
| 典型场景 | 多租户 AI 云 / 推理 | 大规模 AI 训练 |
英伟达 CPO 技术发展路线图(含 NVL576/NVL1152 分层架构)
InfiniBand 架构 · 英伟达首款 CPO 交换机
Ethernet 架构 · 面向多租户 AI 云
Quantum-X Photonics 与 Spectrum-X Photonics 在 GTC 大会亮相,标志着英伟达 CPO 技术正式进入产品化阶段
已完成合作伙伴开始小规模试用 Quantum-X,验证 CPO 在真实 AI 训练场景中的性能与可靠性
已完成CoreWeave、Lambda 等合作伙伴大规模部署 InfiniBand CPO 交换机,CPO 商用正式启动
即将到来以太网 CPO 交换机量产出货,覆盖多租户 AI 云和大规模推理场景
计划中Jensen Huang 公布 Rubin Ultra NVL576 和 Feynman NVL1152 系统,CPO 扩展至 GPU 封装
已完成⚠️ 延期风险:SemiAnalysis 报告延期至2028年,英伟达官方辟谣称 roadmap intact。详见下方供货时间详解。
待确认Feynman 是继 Rubin Ultra 之后的下一代架构,将全面采用 CPO 共封装光学;NVL1152 = 8×Kyber NVL144,1,152 GPU 全光互联全域,功耗降低 70%+
远期规划| 对比项 | 方案A:Oberon 8机架 NVL576 | 方案B:Kyber 单机架 NVL576 |
|---|---|---|
| 机架架构 | 8 × Oberon 机架(NVL72) | 1 × Kyber 单机架 |
| GPU 芯片 | 标准 Rubin GPU(非 Ultra) | Rubin Ultra(2-die 版本,4-die 已取消) |
| 机柜内互连 | 铜线 NVLink(标准 Oberon 架构) | 铜线 Kyber 正交中板(延期风险) |
| 跨柜组网 | Spectrum-X CPO 交换机胖树组网 | CPO 交换机(配套受限) |
| 量产状态 | Rubin 已全面量产 | 延期待确认 |
| 样品交付 | 2026 Q3(已确认) | 2027 下半年(乐观)/ 2028(悲观) |
| 批量供货 | 2026 Q4 起持续放量 | 2028 年(供应链口径) |
NVL1152 = 8 台 Kyber NVL144 机架 × CPO 全光互联
Feynman 是 2028 年继 Rubin Ultra 之后的下一代 GPU 架构,NVL1152 将是首个全面采用 CPO 的超大规模系统
| 配置层级 | GPU 数量 | 机架类型 | 互连方式 | CPO |
|---|---|---|---|---|
| 单机架基础 | 144 GPU | Kyber NVL144 | PCB 中板铜缆 | ❌ 柜内无光 |
| 中规模组合 | 288 GPU | 2 × Kyber | 铜缆直连 | ❌ 纯铜 |
| Rubin Ultra 阶段最大域 | 576 GPU | 8 × Oberon NVL72 | 铜缆 + CPO 交换机 | ✅ 跨柜光互联 |
| Feynman 超大域 | 1,152 GPU | 8 × Kyber NVL144 | CPO 两层全光互联 | ✅✅ 全域光 |
⚠️ 供货时间补充: Kyber NVL144 单机架 2027 下半年少量工程样机,2028 年批量; 完整 NVL1152(8台 Kyber + CPO 交换机整套集群)规划为 2028 年中后期 才规模化商用交付,2027 年仅实验室验证样机。
从传统可插拔到 LPO/NPO/CPO 的渐进式演进,以及关键术语辨析
| 术语 | 全称 | 核心特征 | 功耗 |
|---|---|---|---|
| 传统可插拔 | Pluggable Optics(带 DSP) | 独立模块,插拔式,DSP 芯片信号处理 | 高(20-30W/端口) |
| LPO | Linear Pluggable Optics(线性直驱) | 移除 DSP,线性驱动架构,仍为插拔式 | 中低(~10W/端口) |
| NPO | Near-Packaged Optics(近封装) | 光引擎紧邻芯片放置,未完全集成 | 低(~7W/端口) |
| CPO | Co-Packaged Optics(共封装) | 光引擎与 ASIC 同封装,极短距离 | 极低(~5W/端口) |
结论:传统可插拔光模块(Pluggable)不是LPO。LPO 是在传统可插拔架构基础上移除 DSP 的优化方案,功耗更低但兼容性下降。
独立模块,DSP 芯片均衡补偿,电信号需经 10-20cm PCB
移除 DSP,线性驱动,仍为插拔式,功耗降低但兼容性下降
光引擎紧邻芯片放置,未完全集成,CPO 过渡形态
光引擎与 ASIC 同封装,1-2mm 极短距离,功耗降低 80%
CPO 技术从网络交换机侧扩展至 GPU 封装。GTC 2026 正式发布的 Rubin Ultra NVL576 将采用该技术,实现单机架 576 GPU 的超密度计算。
基于 NVIDIA 路线图各代 AI 算力提升趋势(H100 → B200: ~2.5× → B300: ~2× → Rubin: ~2× → Rubin Ultra: ~2×),累计约 20× 提升
| GPU 型号 | FP8 (TFLOPS) | 显存 | 1 颗 Rubin Ultra ≈ |
|---|---|---|---|
| H100 SXM | ~3,958 | 80GB HBM3 | ≈ 20~30 颗 H100 |
| H800 | ~3,958(NVLink 削减) | 80GB HBM3 | ≈ 20~30 颗 H800 |
| H200 | ~3,958 | 141GB HBM3e | ≈ 20~30 颗 H200(算力维度) |
| GPU 代际 | 显存类型 | 单颗容量 | 内存带宽 |
|---|---|---|---|
| H100 | HBM3 | 80 GB | 3.35 TB/s |
| H200 | HBM3e | 141 GB | 4.8 TB/s |
| B200 (Blackwell) | HBM3e | 192 GB | ~8 TB/s |
| B300 (Blackwell Ultra) | HBM3e | 288 GB | ~12 TB/s |
| GB300 NVL72 | HBM4e | ~500 GB | ~15 TB/s |
| Rubin Ultra | HBM4e | ~512 GB(估) | ~20+ TB/s(估) |
💡 为何实际等效更高? NVL576 通过 CPO + NVLink 实现 576 颗 GPU 的统一内存域,扩展效率远超传统 InfiniBand/以太网集群(大规模训练通信开销可降低 50% 以上)。
⚠️ 注:每个 canister 后端还配备 6 个 NVLink Switch 刀片 + 2 个管理刀片。Feynman NVL1152 为多机架扩展方案。以上性能等效为基于路线图趋势的估算,实际数据以 NVIDIA 官方发布为准。
据 SemiAnalysis 报告,Rubin Ultra 4-die 封装方案因 TSMC CoWoS-L 封装工艺已达物理极限(光刻曝光场限制约 858mm²)而取消。
2027 年实际出货的 Rubin Ultra 将为 2-die 版本,性能约为原 4-die 目标的一半。替代方案 CoPoS 预计 2028 年底才能量产。
通过"光电共封装"的方式,CPO 技术从根本上解决了高速数据传输中的能耗与物理瓶颈,是构建下一代千兆瓦级 AI 工厂不可或缺的底层技术。