架构、性能与选型策略(2026版)
截至2026年,AI算力市场已形成"GPU主导训练、LPU主导高并发推理"的格局。2026年3月NVIDIA在GTC大会发布Vera Rubin平台,正式将Groq LPU技术整合入其产品线,标志着推理专用芯片进入主流市场。本报告融合Coding Confessions深度解析与行业最新数据,从架构原理、TSP硬件设计、实测数据、国产化替代及未来趋势维度,为企业技术选型提供决策依据。
2025年12月,NVIDIA以200亿美元完成对Groq核心技术的收购,获得LPU技术非独家许可并吸纳核心团队。2026年3月GTC大会上,NVIDIA正式发布Groq 3 LPU,整合入Vera Rubin平台,用于AI推理加速。
核心原因:物理距离决定延迟上限
| 指标 | HBM (GPU) | SRAM (LPU) |
| 物理位置 | 芯片外部,通过1000+引脚球栅阵列(BGA)连接 | 芯片内部,与计算单元同处一个硅片 |
| 访问延迟 | 100-200 纳秒 (ns) | 0.5-2 纳秒 (ns) — 快50-400倍 |
| 带宽单位 | 3.35 TB/s (H100) | 150 TB/s (Groq3单芯片) |
| 数据传输 | 序列化并行传输,受制于引脚数量和信号完整性 | 并行内部总线,带宽近乎无限 |
打个比方:HBM就像把图书馆的书放在隔壁楼,阅读时需要走过去拿(100ns);SRAM就像书就放在你办公桌上,伸手就能拿(1ns)。虽然"隔壁楼"有电梯和快递系统(DDR5/HBM的高带宽),但物理距离的差距是根本性的。
关键洞察:不是"把大模型塞进LPU",而是"GPU + LPU 异构协同"
🔑 MoE模型的核心架构:
MoE (Mixture of Experts) 将模型分成两部分:
例如:Mixtral 8x7B有8个专家,每次只激活2个,激活参数只占15-30%
✅ Vera Rubin架构的异构分工:
| 处理器 | 职责 | 内存方案 |
| Vera Rubin GPU | Attention层 + KV缓存 + 长上下文 | 288GB HBM4 |
| Groq 3 LPU | FFN层 + MoE专家路由 + Token生成 | 500MB片上SRAM |
⚡ 关于专家切换延迟:
LPU解决方案:GPU处理需要大内存的部分,LPU处理需要低延迟的部分
| 对比 | 纯GPU方案 | GPU + LPU 异构 |
| 万亿参数MoE | 全部塞进HBM,需要640GB+ | GPU管Attention/KV,LPU管FFN/专家 |
| 延迟 | HBM访问延迟100-200ns | FFN层0.5-2ns,流水线无等待 |
| 专家切换 | 动态路由,运行时决定 | 编译器预知 + 预取隐藏延迟 |
📌 总结:LPU不是GPU的替代品,而是最佳拍档。Vera Rubin平台 = Rubin GPU(处理大内存的Attention)+ Groq LPU(处理低延迟的FFN/专家)。专家切换的延迟被编译器的预取和流水线重叠完全隐藏,对用户感知延迟影响接近零。
| 特性 | GPU (H100) | LPU (Groq3) |
|---|---|---|
| 内存类型 | HBM (片外) | SRAM (片上) |
| 内存带宽 | 3.35 TB/s | 150 TB/s |
| 片上SRAM | ~50 MB | 500 MB |
| 内存访问延迟 | ~100 ns | ~1 ns |
| 制程工艺 | 4N (TSMC) | 三星 SF4 (4nm) |
| 晶体管数量 | 80B | 22B |
| TDP | 700W | >300W |
| 算力 (FP8) | 989 TFLOPS | 1.2 PFLOPS |
| 带宽/算力比 | 3.4 GB/s/TF | 125 GB/s/TF |
💡 关键洞察:LPU的内存带宽是GPU的45倍,这对LLM推理至关重要——内存带宽直接决定Token生成速度。
以下表格详细说明GPU与LPU的架构差异如何直接影响推理速度与效率:
| 特性 | GPU (SIMT) | LPU (Dataflow) | 对推理速度的影响 |
|---|---|---|---|
| 执行模式 | SIMT — 单指令多线程,数千线程并行执行相同指令。但线程间存在分支分歧(branch divergence)时,效率骤降。大模型的自回归生成逐Token执行,大量线程被闲置。 | 数据流 — 算子按拓扑顺序执行,数据从内存流入经过各处理单元流出。无分支分歧,每个时钟周期都在做有效计算。 | ✅ LPU胜出 GPU线程闲置=算力浪费 |
| 调度方式 | 硬件动态调度 — Warp Scheduler在运行时决定哪些线程在哪个计算单元执行。需要复杂的乱序引擎、寄存器重命名、发射队列。运行时开销约占15-30%算力。 | 编译器静态调度 — 编译器在编译时精确规划每条指令的执行时间与数据位置。运行时硬件只需执行既定计划,无调度决策开销。 | ✅ LPU胜出 消除15-30%调度开销 |
| 并行粒度 | 细粒度线程级 — 线程是最小调度单位。H100有168个SM,每SM可调度64个warp(共10752个warp)。线程切换需要保存/恢复寄存器状态,上下文切换开销显著。 | 粗粒度算子级 — 320-lane SIMD单元作为整体调度。指令流式穿过功能单元,无线程切换开销。编译器确保数据在正确时间到达正确位置。 | ✅ LPU胜出 零线程切换开销 |
| 内存架构 | HBM+多级缓存 — H100带宽3.35TB/s,但相对计算速度仍供不应求。L1/L2缓存命中率决定是否能跑满计算单元。缓存未命中时需等待HBM响应(约500周期)。 | 片上SRAM 220MB — Groq3单芯片500MB SRAM,带宽高达150TB/s,是H100的45倍。权重完全片上存储,零HBM访问等待。 | ✅ LPU胜出 消除"内存墙"瓶颈 |
| 延迟确定性 | 非确定性 — 缓存预取投机执行可能命中或失效,乱序执行完成时间不可预测,Token生成延迟波动大(P99延迟可能是P50的3-5倍)。 | 确定性 — ISA (Instruction Set Architecture, 指令集架构) 暴露精确延迟信息,编译器保证数据在指定周期精确到达。Token生成延迟稳定,波动<5%。这对实时交互体验至关重要。 | ✅ LPU胜出 稳定可预测的延迟 |
| 批处理效率 | 大Batch优势 — 同时处理多个序列,计算单元利用率高。但小Batch时线程闲置严重。首Token延迟与Batch大小正相关。 | 流式执行 — 无需Batch即可高效运行。每个新Token直接使用前一Token结果,流水线式生成。首Token延迟与Batch无关,始终最优。 | ✅ LPU胜出 小Batch场景下优势明显 |
LPU之所以能在推理速度上远超GPU,核心在于消除三大瓶颈:
1. 内存墙 — GPU的计算速度(>1000 TFLOPS)远超HBM带宽(3.35 TB/s),计算单元经常等待数据。
→ LPU以150TB/s SRAM带宽彻底消除等待,计算单元始终满载。
2. 调度开销 — GPU需要复杂运行时进行线程调度与内存一致性维护。
→ LPU的编译器静态调度将这部分开销降至零。
3. Batch依赖 — GPU需要大Batch才能跑满算力,导致首Token延迟高。
→ LPU流式执行无需Batch,小Batch下仍保持高效。
TSP (Tensor Streaming Processor) 对传统CPU/GPU架构进行了根本性颠覆。传统多核芯片采用"平铺架构"——每个tile包含全套功能单元。而TSP设计师将功能单元从核心中抽出,排列成2D网格,称为"翻转架构"。
图1: (a) 传统平铺多核架构 vs (b) TSP翻转架构
| 芯片型号 | 制程 | Die Size | 最大功耗 | TDP | 典型功耗 |
| GroqChip (v1) | 14nm | ~725 mm² | 300W | 215W | ~185W |
| GroqCard | — | — | 375W | — | ~240W |
| Groq 3 LP30 | 4nm (三星) | > 700 mm² | 未公开 | — | — |
数据来源:Groq whitepaper, Technetbook, Awesome Agents
Groq 3 LPU采用气冷设计(无需液冷),每瓦特推理吞吐量是GPU的35倍。
每个垂直切片代表一类同构功能单元集合,所有切片以生产者-消费者模式运作——一个切片产生结果作为数据流,下一个切片接收作为输入。
Matrix Multiply
执行矩阵乘法运算,是神经网络计算的核心单元
Shift/XM
执行向量的移位和旋转操作
Memory
处理内存读写操作
Vector/XM
执行向量的算术运算
Instruction Control Unit
水平组织,负责获取和分发指令到其他切片
图2: 数据流在TSP切片间的东西方向流动
图3: 流水线指令执行,时间戳错开执行
图4: 层次化系统架构 — 8个TSP组成节点,9个节点组成完整机架
NVIDIA于2026年3月GTC大会上正式发布Groq 3 LPX,这是首个集成到Vera Rubin平台的LPU机架级系统。
图5: Groq 3 LPU 芯片实物图
图6: GPU + LPU 异构协同架构
| 规格 | LPX Rack | 单芯片 (Groq 3 LPU) |
| LPU数量 | 256个 | 1个 |
| SRAM总容量 | 128 GB | 500 MB |
| SRAM带宽 | 40 PB/s | 150 TB/s |
| Scale-up带宽 | 640 TB/s | 2.5 TB/s |
| 互连技术 | RealScale (芯片直连) | 96个SerDes |
图7: NVIDIA Groq 3 LPX 机架系统 — 256个LPU协同工作
典型配置:1个LPX Rack + 1个Vera Rubin NVL72 Rack
效果:每瓦特推理吞吐量提升35倍!
什么是ISA?
指令集架构定义了CPU/GPU能执行的所有指令及其语义。传统架构只定义"做什么",不暴露"多久做完"——编译器只知道执行结果是正确的,但不知道需要多少时钟周期。
❌ 传统CPU/GPU的ISA局限:
✅ TSP的ISA创新:暴露精确延迟
💡 对推理速度的意义:
| GPU | 运行时猜测最优执行顺序 → 延迟不可预测,P99波动大 |
| TSP/LPU | 编译时规划最优执行路径 → 确定性低延迟,波动<5% |
| 机制 | 功能 | 应用场景 |
|---|---|---|
| HAC (Hardware Aligned Counter) | 256周期溢出计数器,用于TSP间同步 | 时钟同步、漂移校正 |
| SYNC/NOTIFY | 单TSP内 barrier 同步 | 暂停指令队列直到广播RESUME |
| DESKEW | 对齐到epoch边界 | 多TSP执行边界对齐 |
| RUNTIME_DESKEW | 运行时重新同步 | 执行期间动态同步 |
编译器在编译时静态调度所有跨网络的数据移动,消除了传统网络系统中由路由和调度引入的非确定性。这实现了基于张量维度 (H × W × C) 的确定性负载均衡。
采用前向纠错 (FEC) 逐跳传输和原位纠错。瞬态错误通过软件重放处理;每个机架包含一个备用TSP节点用于故障切换。
| 场景特征 | 推荐方案 | 理由 |
|---|---|---|
| 模型训练 & 微调 | 🟢 GPU (NVIDIA/昇腾) | 无可替代,生态依赖 |
| 高并发在线服务 | 🔵 LPU (Groq/国产LPU) | 低延迟、高吞吐、低成本 |
| 多模态推理 | 🟢 GPU | 视觉+语言混合任务,LPU不擅长 |
| 边缘设备/低功耗 | 🔵 国产LPU | 清微/后摩能效比极高 |
| 金融/政务合规 | 🟢🔵 国产 GPU/LPU | 自主可控,符合信创要求 |
| 实时对话 (Chatbot) | 🔵 LPU | 用户感知延迟极低,体验接近真人 |
| 批量离线推理 | 🟢 GPU | 大Batch吞吐量高 |
达芬奇架构,国内生态最成熟
训练 推理支持训练与推理,兼容PyTorch via CANN
MLU架构,国产AI推理芯片龙头
训练 推理市值4434亿元,2025年营收近65亿元
对标国际一线,6000+CUDA兼容
训练万卡级训练集群解决方案
AI计算 + 3D图形渲染双轮驱动
训练 推理2025年营收同比增长243%
明确提出LPU概念,软硬协同设计
推理 边缘单卡跑Llama2-70B,300token/s
可重构计算,"软件定义硬件"
推理 边缘已部署超3万张卡,国家大基金唯一投资
存算一体架构
推理 边缘低功耗优势显著
未来服务器 = GPU (训练/复杂推理) + LPU (高并发服务)
LPU软件栈(驱动、模型转换)成熟度远不及CUDA
新模型架构(如MoE)可能打破LPU的静态调度优势
在编译器技术与生态工具链上,国产厂商仍需追赶
LPU不是GPU的替代品,而是AI算力拼图中不可或缺的专用加速器。在推理侧,它代表了"更高效、更实时"的技术方向。2026年,随着NVIDIA正式入局LPU并将其整合入主流平台,推理专用芯片时代已全面到来。