▶ YouTube 深度解析

一口气看懂谷歌TPU

谷歌TPU打GPU这套打法精准狠 — 深挖谷歌如何挖英伟达CUDA墙角

8,822
播放量
263
点赞
17:11
时长
2025
上传日期
▶ 观看原视频

谷歌 TPU v7 Ironwood 以专用架构 + 3D Torus 互联 + OCS 光交换,
从硬件到软件全面挑战英伟达 GPU 霸权。

视频描述

OpenAI 和 Anthropic 为什么纷纷采用谷歌 TPU?谷歌 TPU 到底有什么独门绝技?

本期视频深入解析谷歌 TPU 的核心技术:OCS 光路交换、ICI 芯片间互联、3D Torus 拓扑结构,
以及谷歌如何从软件层面瓦解 CUDA 生态壁垒。

从硬件架构到商业策略,一口气看懂谷歌 TPU 如何挑战英伟达 GPU 霸权。

内容大纲

视频七个核心章节一览

01
00:00
TPU 战略定位:为何自研芯片
02
02:30
TPU v7 Ironwood 架构解析
03
05:00
3D Torus & OCS 光交换技术
04
08:00
ICI & DCN:从 Pod 到超级集群
05
11:00
TPU vs GPU:专用 vs 通用路线之争
06
13:30
软件突围:挖 CUDA 墙角
07
15:30
商业格局:百万 TPU 大单
08
17:12
TPU 8t:训练专用芯片
09
17:12
TPU 8i:推理专用芯片
10
17:12
TPU 8t vs 8i 对比

关键要点

视频中最核心的 8 个技术洞察

1 性能
TPU v7 (Ironwood) 单芯片算力达 4,614 TFLOPS (BF16),是上代 Trillium 的近 5 倍,采用 3D Torus 拓扑实现超大规模互联。
2 互联
OCS(光路交换)使用 MEMS 微镜阵列 实现动态拓扑重构,无需人工重新布线即可改变芯片间连接关系,是 TPU 互联的核心创新。
3 规模
ICI 支持单 Pod 9,216 颗 TPU 协同,DCN 进一步扩展至 147,456 颗 TPU 的超级集群,总算力 680 ExaFLOPS。
4 拓扑
4x4x4 的 3D Torus 中,64 颗 TPU 组成一个 Cube,每颗芯片有 6 条 ICI 链路连接相邻节点,最大仅 6 跳 即可到达任意芯片。
5 架构
TPU 走 专用路线(ASIC),牺牲通用性换取 AI 极致效率;GPU 走通用路线,兼顾图形、科学计算等多场景。
6 商业
Anthropic 签署超 100 万颗 TPU 合作协议,TPU 每有效 PFLOP 的 TCO 比 NVIDIA GB300 低约 52%
7 生态
谷歌正从软件层面瓦解 CUDA 生态:原生 PyTorch 支持、集成 vLLM/SGLang 推理框架、推出 Pallas 内核语言。
8 软件
XLA 编译器 + JAX 框架 是 TPU 软件栈核心,通过自动并行化和编译优化弥补生态差距,降低迁移成本。

TPU 七代演进史

从 2015 年 TPU v1 到 2025 年 TPU v7 Ironwood

2015

TPU v1

推理专用芯片,首次用于 Google 搜索 RankBrain

2017

TPU v2

首次支持训练,引入 BF16 格式

2018

TPU v3

液冷散热,算力翻倍,Pod 规模扩大

2021

TPU v4

引入 OCS 光交换,10x 性能提升

2023

TPU v5e

成本优化版,广泛部署于 Google Cloud

2024

TPU v6 Trillium

能效比提升 67%,Pod 算力突破 ExaFLOPS

2025

TPU v7 Ironwood

4,614 TFLOPS / 192GB HBM / 7.2 TB/s 带宽

vs v6: 算力提升 ~5x

TPU v7 核心规格

Ironwood 单芯片参数一览

4,614
TFLOPS (BF16)
📚
192 GB
HBM 显存
🔆
7.2 TB/s
内存带宽
🔗
1.2 TB/s
ICI 互联带宽
TPU v7 Ironwood 芯片架构

TPU v7 Ironwood AI 加速器芯片架构图

3D Torus 拓扑结构

4x4x4 Cube = 64 颗 TPU,每颗 6 条 ICI 链路

4x4x4 3D Torus 布局示意

↑ X-Y 平面 (16 TPU)  |  Z 轴方向还有 3 层 (共 64 TPU)
6 条链路
每颗 TPU 连接 X/Y/Z 正负方向邻居
最大 6 跳
任意两颗 TPU 之间最短路径
全互联
无需交换机,芯片直连
低延迟
All-Reduce 通信效率远超 Fat-Tree
3D Torus 拓扑结构

3D Torus 拓扑结构示意图:4x4x4 Cube = 64 颗 TPU 全互联

OCS 光路交换机

MEMS 微镜阵列实现毫秒级动态拓扑重构

OCS 工作原理

TPU
输入
MEMS
微镜阵列
TPU
输出
动态分组:训练不同模型时可按需调整 TPU 连接关系
故障绕路:个别 TPU 故障时可快速绕过
最优拓扑:不同工作负载获得最佳通信拓扑
OCS 光路交换架构

OCS 光路交换架构:MEMS 微镜阵列实现动态拓扑重构

ICI & DCN:从 Pod 到超级集群

两层互联架构支撑百万颗 TPU 协同计算

🔗 ICI
芯片间直连 · 1.2 TB/s
◻ Pod
9,216 TPU · 42+ EFLOPS
🌐 DCN
数据中心网络
❄ 超级集群
147,456 TPU · 680 EFLOPS
分层设计:ICI 层保证 Pod 内部超低延迟(适合模型并行),DCN 层提供跨 Pod 大带宽(适合数据并行 / 流水线并行)
层级互联架构

两层互联架构:从 ICI Pod 到 DCN 超级集群的扩展方案

TPU vs GPU 对比

专用 ASIC 路线 vs 通用 GPU 路线

对比维度 ☀ TPU (ASIC) ⚡ GPU (通用)
设计哲学 专注 AI 矩阵运算 兼顾图形/科学/AI
AI 能效比 极高(专用晶体管) 一般(需兼顾通用)
通用性 仅限 AI 工作负载 图形/科学/编码全场景
互联架构 3D Torus + OCS 动态重构 NVLink/NVSwitch 固定拓扑
软件生态 XLA/JAX/部分PyTorch CUDA 百万开发者
单位 TCO 约低 52% 较高
规模能力 单 Pod 9,216 颗 集群规模受限
TPU vs GPU 架构对比

TPU集群

详细内容

视频七个章节的完整深度解析

TPU 的战略定位:为何谷歌要自研芯片

⏱ 00:00 - 02:30

谷歌早在 2013 年就开始布局自研 AI 芯片,当时内部预测如果每个用户每天使用 3 分钟语音搜索,就需要将数据中心规模翻倍。这一判断促使谷歌走上了 TPU(Tensor Processing Unit)的自研之路。

TPU 的核心理念是"专用胜于通用"——放弃 GPU 的图形渲染、科学计算等通用能力,将所有晶体管预算集中在矩阵运算和 AI 工作负载上。

从 TPU v1(2015年,推理专用)到如今的 TPU v7 Ironwood(2025年),谷歌已经迭代了七代产品。每一代都在算力密度、互联带宽、能效比上实现跨越式提升。TPU 不仅服务于谷歌内部(搜索、YouTube 推荐、Gemini 大模型),还通过 Google Cloud 对外提供服务。

TPU v7 Ironwood 架构解析

⏱ 02:30 - 05:00

TPU v7 代号 Ironwood,是谷歌 2025 年发布的最新一代 TPU,专为大规模 AI 训练和推理设计。其核心规格令人瞩目:

单芯片 BF16 算力达 4,614 TFLOPS,配备 192GB HBM 显存,内存带宽 7.2 TB/s,芯片间互联(ICI)带宽 1.2 TB/s

相比上一代 Trillium(TPU v6),Ironwood 的峰值算力提升近 5 倍。这种跨代飞跃得益于更先进的制程工艺、更大的 die size,以及架构层面对矩阵乘法单元(MXU)的深度优化。

Ironwood 的设计哲学是"为规模而生"——单芯片性能固然重要,但真正的竞争力在于数千颗芯片协同工作时的整体效率。这就引出了 TPU 最核心的技术创新:互联架构。

3D Torus 拓扑与 OCS 光交换技术

⏱ 05:00 - 08:00

TPU 集群采用 4x4x4 的 3D Torus(三维环面)拓扑结构,64 颗 TPU 组成一个 Cube(立方体)。在这种拓扑中,每颗 TPU 有 6 条 ICI 链路 分别连接 X、Y、Z 三个维度上的相邻节点。

3D Torus 的优势在于:任意两颗 TPU 之间的最大跳数仅为 6 跳(4x4x4 拓扑中),远低于传统 Fat-Tree 网络,大幅降低了 All-Reduce 等集合通信的延迟。

OCS(Optical Circuit Switch,光路交换) 是 TPU 互联的另一大杀器。OCS 使用 MEMS(微机电系统)微镜阵列,通过精确控制微镜角度来改变光信号的路由路径。

OCS 的革命性在于:传统数据中心改变网络拓扑需要人工重新插拔光纤,而 OCS 可以在毫秒级别动态重构连接关系。这意味着:

  • 训练不同模型时可以按需调整 TPU 分组
  • 某些 TPU 故障时可以快速绕路
  • 不同工作负载可以获得最优的通信拓扑

这种"软件定义互联"的能力,是英伟达 NVLink/NVSwitch 体系目前不具备的。

ICI 与 DCN:从 Pod 到超级集群

⏱ 08:00 - 11:00

谷歌的 TPU 互联体系分为两层:

ICI(Inter-Core Interconnect,芯片间互联):这是 TPU 之间的直连高速通道,带宽 1.2 TB/s,延迟极低。通过 ICI + 3D Torus + OCS,单个 Pod 可以容纳 9,216 颗 TPU,形成一个逻辑上的"超级计算机"。

9,216 颗 Ironwood TPU 组成的单 Pod,峰值算力超过 42 ExaFLOPS (BF16),足以训练万亿参数级别的大模型。

DCN(Data Center Network,数据中心网络):当单 Pod 不够用时,DCN 将多个 Pod 连接起来。通过 DCN,最多可以将 147,456 颗 TPU 组成一个超级集群,总算力达到惊人的 680 ExaFLOPS

这种分层架构的设计智慧在于:ICI 层保证了 Pod 内部的超低延迟通信(适合模型并行),DCN 层则提供了跨 Pod 的大带宽连接(适合数据并行和流水线并行)。

TPU vs GPU:专用 vs 通用的路线之争

⏱ 11:00 - 13:30

TPU 和 GPU 代表了两种截然不同的芯片设计哲学:

TPU(ASIC 路线):专为 AI 矩阵运算设计,没有图形渲染单元,没有通用计算核心。所有晶体管都服务于 Tensor 运算。优势是能效比极高、单位面积算力密度大;劣势是只能做 AI,不能跑 CUDA 通用程序。

GPU(通用路线):英伟达的 GPU 既能做 AI 训练,也能做图形渲染、科学模拟、视频编解码。CUDA 生态覆盖了几乎所有计算场景。优势是通用性强、生态完善;劣势是为了兼顾多场景,AI 专项效率不如 TPU。

TCO(总拥有成本)角度看,TPU 每有效 PFLOP 的成本比 NVIDIA GB300 低约 52%。这是 Anthropic 选择大规模采用 TPU 的核心经济逻辑。

但 GPU 的护城河在于 CUDA 生态——全球数百万开发者、数万个优化库、几乎所有 AI 框架的首选后端。这不是单纯靠硬件性能就能颠覆的。

软件生态突围:挖 CUDA 墙角

⏱ 13:30 - 15:30

谷歌深知,光有好硬件不够,必须解决软件生态问题。为此,谷歌在多个层面发力:

🔗

PyTorch/XLA

PyTorch 代码几乎无需修改即可在 TPU 上运行,直接降低迁移门槛

vLLM / SGLang

主流 LLM 推理框架已支持 TPU 后端,开发者无需重写推理代码

💻

Pallas

对标 CUDA Kernel 的底层编程接口,允许编写高性能自定义算子

JAX + XLA

谷歌自研框架,函数式编程 + 自动微分,DeepMind 首选方案

XLA(Accelerated Linear Algebra)编译器是 TPU 软件栈的核心。它能自动将高层计算图编译为 TPU 优化指令,实现算子融合、内存优化、自动并行化等,大幅减少手动优化工作。

谷歌的策略是"两条腿走路":一方面让现有 PyTorch 用户低成本迁移,另一方面用 JAX 培养原生 TPU 开发者群体。

商业格局:Anthropic 百万 TPU 大单与未来展望

⏱ 15:30 - 17:11

2025 年,Anthropic 与谷歌达成了超过 100 万颗 TPU 的合作协议,这是 TPU 商业化的里程碑事件。Anthropic 选择 TPU 的主要原因:

💰

TCO 优势

每有效 PFLOP 成本显著低于 GPU 方案

📈

规模优势

单 Pod 9,216 颗 TPU 的超大规模集群能力

🚚

供应链优势

不受英伟达产能限制,供应稳定

🔧

定制化优势

与谷歌合作优化特定工作负载

OpenAI 也被报道在评估 TPU 方案,AI 行业正在从"英伟达独供"走向"多元供应"格局。

TPU v8:训练与推理双芯时代

⏱ 17:12+

2026年4月,谷歌在 Google Cloud Next 大会上正式发布第八代 TPU,**首次将训练和推理彻底拆分为两颗独立芯片**——这是 TPU 产品十年来最重大的架构转向。

分离的根本原因:Agent 时代的训练和推理已演变为两种截然不同的工作负载。训练追求极致吞吐量与规模扩展,推理则对延迟和并发更为敏感。单一芯片难以同时兼顾两类场景的效率最优。

为什么需要分离?

训练 = "大洪水"

不经常来,但一来就是排山倒海。一次前沿模型训练持续数周,横跨万卡规模

💧

推理 = "细水长流"

Agent 爆发后暴涨万倍(英伟达数据:两年增长100倍),混合专家模型路由工作极度频繁

TPU 8t:训练专用芯片

定位:"将前沿模型开发周期从数月压缩至数周"

核心规格

制程台积电 2nm
单芯片 FP4 算力12.6 PFLOPS
HBM 显存216 GB HBM3e
显存带宽6.5 TB/s
集群规模单 Pod 9,600 颗,超集群 >100万
ICI 带宽较上一代提升 2 倍
横向扩展带宽100Gbps → 400Gbps
每瓦性能较 Ironwood 提升 +124%
性价比较 Ironwood 提升 2.8 倍

三项关键技术优化

SparseCore 加速器

专门处理嵌入查找中不规则的内存访问模式,将数据依赖的全局聚合操作从矩阵乘法单元(MXU)中卸载,避免通用芯片常见的零操作瓶颈。

🚀

原生 FP4 支持

通过 4 位浮点数将 MXU 吞吐量翻倍,同时降低数据搬运能耗,使更大的模型层可驻留于本地硬件缓冲区。

🔗

均衡 VPU 扩展设计

使量化、softmax 等向量操作与矩阵乘法实现更好的流水线重叠,提升芯片整体利用率。

Virgo 网络架构:高基数交换机 + 扁平化两层非阻塞拓扑,数据中心网络(DCN)带宽提升最高 4 倍,专为超大规模分布式训练设计。

TPU 8i:推理专用芯片

定位:"专为对延迟最敏感的推理工作负载而设计,让数百万个 AI Agent 同时低延迟运行"

核心规格

制程台积电 2nm
片上 SRAM384 MB(Ironwood 的 3 倍
片外 HBM288 GB
内存带宽TPU 8t 的 1.3 倍
Pod 规模256 → 1,152 颗(提升 4.5 倍)
每 Pod FP8 算力提升8.67 倍
每 Pod HBM 容量提升5.74 倍
每瓦性能较 Ironwood 提升 +117%
性价比较 Ironwood 提升 +80%

超大片上 SRAM:核心亮点

384MB SRAM = Ironwood 的 3 倍,可完全在硅片上容纳更大的 KV 缓存,显著减少长上下文解码期间内核的空闲时间,尤其适合大规模 MoE 模型的低延迟目标。

Boardfly 互联拓扑

最大通信跳数16 跳 → 7 跳(减少 56%)
网络直径缩减 56%
全对全通信延迟改善 最高 50%

完美适配混合专家模型(MoE)和推理模型中频繁的跨芯片令牌路由需求。

📈

CAE 片上加速引擎

运行时数据无需访问外部存储,有效打破"内存墙"瓶颈。

训练 vs 推理:架构差异

▶ TPU 8t 训练芯片

设计哲学:算力密度 + 规模扩展

内存层级:216GB HBM3e

核心优势:更大模型层本地缓存

网络优化:Virgo (DCN 带宽 ×4)

扩展方向:纵向扩展 (superpod)

▶ TPU 8i 推理芯片

设计哲学:内存带宽 + 低延迟

内存层级:384MB SRAM + 288GB HBM

核心优势:更大 KV 缓存本地存储

网络优化:Boardfly (延迟 -50%)

扩展方向:横向扩展 (Pod 内低延迟)

TPU 8t 适配的训练场景

💻

万卡级别分布式训练

🤖

前沿大模型预训练

🎨

嵌入密集型工作负载

🎮

多模态模型训练

TPU 8i 适配的推理场景

💖

Agentic AI

百万级并发 Agent

💬

长思维链推理

🙌

MoE 模型推理

📱

实时对话交互

共同特性

🌱

台积电 2nm 制程

能效翻倍

均为 Ironwood 的 2 倍

🔌

Axion CPU 集成

消除主机侧瓶颈

💻

JAX + Pathways

统一软件栈

🧊

第四代液冷

节能优化

战略意义与产业影响

内存墙破解:通过差异化的内存层次设计(8t 靠 HBM 容量,8i 靠 SRAM 带宽),针对性地解决训练和推理各自的核心瓶颈。
Agent 时代响应:推理需求两年暴涨万倍(英伟达数据),单一芯片已无法高效兼顾。TPU v8 的分离架构是对这一趋势的精准回应。

与英伟达的竞争

训练芯片对标英伟达 Rubin,推理芯片对标英伟达 Groq 3。TPU 与 GPU 的竞争已从单纯的硬件性能,扩展到软件生态、供应链、商业模式的全方位较量

谷歌 CEO 皮查伊:「问题已经从『能不能造一个 agent』,变成『怎么管好几千个』。TPU v8 的设计正是为了以具有成本效益的方式,提供同时运行数百万个智能体所需的大规模吞吐量和低延迟。」