世界模型(World Models)全面解析

感知输入 视觉/语言/动作 图像/视频/传感器 世界模型核心 状态表示学习 动态预测 JEPA / RSSM / Diffusion / VLA 规划与决策 动作序列生成 因果推理 执行输出 机器人/自动驾驶 具身智能 世界模型系统架构 感知 → 理解 → 预测 → 规划 → 执行

世界模型(World Models)是人工智能领域的重要研究方向,旨在构建能够像人类和动物一样,通过观察理解世界运作规律("常识"),并基于此进行预测、规划和决策的AI系统。2025-2026年,随着V-JEPA 2、NVIDIA Cosmos、GAIA-3等关键技术的突破,世界模型正从学术研究走向规模化产业应用,被业界称为"物理AI元年"。

一、引入背景与动机

为什么需要世界模型?

当前以GPT-4、Claude等为代表的大语言模型(LLMs)虽然在文本生成上表现出色,但存在根本性局限:

核心动机:构建能够像人类和动物一样,通过观察理解世界运作规律("常识"),并基于此进行预测、规划和决策的AI系统。

物理AI的崛起

2025年被业界称为"物理AI元年"——AI正从屏幕后的数字世界走向物理世界。具身智能(Embodied AI)需要AI理解重力、摩擦力、碰撞、液体流动等物理规律。

$8.5B
2025年机器人创业投资总额
90%
中国占全球人形机器人市场份额
$38B
人形机器人市场2035年规模

二、定义与核心概念

正式定义

世界模型是能够学习环境动态、预测未来状态,并支持基于想象的推理与决策的AI系统。根据Meta AI的定义,一个合格的世界模型需要具备三大核心能力:

理解(Understanding)

能够理解对世界的观察,包括识别视频中的物体、动作和运动模式。

预测(Predicting)

能够预测世界如何演化,以及智能体采取某个动作后世界将如何变化。

规划(Planning)

在预测能力基础上,能够规划实现特定目标的动作序列。

与世界模型的本质区别

维度 生成式AI(如Sora) 世界模型(如JEPA)
预测目标 像素/Token重建 抽象表征预测
学习方式 数据分布拟合 物理规律理解
输出形式 高保真图像/视频 结构化状态表示
推理能力 模式延续 因果推理与规划
样本效率 需要海量数据 自监督,少量数据即可
物理一致性 可能违反物理定律 显式建模物理规律
Yann LeCun强调:真正的世界模型不是生成像素,而是学习世界的抽象表示并预测其演化。

三、发展阶段

2018 强化学习时代 World Models Dreamer RSSM 2022 生成式爆发 I-JEPA GAIA-1 RT-2 2024 Sora时刻 Sora V-JEPA 2025 物理AI元年 Cosmos V-JEPA 2 GAIA-3 2026 商业化 Marble Genie 3 AMI 世界模型发展历程

第一阶段:强化学习时代(2018-2021)

标志性工作

  • World Models(Ha & Schmidhuber, 2018):首次提出在潜在空间训练智能体,通过"梦境"进行快速学习
  • PlaNet(2019):引入循环状态空间模型(RSSM),结合RNN学习环境动态
  • Dreamer系列(2020-2021):在紧凑状态空间中传播分析梯度,实现长期任务学习

VAERSSM强化学习

第二阶段:生成式爆发(2022-2023)

关键突破

  • I-JEPA(Meta, 2023):LeCun团队提出联合嵌入预测架构,在表征空间进行预测而非像素重建
  • GAIA-1(Wayve, 2023):首个大规模自动驾驶生成世界模型,可用视频/文本/动作输入生成逼真驾驶场景
  • RT-2(DeepMind, 2023):视觉-语言-动作(VLA)模型,将web知识迁移到机器人控制

JEPAVLA自动驾驶

第三阶段:物理AI时代(2024-2026)

当前前沿

  • Sora(OpenAI, 2024):被OpenAI称为"世界模拟器",但仍存在物理仿真局限性
  • V-JEPA(Meta, 2024):将JEPA扩展到视频领域,实现自监督视频预训练
  • Cosmos(NVIDIA, 2025):物理AI世界基础模型平台,开源开放
  • V-JEPA 2(Meta, 2025):实现零样本机器人控制,12亿参数
  • GAIA-3(Wayve, 2025):扩展到安全评估与验证
  • AMI Labs(2026):LeCun创立,获10.3亿美元种子轮融资
  • Marble(World Labs, 2025):李飞飞发布首个商业3D世界模型产品
  • Genie 3(Google DeepMind, 2026):首个实时交互世界模型,24fps/720p

V-JEPA 2CosmosGAIA-3World LabsAMI Labs

四、关键技术架构详解

1. 联合嵌入预测架构(JEPA)

JEPA是Yann LeCun倡导的世界模型核心架构,与生成式模型有本质区别:

Video Input Encoder (S,x) World Model Predict Representations (潜在空间) Predicted Embedding Loss (嵌入空间) JEPA架构原理图

架构原理

  • 非生成式:在嵌入空间计算损失,而非重建像素,避免生成模型的"表面统计"陷阱
  • 自监督学习:通过预测被掩码部分的表征进行训练,无需人工标注
  • 能量模型:使用能量函数表示世界状态兼容性,而非逐点概率分布

V-JEPA 2 关键突破(2025)

  • 参数规模:12亿参数,训练于超过2200万个视频
  • 零样本控制:仅需62小时机器人视频微调,即可实现零样本机器人规划
  • 选择性解码:VL-JEPA 2026通过选择性解码消除自回归瓶颈,实现285%加速
  • 物理推理:能在行动前通过物理推理想象潜在后果
  • IntPhys测试:在物理合理性判断测试中达到98%准确率
实测性能:在8个视频分类和8个视频检索数据集上,VL-JEPA平均性能超越CLIP、SigLIP2和Perception Encoder。

2. 视觉-语言-动作模型(VLA)

VLA模型是2025年机器人领域的突破性架构,直接将感知、语言理解和动作控制整合:

RT-2(Robotic Transformer 2)DeepMind 2023

  • 核心创新:将视觉-语言模型(VLM)转化为视觉-语言-动作(VLA)模型
  • 训练方式:联合训练web-scale视觉语言数据和机器人动作数据
  • 动作表示:将机器人动作编码为文本token,与自然语言token一起训练
  • 泛化能力:能够将在互联网上学到的语义知识泛化到新的机器人任务

其他VLA进展

  • RT-1:多任务机器人演示数据训练,验证了任务和物体组合的学习能力
  • PaLM-E:将多个传感器模态与语言推理融合
  • Flow Matching:以50Hz频率在七个平台上产生连续电机命令

VLA模型的本质突破

现代Physical AI系统的三个关键特征:(1) 学习策略取代符号规划,实现反应性行为;(2) 连续反馈循环连接仿真、部署和模型再训练;(3) 基础模型提供隐式表示,模糊感知与动作的边界。

3. 循环状态空间模型(RSSM)

代表:Dreamer系列、PlaNet

核心思想:通过RNN维护隐状态,分解为随机变量(捕获不确定性)和确定性路径(传递关键信息),平衡表示能力与训练稳定性。

优势:在模型预测控制(MPC)中表现出色,推理效率高,适合车端/机器人实时部署。

4. 扩散模型架构

代表:Sora、Drive-WM、GAIA-1

技术路径

Sora的物理局限性

重要限制
  • 因果理解不足:无法理解特定因果关系,如"咬一口饼干不会留下咬痕"
  • 左右混淆:难以准确区分左右方向
  • 长程物理:复杂场景的物理仿真能力有限
  • 3D一致性:虽展现3D一致性,但缺乏显式3D建模

5. NVIDIA Cosmos 平台架构

2025年CES发布的 Cosmos 是面向物理AI的世界基础模型平台:

NVIDIA Meta
Cosmos Predict
世界生成模型(2B/14B参数)
Cosmos Transfer
仿真到真实图像转换
Cosmos Reason
70亿参数推理模型

平台核心组件

开源策略:平台开放源码,模型以开放权重许可发布,通过Hugging Face分发。2025年12月新增Alpamayo家族模型,用于自动驾驶开发。

6. GAIA系列(Wayve自动驾驶世界模型)

GAIA-1(2023):开创性工作

GAIA-2(2025)

可控多视角生成世界模型,针对自动驾驶领域特定需求优化。

GAIA-3(2025.12)

五、技术能力对比

能力维度 V-JEPA 2 NVIDIA Cosmos GAIA-1/3 RT-2
架构路线 JEPA(非生成) 扩散+自回归 扩散+Transformer VLA(Transformer)
参数量 12亿 2B/14B 90亿 未公开
核心能力 物理推理+零样本控制 世界生成+仿真迁移 驾驶场景生成+评估 视觉-语言-动作控制
物理推理 强(98% IntPhys)
因果理解 优秀 良好 良好 有限
开源程度 部分开源 完全开源 闭源 论文开源

六、应用场景深度解析

自动驾驶车辆 传感器感知范围 世界模型 GAIA/Cosmos 场景理解 运动预测 行人 车辆 道路 自动驾驶世界模型工作原理

1. 自动驾驶(最成熟领域)

世界模型在自动驾驶中的应用已从学术研究走向量产落地:

核心应用场景

代表系统对比

系统 厂商 核心能力
GAIA-1/2/3 Wayve 视频/文本/动作生成,安全性验证
DriveDreamer 清华大学 多视角驾驶场景生成
Drive-WM 华为 端到端规划,多条件控制
OccWorld 理想汽车 3D占用预测,4D世界模型

2. 机器人操作与工业部署

V-JEPA 2等世界模型正在革新机器人学习范式,物理AI首次实现规模化工业部署

BMW + Figure AI:历史性部署案例

  • 部署时间:2024年启动,2025年完成11个月试点
  • 成果:超过1,250小时运行,移动90,000+零件,贡献30,000辆BMW X3生产
  • 扩展:2026年2月,BMW宣布将部署扩展至德国莱比锡工厂,欧洲首次
  • 硬件:Figure 02人形机器人,20kg负载能力
里程碑式突破:V-JEPA 2仅需62小时机器人视频微调,即可在完全陌生的实验室环境中实现零样本机器人操作(抓取、放置物体),无需任务特定数据、训练或奖励。

关键技术

3. Tesla Optimus:垂直整合的世界模型

Tesla正在将自动驾驶世界模型技术垂直整合到人形机器人:

Gen 3
2026年新一代Optimus
AI5
自研芯片完成设计
100万
年产能目标(辆)

战略举措

4. AMI Labs:LeCun的世界模型新篇章

2026年3月,Yann LeCun创立AMI Labs,获得破纪录种子轮融资:

Yann LeCun

Yann LeCun - Turing奖得主

$1.03B
种子轮融资
$3.5B
Pre-money估值
4
核心城市布局

核心团队

战略布局

LeCun的观点:"大型语言模型在当前形式下无法通向真正的智能机器"——AMI Labs代表了世界模型作为LLM替代范式的重要尝试。

5. World Labs:李飞飞的"空间智能"世界模型

2026年2月,李飞飞(Fei-Fei Li)创立的 World Labs 完成10亿美元新一轮融资,估值达约50亿美元,成为空间智能领域的领军企业。李飞飞被誉为"AI教母",因创建ImageNet项目奠定了现代计算机视觉基础。

李飞飞(Fei-Fei Li)

李飞飞(Fei-Fei Li)- AI教母

$1B
新一轮融资(2026.02)
$5B
公司估值
$2B
Autodesk领投

融资历程

时间 轮次 金额 主要投资者
2024年4月 种子轮 未披露
2024年中 A轮 约$1亿 NEA领投
2024年9月 战略轮 $2.3亿 a16z等
2026年2月 新一轮 $10亿 Autodesk $2亿领投、NVIDIA、AMD、富达

核心技术:空间智能(Spatial Intelligence)

World Labs的核心理念是构建"空间智能"——让AI能够理解、导航和推理三维物理世界,而非仅仅处理2D图像或文本。

李飞飞的名言:"如果AI要真正有用,它必须理解世界,而不仅仅是文字。世界由几何、物理和动力学支配,协调语义、空间和物理是AI的下一个伟大前沿。"

核心产品:Marble(2025年11月发布)

Marble是World Labs推出的首款商业世界模型产品:

与Sora等生成式AI的本质区别

维度 传统生成式AI(如Sora) World Labs Marble(空间智能)
理解层次 2D像素/Token生成 3D空间结构与物理理解
交互能力 被动生成视频 可交互、可编辑的3D环境
输出形式 预定义序列 实时生成,持久可导航
应用场景 内容创作 机器人训练、设计、科学发现

战略生态合作

应用场景与战略重点

6. 人形机器人市场格局

🏭 芯片与基础设施

NVIDIA(GPU + Cosmos平台 + Isaac GR00T)

Tesla(FSD Chip + Optimus)

Figure AI(Figure 02)

🚗 自动驾驶

Wayve(GAIA系列,$1.05B软银投资)

特斯拉(FSD端到端)

小鹏/蔚来/华为(中国)

🤖 机器人

Meta(V-JEPA开源)

Physical Intelligence

Boston Dynamics(Atlas)

Hexagon Robotics(AEON)

🔬 研究机构

AMI Labs(LeCun,$1.03B)

World Labs(Fei-Fei Li,$1B)

MIT/Harvard

市场数据

七、产业生态与竞争格局

开源生态

类别 项目 特点
学术框架 DreamerV3、I-JEPA、V-JEPA、RT-2 完全开源/论文开源
仿真平台 CARLA、Isaac Sim、Genesis、Omniverse 物理引擎+渲染
数据集 nuScenes、Waymo Open、KITTI-360 自动驾驶
NVIDIA Cosmos GitHub开源 完整平台+模型权重

世界模型主要玩家与技术路线对比

公司/项目 技术路线 核心产品 融资/资源
World Labs
李飞飞
空间智能(3D世界生成) Marble(可交互3D环境) $1B(2026),估值$5B
AMI Labs
Yann LeCun
JEPA(非生成式) 物理推理世界模型 $1.03B种子轮
Google DeepMind
Demis Hassabis
Genie系列(实时交互3D) Genie 3(24fps,720p实时生成) 谷歌内部资源
NVIDIA Cosmos平台(扩散+仿真迁移) Predict/Transfer/Reason 开源+商用
Wayve GAIA系列(驾驶场景生成) GAIA-3(安全评估) $1.05B(软银)
Meta FAIR V-JEPA/VL-JEPA 12亿参数物理推理模型 Meta内部资源

Genie 3 技术突破(Google DeepMind)

技术路线分化

🧠 非生成式路线(理解优先)

JEPA架构:学习世界抽象表示,预测潜在空间演化

代表:AMI Labs、Meta V-JEPA

🎨 生成式路线(模拟优先)

扩散/自回归模型:直接生成高保真图像/视频/3D环境

代表:Sora、GAIA、Marble

🎮 交互式路线(实时沉浸)

实时生成可导航3D世界,支持用户实时交互

代表:Genie 3、Marble

八、软硬件系统需求

硬件需求

数千
H100 GPU 训练集群
80GB+
单卡显存需求
<100ms
车端推理延迟要求
15天
GAIA-1训练时间(64xA100)

软件栈

层级 组件 代表技术
基础框架 深度学习框架 PyTorch、JAX
模型架构 世界模型核心 JEPA、RSSM、DiT、VLA
仿真平台 物理引擎 NVIDIA PhysX、MuJoCo、Isaac Gym
中间件 机器人/车辆接口 ROS 2、Cyber RT
应用层 端到端系统 FSD V12、Wayve LINGO

九、挑战与局限性

技术挑战

Sora的局限性案例

问题类型 具体表现
因果理解 咬一口饼干不会显示咬痕
空间认知 难以准确区分左右方向
复杂物理 长程物理交互仿真不准确
3D一致性 虽展现3D一致性,但缺乏显式3D建模

伦理与安全

十、未来发展趋势

技术趋势

🔬 从生成到理解

JEPA等非生成式架构将获得更多关注,解决扩散模型的物理不一致问题。

🔀 多模态统一

融合视觉、语言、动作、触觉、声音等多模态输入的世界模型,实现真正的具身智能。

⚡ 实时性与效率

模型蒸馏、量化技术持续突破,支持车端/边缘设备实时推理(<100ms)。

🧠 因果推理增强

超越统计关联,学习物理因果律,实现反事实推理和"假设分析"能力。

🚀 VL-JEPA 2026突破

通过选择性解码消除自回归瓶颈,实现285%推理加速,接近实时应用。

应用趋势

市场预测

万亿级
Physical AI市场潜力
2025
物理AI元年
3-5年
L4/L5成熟期
世界模型代表了AI从"数据模式匹配"向"物理世界理解"的关键跃迁。当前正处于从生成式模拟(Sora)向物理AI(JEPA/Cosmos)过渡的关键期。

真正的世界模型需要超越像素生成,建立对物理因果和常识的深层理解,这仍是AI领域最根本的挑战之一。