第16章

第16章:世界模型 (World Model)

实现驾驶世界模型和视频预测,涵盖 GAIA-1/DriveDreamer 架构、潜在动力学与闭环仿真。

GAIA-1DriveDreamer视频预测潜在动力学闭环仿真

学习环境动态, 预测未来场景


前言

世界模型 (World Model) 是 AI 的一个核心方向: 学习环境的内部表征, 并在此基础上预测未来。在自动驾驶中, 世界模型使车辆能够"想象"不同决策的后果。


第一部分:什么是世界模型?

1.1 核心定义

世界模型学习环境的动态规律:


s_{t+1} = f(s_t, a_t)      -- 状态转移
o_t     = g(s_t)            -- 观测重建
r_t     = h(s_t)            -- 奖励预测

1.2 为什么需要世界模型?

1. 样本效率: 在想象中训练比真实环境快 1000x+

2. 安全验证: 测试 planner 在想象场景中的表现

3. 数据增强: 生成多样化的驾驶场景

4. 反事实推理: "如果我选择另一个动作会怎样?"


第二部分:RSSM

2.1 设计动机

普通 RNN 难以捕捉随机不确定性。RSSM 分离:

- h_t: 确定性状态 (GRU-based, 捕捉长期历史)

- z_t: 随机状态 (从分布采样, 捕捉多模态不确定性)

2.2 RSSM 三大操作

1. Deterministic transition: h_t = GRU(h_{t-1}, z_{t-1}, a_{t-1})

2. Prior: p(z_t | h_t) -- 训练前我们如何预测 z_t

3. Posterior: q(z_t | h_t, o_t) -- 看到观测后如何修正 z_t

KL(posterior || prior) 作为正则化项, 使先验逐渐接近后验。


第三部分:GAIA-1 (Wayve, 2023)

3.1 核心架构


Video → VQ-VAE Encoder → Discrete Tokens
                              ↓
                    Autoregressive Transformer
                              ↓
Action + Description → Condition → Future Tokens
                              ↓
                    VQ-VAE Decoder → Future Video

3.2 关键创新

1. 视频 tokenization (VQ-VAE): 将连续视频压缩为离散 token

2. 自回归动态: 逐 token 预测未来

3. 条件生成: 动作 + 文本描述控制场景演变


第四部分:DriveDreamer (GigaAI, 2024)

4.1 两阶段生成

1. 结构预测: 预测未来的结构化场景信息 (agent 位置, 车道)

2. 视频生成: 基于预测的结构生成像素级视频

4.2 世界模型驱动决策


World Model → Imagined Futures → Planner → Selected Action

第五部分:驾驶应用

5.1 安全性验证

生成 N 个可能的未来 → 检查 planner 在所有未来中的安全性。

5.2 数据增强

世界模型可以生成 corner case 场景, 增强训练数据。

5.3 闭环训练

在 imagination 中训练 planner, 避免真实世界的风险。


项目地址: vla_learn/chapter16_world_model/
预计时间: 1-2 天