实现驾驶世界模型和视频预测,涵盖 GAIA-1/DriveDreamer 架构、潜在动力学与闭环仿真。
世界模型 (World Model) 是 AI 的一个核心方向: 学习环境的内部表征, 并在此基础上预测未来。在自动驾驶中, 世界模型使车辆能够"想象"不同决策的后果。
世界模型学习环境的动态规律:
s_{t+1} = f(s_t, a_t) -- 状态转移
o_t = g(s_t) -- 观测重建
r_t = h(s_t) -- 奖励预测
1. 样本效率: 在想象中训练比真实环境快 1000x+
2. 安全验证: 测试 planner 在想象场景中的表现
3. 数据增强: 生成多样化的驾驶场景
4. 反事实推理: "如果我选择另一个动作会怎样?"
普通 RNN 难以捕捉随机不确定性。RSSM 分离:
- h_t: 确定性状态 (GRU-based, 捕捉长期历史)
- z_t: 随机状态 (从分布采样, 捕捉多模态不确定性)
1. Deterministic transition: h_t = GRU(h_{t-1}, z_{t-1}, a_{t-1})
2. Prior: p(z_t | h_t) -- 训练前我们如何预测 z_t
3. Posterior: q(z_t | h_t, o_t) -- 看到观测后如何修正 z_t
KL(posterior || prior) 作为正则化项, 使先验逐渐接近后验。
Video → VQ-VAE Encoder → Discrete Tokens
↓
Autoregressive Transformer
↓
Action + Description → Condition → Future Tokens
↓
VQ-VAE Decoder → Future Video
1. 视频 tokenization (VQ-VAE): 将连续视频压缩为离散 token
2. 自回归动态: 逐 token 预测未来
3. 条件生成: 动作 + 文本描述控制场景演变
1. 结构预测: 预测未来的结构化场景信息 (agent 位置, 车道)
2. 视频生成: 基于预测的结构生成像素级视频
World Model → Imagined Futures → Planner → Selected Action
生成 N 个可能的未来 → 检查 planner 在所有未来中的安全性。
世界模型可以生成 corner case 场景, 增强训练数据。
在 imagination 中训练 planner, 避免真实世界的风险。
项目地址: vla_learn/chapter16_world_model/
预计时间: 1-2 天