VLA 端到端自动驾驶学习体系

从 Transformer 基础到 VLA 端到端自动驾驶的完整学习路径。面向 CNN 感知算法工程师,17 章系统教程,每章可运行、可实验、可复现。

PyTorchTransformer/GPTLLaVACLIP BEVFormerRT-2/OpenVLACARLADiffusion Policy

学习路线

第一阶段:基础夯实(大模型基础) ├── 第1章:Transformer 深入与 LLM 基础 ├── 第2章:视觉基础模型 (ViT, MAE, DINO) └── 第3章:视觉-语言对齐 (CLIP & SigLIP) 第二阶段:多模态大模型 ├── 第4章:多模态大语言模型 (LLaVA 风格) ├── 第5章:多模态理解与推理 └── 第6章:视频理解模型 第三阶段:自动驾驶感知基础 ├── 第7章:3D 视觉与 BEV 感知 ├── 第8章:占据网络 (Occupancy Network) └── 第9章:端到端感知框架 第四阶段:规划与控制 ├── 第10章:轨迹预测 ├── 第11章:模仿学习与行为克隆 ├── 第12章:扩散策略 (Diffusion Policy) └── 第13章:强化学习规划 第五阶段:VLA 端到端自动驾驶 ├── 第14章:VLA 模型架构 (RT-2, OpenVLA) ├── 第15章:端到端驾驶模型 (UniAD, VAD) ├── 第16章:世界模型 (World Model) └── 第17章:VLA 完整系统集成
第一阶段:基础夯实(大模型基础)
第二阶段:多模态大模型
第三阶段:自动驾驶感知基础
第四阶段:规划与控制
第五阶段:VLA 端到端自动驾驶

关于本教程

本教程面向CNN 自动驾驶感知算法工程师,以"从零实现"为核心理念,每章包含:

源码

完整 Python 源码可在 GitHub 获取(含每章配置、生成脚本和可运行代码)。

github.com/Jingnan-Jia/vlm_learn →