从 Transformer 基础到 VLA 端到端自动驾驶的完整学习路径。面向 CNN 感知算法工程师,17 章系统教程,每章可运行、可实验、可复现。
实现交互式轨迹预测(VectorNet、SceneTransformer),掌握多模态未来生成与社会交互建模。
实现驾驶行为克隆(BC/DAgger/ACT),掌握动作分块、自回归策略与驾驶风格迁移。
从零实现 DDPM/DDIM,构建 Diffusion Policy 用于驾驶动作生成,掌握条件扩散与 Classifier-Free Guidance。
用 PPO/Decision Transformer 训练驾驶策略,掌握离线 RL(CQL/IQL)、安全 RL 与 RLHF 用于驾驶。
从零实现 Mini-VLA,深入理解 RT-2/OpenVLA/Octo 架构,掌握 Action Tokenization 与多模态输入编码。
实现 VAD/UniAD 风格规划器,掌握感知-规划联合训练、可解释性分析与安全性验证。
实现驾驶世界模型和视频预测,涵盖 GAIA-1/DriveDreamer 架构、潜在动力学与闭环仿真。
集成感知-规划-控制全链路,在 CARLA/MetaDrive 中闭环仿真,掌握模型部署与端到端评估。
本教程面向CNN 自动驾驶感知算法工程师,以"从零实现"为核心理念,每章包含:
完整 Python 源码可在 GitHub 获取(含每章配置、生成脚本和可运行代码)。