实现交互式轨迹预测(VectorNet、SceneTransformer),掌握多模态未来生成与社会交互建模。
自动驾驶场景由道路元素组成: 车道线、路缘、人行道都是折线。
地图元素 (折线): 车道线、路缘、停止线
轨迹历史 (折线): 车辆/行人过去 2 秒的路径
VectorNet 用统一的折线表示处理两类输入。
- Subgraph (子图): 编码每条折线内部的几何形状
- Global Graph (全局图): 编码折线之间的交互关系
Subgraph: self-attn on each polyline → polyline feature
Global: cross-attn across polylines → context-aware features
一辆车在路口可能:
- 直行 (概率 0.6)
- 左转 (概率 0.3)
- 右转 (概率 0.1)
单条轨迹预测无法覆盖这种不确定性。
traj_k = anchor_k + offset_k (k = 1, ..., K)
probs = softmax(cls_logits) (K 个模式的概率)
预定义 K 个锚点轨迹, 网络预测偏移量和置信度。
TNT 将轨迹预测解耦为两步:
1. 目标预测: 选 top-K 个可能的目标点
2. 轨迹补全: 对每个目标点生成完整轨迹
优势: 目标点 (位置) 和完整轨迹 (时间+空间) 解耦。
goal_loss = CE(goal_logits, target_goal)
traj_loss = Huber(pred_traj, gt_traj)
total = goal_loss + traj_loss
| 指标 | 定义 | 含义 | ||||
|---|---|---|---|---|---|---|
| ADE | avg( | pred_t - gt_t | ) | 平均位移误差 | ||
| FDE | pred_T - gt_T | 终点位移误差 | ||||
| minADE | min_K(ADE_k) | 最佳模式的 ADE | ||||
| Miss Rate | P(minFDE > 2m) | 超过 2m 误差的比例 |
只对最佳预测模式回传梯度, 鼓励模式覆盖不同的可能性。
- 观测: 2 秒 (20 步 @ 10Hz)
- 预测: 3 秒 (30 步 @ 10Hz)
- 近距离: 路口让行、避让行人
- 高速公路: 变道预测
- 多车交互: 谁先通过路口
1. ✅ VectorNet: Subgraph + Global Graph 折线编码
2. ✅ 多模态: K 种可能轨迹覆盖不确定性
3. ✅ Goal-Conditioned: 先目标→后轨迹 (TNT)
4. ✅ ADE/FDE: 轨迹预测标准评估
5. ✅ 交互建模: 车辆间相互影响
下一章: 模仿学习与行为克隆 — 从专家数据学习驾驶策略