# T01 自动驾驶感知与端到端驾驶 调研报告

> 主题范围：3D 占据预测、3D 目标检测、多传感器融合、在线高精地图、端到端规划、驾驶世界模型、安全关键场景生成、协同驾驶（V2X）、轨迹预测与评估、测试时自适应、驾驶 VQA。
> 覆盖收藏论文 23 篇，外部参考文献约 40 篇（均标注真实 arXiv ID / DOI / 官方 URL）。
> 全文中文撰写，英文术语保留原文。

---

## 一、主题概览与研究热点

本主题 23 篇 AAAI 2026 收藏论文，横跨感知（3D 占据、检测、融合、地图）、决策（端到端规划、轨迹选择、换道预测）、生成与仿真（世界模型、安全场景生成、3D 场景重建）、协同（V2X）以及鲁棒性与评测（测试时自适应、恶劣天气、场景驱动评估）五大板块。归纳出以下六个研究热点：

1. **稀疏化与高分辨率感知表示**：`SPSC` 用查询剪枝+查询序列化对抗占据预测的立方级复杂度；`HD²-SSC` 用"扩维解耦+稠密化精修"弥合图像与体素的维度/密度鸿沟；`BEVDilation` 用 LiDAR 中心化融合缓解传感器几何错位。共性趋势是从稠密网格走向稀疏 Query 化表示，并强调传感器几何的显式建模。
2. **端到端规划的范式迭代**：从"感知→规划"顺序范式走向 **感知-规划耦合**（`VeteranAD`）、**轨迹候选选择/评分**（`DriveSuprim`）、**VLA 语言行动模型**（`OpenDriveVLA`）以及 **Agentic 自校正闭环**（`CorrectAD`），并由 open-loop 评测转向 NAVSIM / Bench2Drive 闭环评测。
3. **驾驶世界模型成为基础设施**：`EOT-WM` 首次统一自车-他车轨迹控制；`Fine-flow 蒸馏` 解决长期生成误差累积；`LidarPainter` 用一步扩散做实时场景重建与风格化。世界模型正从"视觉生成"升级为"可交互的规划评估器/数据生成器"。
4. **安全关键场景生成的智能化**：`Any2Critical`（RAG + NHTSA 事故库）、`ScenGE`（LLM 元场景推理 + 对抗协同进化）、`Guided Latent Spaces`（结构化潜空间可控生成）。趋势是从固定碰撞模板走向 LLM 驱动、上下文相关、可物理验证的生成。
5. **鲁棒性与领域迁移的工程化**：`TSBOW`（极端天气遮挡基准）、BN-TTA（测试时批归一化自适应）聚焦传感器退化/域偏移；`Fisheye3DOD` 聚焦鱼眼几何。显示感知鲁棒性已从"增强数据"走向"模型自适应+专用基准"。
6. **协同智能与多智能体学习**：`UniMM-V2X` 将 MoE 引入多层级感知-预测-规划协同，突破单智能体感知极限。

**总体空白判断**（后文 idea 均由此展开）：
- 世界模型多停留在"生成"层面，**缺少轨迹条件下的安全评分/规划评估能力**（EOT-WM、Fine-flow 均未接入下游 planner 的闭环验证）。
- **测试时自适应与规划/世界模型脱节**：现有 TTA 只做感知层 BN 自适应，没有利用世界模型预测作为自监督信号来在线修正规划。
- **端到端自校正缺少真正的闭环反馈**：CorrectAD 是一次性离线补数据，没有 simulator-in-the-loop 的 RL 纠错回路。
- **占据预测/地图与交通规则割裂**：占据只给"是什么"，不给"能不能压线/超速/占用"的法理约束。
- **多模态系统缺乏对"模态缺失/传感器退化"的系统性鲁棒方案**。
- **安全场景生成缺物理一致性校验**，且以"碰撞率"为单一指标可被轻易刷分。

---

## 二、收藏论文分类梳理（按子方向分组）

### 2.1 3D 占据预测 / 语义场景补全（2 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision III · 论文 38 · SPSC | 稀疏可扩展多模态占据：查询剪枝 + 查询序列化，线性复杂度细粒度交互，nuScenes-Occupancy 三设置均超 SOTA |
| Computer Vision XI · 论文 55 · HD²-SSC | 用"伪三维扩维"和"检测-精修"弥合 2D 输入/3D 输出的维度差与标注稀疏性 |

### 2.2 3D 目标检测与多传感器融合（2 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision V · 论文 13 · Fisheye3DOD | 首个面向环视鱼眼的端到端 3D 检测探索：球面空间表示 + CARLA 合成数据集 Fisheye3DOD |
| Computer Vision XII · 论文 23 · BEVDilation | LiDAR 中心化融合：图像 BEV 特征作隐式引导，稀疏体素膨胀 + 语义引导膨胀，对深度噪声更鲁棒 |

### 2.3 在线高精地图与交通规则（1 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision VI · 论文 6 · PAMR | 自回归共构建车道向量与交通规则，Map-Rule 缓存维持规则长时生效，并发布 MapDRv2 标注 |

### 2.4 鲁棒性 / 测试时自适应（2 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision IV · 论文 27 · TSBOW | 32h 极端天气城市监控遮挡检测基准（8 类、48k 手动标注帧 + 320 万半标注帧） |
| Computer Vision VI · 论文 13 · BN-TTA | 可学习 BN 层 + 几何置信度/熵最小化 + 语义一致双阶段自适应，BEVFormer 在 nuScenes-C 提升约 10% |

### 2.5 端到端规划（5 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision VII · 论文 4 · CorrectAD | Agentic 自校正系统：PM-Agent 定义数据需求，DriveSora 按 3D 布局生成视频补失败样本，纠正 62.5% 失败案例 |
| Computer Vision XI · 论文 64 · DriveSuprim | 粗到细轨迹候选过滤 + 旋转增强 + 自蒸馏，NAVSIM v2 EPDMS 87.1%，Bench2Drive 83.02 DS |
| Computer Vision XII · 论文 15 · VeteranAD | "感知融入规划"：多模态锚定轨迹作为规划先验，自回归逐步引导感知，SOTA over NAVSIM/Bench2Drive |
| Computer Vision XIII · 论文 71 · OpenDriveVLA | 开源 VLA：2D+3D 实例感知 token 与语言层级对齐，agent-environment-ego 交互建模做轨迹生成 |
| AAAI Emerging Trends in AI · 论文 90 · MC2L-Transformer | 学生摘要：粗到细多模态分层 Transformer + 轻量时序上下文，CARLA 中降低碰撞/偏离率 |

### 2.6 驾驶世界模型 / 场景重建（3 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision XIII · 论文 88 · EOT-WM | 首个在视频潜空间统一自车-他车轨迹的世界模型：轨迹-车辆匹配 + 时空 VAE + 轨迹注入 DiT，FID 提升 30%/FVD 55% |
| Machine Learning VIII · 论文 74 · Fine-flow | 细粒度流自监督蒸馏粗粒度流，解耦大运动/双向连续运动，110+ 帧生成 FVD 降 27%、推理提速 85% |
| Computer Vision IV · 论文 37 · LidarPainter | 一步扩散模型从稀疏 LiDAR + 伪影渲染恢复一致驾驶视图，比 StreetCrafter 快 7 倍、省 5 倍显存，支持 "foggy/night" 文本风格化 |

### 2.7 安全关键场景生成（3 篇）

| 论文 | 一句话定位 |
|---|---|
| Philosophy and Ethics of AI · 论文 24 · Any2Critical | 首个从任意真实世界上下文生成安全关键场景：日常交通建图 + NHTSA-5K RAG 策略，平均碰撞率 89.69% |
| Special Track on AI for Social Impact I · 论文 82 · ScenGE | LLM 元场景生成 + 对抗协作图背景车放大，比 SOTA 多发现 31.96% 严重碰撞，可迁移多模拟器 |
| AAAI Emerging Trends in AI · 论文 139 · Guided Latent Spaces | 学生摘要：VAE 统一生成多类关键场景，结构化潜空间可控，面向工业验证流水线 |

### 2.8 协同驾驶 / V2X（1 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision VIII · 论文 56 · UniMM-V2X | MoE 增强多层级融合（感知+预测+规划协同），DAIR-V2X 上感知精度 +39.7%、规划提升 33.2% vs UniV2X |

### 2.9 轨迹预测与评估（2 篇）

| 论文 | 一句话定位 |
|---|---|
| Special Track on AI for Social Impact I · 论文 88 · KnowLCP | 知识增强换道预测：风险意识+运动学约束+意图强度，互信息最大化知识注入，意图/轨迹预测各提升 8-10% |
| Application Domains I · 论文 21 · Measuring What Matters | 场景关键度加权的准确性×多样性二维评估流水线，替代 ADE/FDE 事后指标，选预测器以最大化 SDV 驾驶性能 |

### 2.10 3D 驾驶场景生成（1 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision VII · 论文 51 · LSD-3D | 代理几何生成 + 2D 图像先验分数蒸馏，输出几何精确、可条件于地图布局的大规模 3D 驾驶场景 |

### 2.11 驾驶 VQA / 时空推理（1 篇）

| 论文 | 一句话定位 |
|---|---|
| Computer Vision IV · 论文 29 · STRIDE-QA | 100h 东京多传感器数据构建 1600 万时空推理 QA，通用 VLM 近零分，微调后空间定位 55%、运动预测一致性 28% |

---

## 三、代表性论文精读（5 篇）

精读选取 5 篇覆盖 3D 占据（SPSC）、端到端规划（VeteranAD、CorrectAD）、世界模型（EOT-WM）、安全场景生成（Any2Critical）四大方向。其余 18 篇以摘要通读并入速查表（第四节）。

### 3.1 Computer Vision III · 论文 38 · SPSC: Sparse and Scalable Multi-Modal 3D Occupancy Prediction for Autonomous Driving

- **原文**：AAAI 2026，DOI: 10.1609/aaai.v40i6.42441（无 arXiv 预印本）。
- **问题**：占据预测随分辨率呈立方级增长，尤其高分辨率场景下既难以保持稀疏性又缺乏特征交互。
- **核心机制**：
  1. **渐进剪枝（progressive pruning）**：coarse-to-fine 过程中不断剪除未占据 query，维持数据规模稀疏；
  2. **查询序列化（query serialization）**：把剪枝后的 query 变换为有序序列同时保留空间结构，使注意力交互在**线性复杂度**下获得更大感受野；
  3. 支持多模态 / 单 LiDAR / 单相机三种输入设置。
- **结果**：nuScenes-Occupancy 上多模态、LiDAR、相机设置分别相对提升 mIoU 12.0% / 11.0% / 4.8%。
- **不足与空白**：
  - 依赖 nuScenes 单数据集，未见对 OpenOccupancy（ICCV 2023，DOI 10.1109/iccv51070.2023.01636）、SSCBench 等其他基准的跨域验证，泛化性存疑；
  - 稀疏结构在**极端天气/遮挡**（呼应 TSBOW）与**传感器部分失效**时的退化行为未讨论；
  - 占据输出未与下游规划（可行驶区域/边界约束）耦合，缺少"占据→规划"的端到端闭环验证；
  - 渐进剪枝是启发式策略，没有学习"剪枝决策"本身，可能在大规模无序场景下误剪前景。
- **心得**：本方向后续工作的差异化空间在于——把占据预测做成**规则感知**、**模态鲁棒**、**规划可消费**的表示，而非单纯刷 mIoU。

### 3.2 Computer Vision XII · 论文 15 · VeteranAD: Perception in Plan — Coupled Perception and Planning for End-to-End Autonomous Driving

- **原文**：AAAI 2026，DOI: 10.1609/aaai.v40i15.38230（无 arXiv 预印本）。
- **问题**：主流端到端范式是"感知→规划"顺序执行，感知目标与规划目标解耦，感知信息与最终决策相关性弱。
- **核心机制**：
  1. **多模态锚定轨迹作为规划先验（multi-mode anchored trajectories）**：用多条模式化的锚轨迹显式定义"规划想要什么"；
  2. **沿轨迹的目标感知（perception-in-plan）**：感知模块被设计为沿锚轨迹定向采集交通要素，实现"目标化感知"；
  3. **自回归推进**：逐步预测未来轨迹，同时每一步把注意力聚焦到相关区域做针对性感知，让感知完全服务规划。
- **结果**：NAVSIM 与 Bench2Drive 上达到 SOTA（论文原文）。
- **不足与空白**：
  - 仍是**监督模仿学习**框架，缺乏闭环 reward/探索，长尾与交互（变道博弈）场景泛化有限；
  - 锚轨迹集合需人工设计（数量/模式），模式覆盖不足时感知采样会漏掉关键要素；
  - 自回归感知会放大**早期规划误差**（一步错、步步错），未见错误补偿机制；
  - 仅在 NAVSIM/Bench2Drive 这类"非反应式/低成本闭环"基准评测，未在 CARLA/真实闭环中验证（呼应 `MC2L-Transformer` 的 CARLA 评测与其互补）。
- **心得**：把"感知注意力分配到哪"这个问题从固定网格/均匀分布升级为**规划驱动**，是高效且符合直觉的方向；与世界模型结合后可进一步做"预测驱动感知"。

### 3.3 Computer Vision XIII · 论文 88 · EOT-WM: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space

- **原文**：AAAI 2026，DOI: 10.1609/aaai.v40i16.38403（无 arXiv 预印本）。
- **问题**：现有驾驶世界模型（如 DriveDreamer、Vista、GenAD）只能控制自车轨迹，其他车辆不可控，无法模拟真实交互；且多车轨迹与视频目标匹配困难。
- **核心机制**：
  1. **轨迹-车辆匹配**：把 BEV 空间的自车/他车轨迹投影到图像坐标，将每条轨迹与视频中的对应车辆配对；
  2. **时空 VAE（ST-VAE）**：将"轨迹视频"编码并与驾驶视频 latent 在时空上对齐到统一视觉空间；
  3. **轨迹注入扩散 Transformer**：以自车-他车轨迹为条件去噪生成视频；
  4. 提出 **control-latent similarity** 指标评估轨迹可控性。
- **结果**：nuScenes 上 FID 超 SOTA 30%、FVD 超 55%，并可自产轨迹预测未见场景。
- **不足与空白**：
  - 轨迹匹配依赖投影 + 配对，**遮挡/截断车辆**会错配或漏配（呼应 TSBOW 的遮挡难点）；
  - 生成器仍然是**视频生成**而非物理仿真，生成的未来不可直接喂给 planner 做闭环策略学习（无反应式环境）；
  - "可控"仅到轨迹层面，未扩展到**语义指令（变道原因、让行意图）**与**地图规则**约束；
  - control-latent similarity 指标与下游规划收益之间的相关性未验证。
- **心得**：这是最接近"可交互世界模型"的工作之一；空白在于**把可控生成接入规划闭环**（评估轨迹 / 训练策略 / 生成对抗样本），这正是本报告 idea I1、I3、I6 的锚点。

### 3.4 Philosophy and Ethics of AI · 论文 24 · Any2Critical: Safety-Critical Scenario Generation from Arbitrary Real-World Driving Contexts

- **原文**：AAAI 2026，DOI: 10.1609/aaai.v40i42.40861（无 arXiv 预印本）。
- **问题**：安全场景生成依赖固定碰撞模板或现有地图库，多样性受限、行为不真实；长尾场景稀缺。
- **核心机制**：
  1. **任意场景编码**：利用"日常交通"这一最丰富的真实上下文来源构建全面多样地图数据；
  2. **RAG-based 安全关键场景生成**：基于自建 NHTSA-5K（NHTSA 事故）数据库做检索增强生成，平衡"多样性"与"行为合理性"；
  3. 生成可同时作用于多个自动驾驶系统。
- **结果**：多场景多系统平均碰撞率 89.69%，显著超 SOTA 生成方法。
- **不足与空白**：
  - **以"碰撞率"为核心指标可被刷分**：只要把对手车辆设计得足够激进就必然碰撞，缺乏对场景"物理可行性/行为真实性/可复现性"的校验（`ScenGE` 部分以代码精确控制缓解）；
  - RAG 检索**静态**：NHTSA-5K 与当前上下文的相关性打分没有在线更新，复杂组合场景覆盖有限；
  - 生成后**没有闭环验证闭环**：未在真实/仿真中验证"生成的场景确实暴露了规划的特定失败模式"（与 CorrectAD 的失败驱动思路互补）；
  - 未见对地图多样性与行为合理性之间的定量 trade-off 分析。
- **心得**：LLM+知识库驱动场景生成是明显趋势；空白在"生成→物理校验→闭环评估"的完整链路，且应有**不依赖碰撞率的场景有效性度量**。

### 3.5 Computer Vision VII · 论文 4 · CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving

- **原文**：AAAI 2026，DOI: 10.1609/aaai.v40i10.37718；arXiv: 2511.13297（2025-11，已核验摘要一致）。
- **问题**：数据驱动的端到端规划受长尾问题困扰，失败案例稀缺难以通过数据增强解决。
- **核心机制**：
  1. **PM-Agent（产品经理 Agent）**：模拟产品经理，依据失败案例分析并形式化"数据收集需求"；
  2. **DriveSora**：基于 3D 布局条件的扩散视频生成器，生成与 3D 标注时空一致的视频（解决"生成模型难以按 3D 布局生成高保真视频"的子问题）；
  3. **自校正流水线**：失败场景 → 需求定义 → 数据+标注生成 → 重训练 planner，模型无关、可套用到任意端到端规划器。
- **结果**：nuScenes 纠正 62.5% 失败案例、碰撞率降 39%；自建更难点数据集纠正 49.8%、碰撞率降 27%。
- **不足与空白**：
  - **一次性离线闭环**：校正过程是一次重训练，没有"重训后再次仿真验证→迭代"的持续在线回路；
  - 生成的**视频未来**没有作为轨迹评估器使用，即"生成"与"规划决策"仍是两段式；
  - PM-Agent 的"需求制定"依赖 LLM 推理质量，**需求-数据缺口**没有闭环校验（生成的数据是否真覆盖失败模式未知）；
  - DriveSora 的高保真依赖 3D 布局标注，合成数据的**标注噪声会传染**给重训练后的 planner。
- **心得**：Agentic 自校正把 LLM 组织进自动驾驶工程流水线，是本主题最具工程落地性的方向；空白在于把它升级为 **simulator-in-the-loop 的持续闭环 + RL 化纠错**。

### 3.6 精读小结（横向对比）

| 维度 | SPSC | VeteranAD | EOT-WM | Any2Critical | CorrectAD |
|---|---|---|---|---|---|
| 板块 | 感知表示 | 端到端规划 | 世界模型 | 场景生成 | Agentic 系统 |
| 核心词 | 稀疏序列化 | 感知融入规划 | 自车-他车可控 | RAG 场景生成 | 自校正闭环 |
| 与规划的关系 | 无耦合 | 耦合（感知服务于规划） | 仅生成、未接规划 | 仅测试、未接规划 | 一次性重训 |
| 主要弱点 | 无规则/模态鲁棒 | 模仿学习、无闭环 | 无反应式闭环 | 指标可刷、无物理校验 | 无持续闭环/RL |

共同结论：**"生成/感知/世界模型 × 规划闭环"的耦合与鲁棒性，是 23 篇论文集体未充分解决的问题**。

---

## 四、全部收藏论文创新点与不足速查表

> 引用格式：`（Session名 · 论文N · 英文标题）`。

| # | 收藏论文 | 核心创新点 | 不足 / 空白 |
|---|---|---|---|
| 1 | Computer Vision III · 论文 38 · SPSC | 查询剪枝维持稀疏 + 查询序列化在线性复杂度下扩大感受野；多模态/单 LiDAR/单相机三设置 SOTA | 单数据集验证；无极端天气与传感器失效分析；剪枝策略非学习式；与规划解耦 |
| 2 | Computer Vision XI · 论文 55 · HD²-SSC | 高维语义解耦模块（伪三维扩维解耦遮挡）+ 高密度占据精修（detect-and-refine）弥合维度/密度双鸿沟 | 相机-only，依赖 2D-3D 投影质量；精修模块对极远/遮挡区域仍失效 |
| 3 | Computer Vision V · 论文 13 · Fisheye3DOD | 首个环视鱼眼端到端 3DOD 探索；FisheyeBEVDet/FisheyePETR 用球面空间表示几何 | 仅 CARLA 合成数据、无真实数据泛化验证；未扩展到占据/融合 |
| 4 | Computer Vision XII · 论文 23 · BEVDilation | LiDAR 中心化融合，图像 BEV 作隐式引导缓解深度误差；稀疏体素膨胀 + 语义引导膨胀 | 依赖 LiDAR；相机信息仅作"引导"，极端降采样/丢失相机时退化程度未量化 |
| 5 | Computer Vision VI · 论文 6 · PAMR | 自回归共构建车道向量+交通规则；Map-Rule Cache 保持规则长时生效；MapDRv2 标注 | 规则集合封闭（预定义类别），无法应对开放式/临时规则；长序列记忆开销 |
| 6 | Computer Vision IV · 论文 27 · TSBOW | 极端天气+遮挡监控基准：32h 真实数据、48k 手动+320 万半标注帧、8 类参与者 | 半标注质量未审计；CCTV 视角与自动驾驶车载视角差异大，迁移受限 |
| 7 | Computer Vision VI · 论文 13 · BN-TTA | 可学习 BN + 几何置信度/熵最小化 + 语义一致双阶段自适应，BEVFormer 上 nuScenes-C 提升 ~10% | 感知层 TTA，未覆盖规划；对连续域漂移（随时间变化的天气）缺乏记忆 |
| 8 | Computer Vision VII · 论文 4 · CorrectAD | PM-Agent 定义失败数据需求 + DriveSora 按 3D 布局生成视频，模型无关自校正 | 一次性离线重训无持续闭环；生成-规划两段式；合成标注噪声传染 |
| 9 | Computer Vision VII · 论文 51 · LSD-3D | 代理几何生成 + 2D 图像先验分数蒸馏，几何精确、地图布局可条件、可大规模 3D 生成 | 计算成本高；纹理/几何 trade-off 需要调参；未与场景级安全任务对接 |
| 10 | Computer Vision VIII · 论文 56 · UniMM-V2X | MoE 增强多层级融合，统一感知-预测-规划协同；DAIR-V2X SOTA | 依赖基础设施通信可靠；未见通信带宽/时延退化下的鲁棒性分析 |
| 11 | Computer Vision XIII · 论文 71 · OpenDriveVLA | 开源 VLA：2D/3D 结构化视觉 token 层级对齐语言；agent-environment-ego 交互建模 | 仅在 nuScenes 开环评测；语言命令覆盖有限，无闭环闭环验证 |
| 12 | Computer Vision XIII · 论文 88 · EOT-WM | 视频潜空间统一自车-他车轨迹：轨迹-车辆匹配 + ST-VAE + 轨迹注入 DiT | 非反应式生成；遮挡车辆匹配失败；未接入规划评估/策略学习 |
| 13 | Machine Learning VIII · 论文 74 · Fine-flow | 大运动/双向连续运动解耦 + 细粒度流自监督蒸馏粗粒度流，缓解长期误差累积 | 前端视频世界模型视角单一；自监督信号对罕见长尾运动弱 |
| 14 | Computer Vision IV · 论文 37 · LidarPainter | 一步扩散从稀疏 LiDAR+伪影渲染实时恢复一致视图；文本风格化扩展资产库 | 重建依赖输入渲染质量；风格化仅表层纹理，未改变交通语义 |
| 15 | Philosophy and Ethics of AI · 论文 24 · Any2Critical | 任意真实上下文编码 + NHTSA-5K RAG 生成安全场景，平均碰撞率 89.69% | 碰撞率可刷分；RAG 静态检索；无物理可行性与闭环失效验证 |
| 16 | Special Track on AI for Social Impact I · 论文 82 · ScenGE | LLM 元场景推理 + 对抗协作图放大威胁；多模拟器可部署、对抗训练提升鲁棒性 | 依赖结构化驾驶知识库质量；背景车优化仍偏启发式 |
| 17 | Special Track on AI for Social Impact I · 论文 88 · KnowLCP | 风险/运动学/意图强度三类知识显式建模 + 互信息最大化知识注入 | 知识为静态规则，缺乏场景级语言推理；跨城市迁移未验证 |
| 18 | Application Domains I · 论文 21 · Measuring What Matters | 场景关键度加权的准确性×多样性二维评估流水线替代 ADE/FDE | 未覆盖预测不确定性/校准；与规划器集成方式单一 |
| 19 | AAAI Emerging Trends in AI · 论文 90 · MC2L-Transformer | 粗到细分层 Transformer 兼顾全局一致与局部精度；CARLA 低碰撞/低偏离（学生摘要） | 学生摘要规模小；CARLA 非反应式基准局限；无开源细节 |
| 20 | AAAI Emerging Trends in AI · 论文 139 · Guided Latent Spaces | VAE 统一生成多类关键场景 + 结构化潜空间可控（学生摘要） | 生成真实感/物理一致性未充分验证；面向工业管线的评估缺失 |
| 21 | Computer Vision IV · 论文 29 · STRIDE-QA | 100h 多传感器数据构建 1600 万时空推理 QA；通用 VLM 近零分，微调后大幅提升 | 东京单一城市域；QA 未与规划行动绑定；一致性指标定义单薄 |
| 22 | Computer Vision XII · 论文 15 · VeteranAD | "感知融入规划"：锚定轨迹先验引导定向感知 + 自回归推进 | 模仿学习无闭环；锚轨迹人工设计；早期误差放大无补偿 |
| 23 | Computer Vision XI · 论文 64 · DriveSuprim | 粗到细候选过滤 + 旋转增强 + 自蒸馏稳定选择式规划 | 评分网络依赖仿真器反馈；OOD 场景与多模式分布极端时选择置信度待证 |

---

## 五、外部前沿文献综述（含真实引用）

> 全部条目均来自本次检索到的真实 arXiv ID / DOI / 官方 URL，未编造。

### 5.1 端到端规划与 VLA

- **UniAD**（arXiv 2212.10156）与 **VAD**（arXiv 2303.12077）确立了"规划导向、全任务可微"的端到端范式，是 VeteranAD 的直接先行者；**SparseDrive**（arXiv 2405.19620）证明稀疏场景表示能同时保精度与效率。三者都走"感知-预测-规划"顺序，均未做感知与规划的时间耦合，印证 `VeteranAD` 的新颖性。
- **Hydra-MDP**（arXiv 2406.06978）用多目标知识蒸馏做多模态规划，是 `DriveSuprim`（选择式规划）的直接竞争线。
- **DriveVLM**（arXiv 2402.12289）与 **DriveMLM**（arXiv 2312.09245）把大视觉语言模型接入规划；**OpenDriveVLA**（arXiv 2503.23463）走开源 VLA 路线，与收藏论文 Computer Vision XIII · 论文 71 同源。
- **Reason2Drive**（arXiv 2312.03661）给出链式推理驾驶 VQA 基准，支撑 idea I11 的评测设计；**CogAD**（arXiv 2505.21581）与 **FocalAD**（arXiv 2506.11419）是 2025 年最新的层次/局部运动规划基线。
- **WorldRFT**（AAAI 2026，DOI 10.1609/aaai.v40i14.38149）用 latent 世界模型 + 强化微调做规划，是 idea I3（RL 化纠错）的直接相关证据：2026 年学界已开始把世界模型与 RL 规划结合。

### 5.2 驾驶世界模型与视频生成

- **GAIA-1**（arXiv 2309.17080）、**DriveDreamer**（arXiv 2309.09777）、**DriveDreamer-2**（arXiv 2403.06845）、**Vista**（arXiv 2405.17398）、**GenAD**（arXiv 2402.11502）、**MagicDrive**（arXiv 2310.02601）与 **MagicDrive-V2**（arXiv 2411.13807）构成"条件视频生成世界模型"谱系；其中 MagicDrive-V2 与 `LidarPainter`（一步扩散）同属高保真/高效率生成方向。
- **D2-World**（arXiv 2411.17027）把世界模型解耦为动态流，与收藏论文 Machine Learning VIII · 论文 74（fine-flow 蒸馏粗-flow）思路互补。
- **数据扩展**：**Data Scaling Laws for End-to-End Autonomous Driving**（arXiv 2504.04338）与 **DriveE2E**（arXiv 2509.23922）证明"世界模型合成数据 → 缩放端到端性能"的可行性，支撑 idea I1/I3 的数据引擎假设。
- 世界模型用于规划的评估端：**From Words to Collisions**（arXiv 2502.02145）用 LLM 引导生成对抗驾驶场景做评估，是最接近"世界模型/LLM 作 critic"的现存工作之一。

### 5.3 3D 占据与语义场景补全

- **OccFormer**（ICCV 2023，DOI 10.1109/iccv51070.2023.00865）、**TPV**（CVPR 2023，DOI 10.1109/cvpr52729.2023.00890）、**OpenOccupancy**（ICCV 2023，DOI 10.1109/iccv51070.2023.01636）、**RenderOcc**（ICRA 2024，DOI 10.1109/icra57147.2024.10611537）与 **SparseOcc / Fully Sparse 3D Occupancy Prediction**（arXiv 2312.17118；SparseOcc arXiv 2404.09502）代表稠密→稀疏的演化，`SPSC` 正是这条线上的 AAAI 2026 新作。
- **OccWorld**（arXiv 2311.16038）用占据序列做未来预测世界模型，是"占据→预测→规划"链路的代表，为 idea I4/I5 提供基线。

### 5.4 安全场景生成与仿真

- **DiffScene**（AAAI 2025，DOI 10.1609/aaai.v39i8.32951）、**SAFE-SIM**（arXiv 2401.00391）、**Versatile Behavior Diffusion**（arXiv 2404.02524）证明扩散模型生成对抗行为的有效性；**AuthSim**（arXiv 2502.21100）、**From Words to Collisions**（arXiv 2502.02145）与 **CCFM: Collision-Constrained Flow Matching**（arXiv 2607.04451）表明 2025-2026 学界正在同时重视"真实性/物理约束"与"安全关键"两端的平衡——这正是 `Any2Critical`/`ScenGE` 未解决而本报告 idea I10 要解决的问题。

### 5.5 协同驾驶（V2X）

- **UniV2X**（arXiv 2404.00717，AAAI 2025）提出端到端 V2X 合作范式，是 `UniMM-V2X` 的直接基线；**V2X-VLM**（arXiv 2408.09251）用大视觉语言模型做 V2X 协同，代表 LLM 进入协同层；**LiDAR-based End-to-end Temporal Perception for V-I Cooperation**（arXiv 2411.14927）提示"车路协同下时序感知"的工程化方向，支撑 idea I6。

### 5.6 评测、闭环与鲁棒性

- **NAVSIM**（arXiv 2406.15349）与 **Bench2Drive**（arXiv 2406.03877）是当前闭环评测事实标准，也是多数收藏论文（VeteranAD、DriveSuprim、CorrectAD）的评测平台；**Bench2Drive-VL**（arXiv 2604.01259）新增 VLM 闭环评测，支撑 idea I11。
- **TENT**（arXiv 2006.10726）是测试时自适应的经典基线；收藏论文 Computer Vision VI · 论文 13（BN-TTA）将其扩展到驾驶检测。**End-to-end Autonomous Driving: Challenges and Frontiers**（arXiv 2306.16927）为领域综述背景。

### 5.7 其他支撑文献

- **LanguageMPC（A Language Agent for Autonomous Driving）**（arXiv 2311.10813）：LLM 语言先验驱动规划，支撑 idea I8 的"语言推理先验"论证。
- **End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation**（arXiv 2406.17680）：无需 3D 标注的端到端方法，支撑 idea I5 的"弱标注/无标注自适应"论证。
- **OccLLaMA**（arXiv 2409.03272）：占据-语言-行动统一生成世界模型，是 idea I4/I11 的统一式路线的强相关证据。
- **Surround-View Fisheye Camera Perception for Automated Driving**（IEEE T-ITS 2023，DOI 10.1109/tits.2023.3235057）：鱼眼感知综述，支撑 idea I7。

---

## 六、研究 Idea（12 个，完整实验方案）

> 全部方案按 4×NVIDIA L40（48GB×4=192GB）预算设计；优先 7B-13B 全参（FSDP/DeepSpeed）或 30B-70B LoRA/QLoRA，总训练量控制在数十 GPU·天。

### Idea 1：轨迹条件安全评分潜空间世界模型（Latent Safety Critic for Planning）

- **标题**：轨迹条件安全评分的潜在空间驾驶世界模型 / Latent Trajectory-Conditioned Safety Critic World Model
- **一句话简介**：训练一个"给定候选轨迹→在潜空间直接输出碰撞/安全分数"的世界模型批判器，代替昂贵 rollout 做端到端规划器的轨迹选择与安全评估。
- **动机与现有不足**：EOT-WM（Computer Vision XIII · 论文 88）与 Fine-flow（Machine Learning VIII · 论文 74）把世界模型做到"可控生成"，但生成结果不产出**轨迹级安全分数**；DriveSuprim（Computer Vision XI · 论文 64）的选择式规划依赖仿真器反馈打分，成本高且 OOD 不可靠。缺失的是"世界模型即安全 critic"的统一接口。
- **核心创新点**：1) 在 ST-VAE 潜空间定义**轨迹条件安全嵌入**，用轻量 head 直接回归碰撞/违规分数，避免像素级 rollout；2) 用**控制潜相似度**类指标（EOT-WM 提出）做分数校准的辅助信号；3) critic 与 planner 联合训练成可微闭环。
- **方法概要**：以 EOT-WM 的轨迹注入 DiT 为骨干，去掉完整去噪生成，改为"轨迹 embedding + 场景 latent → MLP critic → {碰撞概率, 违规率, 安全裕度}"。数据流水线：nuScenes 真值轨迹 + 扰动轨迹（横向/纵向扰动、超速、压线）构造正负样本；训练损失 = 轨迹条件安全分类/回归 + 潜空间对比（安全 vs 危险轨迹拉远）。
- **数据集与基线**：nuScenes、NAVSIM（2406.15349）轨迹候选集；基线 = EOT-WM 像素级 rollout 打分、DriveSuprim 评分网络、规则几何校验器（Simple Safety）。
- **评测指标**：主指标 = 与仿真器真值碰撞标签的一致性（AUC/AP）、轨迹选择命中率；消融 = 潜空间 vs 像素级成本、扰动幅度敏感性、OOD 场景迁移。
- **算力与训练方案**：潜空间 DiT 骨干约 0.5-1B，critic head 小；单卡 batch=16，4×L40 FSDP 训练 ~60k step，约 3-4 GPU·天（复用预训练 latent）。
- **DeepSeek/Kimi API 用法**：用 LLM 生成**语义多样性扰动指令**（"前车急刹时自车仍加速""变道压线"），自动合成轨迹扰动与失败标签，作为 critic 的难样本。
- **投稿目标会议与优先级**：CoRL 2026 / ICML 2027，**高**（世界模型批判器是 2025-2026 最热交叉点）。
- **可行性与风险**：最大风险是潜空间分数与真实碰撞的相关性不足——需先用 EOT-WM 控制潜指标与 NAVSIM 仿真碰撞做 Pearson 校准；若相关性 <0.6，退回"半像素级"混合架构。

### Idea 2：世界模型正则化的测试时自适应规划（World-Model-Regularized Test-Time Adaptation）

- **标题**：世界模型正则化的测试时自适应规划 / Test-Time Adaptation for E2E Planning Regularized by a World Model
- **一句话简介**：在测试端部署时，用世界模型对在线场景的"预测-观察一致"作为自监督约束，仅更新可学习 BN/轻量 LoRA 参数，让感知与规划同步适应域漂移。
- **动机与现有不足**：BN-TTA（Computer Vision VI · 论文 13）只自适应感知层 BN 且无规划约束；极端天气（TSBOW，Computer Vision IV · 论文 27）下感知退化会直接传导到规划。现有 TTA 均无"未来一致性"信号来防止过度拟合单帧。
- **核心创新点**：1) 把 TTA 从感知层扩展到**感知+规划联合**；2) 引入世界模型的**自监督一致性正则**（自车-他车轨迹注入生成视频与真实观测对比）；3) 双阶段：先感知 BN 预热、再规划头 LoRA 微调，避免大模型 TTA 不稳定（呼应 BN-TTA 的稳定性动机）。
- **方法概要**：基线规划器 = OpenDriveVLA（arXiv 2503.23463）或 VeteranAD 结构。流式数据：在线 t 帧 → 世界模型（复用 EOT-WM latent）以"上一时刻轨迹"生成未来预测视频 → 与 t+1 真实观测在潜空间算 L1 一致性；联合 TTA 损失 = 熵最小化（感知）+ 潜空间预测一致（世界模型）+ 规划安全正则（碰撞临界距离）。
- **数据集与基线**：nuScenes-C、TSBOW、Cityscapes→ACDC（域迁移）；基线 = TENT（arXiv 2006.10726）、BN-TTA（Computer Vision VI · 论文 13）、EATA/CoTTA 类。
- **评测指标**：主指标 = 闭环 PDMS（NAVSIM）/ 碰撞率（Bench2Drive），域漂移下感知 mAP 保持率；消融 = 一致性正则权重、适应窗口长度、可更新参数类型（BN vs LoRA）。
- **算力与训练方案**：感知编码器 + 世界模型 latent 分支冻结，仅 BN/小 LoRA（<0.5B）可更新；在线单卡推理 + 每场景梯度步 ~5-10 步；离线域迁移预训练 2-3 GPU·天。
- **DeepSeek/Kimi API 用法**：LLM 对每类域漂移（雾、夜、雨）生成**故障描述与应检出的危险信号清单**，用于构建评测时的自适应优先级。
- **投稿目标会议与优先级**：ICLR 2027 / IV 2026，**中高**（TTA+世界模型是新组合，但需扎实消融）。
- **可行性与风险**：最大风险是"潜空间一致性"在低质量视频下噪声大——需先离线在 nuScenes-C 上校准一致损失与真实域偏移的相关性；同时在线梯度步的算力需严格控制在推理时延内。

### Idea 3：Simulator-in-the-Loop 的端到端自校正 RL 闭环（Closed-Loop Self-Correction with Counterfactual RL）

- **标题**：仿真器在环的端到端规划自校正强化闭环 / Simulator-in-the-Loop Self-Correcting RL for End-to-End Planning
- **一句话简介**：把 CorrectAD（Computer Vision VII · 论文 4）的一次性补数据升级为"世界模型生成反事实失败 → 策略 RL 微调 → 再仿真验证 → 再生成"的持续闭环。
- **动机与现有不足**：CorrectAD 无持续回路、无 RL 信号、生成-规划两段式；WorldRFT（AAAI 2026，DOI 10.1609/aaai.v40i14.38149）证明 latent 世界模型可做 RL 微调，但未与"失败驱动的反事实数据生成"结合。
- **核心创新点**：1) **反事实场景飞轮**：用 EOT-WM 自车-他车可控生成把 planner 的失败片段"变化出"更多同分布变体；2) **critic 即奖励**：用 Idea 1 的安全 critic 或简单几何安全裕度做 reward 的稠密化；3) **验证门控**：RL 后的策略必须在新生成场景上复测，不达阈值则重新生成更激进变体。
- **方法概要**：初始化 planner（Hydra-MDP/SparseDrive 结构）→ 从失败库采样 → 世界模型反事实生成 N 个变体 → PPO/RLVR 微调 → 用基线生成器与真实场景双复测 → 未达标场景喂回 LLM 元描述器。RL 状态 = BEV 特征 + 轨迹潜码；动作 = 自车轨迹参数化。
- **数据集与基线**：nuScenes + Bench2Drive 场景库；基线 = CorrectAD 一次性管线、SparseDrive+数据增强、WorldRFT。
- **评测指标**：主指标 = 失败率（碰撞/违规/偏离）在未见过变体上的下降、DS/成功率（Bench2Drive）；消融 = 反事实多样性、RL 与生成频率、reward 稠密化。
- **算力与训练方案**：planner 1-2B，LoRA 微调（QLoRA 4bit）4×L40 并行；数据合成 4 卡流水线（2 卡生成+2 卡 RL）；每轮迭代 ~2-3 GPU·天，总 8-12 GPU·天。
- **DeepSeek/Kimi API 用法**：LLM 把失败视频/轨迹转成**结构化失败描述（含成因、场景要素、关键交互车辆）**，驱动反事实变体生成与 RL 奖励的自然语言解析。
- **投稿目标会议与优先级**：NeurIPS 2026 / CoRL 2026，**高**（闭环+世界模型+RL 三位一体稀缺）。
- **可行性与风险**：最大风险是 RL 在 4×L40 上的采样吞吐不足（世界模型生成慢）——缓解：latent 世界模型批量生成 + 预生成池；另需警惕反事实场景与真实分布偏差过大导致过拟合。

### Idea 4：规则感知的稀疏占据预测（Rule-Conditioned Sparse Occupancy）

- **标题**：规则感知的稀疏占据预测：把交通规则变成可微的安全边界 / Rule-Aware Sparse Occupancy: Traffic Rules as Differentiable Safety Boundaries
- **一句话简介**：在 SPSC 类稀疏占据表示上显式注入"停止线/限速/禁止变道/让行"等规则编码，输出"合法可行驶占据 vs 禁止占据"分层体素。
- **动机与现有不足**：SPSC（Computer Vision III · 论文 38）只做几何-语义占据，无法回答"该区域是否可以进入"；PAMR（Computer Vision VI · 论文 6）只在地图层建模规则且规则封闭；HD²-SSC（Computer Vision XI · 论文 55）的稠密化不感知规则。
- **核心创新点**：1) 在稀疏 query 上新增**规则 token 通道**（规则类别 + 空间作用域），随查询序列化一起参与注意力；2) 输出双通道占据：物理占据 + 法理（legal）可行驶性；3) 规则-占据一致性损失（禁止区域内预测"可进入"即惩罚）。
- **方法概要**：骨干 = SPSC（渐进剪枝 + 查询序列化）；规则头：轻量向量场 → 规则编码器；数据流水线：MapDRv2（PAMR 发布）+ nuScenes 地图标注释出规则体素标注；损失 = mIoU 主损失 + 法理通道 BCE + 规则区域一致性。
- **数据集与基线**：nuScenes-Occupancy、OpenOccupancy（ICCV 2023）、MapDRv2；基线 = SPSC、OccWorld（arXiv 2311.16038）、BEVFormer-Occ 加规则后处理。
- **评测指标**：主指标 = 语义 mIoU（保留）+ 法理可行驶 IoU（新增）+ 违规占用率；消融 = 规则 token 通道数、规则编码器位置、一致性损失权重。
- **算力与训练方案**：SPSC 规模（<200M），4×L40 数据并行；全量训练 ~150k step，5-6 GPU·天。
- **DeepSeek/Kimi API 用法**：LLM 从道路图+交规文本自动**生成规则标注规则（规则→空间作用域映射）**，并审查自动标注质量，作为伪标注引擎。
- **投稿目标会议与优先级**：ICRA 2027 / ICLR 2027，**中高**（规则×占据交叉点新颖，工程量大）。
- **可行性与风险**：最大风险是"规则作用域"自动标注噪声大——需人工抽检 + 规则一致性损失做软约束；若规则信号太弱，退化为可插拔后处理模块仍可发。

### Idea 5：模态无关的掩码占据预训练（Modality-Agnostic Masked Occupancy Pretraining）

- **标题**：模态无关的掩码占据预训练：传感器任意缺失下的鲁棒感知 / Modality-Agnostic Masked Occupancy Pretraining for Sensor-Robust Perception
- **一句话简介**：把多模态（相机+LiDAR）输入随机掩掉任意模态，预训练占据模型学会"用剩模态补齐全模态表示"，实现部署时传感器退化（雨雾、遮挡、掉线）下的无缝鲁棒。
- **动机与现有不足**：SPSC 多模态设置假设传感器全好；BEVDilation（Computer Vision XII · 论文 23）相机信息仅作引导、LiDAR 丢失即瘫痪；BN-TTA 只做参数自适应不做表示级补全。传感器失效（TSBOW 场景）是最大真实风险却无方法专攻。
- **核心创新点**：1) 随机模态掩码预训练（相机掩码/LiDAR 掩码/联合掩码），训练模态不变占据表示；2) **模态路由门**在推理时按可用模态动态切换分支；3) 与 TTA 结合：掩码自监督天然提供"无标注在线适应"信号。
- **方法概要**：骨干 = SPSC 多模态版；预训练阶段以任意模态子集输入预测完整占据真值（masked multi-modal autoencoding）；微调阶段在 nuScenes-Occupancy 上带掩码训练；推理门控 = 统计每个模态的可用性/置信度。
- **数据集与基线**：nuScenes-Occupancy + nuScenes-C（相机损坏）、SemanticKITTI；基线 = SPSC、BEVDilation、OccFormer+融合、Transformer 多模态占位补齐。
- **评测指标**：主指标 = 模态缺失矩阵下的平均 mIoU（缺失 0/1/2 模态分别统计）+ 退化曲线；消融 = 掩码率、门控机制、与 BN-TTA 组合。
- **算力与训练方案**：<200M 骨干，4×L40 数据并行，掩码预训练 200k step（约 6-7 GPU·天）+ 微调。
- **DeepSeek/Kimi API 用法**：LLM 生成**传感器退化合成方案清单**（对应天气/故障类型），指导掩码策略与评测协议设计。
- **投稿目标会议与优先级**：CVPR 2027 / ITSC 2026，**高**（鲁棒性是刚需，实验可控）。
- **可行性与风险**：最大风险是掩码预训练收益被强 LiDAR 单模态吸收（相机主导不了精度）——需设计模态均衡采样与"最小可工作子集"评测；若收益不足可退化为模态蒸馏辅助损失。

### Idea 6：V2X 协同潜空间世界模型与协同规划（Cooperative Latent World Model for V2X Planning）

- **标题**：车-路协同的潜空间世界模型与协同规划 / Cooperative Latent World Model for V2X Planning
- **一句话简介**：把 UniMM-V2X（Computer Vision VIII · 论文 56）的多级融合升级为"多车共享未来轨迹世界模型"：让车端与路端共同预测未来并协同规划，减少单车视角盲区。
- **动机与现有不足**：UniMM-V2X 协同只到感知-预测-规划特征共享，没有**跨车未来生成**；V2X-VLM（arXiv 2408.09251）用 LLM 但无世界模型；单车世界模型（EOT-WM）不利用路端信息。
- **核心创新点**：1) **协同潜世界模型**：多智能体共享 latent 轨迹注入 DiT，未来生成以"车队+路端"联合状态为条件；2) MoE 按通信质量路由跨车 query（通信退化时自动降级为单车）；3) 协同 critic（复用 Idea 1）对车队轨迹联合打分。
- **方法概要**：扩展 UniMM-V2X 编码器 → 车端/路端潜空间对齐（对比学习）→ 协同世界模型生成 N 步未来 → 协同规划头输出车队轨迹。DAIR-V2X 提供车-路双源数据；通信退化通过 mask/丢包模拟。
- **数据集与基线**：DAIR-V2X、V2XSet（已有公开使用记录）；基线 = UniMM-V2X、UniV2X（arXiv 2404.00717）、单车 EOT-WM 上采样。
- **评测指标**：主指标 = 协同规划 PDMS/碰撞率（在 V2X 闭环模拟中）、未来生成 FVD；消融 = 通信丢包率 0/20/50% 下性能、MoE 路由、车-路对比对齐。
- **算力与训练方案**：编码器+世界模型 latent 骨干 ~1B，4×L40 FSDP 训练 ~100k step，约 8-10 GPU·天；车端推理轻量化可部署。
- **DeepSeek/Kimi API 用法**：LLM 解析 DAIR-V2X 场景生成**协同失败案例描述与变体**（路端遮挡、通信时延），用于评测与难例采样。
- **投稿目标会议与优先级**：CVPR 2027 / ITSC 2027，**中**（需数据集许可与模拟器整合，风险中等）。
- **可行性与风险**：最大风险是 DAIR-V2X 的标注与 V2X 闭环模拟器整合成本高——建议先用已开放的 V2X 感知标签做预测任务验证，规划部分在简化模拟器（CARLA+通信插件）中做。

### Idea 7：鱼眼球面占据：从合成到真实的跨域鲁棒（Fisheye Spherical Occupancy for Robust Wide-FOV Perception）

- **标题**：鱼眼球面占据：几何对齐的跨域鲁棒宽视场感知 / Fisheye Spherical Occupancy: Geometry-Aligned Cross-Domain Robust Wide-FOV Perception
- **一句话简介**：把 SPSC 稀疏占据与球面坐标表示结合，建立"合成(鱼眼)→真实(鱼眼)"一致的占据预测，解决 3DOD 鱼眼方案合成-真实鸿沟。
- **动机与现有不足**：Fisheye3DOD（Computer Vision V · 论文 13）只在 CARLA 合成数据上验证且只做 3DOD；真实鱼眼占据预测无基准；现有 BEV 类方法假设针孔几何，鱼眼强畸变下深度误差大。
- **核心创新点**：1) 球面坐标 token 化的稀疏占据（把笛卡尔体素改为等距球面-深度双表示）；2) 合成到真实的自监督（CARLA 合成鱼眼 → 真实鱼眼用几何约束对齐，无需配对）；3) 鱼眼-针孔混合阵列训练提升鲁棒性。
- **方法概要**：扩展 FisheyeBEVDet 的球面表示到占据；球面→笛卡尔可微映射 + 深度一致性损失；自监督域对齐用"轨迹一致性"（同一车辆在鱼眼与针孔视图的重投影一致）。
- **数据集与基线**：Fisheye3DOD（合成）、nuScenes（含鱼眼环视）、WoodScape（公开鱼眼数据集）；基线 = SPSC（在鱼眼上直接跑）、Fisheye3DOD、BEVDilation。
- **评测指标**：主指标 = 球面/笛卡尔占据 mIoU 的合成-真实 gap、3DOD AP；消融 = 坐标表示、域对齐损失、混合阵列。
- **算力与训练方案**：骨干 <300M，4×L40；合成预训练 80k step（3 GPU·天）+ 真实微调 40k step。
- **DeepSeek/Kimi API 用法**：LLM 生成**鱼眼场景描述与畸变问题报告**，帮助标注优先级与难例采样；自动生成合成场景变体提示词。
- **投稿目标会议与优先级**：ICRA 2027，**中**（数据集组装是主要工作量，纯方法创新中等）。
- **可行性与风险**：最大风险是真实鱼眼数据获取/许可与标注成本；若无真实数据，先证明"合成内一致性"收益，域对齐部分作为 ablation 留作后续。

### Idea 8：LLM 推理先验蒸馏的换道预测（LLM-Reasoned Intention Priors Distilled to a Lightweight Predictor）

- **标题**：语言推理先验蒸馏的轻量换道预测 / Language-Reasoned Intention Priors Distilled for Lane-Change Prediction
- **一句话简介**：用 LLM 对历史轨迹+场景做"换道意图"的语言推理，将意图先验蒸馏进轻量预测器，融合 KnowLCP 的运动学约束，实现跨城市低成本迁移。
- **动机与现有不足**：KnowLCP（Special Track on AI for Social Impact I · 论文 88）注入静态规则但无场景语义推理；纯数据驱动模型在换城市（不同交规/驾驶风格）时掉点；大 LLM 直接推理换道不符合实时性。
- **核心创新点**：1) 离线 LLM 推理 → 蒸馏为**意图先验特征（token）**，在线只跑轻量编码器；2) 先验不确定性传递：LLM 低置信场景自动回退到纯几何预测；3) 知识注入用互信息目标（沿用 KnowLCP 优势）但换成语言先验。
- **方法概要**：两阶段：a) 离线用 DeepSeek/Kimi 对轨迹+俯视图描述生成意图标签与推理链，构造蒸馏目标；b) 在线预测器 = 轨迹编码器 + 轻量视觉编码器，蒸馏损失 = 意图分布 KL + 轨迹回归 + 运动学可行性正则。
- **数据集与基线**：Argoverse 2、HighD、INTERACTION；基线 = KnowLCP、HiVT/QCNet 类主流预测器、LLM 直接推理（只做评测参考）。
- **评测指标**：主指标 = 意图 F1 + FDE/minADE（换道子集单独统计）；消融 = 蒸馏目标、先验置信回退、跨数据集迁移（A2→HighD）。
- **算力与训练方案**：在线预测器 <100M，单卡即可；离线蒸馏数据由 API 生成（成本可控）；训练 2-3 GPU·天。
- **DeepSeek/Kimi API 用法**：核心用途——离线意图推理链生成 + 蒸馏标签 + 跨域场景改写（把城市 A 场景翻译成城市 B 交规）。
- **投稿目标会议与优先级**：ICRA 2027 / NeurIPS 2026（workshop），**中高**（数据-蒸馏路线清晰，API 成本可审计）。
- **可行性与风险**：最大风险是 LLM 意图标注质量不均（模糊场景）——用互信息过滤低置信样本；蒸馏收益需与"更多数据训练"对照，避免被质疑。

### Idea 9：长期世界模型的层次一致性蒸馏（Horizon-Adaptive Consistency Distillation for Long-Term World Models）

- **标题**：面向长期世界模型的视界自适应一致性蒸馏 / Horizon-Adaptive Consistency Distillation for Long-Term Driving World Models
- **一句话简介**：在 Fine-flow 蒸馏的基础上加入"视界自适应蒸馏+漂移感知"，让长程生成既连贯又能暴露合理的分布外失败。
- **动机与现有不足**：Fine-flow（Machine Learning VIII · 论文 74）用细流监督粗流改善一致性，但蒸馏对**罕见长尾运动**监督弱、且只做单尺度；长期生成误差累积（drift）仍无自检机制。
- **核心创新点**：1) **视界自适应蒸馏权重**：随预测视界增长提高细流监督权重；2) **漂移探测器**：潜空间自一致分数低于阈值即停止 rollout 或重启；3) 长尾运动专项增强（变道/让行/逆行样本重采样）。
- **方法概要**：复用 Fine-flow 的双流 DiT；新增 drift-aware 损失（相邻窗口一致）+ 视界权重调度；评测在 110+ 帧长生成上做。
- **数据集与基线**：nuScenes、Waymo open motion（已有公开数据集）；基线 = Fine-flow、D2-World（arXiv 2411.17027）、MagicDrive-V2（arXiv 2411.13807）。
- **评测指标**：主指标 = 长程 FVD + 漂移率（自一致分数下降率）+ 推理速度；消融 = 视界调度、漂移重启阈值、长尾重采样。
- **算力与训练方案**：双流 DiT ~0.5B，4×L40 训练 120k step（5-6 GPU·天）；长程推理用批量去噪并行。
- **DeepSeek/Kimi API 用法**：LLM 生成**长尾运动序列描述**（换道受阻、鬼探头、行人横穿）用于重采样与合成难例片段。
- **投稿目标会议与优先级**：ICLR 2027 / NeurIPS 2026，**中**（增量改进，需与 Fine-flow 拉开差距）。
- **可行性与风险**：最大风险是"漂移探测器"阈值难设（过严砍掉合法长尾）——用校准集搜索阈值，并作为可调超参公开。

### Idea 10：物理一致性的安全场景生成与闭环失效验证（Physics-Consistent Adversarial Scenario Generation）

- **标题**：物理一致的安全场景生成与闭环失效验证 / Physics-Consistent Adversarial Scenario Generation with Closed-Loop Failure Validation
- **一句话简介**：在 Any2Critical/ScenGE 基础上加"运动学一致性校验 + 闭环失效复验"，让生成场景既难（高威胁）又真（物理可行），且验证其确实暴露规划器具体失败模式。
- **动机与现有不足**：Any2Critical（Philosophy and Ethics of AI · 论文 24）用碰撞率刷分、无物理校验；ScenGE（Special Track on AI for Social Impact I · 论文 82）有代码级控制但仍是启发式；CCFM（arXiv 2607.04451）刚提出碰撞约束流匹配，说明"约束生成"是 2026 新热点，尚无完整闭环链路。
- **核心创新点**：1) **物理一致性过滤器**：对抗车辆的轨迹必须满足运动学/动力学可行（加/减速、转向速率），过滤"传送式碰撞"；2) **闭环失效验证**：生成的场景在模拟器中跑基线 planner，只有真实暴露特定失败类别（如"被追尾"）才计入有效；3) **场景有效性度量**替代单一碰撞率（覆盖度×真实性×失效归因）。
- **方法概要**：RAG 场景检索（沿用 Any2Critical 的 NHTSA-5K 思路）→ LLM 元描述 → 轨迹生成（CCFM 风格约束流匹配）→ 物理过滤 → CARLA/基准闭环复验 → 失败归因（用 Idea 1 critic）→ 回灌难例库。
- **数据集与基线**：nuScenes/Argoverse 场景 + 模拟器闭环；基线 = Any2Critical、ScenGE、DiffScene（AAAI 2025）、SAFE-SIM（arXiv 2401.00391）。
- **评测指标**：主指标 = 有效失效暴露率（归因正确的碰撞/违规/僵局）+ 真实性指标（物理可行性通过率、行为合理性）；消融 = 物理过滤器阈值、闭环复验必要性、RAG 库规模。
- **算力与训练方案**：生成器 <500M + 模拟器批量并发；4×L40 跑生成+闭环复验流水线，单轮 2-3 GPU·天，共 6-8 GPU·天。
- **DeepSeek/Kimi API 用法**：LLM 做事故库检索重排序、元场景推理、以及**失效归因报告**（从轨迹+视频判断失败类别与责任主体）。
- **投稿目标会议与优先级**：ICLR 2027 / IEEE T-IV 期刊，**高**（安全验证是政策刚需，指标与链路完整性强）。
- **可行性与风险**：最大风险是模拟器闭环复验吞吐低——用并发批次 + 预过滤难例；物理过滤器误伤多样场景时需在"多样性-真实性"上做 Pareto 消融。

### Idea 11：占据锚定的驾驶 VQA 与规划一致性微调（Occupancy-Grounded Driving VQA with Planning-Consistency Fine-tuning）

- **标题**：占据锚定的驾驶 VQA 与规划一致性微调 / Occupancy-Grounded Driving VQA with Planning-Consistency Fine-Tuning
- **一句话简介**：把 STRIDE-QA 式的时空 VQA 锚定到占据表示，用"VQA 答案必须与规划动作自洽"作为奖励，端到端微调 VLA，同时提升问答正确率与规划安全。
- **动机与现有不足**：STRIDE-QA（Computer Vision IV · 论文 29）证明通用 VLM 时空推理近零分，但 VQA 与规划脱节；OpenDriveVLA（Computer Vision XIII · 论文 71）有 VQA+轨迹却未用 VQA 作为规划正则。
- **核心创新点**：1) **占据锚定问答**：问题与答案引用占据体素索引，天然带 3D 可验证性；2) **规划一致性奖励**：VQA 答案若与模型实际输出的轨迹矛盾（如答"前车将直行"但轨迹预测前车变道）则罚分，作为 RLHF 式奖励；3) 用 Occupancy-LLM（借鉴 OccLLaMA 思路）统一占据 token 与语言。
- **方法概要**：数据：STRIDE-QA 基础上加占据标注；模型：OpenDriveVLA + 占据 tokenizer；训练：先 VQA 监督，再 DPO/RLVR 用规划一致性奖励微调；评测闭环用 Bench2Drive-VL（arXiv 2604.01259）思路。
- **数据集与基线**：STRIDE-QA、nuScenes-QA（Reason2Drive 同源生态，arXiv 2312.03661）、Bench2Drive-VL；基线 = OpenDriveVLA、OccLLaMA、通用 VLM 微调。
- **评测指标**：主指标 = 空间定位准确率 + 预测一致性（沿用 STRIDE-QA）+ 闭环 PDMS；消融 = 占据锚定、一致性奖励权重、RLVR 样本量。
- **算力与训练方案**：VLA 7B，QLoRA（4bit）微调 4×L40，约 100-200k step 8-12 GPU·天；VQA 数据合成走 API。
- **DeepSeek/Kimi API 用法**：用 LLM 生成**占据锚定问答对**（"第三车道 SUV 在 2 秒后会不会进我们的行驶带"）与**答案-轨迹矛盾检测**（judge 角色）。
- **投稿目标会议与优先级**：CVPR 2027 / ECCV 2027，**高**（VQA×规划×占据三者结合的稀缺组合）。
- **可行性与风险**：最大风险是 7B VLA 在 4×L40 上 RLVR 采样慢——预先批量化问答生成，RL 只用小规模难例；若 RLVR 不稳退化为 DPO 两阶段。

### Idea 12：不确定性感知的预测器评估与闭环选择（Uncertainty-Aware Scenario-Driven Predictor Evaluation）

- **标题**：不确定性感知的预测器评估与闭环选择 / Uncertainty-Aware Scenario-Driven Evaluation and Selection of Trajectory Predictors
- **一句话简介**：在 Application Domains I · 论文 21 的"准确性×多样性"二维评估基础上加入**预测不确定性/校准维度**，并用闭环收益选择预测器，让评估真正对齐 SDV 驾驶性能。
- **动机与现有不足**：Measuring What Matters（Application Domains I · 论文 21）缺不确定性与校准维度；高置信错误（overconfidence）会导致 SDV 激进决策；现有评估仍以事后误差为主，未把"预测不确定性如何被规划消费"纳入。
- **核心创新点**：1) **三维评估立方**：准确性 × 多样性 × 不确定性校准（ECE/RCE）；2) **不确定性加权规划消费**：把预测不确定性作为规划器的风险权重输入，量化"评估分数差 → 驾驶性能差"；3) **闭环选型协议**：按场景关键度分层选预测器，输出可审计的选型报告。
- **方法概要**：给定预测器集合（HiVT/QCNet/KnowLCP 变体等）→ 在 NAVSIM 风格闭环基准上分别做开环指标+闭环 PDMS 双测 → 计算三维分数与"评估-驾驶性能"相关性（Spearman）→ 生成不确定性加权规划器消融。
- **数据集与基线**：Argoverse 2、nuScenes、NAVSIM 场景集；基线 = 纯 ADE/FDE、Measuring What Matters 二维方案、NAVSIM 官方协议。
- **评测指标**：主指标 = 三维评分与闭环驾驶性能的相关性（Spearman ρ）；消融 = 场景关键度分层、不确定性权重、选型协议稳定性。
- **算力与训练方案**：多为评测计算，单卡跑推理+闭环模拟；总 1-2 GPU·天；无需大训练。
- **DeepSeek/Kimi API 用法**：LLM 自动生成**场景关键度描述与风险标签**，辅助分层采样；生成评估报告摘要。
- **投稿目标会议与优先级**：ITSC 2026 / IEEE T-IV，**中**（方法论性质，工程量小、易发，但创新密度中）。
- **可行性与风险**：最大风险是"相关性"结论受基准分布影响——用多数据集交叉验证 + 报告置信区间；若相关性弱，转为"不确定性消费"方法论论文。

---

## 七、综述性结论与投稿策略

### 7.1 结论

1. **感知层**已进入"稀疏化 + 规则/模态鲁棒"阶段（SPSC、HD²-SSC、BEVDilation），但占据/地图表示尚未与交通规则、规划约束打通，且多模态系统缺"传感器任意退化"的系统性保障。
2. **端到端规划**正从顺序式（UniAD/VAD 谱系）向**感知-规划耦合**（VeteranAD）、**选择式**（DriveSuprim）、**VLA**（OpenDriveVLA）和**Agentic 自校正**（CorrectAD）演化；共同短板是**缺乏闭环 RL 与长期世界模型反馈**。
3. **世界模型**已具备自车-他车可控生成能力（EOT-WM）与长期一致性方案（Fine-flow），但**尚未成为规划器的评估器/训练环境**——这是最大的空白。
4. **安全场景生成**已 LLM 化（Any2Critical、ScenGE），但普遍**缺物理一致性与闭环失效验证**，指标易刷分。
5. **评测与鲁棒性**正转向闭环（NAVSIM/Bench2Drive）与场景驱动（Measuring What Matters），测试时自适应只覆盖感知层（BN-TTA），未见"世界模型正则化的规划级 TTA"。

### 7.2 投稿策略建议

- **冲刺顶会（高优先级，建议 1-2 个并行做）**：Idea 1（潜空间安全 critic）、Idea 3（simulator-in-the-loop RL 闭环）、Idea 11（占据锚定 VQA 与规划一致微调）。三者均有"世界模型/VLA × 规划闭环"的稀缺组合，与 2026 年 WorldRFT（AAAI 2026）、CCFM（arXiv 2607.04451）热点同频，适合 NeurIPS 2026 / CVPR 2027 / CoRL 2026。
- **稳扎稳打（中高）**：Idea 2（世界模型正则 TTA）、Idea 4（规则感知占据）、Idea 5（模态无关预训练）、Idea 8（LLM 先验蒸馏）、Idea 10（物理一致场景生成）。方法明确、算力可控，适合 ICLR/ICRA/ITSC，尤其 Idea 4/5/8 工程可行性高。
- **工程/方法型（中）**：Idea 6（V2X 世界模型）、Idea 7（鱼眼占据）、Idea 9（长期蒸馏）、Idea 12（评估协议）。适合 ITSC / IEEE T-IV / workshop，实验成本低、可与上述 idea 形成系列。
- **算力分配建议**：4×L40 上并发跑"1 个大模型 idea（QLoRA 30B 或 FSDP 13B）+ 2 个轻量 idea（数据合成/评测占 2 卡）"；数据合成与 API 调用全部并行化，把 GPU·天花在刀刃上。

---

*附录：外部文献引用索引（全部经 API 检索核验）*
UniAD 2212.10156 · VAD 2303.12077 · SparseDrive 2405.19620 · Hydra-MDP 2406.06978 · DriveVLM 2402.12289 · DriveMLM 2312.09245 · DriveDreamer 2309.09777 · DriveDreamer-2 2403.06845 · GenAD 2402.11502 · MagicDrive 2310.02601 · MagicDrive-V2 2411.13807 · Vista 2405.17398 · GAIA-1 2309.17080 · OccWorld 2311.16038 · D2-World 2411.17027 · Fully Sparse Occ 2312.17118 · SparseOcc 2404.09502 · OccFormer DOI 10.1109/iccv51070.2023.00865 · TPV DOI 10.1109/cvpr52729.2023.00890 · OpenOccupancy DOI 10.1109/iccv51070.2023.01636 · RenderOcc DOI 10.1109/icra57147.2024.10611537 · Bench2Drive 2406.03877 · NAVSIM 2406.15349 · UniV2X 2404.00717 · V2X-VLM 2408.09251 · Reason2Drive 2312.03661 · OccLLaMA 2409.03272 · DiffScene DOI 10.1609/aaai.v39i8.32951 · SAFE-SIM 2401.00391 · VBD 2404.02524 · TENT 2006.10726 · OpenDriveVLA 2503.23463 · CorrectAD 2511.13297 · WorldRFT DOI 10.1609/aaai.v40i14.38149 · Data Scaling Laws 2504.04338 · DriveE2E 2509.23922 · CogAD 2505.21581 · FocalAD 2506.11419 · From Words to Collisions 2502.02145 · AuthSim 2502.21100 · CCFM 2607.04451 · LiDAR E2E V-I 2411.14927 · LanguageMPC 2311.10813 · Modularization-free E2E 2406.17680 · Bench2Drive-VL 2604.01259 · E2E AD Challenges 2306.16927 · Fisheye survey DOI 10.1109/tits.2023.3235057 · Lake Trout / 其余噪声命中未引用
