# AAAI 2026 收藏论文 · 主题调研与研究规划总索引

> 基于 `AAAI2026_收藏论文.md`（210 篇）的深度调研成果。
> 生成方式：13 个主题并行子智能体调研 → 主智能体质检汇总。
> 产出：13 份主题调研报告，每份含「主题概览 / 收藏论文分组梳理 / 代表论文精读 / 全部论文创新点-不足速查表 / 外部前沿文献综述（引用均核验 arXiv/DOI）/ 12-13 个完整可执行研究 idea / 投稿策略」。
> **环境约束**：4×L40（192GB）+ DeepSeek V4 Flash/Pro、Kimi K2.6 API。所有 idea 的实验方案均按此条件设计（模型规模、并行方式、GPU·天预算、API 用法）。

---

## 一、目录与文件结构

```
_调研工作/
├── 00_README_研究规划.md          ← 本文件
├── 00_主题分类总览.md              ← 210 篇论文的完整主题归属清单
├── T01_自动驾驶感知与端到端驾驶/    论文清单.md + 调研报告.md
├── T02_视频理解与视频多模态大模型/
├── T03_图像多模态大模型与基础视觉/
├── T04_3D视觉与空间智能/
├── T05_大模型高效训练与推理/
├── T06_LLM智能体与多智能体协作/
├── T07A_LLM安全（一）攻击越狱后门隐私/
├── T07B_LLM安全（二）防御对齐与可信评估/
├── T08_检索增强RAG与知识管理/
├── T09_医疗AI与AI for Science/
├── T10_认知心理教育与人机交互/
├── T11_金融AI与决策/
└── T12_强化学习与机器人/
```

引用格式说明：论文编号在每个 Session 内重新计数，引用一律带 Session 前缀，如 `（Computer Vision IV · 论文 38 · 英文标题）`。

---

## 二、13 个主题与 Idea 总览（共 157 个 idea）

### T01 自动驾驶感知与端到端驾驶（23 篇）→ [调研报告](T01_自动驾驶感知与端到端驾驶/调研报告.md)
主要空白：世界模型只做生成未成评测器；TTA 不到规划层；端到端自校正无闭环 RL；占据与交通规则割裂；缺传感器退化鲁棒；场景生成可刷分无物理校验。
- Idea1 轨迹条件安全评分潜空间世界模型（高）
- Idea2 世界模型正则化的测试时自适应规划
- Idea3 仿真器在环端到端自校正 RL 闭环（高）
- Idea4 规则感知稀疏占据预测
- Idea5 模态无关掩码占据预训练（传感器退化鲁棒）
- Idea6 V2X 协同潜空间世界模型
- Idea7 鱼眼球面占据合成到真实跨域
- Idea8 LLM 推理先验蒸馏轻量换道预测
- Idea9 长期世界模型视界自适应一致性蒸馏
- Idea10 物理一致安全场景生成+闭环失效验证
- Idea11 占据锚定驾驶 VQA 与规划一致性微调（高）
- Idea12 不确定性感知预测器评估与闭环选型

### T02 视频理解与视频多模态大模型（9 篇）→ [调研报告](T02_视频理解与视频多模态大模型/调研报告.md)
主要空白：跨视频证据整合无方法；视频时间推理缺"证据接地+可验证奖励"训练；极端领域只测不训；APVR 类检索是手工启发式。
- Idea1 证据接地视频 LLM 时间 RLVR（高）
- Idea2 跨视频证据路由与聚合网络 CVRA（高）
- Idea3 可学习自适应关键检索 LAPR（把 APVR 启发式变 RL 策略）
- Idea4 视频原生自监督 RLVR（状态转移验证奖励）
- Idea5 跨视频功能步对齐网络 FSA-Net（高）
- Idea6 视障辅助"缺失-画质"判别与空间推理校准
- Idea7 EgoCross 域自适应双 LoRA + GRPO（高）
- Idea8 时间感知零样本视频时刻检索
- Idea9 查询条件极端 token 压缩+位置偏置校正
- Idea10 时间接地多视频 QA 基准与合成-验证流水线
- Idea11 水下/极端环境视频持续域自适应
- Idea12 证据充分性驱动自适应推理预算

### T03 图像多模态大模型与基础视觉（23 篇）→ [调研报告](T03_图像多模态大模型与基础视觉/调研报告.md)
主要空白：评测与训练脱节；幻觉缓解停对象级缺属性/关系粒度；复杂编辑缺子任务一致性图；计数未统一"尺度+文本+属性"；偏好模型黑盒不可解释。
- Idea1 属性-关系级幻觉三元组偏好优化（高）
- Idea2 分辨率自适应视觉 token 预算训练
- Idea3 EditGraph 复杂指令编辑规划（高）
- Idea4 文本+稀疏框渐进查询开放世界计数
- Idea5 MLLM 化属性-位置解耦参考表达计数
- Idea6 意图感知难负样本+重排的 CIR
- Idea7 后处理鲁棒+跨生成器扩散伪造检测
- Idea8 身份/风格记忆库+轻量 Adapter 一致文生图
- Idea9 遥感 OVS 双语知识蒸馏+旋转等变预训练
- Idea10 预算感知层次化图像集合摘要
- Idea11 MME-SCI 驱动闭环课程式 RL 科学推理（高）
- Idea12 属性轴可解释 T2I 偏好模型（高）

### T04 3D视觉与空间智能（5 篇）→ [调研报告](T04_3D视觉与空间智能/调研报告.md)
主要空白：单图头像强依赖私有数据+逐主体优化；跨视角定位无交互闭环；空间推理只测不训；平面图缺约束验证；4D 点云 TTA 未用时序信息。
- Idea1 TVAvatar 文本驱动身份保持单图 3D 头像（高）
- Idea2 单图头像少样本测试时个性化
- Idea3 人脸先验注入通用 image-to-3D（高）
- Idea4 A2Geo 语言 Agent 跨视角定位闭环（高）
- Idea5 跨季节/传感器定位基础模型预训练
- Idea6 SpaceRL 合成渲染+RL 训练 3D 空间推理（高）
- Idea7 场景图级空间推理基准+一致性诊断
- Idea8 约束验证闭环 LLM+扩散平面图生成（高）
- Idea9 文本→平面图→3D 一致级联生成
- Idea10 FlowTTA 场景流一致 4D 点云主动 TTA（高）
- Idea11 开放词汇 4D 分割测试时适配
- Idea12 野外 3DGS 渲染测试时自适应

### T05 大模型高效训练与推理（28 篇）→ [调研报告](T05_大模型高效训练与推理/调研报告.md)
主要空白：CoT 压缩/KV 压缩/测试时计算三链路脱节；多 LoRA 组合冲突无解；MoE 压缩缺"冗余分析→子空间合并→蒸馏恢复"闭环；KV 压缩多手工启发式。
- Idea1 DR-LoRA 难度自适应动态秩 LoRA+遗忘补偿（高）
- Idea2 COMET 可组合子空间正交 LoRA 专家
- Idea3 MEKD 微专家均衡 MoE→MoE 蒸馏（高）
- Idea4 CASS 容量感知软槽动态稀疏路由
- Idea5 LAPER 学习型注意力画像感知 KV 压缩（高）
- Idea6 RKA 推理-缓存耦合 KV 释放管理
- Idea7 TBC 通用思考预算控制器（高）
- Idea8 ECO-Zoo 异构模型库成本最优测试时路由（高）
- Idea9 SOAD 状态自适应在线蒸馏
- Idea10 ABAT 极省 API 黑盒调优
- Idea11 D³-Curator 难度×多样性×质量联合数据策展（高）
- Idea12 LCM-R 潜码本压缩+蒸馏恢复

### T06 LLM智能体与多智能体协作（20 篇）→ [调研报告](T06_LLM智能体与多智能体协作/调研报告.md)
主要空白：验证/奖励信号稀缺；静态工具图/静态基准/静态人格缺在线适应；记忆无纠错且会传播偏见；工具/安全/公平缺位。
- Idea1 GUI 智能体跨会话主动感知记忆（高）
- Idea2 工具验证反事实多智能体事实性裁决（高）
- Idea3 在线自适应+安全感知工具图路由（高）
- Idea4 记忆级角色偏见缓解+基准
- Idea5 差分隐私异构联邦工作流合成
- Idea6 认知负载自适应 CoT 合成与蒸馏（高）
- Idea7 技能基元去中心化 MARL 上下文协调
- Idea8 不确定度引导课程式 RLVR（高）
- Idea9 非平稳环境 agent 适应能力基准（高）
- Idea10 成对查询蒸馏可训练代码选择器
- Idea11 GNN 性能预测器加速工作流合成
- Idea12 安全感知企业工具生成与沙箱闭环

### T07A LLM安全（一）：攻击/越狱/后门/隐私（18 篇）→ [调研报告](T07A_LLM安全（一）攻击越狱后门隐私/调研报告.md)
主要空白：攻击多停 ≤8B 静态单模型；生命周期（RLHF/LoRA）、跨模型迁移、RAG/MCP 生态三大留白；符号通道无自动化基准；多模态 RAG 隐私未推向重构攻击。
- Idea1 跨模型可迁移多目标混合后门
- Idea2 生命周期持久后门（DPO/RLHF/LoRA-Hosted）
- Idea3 符号通道（Emoji/Unicode）越狱自动化基准与对齐
- Idea4 白盒越狱"机制库"跨模型子空间分析
- Idea5 跨语言 macaronic T2I 越狱+概念去除鲁棒评测
- Idea6 MCP 工具投毒隐蔽触发+延迟激活与供应链信任
- Idea7 多智能体软件"时序炸弹后门"与关键节点防御
- Idea8 多模态 RAG 训练数据重构攻击与重构度评估
- Idea9 黑盒知识窃取提取质量审计与 API 防护
- Idea10 FL 药丸投毒攻防博弈与细粒度防御
- Idea11 解码行为指纹黑盒成员推理
- Idea12 事实核查投毒跨系统迁移与理由侧信道

### T07B LLM安全（二）：防御/对齐/可信评估（26 篇）→ [调研报告](T07B_LLM安全（二）防御对齐与可信评估/调研报告.md)
主要空白：推理模型 CoT 阶段是防御真空；水印/后门/评测缺对抗鲁棒评估；安全评测自身不可信（评审偏见+测试集污染）；机制发现未转成可部署防御。
- Idea1 推理模型 CoT 阶段激活级安全干预（高）
- Idea2 SAE 拒绝特征因果最小干预防御（高）
- Idea3 多比特水印对抗鲁棒基准+容错解码
- Idea4 后门检测自适应对手与双重防御
- Idea5 诚实-拒绝-校准三目标参数高效修复
- Idea6 谄媚激活级在线纠偏
- Idea7 污染免疫安全动态基准（高）
- Idea8 评审者作者身份表示级去识别
- Idea9 推理模型数据高效安全 RL+奖励黑客分析（高）
- Idea10 安全神经元感知混合精度量化保护
- Idea11 提示词脱敏隐私基准与鲁棒脱敏器
- Idea12 无偏统一安全评测协议

### T08 检索增强RAG与知识管理（11 篇）→ [调研报告](T08_检索增强RAG与知识管理/调研报告.md)
主要空白："检索到≠用上"缺归因指标；知识编辑与 RAG 架构割裂，KV/图索引级"可编辑记忆"是处女地；图 RAG 索引静态；RALM 拒绝缺证据充分性建模。
- Idea1 检索贡献归因诊断框架 AttribBench
- Idea2 查询感知动态 token 重要性多向量检索（QIA-Late）
- Idea3 KV 级可编辑长上下文记忆 KV-Edit（高）
- Idea4 图 RAG 增量更新与图级知识编辑 GraphDelta（高）
- Idea5 检索感知 RAG 语料自动精炼（高）
- Idea6 区域级视觉文档 RAG 评测
- Idea7 证据充分性门控 RALM 拒绝与校准（高）
- Idea8 多跳编辑图记忆 GraphMemKE
- Idea9 查询自适应粗→精压缩检索
- Idea10 检索增强 LLM 优化求解器选择
- Idea11 学习型基数估计多表遗忘评测
- Idea12 自演化检索摘要索引

### T09 医疗AI与AI for Science（11 篇）→ [调研报告](T09_医疗AI与AI for Science/调研报告.md)
主要空白：评测塌缩（BLEU 与临床质量脱钩）；"看见≠说对"幻觉源于语言先验；3D CT VLM token 冗余；时序/纵向推理缺三合一；多智能体无仲裁无证据链；PRO 语料空白。
- Idea1 LongiCXR 纵向胸片时序感知报告生成（高）
- Idea2 3D CT VLM 体素 token 压缩+区域对齐（高）
- Idea3 区域自适应即插即用幻觉抑制
- Idea4 临床语义扰动鲁棒基准
- Idea5 肺结节多智能体记忆进化+评测协议
- Idea6 证据可追溯药物发现 RAG（高）
- Idea7 PRO 语义化基准+主动随访智能体
- Idea8 医学知识图谱引导可解释推理
- Idea9 AI for Science 假设-验证-发现闭环
- Idea10 3D 医学空间定位评测探针
- Idea11 放射报告临床相关性评测套件
- Idea12 LLM 医学影像-报告合成数据增强

### T10 认知、心理、教育与人机交互（22 篇）→ [调研报告](T10_认知心理教育与人机交互/调研报告.md)
主要空白：心理评估"LLM 评 LLM"循环、单会话无金标准；教育诊断直觉文本与概率知识追踪两范式不融合；认知基准缺 IRT 校准；儿童评测只诊断不改进；文化冲突只评测不去偏。
- Idea1 纵向多会话治疗联盟竞技场（高）
- Idea2 IRT 心理测量学校准统一认知基准（高）
- Idea3 探测引导类比推理隐藏表示修补
- Idea4 跨语言时间认知 Weber-Fechner 一致性
- Idea5 皮亚杰课程式儿童 MLLM 训练
- Idea6 文本诊断×深度知识追踪混合学习诊断（高）
- Idea7 咨询策略树+树搜索生成与自纠错（高）
- Idea8 来访者模拟保真度评测框架
- Idea9 文化冲突决策去偏与价值观校准（高）
- Idea10 面向教师可验证诊断报告生成（高）
- Idea11 多会话咨询记忆-遗忘建模
- Idea12 心理咨询 LLM 安全红队与护栏对齐（高）

### T11 金融AI与决策（5 篇）→ [调研报告](T11_金融AI与决策/调研报告.md)
主要空白：前视偏差是公理问题；金融 TSFM 被欧美价格垄断缺 A 股制度感知与"新闻×K线"多模态；研报 11 指标只评文本缺数值可溯源；智能体缺防泄漏回测。
- Idea1 点即时刻污染审计与时间理解基准（高）
- Idea2 ChronoRL 时序推理预算分配
- Idea3 FinAlign 术语收益转译端到端对比微调
- Idea4 Kronos-CN 面向 A 股/港股的 K 线基础模型（高）
- Idea5 防前视新闻事件×K线多模态预测（高）
- Idea6 QuantCoder 防前视静态检查+回测审计量化平台
- Idea7 FinRpt-Ground 事实锚定研报生成
- Idea8 市场仿真驱动的投资智能体行为评测
- Idea9 金融数字/表格幻觉检测与可溯源验证器
- Idea10 合规/风控可解释对话智能体
- Idea11 时间线一致自监督时序数据增强
- Idea12 以回测收益-风险+事实性为奖励的智能体对齐
- Idea13 中英金融术语对齐与跨语言合规检索

### T12 强化学习与机器人（9 篇）→ [调研报告](T12_强化学习与机器人/调研报告.md)
主要空白：MoE 抗遗忘结构与 RLVR 后训练未结合；LLM 决策 agent 不可学不可验证缺过程奖励；LCDSP 风格参数全手工；JRDB-Reasoning/IndoorUAV 只测不训；bandits×LLM 未落地具身。
- Idea1 SkillForge-RLVR 扩散 VLA 的 MoE+GRPO 后训练（高）
- Idea2 室内 UAV VLN 的 LLM-judge 过程奖励 RL（高）
- Idea3 StyleGrow LLM 自动发现风格参数+跨域迁移
- Idea4 UAV 搜索可学习探索-利用+LLM 语义先验
- Idea5 多目标 RL+LLM 偏好对齐
- Idea6 长时序操作技能上下文赌博机路由
- Idea7 JRDB-Reasoning 图可验证奖励强化微调（高）
- Idea8 LLM 环境设计师缩小人机目标分歧
- Idea9 VLA/VLN 失败感知恢复
- Idea10 跨形态 VLA 技能库+bandit 路由器
- Idea11 难度分级指令合成+RLVR 数据课程
- Idea12 足球 LLM 子目标协调+风格控制

---

## 三、跨主题协同机会（重点推荐）

1. **"可验证奖励强化（RLVR/GRPO）"主线**（贯穿 T01/T02/T05/T06/T07B/T09/T12）
   多主题 idea 都指向同一技术缺口：验证信号稀缺、过程奖励不足。若以"构建通用可验证奖励引擎 + 复用于 N 个领域"为主线，可形成系列投稿（NeurIPS 2026 → CVPR/ICML 2027 三连）。

2. **"合成数据 × LLM-as-judge"基础设施**（T05/T08/T09/T10/T11）
   你手里的 DeepSeek V4 + Kimi K2.6 正好支撑合成数据与评测闭环。T05 Idea11、T09 Idea12、T11 Idea4、T10 Idea2 可打包成一套"数据策展 + 评测协议"方法论论文。

3. **推理模型（DeepSeek V4 系）作为研究对象与工具**
   - 作为对象：T07B（CoT 阶段防御）、T05（思考预算/CoT 压缩）、T10（推理链提取）。
   - 作为工具：T02/T09/T10 用它合成 CoT 数据做蒸馏 teacher。
   围绕"推理模型的效率×安全×可信"三视角可各出一篇。

4. **多模态感知 × LLM 决策的闭环**（T01/T02/T06/T12）
   自动驾驶、视频理解、GUI agent、机器人共享同一范式：感知→推理→行动→验证。T01 Idea3、T06 Idea8、T12 Idea1/2 可共用一个强化框架代码库，边际成本低。

5. **"只测不训"基准升维为"评测+训练闭环"**（T02/T03/T10/T12）
   多个收藏基准（CrossVid/MME-SCI/JRDB-Reasoning/ChildBench/PFP）都只做评测，把"基准驱动课程式训练"做成方法论有清晰差异点。

---

## 四、硬件/API 使用指南（贯穿所有报告）

- **4×L40（192GB）能力边界**：全参微调 ≤7-13B（FSDP）；LoRA/QLoRA 可调 30B-70B；可常驻 1-2 卡推理大模型（INT4 70B ≈ 40GB）配合其余卡训练。
- **DeepSeek V4 Flash**：高性价比合成数据/蒸馏/批处理（多数报告默认用它）。
- **DeepSeek V4 Pro**：高质量 CoT、复杂推理 teacher、难样本补造。
- **Kimi K2.6**：长上下文合成、多智能体模拟、报告/文章生成。
- **Kimi K3**：不稳定，仅作交叉验证备用。
- 每个 idea 的「算力与训练方案」「API 用法」字段已给出具体到 GPU·天 的预算。

---

## 五、使用建议

1. 先读 `00_主题分类总览.md` 确认你关心的论文归属。
2. 选 2-3 个高优先 idea（报告里已标注），先做小规模可行性实验（零训练基准类 idea 最快）。
3. 单份报告尾部有该主题的「投稿策略」建议。
4. 如需，我可以基于你选中的 idea 进一步展开为详细实验设计书（数据细节、基线复现步骤、时间线）。
