# T12 强化学习与机器人 调研报告

> 主题：视觉语言导航（VLN，UAV/室内）、VLA 具身操作、无人机目标搜索、人机目标对齐、多臂赌博机与 LLM、语言控制 RL、多目标搜索、可视化规划工具。
> 收藏论文数：9 篇。本报告由文献调研智能体 T12 完成。
> 数据获取说明：代表性论文全文来自 AAAI OJS 开放获取 PDF 与 arXiv 官方页；外部文献均经 arXiv / Crossref / Semantic Scholar 接口核验，标注真实 ID；未核验者不写入。

---

## 一、主题概览与研究热点

本主题的 9 篇 AAAI 2026 收藏论文横跨"决策智能"的三个支点：**感知-语言-行动的具身闭环**（VLA、VLN、UAV 目标搜索）、**语言与强化学习的接口**（language-conditioned RL、bandits+LLM）、以及**决策过程的评测与可视化基建**（视觉推理基准、多目标搜索综述、规划可视化工具）。

综合 9 篇论文与 2023–2026 外部前沿文献，本主题 2026 年的热点可归纳为五条主线：

1. **VLA 从"行为克隆"走向"RL 后训练"**：DiTEA（MoE 抗技能遗忘）与 π0 / GR00T N1 / OpenVLA 等基础模型证明"预训练+微调"已是主流，但 2025–2026 最活跃的新趋势是用**可验证奖励 RL（RLVR/GRPO）**做 VLA 后训练（Z-1、VLA-R1、SmoothVLA、TacCoRL 等），以解决演示数据上限与指令跟随缺陷。DiTEA 的 MoE 门控与 RLVR 的奖励优化天然互补，是当前最大的空白机会点之一。
2. **无人机与空中 VLN 从"室外稀疏"转向"室内稠密 3D"**：CityAVOS 定义城市 UAV 目标搜索、IndoorUAV 定义室内 4-DoF 连续 VLN，两者都把"MLLM 高层推理 + 低层连续控制 + 探索-利用平衡"作为核心矛盾，且均显式报告与人类表现仍有巨大差距（CityAVOS SR 53.5% vs 人类 78.7%；IndoorUAV VLN SR 仅 7.3%）。**基准已就绪、方法远未饱和**，是快速出成果的方向。
3. **语言控制 RL 从"指令-状态直接映射"走向"抽象指令-风格-策略解耦"**：LCDSP 用"风格参数 SP"把抽象战术指令翻译为行为风格，绕开为抽象指令设计奖励的难题；配套的外部工作（LLM-MARL、MAPL、Eurekaverse）都在探索"LLM 做高层语义 + RL 做底层执行"的分工。
4. **Bandits 与 LLM 双向融合进入工程化阶段**：Bouneffouf & Feraud 的综述论文 77 与多篇 2026 新作（LLMP-UCB、多目标 prompt bandit、LLM 贪心代理研究）共同表明，"用 bandit 管理 LLM 的探索-利用"以及"用 LLM 提供 bandit 的上下文先验"已从理论走向可部署，但**在机器人/具身场景中的落地仍然罕见**。
5. **决策质量的评测与对齐基建升温**：JRDB-Reasoning 把视觉推理复杂度形式化为 (实体, 关系, 时间) 三元组；GSD 论文 43 把"人类预期 vs 机器人实际达成状态"差异化为可优化的目标；多目标搜索综述论文 22 与 PANSim 演示（论文 254）则从理论框架与可视化两个侧面补齐决策研究的"测量学"。

**总体判断**：本主题最大的共性空白是——**高层语义（语言/风格/多目标/人类预期）如何以可验证、可优化、可测度的方式注入低层决策，而现有的注入手段要么靠人工设计奖励（脆弱）、要么靠 LLM 提示词（昂贵、不可微、不可学）**。下面的 12 个 Idea 均围绕这一空白展开。

---

## 二、收藏论文分类梳理（按子方向分组）

### 组 A：VLA 具身操作
- **（Intelligent Robotics · 论文 30 · DiTEA: Mixture-of-Experts for Vision-Language-Action Model in Robotic Manipulation）**：扩散 VLA + Action MoE + 任务指令门控，缓解多任务微调时的指令跟随差与"技能遗忘"。仿真（SIMPLER/WidowX）与真机（Franka）均验证优于 CogACT/OpenVLA。

### 组 B：视觉语言导航（VLN / UAV）
- **（Machine Learning V · 论文 82 · IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments）**：首个室内连续环境 UAV VLN 基准（1075 场景、5 万条 4-DoF 轨迹、VLN/VLA 双子集），并给出"GPT-4o 指令分解 + π0 VLA 执行"的 IndoorUAV-Agent。所有方法在 VLN 上 SR 不足 10%，凸显任务难度与空白。
- **（Intelligent Robotics · 论文 26 · Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology）**：首个城市空间 UAV 视觉目标搜索基准 CityAVOS（2420 任务、6 类目标）+ PRPSearcher（三地图 + 去噪 + IPT 提示，GPT-4o 驱动），SR 53.5%，距人类 78.7% 仍有差距。

### 组 C：语言控制 RL 与多智能体决策
- **（Machine Learning VII · 论文 79 · Complex Instruction Following with Diverse Style Policies in Football Games）**：LCDSP——用 DST（风格参数 + PSS 采样）训练单一多风格策略，用 SI（Qwen2.5-0.5B 微调）把抽象战术指令译为 SP，在 GRF 5v5 中实现 Tiki-Taka/反击/摆大巴等风格化执行。

### 组 D：人机对齐与多目标决策理论
- **（Humans and AI · 论文 43 · Reducing Goal State Divergence with Environment Design）**：定义目标状态分歧 GSD 指标，提出 HRGAD 问题——找最小环境修改集合以缩小"人类预期状态"与"机器人实际状态"的偏差，在规划基准上验证。
- **（AAAI Emerging Trends in AI · 论文 22 · Multi-Objective Search: Algorithms, Applications, and Emerging Directions）**：多目标搜索（MOS）综述，梳理算法、跨学科应用与开放前沿。
- **（AAAI Emerging Trends in AI · 论文 254 · PANSim: Visualization Tool for Planning and Acting against Nature）**：面向"自然行为"可改环境下的规划智能体可视化调试演示工具。

### 组 E：Bandits 与 LLM / 视觉推理评测
- **（Special Track on AI for Social Impact II · 论文 77 · Multi-Armed Bandits Meet Large Language Models）**：bandit×LLM 综述（其 arXiv 版为 2505.13355），梳理双向增强路径与开放挑战。
- **（Computer Vision IV · 论文 31 · JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics）**：把推理复杂度形式化为 D=S+R+T，自适应查询引擎生成难度可控、带逐步中间标注的问题，扩展 JRDB（HOI + 几何关系标注），评测显示 VLM 随难度 D 增大显著退化、距人类差距大。

---

## 三、代表性论文精读（5 篇，含创新点/不足/心得）

> 精读对象按子方向各选代表：VLA（DiTEA）、室内 UAV VLN（IndoorUAV）、无人机搜索（CityAVOS/PRPSearcher）、语言控制 RL（LCDSP）、具身视觉推理评测（JRDB-Reasoning）。均基于全文阅读。

### 3.1 DiTEA（Intelligent Robotics · 论文 30）
- **核心方案**（据全文）：以 CogACT 风格扩散 VLA 为基础（DINOv2+SigLIP 视觉、LLaMA2-7B 语言、DiT 动作头）。三处结构创新：①Action MoE——把 DiT 的 MLP 换成 MoE 层（每专家为同构 MLP + 一个总是激活的共享专家），隔离多任务权重冲突；②Task-Instruction Gate——用"指令提示 token"而非特征 token 做门控输入，软最大化选出最相关专家，提升指令跟随；③针对动作 token 序列的负载均衡损失（对原公式按动作序列长度做归一化改进）。训练：BridgeV2 微调约 2 万步、8×A100、FSDP；真机先 DROID 全参预训练再冻结 VLM 只训 DiT，lr=2e-5。
- **结果**：SIMPLER WidowX 平均 SR 40.8%（CogACT 35.2%、OpenVLA 1.0%）；Franka 真机 8 任务平均 40.2%（CogACT 34.0%）；消融显示 TIG+共享专家+负载均衡 三件套从 40.2% 提升至 51.5%。指令跟随实验中，**在复杂/干扰指令上仍弱于自回归 OpenVLA**。
- **不足与空白**：①只评估了 4+8 个任务，任务数有限；②作者自认计算开销大，缺乏大规模预训练与零样本适应；③门控由指令 token 单点决定，缺乏对"任务难度/历史上下文"的感知；④指令跟随指标非统一基准，自建评分协议，可比性弱；⑤未结合 RL 后训练（这正是 2025-2026 的最热方向）。
- **心得**：DiTEA 证明"MoE 抗遗忘"与"指令门控"有效，但它是**纯行为克隆的 MoE**；把 DiTEA 的 Action MoE 与 GRPO/RLVR 后训练结合（奖励显式惩罚技能遗忘、奖励指令跟随），是 Idea 1 的直接来源。

### 3.2 IndoorUAV（Machine Learning V · 论文 82）
- **核心方案**（据全文）：从 MP3D/Gibson/HM3D/Replica 精选 1075 个 Habitat 场景，移除 navmesh 后用 4-DoF 动作空间（前/垂移/横移/偏航，含 small/large 双尺度）手动遥测采集轨迹，反转+重组合做增强；GPT-4o 关键帧描述→指令生成流水线产出 50965 条轨迹（VLN 16040 条长时序 + VLA 34925 条 1-3 动作短时序），并按轨迹长度/动作类型分难易三级。IndoorUAV-Agent = GPT-4o 指令分解 + π0 为基础微调的 VLA 顺序执行，跨子任务用上一子任务的末帧做视觉连续。
- **结果**：VLA 全集 SR 仅 27.16%（微调 π0，easy 46.6%），VLN 全模型 SR ≤ 7.3%（Ours 7.29%/5.06%，NDTW 17.2/15.7）；NaVid 高频"不停"失败；Seq2Seq/CMA 几乎失效。**方法远未解决该任务**。
- **不足与空白**：①手动采集轨迹昂贵、不可规模化；②指令为 GPT 生成，与真实用户口语分布存在漂移；③VLA 子集动作粒度与真实无人机底层控制（如电机速率、PWM）不匹配，存在 sim-to-real 鸿沟；④任务分解错误会线性累积（论文亦报告失败例为"卡在某指令上不停执行"）；⑤没有探索"过程奖励 + RL"来纠正分解误差。
- **心得**：IndoorUAV 是一个"高难度、未饱和"的基准，任何提升（过程奖励 RL、指令级纠错、故障检测）都容易形成显著增益。Idea 2、Idea 9 直接建于此。

### 3.3 CityAVOS / PRPSearcher（Intelligent Robotics · 论文 26）
- **核心方案**（据全文）：EmbodiedCity（UE5.3）+ AirSim 上构建 2420 个 AVOS 任务（6 类静态城市目标、易/难两级）。PRPSearcher 分三阶段：感知（MLLM 按任务提取相关语义→Ground-SAM 分割→3D 投影构建以目标为中心的动态语义地图）；推理（MLLM 对语义类别打"吸引力值"构建 3D 认知地图，用镜像地图+去噪剔除已识别非目标干扰）；规划（3D 不确定性地图衰减公式 + DBSCAN 聚合高吸引区 + IPT 提示在探索/利用建议间切换，θT 阈值控制探索提示注入频率）。主模型 GPT-4o。
- **结果**：SR 53.50%、SPL 40.57%（总任务），比最优基线平均 +37.69% SR；人类 78.68% SR；消融显示"仅探索""仅利用"分别掉到 10.4%/49.2%，IP θT 对探索频率高度敏感。
- **不足与空白**：①高度依赖 GPT-4o 的推理与语义质量，**API 成本导致只评测了 25% 任务**；②"吸引力值/去噪/IPT"都是硬编码提示词与规则，不可学习、不可微、跨域难迁移；③稀疏语义场景（如"墙边黑车"）失败率高，探索效率低于人类；④无任何 RL/学习组件，无法随数据自我改进；⑤难以处理时间变化目标（动态物体）。
- **心得**：PRPSearcher 是"LLM 启发式 agent"的典型样本——强但贵、不可学。把它变成"**LLM 语义先验 + 可学习的小策略（RL/bandit）**"的混合体是 Idea 4 的核心；这也与论文 77 的 bandit 主题形成天然连接。

### 3.4 LCDSP（Machine Learning VII · 论文 79）
- **核心方案**（据全文）：GRF 5v5（3K 步稀疏奖励，10 种行为/10 个 SP，Float+Bool 两类）。DST：用 SP 调制每行为的 reward shaping，策略输入 (s, ω)；Prioritized Style Sampling (PSS) 按"条件熵下降量"优先采样能产生区分性行为的 SP 组合，用 SEU/SMUL/SELO 衡量训练效率。SI：Qwen2.5-0.5B 冻结 + Adaptive Style-adjustment Block (ASaB)，把"行为描述"表征作为每维自适应缩放 (γ,β)，指令→SP 多头回归；对比 Hill/BERT、BC-Z、TALAR，MAE 0.671 最优；指令评测集 8.6K 条（6 战术×1.4K，GPT/Claude/Llama 对齐做基线）。
- **结果**：六种战术（积极进攻、全力进攻、均衡、反击、摆大巴、Tiki-Taka）在比赛指标（进球/控球/传球/间距/胜率）上呈现明显且与战术一致的分化；PSS 显著提升训练效率（SEU 1.81→3.50）。
- **不足与空白**：①SP 与 reward shaping **完全人工设计**，换环境要重做；②SI 依赖合成指令训练，对真实用户口语（含多义、否定、条件）鲁棒性未知；③指令→SP 是回归映射，无法表达"先防守再反击"这种时序组合；④评估用游戏内统计量而非"指令完成度"，无统一成功判据；⑤多智能体协作只隐式存在于 reward shaping，没有显式协调机制。
- **心得**：LCDSP 的"风格参数解耦"思想极佳，但手工 SP 是瓶颈。**用 LLM 自动发现/生成 SP 与 reward shaping（如 MAPL 的 LLM 偏好、Eurekaverse 的 LLM 环境生成），再跨域验证风格迁移**，构成 Idea 3、Idea 12。

### 3.5 JRDB-Reasoning（Computer Vision IV · 论文 31）
- **核心方案**（据全文）：复杂度形式化 D=S+R+T（实体数、空间关系边数、时间槽数），用户实验（20 人×500 题）验证与主观难度强相关；自适应查询引擎按用户偏好（VG/VQA、image/video、subject、spatial/temporal scope）在时空图上组合搜索，生成"非预设"组合问题并附带逐步中间注解（workflow）；在 JRDB 上新增 HOI 手工标注（4 大类：姿态/观察/物理/操纵）与几何关系（16 方向 + 5 档距离，KD-tree 点云近邻）。
- **结果**：VG mIoU 与 VQA 精度随 D1→D3 单调下降（如 Florence-V2 mIoU 37.6→25.2；VQA InternVL2.5 49.9→44.6），逐步评测显示模型在 step1-3 尚可、后续组合步骤崩坏；人类 VG 95.5/87.6/86.6，模型仅 30-50%。
- **不足与空白**：①评测仅到 D3、T=1（单时间槽），时间推理能力未被真正检验；②模型多为零样本直接测，无"在此基准上训练/RL"的玩法；③workflow 中间注解只用于评测，**未被用于训练（process reward）**——这是明显的未开采金矿；④HOI 只覆盖静止帧级交互，缺连续动作级关系。
- **心得**：JRDB-Reasoning 的"难度形式化 + workflow 注解"天然适配 RLVR 的训练范式（可验证的过程奖励），Idea 7 将其作为训练场；其难度分级思想也用于 Idea 11 的数据课程。

---

## 四、全部收藏论文创新点与不足速查表

| # | 论文（Session·N） | 核心创新点 | 不足/空白/可改进 |
|---|---|---|---|
| 1 | Computer Vision IV · 31 JRDB-Reasoning | 推理复杂度 D=S+R+T 形式化；自适应查询引擎生成难度可控+带逐步注解问题；JRDB 新增 HOI/几何标注 | 只测到 D3、T=1；无在此基准上的训练/RL 玩法；workflow 注解未用于训练；HOI 缺动作级 |
| 2 | Humans and AI · 43 Goal State Divergence | 提出 GSD 指标（可达状态 vs 人类预期状态），近似边界推导；HRGAD 环境设计问题求最小修改集 | 修改为规划级抽象，缺真机可执行性；假设人类预期可形式化；未见与 LLM 协作 |
| 3 | Intelligent Robotics · 26 CityAVOS/PRPSearcher | 首个城市 UAV 视觉目标搜索基准；三地图 + 去噪 + IPT 探索-利用平衡的 MLLM agent | GPT-4o 昂贵只评 25% 任务；提示词/规则不可学；稀疏语义失败率高；无 RL 组件；缺动态目标 |
| 4 | Intelligent Robotics · 30 DiTEA | 扩散 VLA + Action MoE + 任务指令门控，抗技能遗忘、提指令跟随 | 纯行为克隆；复杂指令仍弱于自回归；任务/场景少；无大规模预训练与 RL 后训练；计算开销大 |
| 5 | Machine Learning V · 82 IndoorUAV | 首个室内 UAV 4-DoF 连续 VLN 基准（VLN/VLA 双子集）；GPT-4o 分解+π0 VLA 的基线 agent | VLN SR<10% 远未解决；手动采集贵；GPT 指令分布漂移；分解误差累积无纠错；无过程奖励 RL |
| 6 | Special Track on AI for Social Impact II · 77 Bandits Meet LLMs | bandit×LLM 双向融合综述（LLM 微调/提示/响应生成 + LLM 上下文增强 bandit） | 综述性质，未落地；未提机器人/具身场景；缺乏工程化评估 |
| 7 | AAAI Emerging Trends in AI · 22 Multi-Objective Search | MOS 统一框架综述：算法、跨学科应用与开放前沿 | 理论综述；与 LLM/学习方法的结合（如 LLM 偏好、RL 多目标）只是点到为止 |
| 8 | AAAI Emerging Trends in AI · 254 PANSim | 面向"自然行为"改环境的规划可视化/调试工具（demo） | 仅演示工具；无可度量评估；未与学习型规划器结合 |
| 9 | Machine Learning VII · 79 LCDSP | SP 解耦抽象指令与风格行为；PSS 采样提训练效率；SI 轻量指令→SP 翻译 | SP/reward 全人工设计；SI 只吃合成指令；无法表达时序组合战术；无统一指令完成判据 |

---

## 五、外部前沿文献综述（含真实引用）

> 以下文献均通过 arXiv API / Crossref / Semantic Scholar 接口核验。引用格式：标题（arXiv:xxxx 或 DOI）。

### 5.1 VLA：基础模型、MoE 与 RL 后训练
- **OpenVLA: An Open-Source Vision-Language-Action Model**（arXiv:2406.09246）：7B 开源 VLA，Llama2+DINOv2+SigLIP，970K 演示；验证 LoRA 可消费级 GPU 微调。构成 DiTEA/IndoorUAV 的通用底座。
- **π0: A Vision-Language-Action Flow Model for General Robot Control**（arXiv:2410.24164, RSS 2025）：流匹配 VLA，预训练 VLM 上接动作专家；IndoorUAV-Agent 的低层控制器即微调 π0。
- **GR00T N1: An Open Foundation Model for Generalist Humanoid Robots**（arXiv:2503.14734）：双系统（System2 VLM + System1 扩散 DiT）人形 VLA，异构数据训练。
- **RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control**（arXiv:2307.15818）：把动作 token 化并入 VLM，互联网知识迁移到控制。
- **Diffusion Policy: Visuomotor Policy Learning via Action Diffusion**（arXiv:2303.04137）：动作扩散策略的开创工作。
- **DiTEA**（DOI:10.1609/aaai.v40i22.38902，收藏论文 4）：扩散 VLA 的 Action MoE + 指令门控。
- **MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning**（arXiv:2510.18337）：MoT 快慢推理双专家，动作专家条件化于分解后的运动指令。
- **InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation**（arXiv:2507.17520）：VLA 指令微调范式 + MoE 适配，保持 VLM 推理能力。
- **FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts**（arXiv:2508.02190, ICCV 2025）：双门控 MoE + 联邦聚合。
- **MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Language-Conditioned MoE Transformers**（arXiv:2603.15265）：ACT 编码器嵌入 MoE + FiLM，双机械臂多任务。
- **ManualVLA**（arXiv:2512.02013）：MoT + 手册式 CoT 生成再执行，长时序装配。
- **AffordanceVLA**（arXiv:2606.06155）：MoT + 三阶段 affordance 中间表征。
- **RL 后训练一族**：**Z-1: Efficient RL for VLA Models**（arXiv:2606.31846，π0.5 上对 RoboCasa 24 任务做任务级 GRPO，+13.2% SR）；**VLA-R1: Enhancing Reasoning in VLA**（arXiv:2510.01623，RLVR+GRPO+可验证区域对齐/轨迹一致性奖励）；**SmoothVLA**（arXiv:2603.13925，GRPO+物理内在平滑奖励，LIBERO +13.8% 平滑度）；**TacCoRL**（arXiv:2606.11743，触觉 VLA + 仿真 RL 的可验证任务奖励）；**RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment**（arXiv:2608.01013，PPO→GRPO 零演示迁移新形态）。**结论：VLA+RLVR 是 2026 年最活跃主线，但把 MoE 门控与 RLVR 结合、并用 LLM-as-judge 做指令跟随奖励的研究仍罕见。**

### 5.2 VLN 与空中导航
- **Beyond the Nav-Graph: VLN in Continuous Environments**（arXiv:2004.02857，VLN-CE）：连续环境 VLN 开山基准。
- **GOAT: GO to Any Thing**（arXiv:2311.06430）：开放词汇目标导航 + 分层探索。
- **CityNav: A Large-Scale Dataset for Real-World Aerial Navigation**（arXiv:2406.14240, ICCV 2025）：首个真实城市空中 VLN 数据集（32637 轨迹），语义地图辅助模态。
- **FlightGPT**（arXiv:2505.12835）：UAV VLN 的 SFT+GRPO 两阶段训练，复合奖励（目标准确+推理质量+格式合规），在 CityNav 上 SOTA。
- **GeoNav**（arXiv:2504.09587, Pattern Recognition 2026）：双尺度空间认知（全局草图地图 + 局部场景图）+ 空间 CoT，CityNav 上提升 18.4% SR。
- **OpenFly**（arXiv:2502.02856 见 IndoorUAV 引用，工具链+10 万轨迹空中 VLN）、**UAV-Flow Colosseo**（arXiv:2505.15725，首个真机"飞在词上"基准）、**SkyVLN**（arXiv:2507.06564，NMPC 避障）、**AerialVLN**（arXiv:2306.04006 见引用）。**结论：空中 VLN 的"LLM 分解+底层控制"已出现，但室内稠密空间、过程奖励与错误恢复仍是空白（IndoorUAV 即空白的量化证据）。**

### 5.3 LLM 具身代理、语言条件 RL 与多智能体
- **Voyager: An Open-Ended Embodied Agent with LLMs**（arXiv:2305.16291）：LLM 自动课程 + 技能库。
- **SayTap: Language to Quadrupedal Locomotion**（arXiv:2306.07580）：语言→足式步态模式参数，与 LCDSP 的"参数化行为"思想同源。
- **LLM-MARL**（arXiv:2506.04251）：LLM 子目标/通信/记忆 + PPO 的 MARL 框架，在 GRF/MAgent/SMAC 上一致提升。
- **MAPL: Multi-Objective AI-Informed Preference Learning for Robot Locomotion**（arXiv:2606.25398）：LLM 按语义维度对轨迹两两偏好→多头偏好模型→聚合奖励，摆脱手工 reward engineering。**这是"LLM 自动替代手工 SP/reward"的关键参照。**
- **Eurekaverse: Environment Curriculum Generation via LLMs**（arXiv:2411.01775, CoRL 2024）：LLM 用代码生成环境课程（UED），真机迁移成功；是"LLM 做环境设计"的代表，与收藏论文 43（GSD/HRGAD）方向直接呼应。
- **Mitigating Goal Misgeneralization via Minimax Regret**（arXiv:2507.03068, RLC 2025）：UED/最小最大遗憾缓解目标错位，与 GSD 的"目标对齐"主题互补。
- **Regime-Conditional Stabilisation of LLM-Augmented Cooperative MARL**（arXiv:2607.04470）：LLM 生成奖励权重 + MARL 的平稳性条件分析（PBRS + EMA），提示"LLM 动态调奖励"有稳定性风险。
- **Balancing Multiple Objectives in Urban Traffic Control with RL from AI Feedback**（arXiv:2602.20728）：多目标 RLAIF，LLM 偏好标签支撑多目标策略平衡。

### 5.4 Bandits × LLM 与决策-推理 RL
- **Survey: Multi-Armed Bandits Meet Large Language Models**（arXiv:2505.13355）：收藏论文 77 的 arXiv 版。
- **A Component-Based Survey of Interactions between LLMs and Multi-Armed Bandits**（arXiv:2601.12945）：组件级综述（bandit 解决 LLM 的 RAG/个性化/预训练；LLM 重定义 bandit 的臂与环境模型）。
- **When Do We Need LLMs? A Diagnostic for Language-Driven Bandits**（arXiv:2604.05859, RLC 2026）：LLMP-UCB，证明轻量数值 bandit 常优于逐决策用 LLM，提出几何判据决定何时用 LLM。
- **Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits**（arXiv:2605.14553, ICLR 2026）：多目标 bandit 找 Pareto 提示集，可证明识别误差界。
- **LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making**（arXiv:2504.16078）：LLM 决策三缺陷（贪心/频率偏置/知行差距），RL 微调自生成 CoT 可缓解。
- **Comparing Exploration-Exploitation Strategies of LLMs and Humans**（arXiv:2505.09901）：MAB 实验中思考型 LLM 更接近人类，但非平稳环境下 directed exploration 仍弱于人类。
- **When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training**（arXiv:2509.24923）：SFT/RL 训练带出"更贪婪"策略，警告平均遗憾之外的鲁棒性评估。
- **FOCUS: Efficient Keyframe Selection via Bandits**（arXiv:2510.27280）：把长视频关键帧选择建模为 bandit 组合纯探索，与 VLN/VLA 数据压缩相关。

### 5.5 具身视觉推理评测与多目标 RL
- **3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding**（arXiv:2603.04976, ICML 2026）：首次把 RLVR 扩展到视频 3D 感知推理，GRPO+3D IoU/F1 可验证奖励。与 Idea 7 思想一致但面向 3D 场景理解而非人群环境推理。
- **ORACLE: Multi-Objective RL Analog Circuit Optimizer with LLM-guided Exploration**（arXiv:2608.04999）：向量值学习 + 偏好向量条件化 + LLM 过滤动作，多目标 RL 通用范式参照。
- **STAIF**（arXiv:2607.22649）：复杂指令遵循的两阶段——DPO 软约束 + RLVR 硬约束，与 LCDSP 的抽象指令主题相关。
- **Rethinking Agentic RL in LLMs**（arXiv:2604.27859）：LLM 智能体 RL 的概念综述（目标设定/自省/多步推理进入学习环）。
- **DeepSeek-R1**（arXiv:2501.12948）与 **Kimi K1.5**（arXiv:2501.12599）：RLVR/GRPO 的通用范式来源（也呼应本组可用的 DeepSeek/Kimi API）。

---

## 六、研究 Idea（12 个，完整实验方案）

> 资源假设：4×NVIDIA L40（48GB×4=192GB）；DeepSeek V4 Flash/Pro、Kimi K2.6（K3 慎用）；仿真优先、真机后置；预算数十 GPU·天。

---

### Idea 1：SkillForge-RLVR —— 面向指令跟随的扩散 VLA MoE 后训练
- **标题**：SkillForge-RLVR: Instruction-Following RL Post-Training for Mixture-of-Experts Diffusion VLAs / SkillForge-RLVR：专家混合扩散 VLA 的指令跟随强化后训练
- **一句话简介**：在 DiTEA 式 Action MoE 之上引入 RLVR/GRPO 后训练，用"可验证指令跟随奖励 + 技能遗忘惩罚"同时提升多任务指令跟随与专家隔离度。
- **动机与现有不足**：DiTEA（Intelligent Robotics · 论文 30）用 MoE+指令门控抗遗忘，但仍是纯行为克隆，复杂/干扰指令下弱于自回归模型；而 VLA-R1（arXiv:2510.01623）、Z-1（arXiv:2606.31846）、SmoothVLA（arXiv:2603.13925）证明 RLVR 能提升 VLA，却都没有结合"门控/专家隔离"结构来显式保护旧技能。
- **核心创新点**：①在 Action MoE 上做 GRPO 后训练，奖励 = 任务成功率 + 指令-动作语义对齐（LLM-as-judge）+ 专家路由稳定项；②提出"技能遗忘正则"：用固定参考专家输出的 KL/路径距离惩罚新任务对旧专家权重的漂移；③路由与指令跟随联合优化（门控也参与 RL，让 RL 学习"什么指令该走哪个专家"）。
- **方法概要**（仿真+真机）：基础模型取 DiTEA 结构（或直接基于 CogACT 复现），先在 BridgeV2/DROID 上 SFT 出 MoE 底座；再对 8-12 个多任务（SIMPLER 四任务 + RLBench/robosuite 子集）做 GRPO 后训练，每任务 8 个 rollout 共享前缀，奖励用 `success + λ·LLM_score(instruction, obs, action 描述) − μ·expert_drift`；训练用 FSDP（4×L40 可放 7B 全参，梯度累积大 batch）；最后真机 Franka 复刻 DiTEA 的 8 任务验证。
- **数据集与基线**：BridgeData V2、DROID、SIMPLER（WidowX）、RLBench-OG（arXiv:2508.05186 的 OOD 变体）；基线必须对比 CogACT、DiTEA（复现）、OpenVLA、π0（微调）、VLA-R1、SmoothVLA、Z-1 的评测设定。
- **评测指标**：主指标 = 多任务平均 SR + 指令跟随通过率（分 basic/complex/distractor 三档，可沿用 DiTEA 评分协议并统一化）；消融指标 = 旧任务回退率（skill forgetting）、专家路由熵、负载均衡偏差、LLM-judge 与人工评估一致性。
- **算力与训练方案**：7B VLA 全参 FSDP + 8×batch×8 rollout = 64 并行，4×L40；SFT 约 20-40K 步（3-5 GPU·天），GRPO 后训练 3-6K 步（5-8 GPU·天），总 ~10-13 GPU·天/模型；真机评估 2-3 周人工轮换。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro / Kimi K2.6 作为 LLM-as-judge 给"动作文本化描述"打指令-行为对齐分（替代需人工标注的指令跟随奖励）；Kimi 用于生成复杂/干扰指令的评测集（扩展现有指令库）。
- **投稿目标会议与优先级**：ICRA 2027（9 月截稿）或 CoRL 2027（6 月截稿）。优先级：**高**——VLA+RLVR 是 2026 最热主线，叠加 MoE 抗遗忘为差异化卖点。
- **可行性与风险**：最大技术风险是 RL 后训练导致动作分布漂移、稳定性下降（SmoothVLA 已见抖动问题）；缓解：冻结视觉编码器、用 SmoothVLA 的 jerk 内在奖励、专家漂移正则；API judge 的噪声用多数投票+阈值卡控。

---

### Idea 2：Process-Reasoning UAV —— 室内 UAV VLN 的过程奖励强化学习
- **标题**：ProcessReward-Fly: RL with LLM-Judge Process Rewards for Indoor UAV Vision-Language Navigation / 过程奖励之翼：室内无人机视觉语言导航的 LLM 裁判过程奖励强化学习
- **一句话简介**：在 IndoorUAV 基准上，用"LLM 给子任务逐段过程奖励 + GRPO 微调 π0"取代"一步到底的 SFT"，缓解长时序 VLN 的误差累积。
- **动机与现有不足**：IndoorUAV（Machine Learning V · 论文 82）所有方法 VLN SR<10%，主因是任务分解后无反馈、误差线性累积（论文报告的失败模式即"卡在一条子指令不停执行"）；FlightGPT（arXiv:2505.12835）在室外 CityNav 上用 GRPO 有效，但室内 4-DoF 稠密空间 + 分解式长时序尚无过程奖励方案。
- **核心创新点**：①把长指令分解后每一子目标作为"可验证里程碑"，由 LLM-as-judge 判断是否达成（图像+位姿证据），形成过程奖励；②GRPO 中引入"子任务间视觉连续性"奖励（末帧对齐），惩罚跨子任务漂移；③对比"整段稀疏奖励"与"过程奖励"的样本效率。
- **方法概要**（仿真）：数据用 IndoorUAV-VLN（16040 轨迹）+ VLA（34925）子集；基线为微调 π0 与复现 IndoorUAV-Agent；训练：SFT 底座 → GRPO 后训练，每 rollout 用 Habitat 连续执行，子任务终点触发的过程奖励由 DeepSeek V4 Pro（帧+姿态→"达成/未达成"三态）给出，配自一致性投票；在 test-unseen 上评测。
- **数据集与基线**：IndoorUAV-VLN/VLA（官方）与 R2R/VLN-CE（跨域对照）；基线 = IndoorUAV-Agent、π0、π0-FAST、OpenVLA、NaVid、FlightGPT（如可复现）。
- **评测指标**：主指标 SR / NE / NDTW（沿用官方口径，VLN SR 阈值 2m）；消融指标 = 子指令级成功率、分解后剩余步数、过程奖励与末端奖励一致性、LLM 判官置信度。
- **算力与训练方案**：π0 类 3.3B 模型 FSDP 微调（4×L40 绰绰有余，π0 原用 2×A6000 即训）；GRPO 8×8 rollout、600-1000 步 ≈ 4-6 GPU·天；Habitat 仿真可在 CPU 池并行，GPU 只训策略。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro 作为过程奖励判官（每子任务终点一次调用，覆盖 16K 轨迹约 20-50 万次调用，可用 Flash 分流降低 80% 成本）；Kimi K2.6 用于离线构建"子指令-关键帧-达成标签"的判官校准集。
- **投稿目标会议与优先级**：RSS 2027（2 月截稿）或 CoRL 2027。优先级：**高**——基准新且公开、所有方法都低，提升空间显著、可复现性强。
- **可行性与风险**：判官误判导致奖励偏置（用 3 模型投票+阈值卡控）；仿真动力学与真机差异（本 idea 只承诺仿真，真机留作 follow-up）；Habitat 室内飞行与真实无人机动力学差距大，投稿时明确界定仿真范围。

---

### Idea 3：StyleGrow —— LLM 自动发现风格参数与跨域风格解释器迁移
- **标题**：StyleGrow: LLM-Discovered Style Parameters with Cross-Domain Style Interpreter for Language-Controlled RL / StyleGrow：语言控制强化学习的 LLM 风格参数发现与跨域风格解释器迁移
- **一句话简介**：让 LLM 自动为新环境生成"风格参数 + reward shaping 描述"，并让 LCDSP 的风格解释器在足球→足式运动/导航间跨域迁移。
- **动机与现有不足**：LCDSP（Machine Learning VII · 论文 79）的 SP 与 reward shaping 全人工设计（10 行为 10 SP），换域必重做；SI 只吃合成指令，跨域泛化未验证；MAPL（arXiv:2606.25398）用 LLM 偏好替代手工 reward，但未给出"可移植的指令→行为参数"接口。
- **核心创新点**：①LLM 两阶段发现：先由 DeepSeek 对目标环境产出候选行为集，再用"行为差异度/可奖励性"评分筛选出最有利 SP 集，自动生成 reward shaping 描述（近似 Eurekaverse 的 LLM 环境/任务生成思想）；②Style Interpreter 做"域适配"微调：在 GRF 域先验上只改 ASaB 缩放头，把新环境行为描述注入，验证 SI 跨域迁移；③提供"零手工 reward"的语言控制 RL 流水线。
- **方法概要**（仿真为主）：域 1 = GRF 5v5（复现 LCDSP）；域 2 = SayTap 式四足步态（arXiv:2306.07580 参数空间）；域 3 = 2D/3D 导航（Habitat 或 Gym-MiniGrid 目标指令）。流水线：LLM 生成 SP 集 → PPO/DST 训练多风格策略 → LLM 生成指令-标签对训练 SI → 冻结策略、迁移 SI 到新域。全流程可脚本化。
- **数据集与基线**：GRF 5v5 官方场景、四足公开步态参数、导航指令集；基线 = LCDSP 原版（复现）、SayTap、LLM-MARL、MAPL、手写 reward 的 PPO。
- **评测指标**：主指标 = 风格达成率（域内游戏/步态指标分化度）+ SI 的 MAE；消融 = SP 自动发现与人工 SP 的 SEU/SMUL/SELO 对比、跨域 SI 的 zero-shot/few-shot 迁移率、LLM 生成 reward 的合法性（真机安全检查）。
- **算力与训练方案**：策略侧 = GRF/四足 PPO（单卡即可，数千 GPU·时）；SI = Qwen2.5-0.5B/1.5B 微调（1 卡，小时级）；LLM 生成与判分走 API。总 GPU 预算 < 5 GPU·天。非常适合 4×L40。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro 负责 SP 发现与 reward shaping 生成；Kimi K2.6 负责指令合成与 SI 训练数据的标签校准；两者互为 judge 交叉打分。
- **投稿目标会议与优先级**：NeurIPS 2027 或 ICML 2027（1 月截稿）——属方法+科学发现型；也可投 AAAI 2028 的 RL 方向。优先级：**中高**。
- **可行性与风险**：风险在于 LLM 生成的 SP 可能不具区分性（用条件熵校验，复用 PSS）；四足仿真真实度有限（用 MuJoCo 开源模型）；跨域迁移若失败，退化为"SP 发现"单独成文。

---

### Idea 4：Learn-to-Search —— 无人机目标搜索的可学习探索-利用策略
- **标题**：Learn-to-Search: A Trainable Exploration-Exploitation Policy with LLM Semantic Priors for UAV Object Search / 学以致搜：带 LLM 语义先验的无人机目标搜索可训练探索-利用策略
- **一句话简介**：把 PRPSearcher 的硬编码"吸引力值+IPT 阈值"换成一个小型可学习策略（RL/bandit），LLM 只提供低频语义先验，显著降本并提升效率。
- **动机与现有不足**：PRPSearcher（Intelligent Robotics · 论文 26）依赖 GPT-4o 高频推理（致只测 25% 任务），吸引力值/去噪/IPT 均不可学习；无 RL 组件，无法随数据改进；"当用 LLM、当用数值方法"正是 LLMP-UCB（arXiv:2604.05859）提出却未在具身场景验证的问题。
- **核心创新点**：①把"探索建议（不确定性地图收益）vs 利用建议（认知地图吸引区）"建模为**上下文 bandit + 小型策略**：上下文 = 语义/认知/不确定性三维地图的压缩特征，动作 = 候选航点，奖励 = 是否进入目标邻域；②LLM 仅在语义瓶颈（相关对象提取、吸引力初值）低频调用（每任务 <5 次，DeepSeek 降本），高频决策交给学到的策略；③在 CityAVOS 上首次给出"LLM 语义先验 + 可学习规划"的混合范式。
- **方法概要**（仿真）：EmbodiedCity + AirSim 环境复现 CityAVOS 2420 任务；策略 = 轻量 GNN/MLP（状态 = 3D 栅格特征，动作 = 6 方向+停止），PPO 训练；LLM 提供吸引力先验作为状态特征与稀疏语义奖励（到达"同类语义区域"给中间奖励）；对比 PRPSearcher 全 GPT-4o 版本，测 API 调用次数与 SR 的帕累托面。
- **数据集与基线**：CityAVOS 官方数据集；基线 = PRPSearcher（复现或官方开源）、RE、FBE、L3MVN、WMNav、STMR（论文 26 的表 1 全家桶）。
- **评测指标**：主指标 SR / SPL / MSS / NE；消融 = 语义先验有无、bandit 探索项有无、LLM 调用频次、不同难度子集（easy/hard）表现、API 成本（$）。
- **算力与训练方案**：状态空间小（3D 栅格），策略 <1M 参数，PPO 单卡 1-3 天可收敛；仿真并行在 CPU 池跑；GPU 几乎无压力。总预算 3-5 GPU·天。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Flash 做高频但便宜的语义分割目标提取与吸引力初值（每任务几次）；Kimi K2.6 做低频的目标-场景常识推理与奖励辅助；全部走 API，不动 GPU。
- **投稿目标会议与优先级**：ICRA 2027 或 IROS 2027（3 月截稿）。优先级：**中高**——成本-效果帕累托是新亮点。
- **可行性与风险**：最大风险 = 学到的探索策略在城市大空间稀疏奖励下不收敛（缓解：分层——先 bandit 选区域再局部 PPO）；与 PRPSearcher 的公平对比需复现其提示词细节。

---

### Idea 5：MORL-Pref —— 多目标强化学习 + LLM 偏好对齐的导航/操作
- **标题**：MORL-Pref: Multi-Objective RL with LLM Preference Alignment for Robot Behavior / MORL-Pref：面向机器人行为的多目标强化学习与 LLM 偏好对齐
- **一句话简介**：把"多目标搜索（论文 22）"与"LLM 偏好学习（MAPL 式）"结合，训练单策略在"安全-效率-风格"目标间的偏好可控导航/操作。
- **动机与现有不足**：多目标搜索综述（AAAI Emerging Trends in AI · 论文 22）指出"现实系统罕见单一指标"，但缺乏与 LLM 偏好的结合；MAPL（arXiv:2606.25398）证明 LLM 偏好可替代手工 reward 却只用于四足运动；ORACLE（arXiv:2608.04999）用偏好向量条件化单模型出多目标解，但未用 LLM。三者的结合点是空白。
- **核心创新点**：①单策略 + 偏好向量条件化（如 ORACLE），策略 π(a|s,w) 在 w∈Δ 上可连续插值；②LLM（DeepSeek）按语义维度（安全裕度/速度/平滑度/风格）两两比较轨迹，训练多头偏好模型作奖励；③用多目标搜索算法（如 BOA*/ε-约束）在训练后对偏好-行为进行 Pareto 审计，形成"偏好驱动训练 + 搜索驱动验证"闭环。
- **方法概要**（仿真）：环境 = 2D 导航（SafetyGym 或自建）与 SIMPLER 操作子集；做法：离线收集多风格轨迹→LLM 偏好标注→多头奖励模型→条件化 PPO（w 采样自单纯形）→对 w 网格插值评测；真机可选：Franka 上以"安全避障 vs 任务速度"双目标演示。
- **数据集与基线**：SafetyGym、Meta-World、SIMPLER；基线 = MAPL、ORACLE 复现、单目标 RL、线性加权 reward 的 PPO。
- **评测指标**：主指标 = 偏好对齐率（人类/LLM 对策略行为风格的一致性）+ 帕累托前沿覆盖率（HV/IGD）；消融 = w 插值连续性、LLM 偏好 vs 人工偏好、不同目标数（2/3/4）。
- **算力与训练方案**：奖励模型 0.5-2B 微调（1-2 卡，小时级）+ 条件化策略 PPO（SafetyGym/Meta-World 单卡 2-5 天）。总预算 5-10 GPU·天。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro 做轨迹两两偏好标注（语义维度打分）；Kimi K2.6 做冲突偏好仲裁与生成多样指令集；两者交叉验证偏好一致性。
- **投稿目标会议与优先级**：ICML 2027 / NeurIPS 2027（1 月截稿）或 IROS 2027。优先级：**中**——需与现有 MORL 文献拉开明确差距。
- **可行性与风险**：风险 = LLM 偏好在高维轨迹上不稳定（缓解：维度拆分+多投票）；多目标 RL 收敛慢（用 PSS 类似采样优先训练有区分度的 w）；真机安全目标需谨慎，先仿真。

---

### Idea 6：Bandit-Skill-Router —— 长时序操作的上下文赌博机技能路由器
- **标题**：Bandit-Skill-Router: Contextual Bandit over VLA Skills with LLM Context Features for Long-Horizon Manipulation / Bandit-Skill-Router：面向长时序操作、以 LLM 上下文特征驱动的 VLA 技能上下文赌博机路由器
- **一句话简介**：用上下文 bandit 在"动作原语/技能库"间做路由，LLM 只提供上下文特征与偏好先验，解决长时序 VLA 的复合指令漂移。
- **动机与现有不足**：VLA 长时序任务（如 IndoorUAV 的分解执行）易在子技能边界累积误差；现有 LLM 规划（SayCan/LLM-Planner 一族）把选择交给提示词，不维护探索-利用与反馈；bandits×LLM（论文 77；arXiv:2604.05859、arXiv:2605.14553）证明 bandit 管理 LLM 选择可行，但在操作技能路由上无人做。
- **核心创新点**：①把"下一个技能/原语"建模为**上下文 bandit**：臂 = 技能（如 grasp/place/reorient/push），上下文 = LLM 抽取的语言-视觉特征 + 上一步成败，用 UCB/汤普森采样平衡探索；②LLM 在"臂初始化"与"失败后的臂重定义"时介入（低频），高频路由交给 bandit；③引入"技能执行失败再采样"的反馈回路，缓解长时序误差累积。
- **方法概要**（仿真+真机可选）：在 Meta-World/RLBench 上把任务拆为技能序列；技能策略用预训练 VLA 或 Diffusion Policy；路由器 = 上下文线性 bandit，奖励 = 子技能成功率/进度；LLM（DeepSeek Flash）在每任务开始时给出技能候选与语言描述特征；对比固定脚本路由、LLM-only 路由（提示词）、端到端 VLA。
- **数据集与基线**：Meta-World、RLBench、SIMPLER；基线 = LLM-Planner、SayCan 复现、决策 transformer、端到端 VLA。
- **评测指标**：主指标 = 长时序任务成功率 + 平均路由遗憾；消融 = bandit vs 纯 LLM 路由、臂数量、反馈延迟、失败恢复率。
- **算力与训练方案**：bandit 无训练（在线 UCB），技能策略已预训练（仅做少量微调）；GPU 主要为技能策略微调与仿真 rollout，4×L40 中 1-2 卡即可，预算 3-6 GPU·天。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Flash 做技能候选生成与上下文特征；Kimi K2.6 做失败分析（给出失败原因与臂重定义建议）。
- **投稿目标会议与优先级**：ICRA 2027 / CoRL 2027。优先级：**中**。
- **可行性与风险**：风险 = 技能粒度选择敏感（统一用官方任务元数据定义技能）；bandit 在线探索在真机上有安全风险（先仿真、真机用离线预采集历史做 warm-start）。

---

### Idea 7：Reason-RLVR —— 基于 JRDB-Reasoning 的具身视觉推理强化微调
- **标题**：Reason-RLVR: RLVR over Graph-Verifiable Rewards on JRDB-Reasoning for Embodied Visual Reasoning / Reason-RLVR：在 JRDB-Reasoning 上用图可验证奖励做具身视觉推理强化微调
- **一句话简介**：把 JRDB-Reasoning 的逐步 workflow 注解转成可验证过程奖励，用 GRPO 强化微调 VLM，提升高难度（D3）人群环境视觉推理。
- **动机与现有不足**：JRDB-Reasoning（Computer Vision IV · 论文 31）把复杂度形式化并给出逐步注解，但只用于评测（零样本测 VLM，D3 明显崩溃），未用于训练；3D-RFT（arXiv:2603.04976）在 3D 场景上证明 RLVR 有效，却未涉人群/社交关系与工作流过程奖励。
- **核心创新点**：①过程奖励 = 图匹配：把模型回答逐步映射到 JRDB 的 STG 节点/边，用"中间步骤命中率"作可验证奖励（比末端 VQA 精确率更细粒度）；②难度课程：按 D1→D3 递增采样训练（呼应论文 31 的难度定义），课程切换由过程奖励收敛触发；③对比末端奖励 vs 过程奖励在 D3 与 T>1 上的差距。
- **方法概要**（离线/仿真）：JRDB-Reasoning 图像/视频子集 + 查询引擎生成训练问题；模型 = Qwen2.5-VL-7B / InternVL2.5-8B（LoRA 或全参 FSDP）；GRPO 后训练，组内比较按 D 分层；在官方 D1-D3 测试与 zero-shot 其他基准（如 GQA、ScanQA-3D）上评测。
- **数据集与基线**：JRDB-Reasoning（官方）+ GQA/CLEVR/ScanReason 迁移对照；基线 = InternVL2.5、Qwen2.5-VL、Paligemma、LLaVA-NeXT（原论文表 2/3/4 全套）。
- **评测指标**：主指标 = 各难度级 VG mIoU / VQA 精度 + 逐步步骤命中率；消融 = 过程 vs 末端奖励、课程有无、T>1 视频时间推理、与人类 Eval 的 gap 缩小幅度。
- **算力与训练方案**：8B VLM 全参 FSDP 或 LoRA，4×L40；SFT 1-2 天，GRPO 600-1200 步 2-4 天；总预算 8-12 GPU·天。完全在 4×L40 内。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro / Kimi K2.6 生成扩展训练问题与"问题-步骤-答案"三元组（扩充分布，防过拟合生成分布）；作为离线 judge 校准过程奖励规则。
- **投稿目标会议与优先级**：CVPR 2027（11 月截稿）或 NeurIPS 2027。优先级：**高**——基准新、评测完备、与 3D-RFT 形成差异化（人群+过程奖励+难度课程）。
- **可行性与风险**：风险 = 图匹配判奖励对结构化输出要求高（约束解码 + LLM 辅助解析）；T>1 视频训练显存与时间成本上升（先只训 T=1，再扩展到 2-3 帧）。

---

### Idea 8：Align-By-Design —— LLM 环境设计师缩小人机目标状态分歧
- **标题**：Align-By-Design: LLM Environment Designer for Minimizing Human-Robot Goal State Divergence / 设计即对齐：面向人机目标状态分歧最小化的 LLM 环境设计师
- **一句话简介**：把 GSD/HRGAD（Humans and AI · 论文 43）的"环境修改最小化"交给 LLM 生成候选修改并用可验证 GSD 排序，实现人机协作环境的可解释对齐。
- **动机与现有不足**：论文 43 的 GSD 指标好但 HRGAD 的搜索假设环境修改可枚举、代价已知，未利用语义知识；Eurekaverse（arXiv:2411.01775）证明 LLM 能生成环境课程，但不针对"人类预期 vs 机器人实际状态"分歧；MAPL 证明 LLM 偏好可建模人的语义，但无环境设计。
- **核心创新点**：①LLM（DeepSeek Pro）基于"人类指令语义 + 当前环境 + 机器人能力"生成候选环境修改（物体摆放/路标/感知提示），输出带代价估计；②用 GSD 可计算界（论文 43 的最大/最小界）作为排序与筛选的验证信号，LLM 生成 + 形式验证闭环；③在规划仿真（PDDL/规划基准）与轻量仿真（Gym-MiniGrid 具身版）双轨验证。
- **方法概要**（仿真）：域 = PDDL 规划基准（论文 43 用过的）与 MiniGrid 人机协作指令集；流水线：人类指令 → LLM 生成修改候选集 → 形式化验证 GSD 界 → 选择最小代价集 → 重规划并计算实际 GSD 下降；评估 LLM 生成命中率（是否包含形式最优解）。
- **数据集与基线**：论文 43 的规划基准（复现其 HRGAD 求解器）+ MiniGrid 指令集；基线 = HRGAD 精确/近似求解、随机修改、纯 LLM 无验证。
- **评测指标**：主指标 = 实际 GSD 下降 / 修改代价 / 人类满意度（小型用户研究）；消融 = LLM 生成 vs 枚举、验证环节有无、不同 LLM。
- **算力与训练方案**：无需训练（无 GPU 训练需求），仅需 LLM API + 规划器（PDDL planner）在 CPU 上运行；GPU 预算 ≈ 0（可用于并行的 RL 消融），是低成本 idea。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro 生成环境修改候选；Kimi K2.6 做人类指令释义与候选语义合理性复核；两者互评。
- **投稿目标会议与优先级**：AAMAS 2027（HRI 线）或 ICRA 2027（人机协作线）。优先级：**中**。
- **可行性与风险**：风险 = GSD 在真机难以实测（论文 43 亦只用规划基准）；LLM 生成解与形式最优解差距需量化；无训练内容，新颖度依赖"LLM×形式验证"的组合，须论证充分。

---

### Idea 9：FailCheck —— 长时序 VLA/VLN 的失败感知恢复
- **标题**：FailCheck: LLM-as-Judge Failure Detection and Subgoal Repair for Long-Horizon VLA/VLN Agents / FailCheck：面向长时序 VLA/VLN 智能体的 LLM 判官失败检测与子目标修复
- **一句话简介**：在 VLA/VLN 执行回路中插入"LLM-as-judge 卡点检测 + 子目标重规划"，把 IndoorUAV-Agent 式分解的误差累积显式打断并修复。
- **动机与现有不足**：IndoorUAV（论文 82）失败模式是"卡在子指令反复执行"，无检测与恢复；现有长时序 VLN 只做单向分解（LLM→VLA），缺乏"执行-验证-再规划"闭环；ReAgent-V（arXiv:2506.01300）在多模态视频上证明 reward 驱动的反思有效，未用于机器人控制。
- **核心创新点**：①轻量卡点检测器：小模型（或低成本 LLM）在每子任务间隔判断"当前视觉-位姿是否满足子目标"，输出 3 态（进行/达成/卡死）；②卡死时触发修复：LLM 基于最近 K 帧+失败原因重写剩余子目标（retry/绕路/回退重来）；③把"检测-修复"做成与策略解耦的可插拔模块，可叠加在任何 VLA/VLN 上。
- **方法概要**（仿真）：复现 IndoorUAV-Agent 与微调 π0；在其外层加 FailCheck；仿真中注入故障（遮挡、光照变化）测鲁棒性；对比无恢复版本，统计 SR/步数/修复触发率。
- **数据集与基线**：IndoorUAV-VLN/VLA、VLN-CE；基线 = 无恢复的分解式 agent、端到端 π0、NavGPTv2。
- **评测指标**：主指标 = SR / 成功率-步数帕累托；消融 = 检测器精度（precision/recall of 卡死）、修复策略类型、API 调用频率与成本。
- **算力与训练方案**：检测器为 0.5-1.5B 小模型微调（1 卡 1 天）+ 主策略微调（4 卡 3-5 天）；总预算 6-10 GPU·天。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Flash 做高频卡死判定（低成本）；Kimi K2.6 做低频子目标重规划（每次修复一次调用）。
- **投稿目标会议与优先级**：CoRL 2027 或 RSS 2027。优先级：**中高**——与 Idea 2 互补（Idea 2 做过程奖励在线训练，本 idea 做推理时恢复），可单独成文或合并。
- **可行性与风险**：检测器误报导致无谓重规划（设卡死确认阈值+连续两轮证据）；真机恢复动作有安全约束（先仿真，真机仅做"停止并求助人类"的保守恢复）。

---

### Idea 10：XEmb-SkillLib —— 跨形态 VLA 技能库的 bandit 路由器
- **标题**：XEmb-SkillLib: Cross-Embodiment Skill Library with Bandit-Trained Router for VLA / XEmb-SkillLib：面向 VLA 的跨形态技能库与赌博机路由器
- **一句话简介**：用"形态-技能"二维 MoE 适配器 + 训练期 bandit 路由，在 Open X-Embodiment 多形态数据上训练一个抗跨形态遗忘的 VLA。
- **动机与现有不足**：DiTEA（论文 30）在单形态内用 MoE 抗遗忘，但跨形态（机械臂/移动/双机械臂/人形）数据共享时的负迁移与遗忘未解；FedVLA（arXiv:2508.02190）用双门控 MoE 但面向联邦隐私；现有 cross-embodiment VLA 多靠大算力全量训练。
- **核心创新点**：①"形态-技能"专家网格：专家沿形态维与技能维稀疏激活，共享专家兜底，结构上隔离跨形态冲突；②**训练期 bandit 路由**：把"当前 batch 用哪些专家子集"建模为 bandit 选择，按各专家在验证子集的增益动态分配（呼应论文 77 的 bandit 调 LLM 微调，这里用在 MoE 路由）；③在 4×L40 上可复现的 cross-embodiment 训练配方（对比 OpenVLA 的 64+GPU 要求）。
- **方法概要**（离线/仿真）：数据 = Open X-Embodiment（BridgeV2/DROID/RT 子集）+ 仿真（robosuite/RLBench 双形态）；模型 = 7B VLA 底座 + 双维 MoE 动作头；两阶段：SFT（bandit 在线分配专家负载）→ 少量 RL（GRPO，奖励含跨形态保留率）；评测跨形态保留与 OOD 任务。
- **数据集与基线**：Open X-Embodiment、SIMPLER、RLBench；基线 = OpenVLA（微调）、DiTEA（复现）、GR00T N1（或其在公开子集的复现）、FedVLA。
- **评测指标**：主指标 = 各形态/各任务的 SR + 跨形态遗忘率（先训后学新形态的旧形态回退）；消融 = bandit 路由 vs 均匀路由、形态-技能专家网格设计、共享专家比例。
- **算力与训练方案**：7B FSDP + MoE 动作头，4×L40；SFT 30-60K 步（6-10 GPU·天），GRPO 3-6K 步（5-8 GPU·天）；总预算 12-18 GPU·天，是 12 个 idea 中最重的，但仍是 4×L40 数周内可完成的量级。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Flash 离线做跨形态任务的指令改写与对齐（同一任务多形态指令统一）；Kimi K2.6 做任务相似度图，帮助初始化专家路由先验。
- **投稿目标会议与优先级**：ICRA 2027 或 RSS 2027。优先级：**中**（工程量较大）。
- **可行性与风险**：最大风险 = 4×L40 上跨形态数据量有限导致专家坍缩（用负载均衡损失+bandit 探索惩罚缓解）；Open X-Embodiment 下载/清洗工作量高（先只用 2-3 个公开子集）。

---

### Idea 11：DiffCurriGen —— 难度分级指令合成 + RLVR 数据课程
- **标题**：DiffCurriGen: Difficulty-Graded Instruction Synthesis with RLVR Data Curriculum for VLA/VLN / DiffCurriGen：面向 VLA/VLN 的难度分级指令合成与 RLVR 数据课程
- **一句话简介**：复用 JRDB-Reasoning 的难度形式化与 IndoorUAV 的指令流水线，用 DeepSeek/Kimi 合成"难度可标定"的指令-轨迹数据，并以难度课程做 RLVR 训练。
- **动机与现有不足**：IndoorUAV（论文 82）的 GPT 指令存在分布漂移且难度标注粗（只按长度）；JRDB-Reasoning（论文 31）证明 D=S+R+T 与感知难度强相关；没有工作把"难度标定的合成指令"作为 RLVR 数据课程喂给 VLA/VLN。
- **核心创新点**：①把 D=S+R+T 扩展到"导航指令难度"：实体/里程碑数、空间关系、时序步骤数 → 生成难度可调指令（直接复用 JRDB 形式化方法，跨域迁移）；②两代 LLM（DeepSeek/Kimi）协同生成+互审，产出大规模、难度分层、语义多样指令；③用难度课程 + 过程奖励做 RLVR（简单→难，触发式升级），并给出"合成数据难度漂移"的可测度诊断。
- **方法概要**（仿真）：基于 IndoorUAV 场景与轨迹（或用 Habitat 自采）生成难度分层的指令-轨迹对；训练 π0 类 VLA 与分解式 agent；RLVR 阶段按难度批次喂数据，课程升级由验证集增益触发；对合成 vs 人工指令做分布漂移测量（embedding + 人工抽查）。
- **数据集与基线**：IndoorUAV-VLN/VLA + 新合成子集；基线 = 原指令分布训练、无课程 RLVR、课程但无 RL。
- **评测指标**：主指标 = 各难度 SR/NDTW + 指令语义忠实度（人类/LLM 评分）；消融 = 课程策略、难度形式化参数、合成模型组合、漂移指标。
- **算力与训练方案**：π0 类 3B 模型微调 + GRPO，4×L40 内 6-10 GPU·天；合成数据管线走 API（成本可控，Flash 为主）。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Flash 批量合成低-中难度指令；Kimi K2.6 合成高难度与时序组合指令并做互审评分；两代模型交叉验证难度标定。
- **投稿目标会议与优先级**：CVPR 2027 / NeurIPS 2027。优先级：**中高**——数据基建型贡献，易做增量、易被引用。
- **可行性与风险**：合成指令质量参差导致训练噪声（用难度-指令判官过滤 + 与人工子集对照）；难度形式化跨域有效性需重新用户研究验证。

---

### Idea 12：TacticTalk —— 多智能体足球战术的 LLM 子目标协调 + 风格控制
- **标题**：TacticTalk: LLM Subgoal Coordination with Style Control for Multi-Agent Football / TacticTalk：面向多智能体足球的 LLM 子目标协调与风格控制
- **一句话简介**：把 LCDSP 的风格控制与 LLM-MARL 的子目标协调结合：LLM 把"战术风格指令"分解为队友级子目标，风格参数在 MARL 层调制协作行为。
- **动机与现有不足**：LCDSP（论文 79）风格控制是单策略级、缺显式队友协调；LLM-MARL（arXiv:2506.04251）有协调但无风格参数；"教练式战术指令（如'保持阵型反击'）→ 多智能体执行"这一抽象层无人解决；STAIF（arXiv:2607.22649）在 LLM 指令遵循上证明"软约束 DPO + 硬约束 RLVR"分治有效，可迁移到战术执行。
- **核心创新点**：①LLM 教练层：把教练战术指令分解为"每名队员的局部子目标 + 全局阵型状态"，作为多智能体策略的条件；②风格-协调联合：SP 同时调制个体行为偏好与队形参数（间距/压上程度），策略 π_i(a_i|s,ω,子目标_i)；③两阶段训练：先软对齐（模仿教练指令-行为的偏好对，DPO 式）再 RLVR（硬性战术指标，如控球率/射门数阈值）——复刻 STAIF 的分治思想到 MARL。
- **方法概要**（仿真）：GRF 5v5（复现 LCDSP 环境与 10 行为 SP 体系）；策略 = MAPPO/QMIX + 条件化；LLM 在每 episode 开头与战术切换时生成子目标（低频）；训练两阶段 PPO/GRPO + 偏好阶段；对 6 种战术做指标分化评测（对照 LCDSP 的图 4）。
- **数据集与基线**：GRF 5v5 官方场景；基线 = LCDSP（复现）、LLM-MARL、MAPPO、QMIX。
- **评测指标**：主指标 = 战术风格达成率（游戏内指标分化 + 与教练指令语义一致性，LLM-judge）+ 胜率/控球率；消融 = 子目标有无、SP 与队形耦合、两阶段训练、LLM 调用频率。
- **算力与训练方案**：GRF PPO/MAPPO 单卡可跑，4×L40 中 2-4 卡并行多 seed；训练 5-8 GPU·天；LLM 走 API。成本低。
- **DeepSeek/Kimi API 用法**：DeepSeek V4 Pro 做战术分解与子目标生成；Kimi K2.6 做战术指令-行为偏好对标注（软对齐阶段数据）与风格指标判官。
- **投稿目标会议与优先级**：AAMAS 2027 或 AAAI 2028（RL/MARL 线）。优先级：**中**。
- **可行性与风险**：LLM 子目标对 MARL 稳定性的干扰（参考 arXiv:2607.04470 的平稳性问题，用冻结阶段+EMA 稳定化）；战术指标可验证性需规则化（守门/控球/间距可计算）；与 LCDSP 区分度需在写作中强调"协调层"新增。

---

## 七、综述性结论与投稿策略

### 7.1 主要空白总结（由收藏论文 + 外部文献交叉得出）
1. **VLA 的"结构抗遗忘 × 奖励后训练"尚未结合**：DiTEA（MoE 门控）与 Z-1/VLA-R1/SmoothVLA（RLVR）分属两条独立线，二者结合（Idea 1）是最具发表价值的高地。
2. **LLM 驱动的决策 agent 普遍"不可学、不可验证"**：PRPSearcher（论文 26）靠提示词、IndoorUAV-Agent（论文 82）靠分解无反馈；把 LLM 先验与可学习/可验证组件（RL、bandit、过程奖励、GSD 界）耦合，是贯穿 Idea 2/4/6/8 的共同解法。
3. **手工设计（SP/reward/环境）是语言控制 RL 的瓶颈**：LCDSP（论文 79）SP 靠人、MAPL/Eurekaverse 证明 LLM 可替代，但"自动发现 + 跨域迁移"（Idea 3）尚无工作。
4. **评测基准已有、训练玩法空缺**：JRDB-Reasoning（论文 31）与 IndoorUAV（论文 82）都"只测不训"；RLVR 用其可验证结构训练（Idea 2/7/11）是低成本高回报路径。
5. **bandits×LLM 在具身场景落地少**：综述（论文 77）与 2026 新作多在文本/推荐域；机器人技能路由与 UAV 搜索（Idea 4/6/10）是差异化机会。
6. **人机目标对齐缺语义化环境设计**：GSD（论文 43）形式化好但无 LLM 语义注入（Idea 8）；多目标搜索（论文 22）缺 LLM 偏好注入（Idea 5）。

### 7.2 投稿策略建议
- **快攻（基准新、方法差、易复现）**：Idea 2（IndoorUAV 过程奖励）、Idea 7（JRDB-Reasoning RLVR）→ 目标 RSS 2027 / CoRL 2027 / CVPR 2027，预计 6-8 个月可出稿，是本组最高性价比。
- **热点差异（VLA+RLVR+MoE）**：Idea 1 → ICRA 2027 / CoRL 2027；竞争激烈，靠"MoE 结构 × RLVR × 指令跟随奖励"三维差异化取胜。
- **方法创新（LLM×RL 接口）**：Idea 3（风格自动发现）、Idea 4（可学习搜索）、Idea 5（多目标偏好）→ ICML 2027 / NeurIPS 2027 / AAMAS 2027，理论+实证并重。
- **工程向（可插拔、真机友好）**：Idea 9（失败恢复）、Idea 6（技能路由器）、Idea 12（战术协调）→ ICRA/IROS/CoRL。
- **低成本保底**：Idea 8（LLM 环境设计，GPU≈0）、Idea 11（数据合成，中）→ 可并行推进作为机动项目。
- **真机定位**：本组 12 个 idea 中，Idea 1/3/5/6/10 含真机验证项，但均以仿真为主体、真机为加分项；4×L40 完全可以支撑除 Idea 10（偏重，12-18 GPU·天）外全部 idea 的仿真训练。建议主推组合 = Idea 1 + Idea 2 + Idea 7（三篇互为引用、故事线完整：VLA 强化→空中 VLN 强化→具身推理强化）。

---

*报告完。所有外部文献 ID 均经核验；收藏论文引用均带 Session 前缀与编号。*
