CVPR2026 收藏论文 · 12 方向深度调研与 72 个可执行 Idea

175 篇收藏论文 → 12 个研究方向 → 逐篇批判性评析 → 方向级深度调研(200+ 外部文献)→ 每方向 6 个 Idea(共 72 个,全部含 8×L40 算力核算)。硬件约束:8×NVIDIA L40。
175收藏论文
12研究方向
72可执行 Idea
200+外部调研文献
24 万中文字符
|
一、12 个方向总览(点击展开查看 6 个 Idea)
M1MLLM 感知-推理机制、强化学习与评测
17 篇论文 · 6 个 Idea
1 PerceptDiag —— 感知-推理归因(PRA)任务与可诊断化协议 中风险
2 PerceiveRL —— 把感知能力作为 RL 的显式优化目标 中风险
3 PerceiveScale —— 感知-推理解耦的 Scaling Law 与数据配方 中风险
4 DiffuV-Reason —— 扩散式 MLLM 的双向视觉推理(高回报) 高回报
5 VisPRM —— 多模态过程奖励模型与视觉信用分配(高回报/Oral 候选) 高回报
6 ToolPerceive —— 诊断驱动的感知修复工具智能体(高回报) 高回报
M2长视频与流式视频理解
19 篇论文 · 6 个 Idea
1 OrderPax —— 时序保真的视频 Token 压缩 中风险
2 BudgetVid —— 任意时间帧预算调度 中风险
3 LeanVid Audit —— 长视频评测漏洞审计与校正 中风险
4 ChronoNet —— 解耦时空的双流时序通道 中风险
5 SpeakNow —— 何时回答/沉默/打断的形式化与 anytime 时序感知评测 中风险
6 TokenRL-Agent —— 预算感知的 agentic 长视频推理 中风险
M3多模态模型高效化:视觉 Token 压缩 / KV Cache / 量化 / 小模型 / 高效训练
11 篇论文 · 6 个 Idea
1 BlindFold —— 语言先验去污协议 + 信息保持率(IR)指标(低风险/评测立标准) 低风险
2 GradCover —— 梯度覆盖度驱动的 MLLM SFT 数据调度与早停(低风险/训练侧冷门) 低风险
3 FP8-Align —— Ada 上"真延迟"导向的剪枝 × FP8 协同设计(中风险/系统级) 中风险
4 ReVTok —— 可逆视觉 token 压缩(学习型残差码本 + 查询触发再膨胀)(高风险/机制级) 高回报
5 BudgetNet —— 可微连续 token 预算分配(延迟感知的资源分配头)(高风险/机制级) 高回报
6 MSVT —— 最小充分视觉 token:新任务、新指标、新数据集(新问题定义/中风险) 中风险
M4视觉生成与编辑:物理一致性、长叙事、定制化与加速
20 篇论文 · 6 个 Idea
1 MemSlot——把"首帧记忆缓冲区"泛化为可定位、可调度的通用外部记忆槽 中风险
2 SpecDecay——长视频自回归漂移的谱能量机制解释与 training-free 方差锚定采样 中风险
3 PhysReg——可微物理先验作为少步视频生成的轻量约束注入(覆盖非刚体/流体) 中风险
4 TC-DMD——1.3–5B 视频 DiT 的少步蒸馏与时序一致性系统性研究 中风险
5 ShotGraph——跨镜头物理/叙事一致性评测与新范式 Mixture-of-Memory 中风险
6 PhysDPP——物理多样性感知的 T2V 策略优化 中风险
M5端到端自动驾驶:规划、驾驶 VLA 与因果/强化学习
21 篇论文 · 6 个 Idea
1 CF-Eval——仿真因果干预验证协议(Causal/反事实,要求3) 中风险
2 AdaptCoT——CoT 有无用的受控证伪与自适应决策器(要求2,解决学术争论) 中风险
3 LongTailLoop——长尾获取/生成/评测闭环(要求4) 中风险
4 CausalLatent——潜空间因果去混淆的世界模型推理(高风险高回报,Oral 候选) 高回报
5 SimCausal-RL——因果正则的闭环 RL 后训练(高风险高回报,Oral 候选) 高回报
6 ESLI——Ego-Status Leakage Index 与新开环评测任务(新问题/新任务定义,要求1) 新问题
M6世界模型、4D/3D 场景重建与驾驶仿真
14 篇论文 · 6 个 Idea
1 REP-4WM — 驾驶世界模型"表征空间"头对头与机制解释 中风险
2 OccWM-Lite — 轻量轨迹条件占用世界模型 + 闭环规划头 中风险
3 EMERGE-Obj — 无监督物体性与动力学定律涌现(可证伪评测) 中风险
4 EvalDrive — 反事实闭环仿真协议,实证 FVD 与有用性脱节 中风险
5 FF-4DSim — 前馈式动态高斯世界模型(VGGT/π3 全参微调) 中风险
6 LongTail-Sim — 长尾真实资产 + 任意传感器泛化分割(新问题定义) 新问题
M7交互式与具身智能体:GUI/Web/机器人操作与导航
16 篇论文 · 6 个 Idea
1 SCoRe —— 自我一致性 Rollout 代理指标:不执行环境也能预测 Online 成功率 中风险
2 ANDAS —— 注意力-新颖性联合检测的弹窗/注入防御闸门 中风险
3 VidMine —— 旁白对齐 + 信息量排序的视频挖掘课程 中风险
4 GWM —— 可预测状态摘要器:GUI 世界模型同时干三件事 中风险
5 GoalVA —— 视觉目标想象作为长时程操作 VLA 的 CoT 中风险
6 PAUSE —— 主动辅助策略:何时接管、何时提问、何时放手 中风险
M8多模态安全:对抗攻击、后门、越狱、防御与 AIGC 取证
18 篇论文 · 6 个 Idea
1 SubspaceTransfer——给"可迁移对抗攻击"做解剖:迁移发生在哪一层、如何预测、如何利用(机制理解,高回报) 高回报
2 DIA——抗漂移的生成模型指纹图集:把"判别真假"升级为"跨架构可归因"(低-中风险,高回报) 中风险
3 AgentGuard——面向 GUI/embodied agent 的"目标-动作语义一致性"后门实时审计(agent 安全,高回报) 高回报
4 StylePurity——训练无关的"风格抖动一致性"MLLM 越狱防御(低风险,稳定中稿) 低风险
5 AdapterScope——面向 T2I LoRA 分享生态的供应链后门"发布前体检"(低风险,稳定) 低风险
6 PromptProof——提示词级水印:给"prompt 窃取"装上可验证取证(新问题定义,高回报) 高回报
M9参数高效微调、模型合并、持续学习与测试时自适应
7 篇论文 · 6 个 Idea
1 JBS(Joint-Basin Surrogate)——用 Fisher 加权闭式解把 LoRA 合并、持续学习、TTA 统一为"参数流形上的多目标最小二乘" 中风险
2 Adapter-OS——面向个人研究者的 LoRA 资产管理协议(检索/组合决策/去重/压缩) 中风险
3 TVAC——Test-time Answer-Consistency Adaptation(VLM 的 VQA/长尾/视频测试时自适应) 中风险
4 TRAS——Token-Routed Adapter Swarm:以"路由稳定性"为统一目标连接合并、持续学习与 TTA 中风险
5 Mergeability Prediction——定义"可合并性"为适配器的可预测属性(新问题定义) 新问题
6 TTCVE——Test-Time Continual Vocabulary Expansion(VLM 的测试时持续词表扩展) 中风险
M10鲁棒视觉感知:检测/跟踪/分割/复原(UAV、事件相机、域自适应)
14 篇论文 · 6 个 Idea
1 TempVerify——时序一致性验证的 VLM 辅助 UAV 半监督检测与边缘蒸馏(低风险,VLM×感知交叉) 低风险
2 TTDA-UAV——面向 UAV 部署域偏移的测试时域适应检测(低风险) 低风险
3 TempoAlign——事件-帧异步时序对齐与曝光建模的鲁棒多模态检测(高风险,事件相机时间一致性) 高回报
4 TrustPercept——"何时在瞎猜":分布偏移下带统计保证的检测失败预警(高风险,不确定性/可靠性) 高回报
5 POR-Net——感知导向的图像复原:以下游检测回报为目标的复原范式与评测协议(新任务定义) 新问题
6 GoUAV——可信开放的 UAV 边缘开放词汇感知(中风险,VLM×感知落地) 中风险
M11跨模态检索与多模态 RAG
7 篇论文 · 6 个 Idea
1 When Does Retrieval Hurt? — Diagnosing Failure Modes of Multi-Modal RAG(MM-RAG 失败模式诊断) 中风险
2 Verify-then-Retrieve-Retrieve: Evidence-Gated Iterative Retrieval for Reasoning-Intensive Retrieval(证据门控的迭代检索) 中风险
3 TimeRAG: Spatio-Temporal Segment Retrieval for Temporal Reasoning over Long Video(时空片段级检索增强的视频时序推理) 中风险
4 Memory-as-RAG: Auditable Long-Horizon Egocentric Memory Retrieval with Shared Agent Memories(记忆即检索) 中风险
5 MM-Attest: Evidence Conflict Resolution and Attribution for Multi-Source Multi-Modal RAG(多源多模态 RAG 的证据冲突消解与可信归因) 中风险
6 Compose-by-Decompose: Attribute-Level Decomposition and Verification for Composed Image Retrieval(分解-组合-验证的 CIR) 中风险
M12医学与科学多模态、科研自动化
11 篇论文 · 6 个 Idea
1 EchoGround——面向超声视频的时序区域级医学 VLM 与可控报告生成 中风险
2 ReproAgent——预算感知的论文实验复现代理(Budget-Aware Paper-to-Code) 中风险
3 TrustMed-Bench——医生在环的医学 VLM 可信落地评测协议与新基准 中风险
4 Attrib-RAG——引用级证据归因的医学多模态 RAG(Claim-Level Attribution) 中风险
5 US-WORLD——超声自由扫查的预测性容积世界模型 中风险
6 Ground-Verify——医学 VLM 的 mask 级 grounding 与"生成-定位-重读"自验证闭环 中风险
二、72 个 Idea 总表(可按方向/风险筛选)
方向Idea类型
M1 PerceptDiag —— 感知-推理归因(PRA)任务与可诊断化协议 中风险
M1 PerceiveRL —— 把感知能力作为 RL 的显式优化目标 中风险
M1 PerceiveScale —— 感知-推理解耦的 Scaling Law 与数据配方 中风险
M1 DiffuV-Reason —— 扩散式 MLLM 的双向视觉推理(高回报) 高回报
M1 VisPRM —— 多模态过程奖励模型与视觉信用分配(高回报/Oral 候选) 高回报
M1 ToolPerceive —— 诊断驱动的感知修复工具智能体(高回报) 高回报
M2 OrderPax —— 时序保真的视频 Token 压缩 中风险
M2 BudgetVid —— 任意时间帧预算调度 中风险
M2 LeanVid Audit —— 长视频评测漏洞审计与校正 中风险
M2 ChronoNet —— 解耦时空的双流时序通道 中风险
M2 SpeakNow —— 何时回答/沉默/打断的形式化与 anytime 时序感知评测 中风险
M2 TokenRL-Agent —— 预算感知的 agentic 长视频推理 中风险
M3 BlindFold —— 语言先验去污协议 + 信息保持率(IR)指标(低风险/评测立标准) 低风险
M3 GradCover —— 梯度覆盖度驱动的 MLLM SFT 数据调度与早停(低风险/训练侧冷门) 低风险
M3 FP8-Align —— Ada 上"真延迟"导向的剪枝 × FP8 协同设计(中风险/系统级) 中风险
M3 ReVTok —— 可逆视觉 token 压缩(学习型残差码本 + 查询触发再膨胀)(高风险/机制级) 高回报
M3 BudgetNet —— 可微连续 token 预算分配(延迟感知的资源分配头)(高风险/机制级) 高回报
M3 MSVT —— 最小充分视觉 token:新任务、新指标、新数据集(新问题定义/中风险) 中风险
M4 MemSlot——把"首帧记忆缓冲区"泛化为可定位、可调度的通用外部记忆槽 中风险
M4 SpecDecay——长视频自回归漂移的谱能量机制解释与 training-free 方差锚定采样 中风险
M4 PhysReg——可微物理先验作为少步视频生成的轻量约束注入(覆盖非刚体/流体) 中风险
M4 TC-DMD——1.3–5B 视频 DiT 的少步蒸馏与时序一致性系统性研究 中风险
M4 ShotGraph——跨镜头物理/叙事一致性评测与新范式 Mixture-of-Memory 中风险
M4 PhysDPP——物理多样性感知的 T2V 策略优化 中风险
M5 CF-Eval——仿真因果干预验证协议(Causal/反事实,要求3) 中风险
M5 AdaptCoT——CoT 有无用的受控证伪与自适应决策器(要求2,解决学术争论) 中风险
M5 LongTailLoop——长尾获取/生成/评测闭环(要求4) 中风险
M5 CausalLatent——潜空间因果去混淆的世界模型推理(高风险高回报,Oral 候选) 高回报
M5 SimCausal-RL——因果正则的闭环 RL 后训练(高风险高回报,Oral 候选) 高回报
M5 ESLI——Ego-Status Leakage Index 与新开环评测任务(新问题/新任务定义,要求1) 新问题
M6 REP-4WM — 驾驶世界模型"表征空间"头对头与机制解释 中风险
M6 OccWM-Lite — 轻量轨迹条件占用世界模型 + 闭环规划头 中风险
M6 EMERGE-Obj — 无监督物体性与动力学定律涌现(可证伪评测) 中风险
M6 EvalDrive — 反事实闭环仿真协议,实证 FVD 与有用性脱节 中风险
M6 FF-4DSim — 前馈式动态高斯世界模型(VGGT/π3 全参微调) 中风险
M6 LongTail-Sim — 长尾真实资产 + 任意传感器泛化分割(新问题定义) 新问题
M7 SCoRe —— 自我一致性 Rollout 代理指标:不执行环境也能预测 Online 成功率 中风险
M7 ANDAS —— 注意力-新颖性联合检测的弹窗/注入防御闸门 中风险
M7 VidMine —— 旁白对齐 + 信息量排序的视频挖掘课程 中风险
M7 GWM —— 可预测状态摘要器:GUI 世界模型同时干三件事 中风险
M7 GoalVA —— 视觉目标想象作为长时程操作 VLA 的 CoT 中风险
M7 PAUSE —— 主动辅助策略:何时接管、何时提问、何时放手 中风险
M8 SubspaceTransfer——给"可迁移对抗攻击"做解剖:迁移发生在哪一层、如何预测、如何利用(机制理解,高回报) 高回报
M8 DIA——抗漂移的生成模型指纹图集:把"判别真假"升级为"跨架构可归因"(低-中风险,高回报) 中风险
M8 AgentGuard——面向 GUI/embodied agent 的"目标-动作语义一致性"后门实时审计(agent 安全,高回报) 高回报
M8 StylePurity——训练无关的"风格抖动一致性"MLLM 越狱防御(低风险,稳定中稿) 低风险
M8 AdapterScope——面向 T2I LoRA 分享生态的供应链后门"发布前体检"(低风险,稳定) 低风险
M8 PromptProof——提示词级水印:给"prompt 窃取"装上可验证取证(新问题定义,高回报) 高回报
M9 JBS(Joint-Basin Surrogate)——用 Fisher 加权闭式解把 LoRA 合并、持续学习、TTA 统一为"参数流形上的多目标最小二乘" 中风险
M9 Adapter-OS——面向个人研究者的 LoRA 资产管理协议(检索/组合决策/去重/压缩) 中风险
M9 TVAC——Test-time Answer-Consistency Adaptation(VLM 的 VQA/长尾/视频测试时自适应) 中风险
M9 TRAS——Token-Routed Adapter Swarm:以"路由稳定性"为统一目标连接合并、持续学习与 TTA 中风险
M9 Mergeability Prediction——定义"可合并性"为适配器的可预测属性(新问题定义) 新问题
M9 TTCVE——Test-Time Continual Vocabulary Expansion(VLM 的测试时持续词表扩展) 中风险
M10 TempVerify——时序一致性验证的 VLM 辅助 UAV 半监督检测与边缘蒸馏(低风险,VLM×感知交叉) 低风险
M10 TTDA-UAV——面向 UAV 部署域偏移的测试时域适应检测(低风险) 低风险
M10 TempoAlign——事件-帧异步时序对齐与曝光建模的鲁棒多模态检测(高风险,事件相机时间一致性) 高回报
M10 TrustPercept——"何时在瞎猜":分布偏移下带统计保证的检测失败预警(高风险,不确定性/可靠性) 高回报
M10 POR-Net——感知导向的图像复原:以下游检测回报为目标的复原范式与评测协议(新任务定义) 新问题
M10 GoUAV——可信开放的 UAV 边缘开放词汇感知(中风险,VLM×感知落地) 中风险
M11 When Does Retrieval Hurt? — Diagnosing Failure Modes of Multi-Modal RAG(MM-RAG 失败模式诊断) 中风险
M11 Verify-then-Retrieve-Retrieve: Evidence-Gated Iterative Retrieval for Reasoning-Intensive Retrieval(证据门控的迭代检索) 中风险
M11 TimeRAG: Spatio-Temporal Segment Retrieval for Temporal Reasoning over Long Video(时空片段级检索增强的视频时序推理) 中风险
M11 Memory-as-RAG: Auditable Long-Horizon Egocentric Memory Retrieval with Shared Agent Memories(记忆即检索) 中风险
M11 MM-Attest: Evidence Conflict Resolution and Attribution for Multi-Source Multi-Modal RAG(多源多模态 RAG 的证据冲突消解与可信归因) 中风险
M11 Compose-by-Decompose: Attribute-Level Decomposition and Verification for Composed Image Retrieval(分解-组合-验证的 CIR) 中风险
M12 EchoGround——面向超声视频的时序区域级医学 VLM 与可控报告生成 中风险
M12 ReproAgent——预算感知的论文实验复现代理(Budget-Aware Paper-to-Code) 中风险
M12 TrustMed-Bench——医生在环的医学 VLM 可信落地评测协议与新基准 中风险
M12 Attrib-RAG——引用级证据归因的医学多模态 RAG(Claim-Level Attribution) 中风险
M12 US-WORLD——超声自由扫查的预测性容积世界模型 中风险
M12 Ground-Verify——医学 VLM 的 mask 级 grounding 与"生成-定位-重读"自验证闭环 中风险
建议阅读顺序:先看上方 12 个方向卡片了解全局 → 打开与你最相关的方向(M5 自动驾驶 / M12 医学与你的双重背景最契合)→ 用底部表格按"低风险"筛选出第一批 3 个月可出稿的选题 → 每方向完整 8 字段方案见对应 M*.md 文件。