GRLoc
GRLoc Geometric Representation Regression for Visual Localization
RaymapPointmap确定性求解
一句话回忆把学习难题拆成图像到几何、几何到位姿两段;截至语料时间仍属预印本,强结果需独立复现。
- 针对问题
- 如何避免黑盒直接输出 6DoF,改为预测可验证、可诊断的稠密几何中间量?
- 过去缺陷
- 直接输出 6DoF 把所有几何证据压成少量数字,难以检查哪里错了。
- 核心做法
- RGB H×W×3 → 视觉编码/解码 → raymap H×W×6 + pointmap H×W×3 → 可微确定性求解器。论文先预测射线、点图或场景坐标,再由几何求解得到位姿。
- 结果记忆
- 报告强于直接 APR 的精度与泛化,并提供中间几何残差用于诊断。
- 改进方向
- 独立评估中间量误差、几何残差、求解成功率和最终位姿,避免只看最后一个数字。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
A46 · 2026-05-12arXiv
合成数据与适配
PoseCompass
PoseCompass Intelligent Synthetic Pose Selection for Visual Localization
3DGS样本选择主动学习
一句话回忆核心从“生成更多数据”转向“优化每单位渲染与适配时间的监督价值”;结果仍待更大规模同行复现。
- 针对问题
- 3DGS 随机合成会产生冗余或低质量视图,怎样在有限渲染/微调预算下选择真正有价值的姿态?
- 过去缺陷
- 训练轨迹覆盖有限,昂贵的真实采集无法遍历所有视点、天气和照明。
- 核心做法
- 候选 pose 集 M×6 → 定位难度 + 覆盖新颖性 + 可观测性评分 → 轨迹约束 top-K → 3DGS 渲染 K 张。论文用可控渲染补足覆盖,并选择最有价值的合成样本。
- 结果记忆
- 报告适配约 15.2→5.1 分钟,中位位姿误差降低约 53.8%。
- 改进方向
- 固定总训练预算,对比随机采样、难度驱动采样和真实数据增量,并审计渲染失败率。
- 系统边界
- 数据适配模块;适配前有选择/渲染;额外依赖:3DGS + 候选姿态。
KANLoc
Learning to anchor visual odometry KAN-based pose regression for planetary landing
KAN视觉里程计行星着陆
一句话回忆APR 的最佳角色是偶尔校正全局漂移,而非逐帧替代 VO;评价必须看锚捕获率、后端结果和总延迟。
- 针对问题
- 月面弱纹理/低照中 APR 会离群、VO 会累积漂移,怎样用少量可靠全局锚稳定整条轨迹?
- 过去缺陷
- APR 快但粗,结构法精但依赖匹配并可能初始化失败。
- 核心做法
- 每帧 RGB → CNN 特征 d → 轻量 KAN → VO 相对边 + 锚。论文让 APR 与 VO、PnP、SCR 或优化后端分工。
- 结果记忆
- ≥15 FPS;平均平移/旋转误差下降约 32%/45%,单轨迹最高约 45%/48%。
- 改进方向
- 比较随机初值、检索初值和 APR 初值,报告后端收敛率、迭代数与全链路时延。
- 系统边界
- 条件化/混合定位;依赖完整系统;额外依赖:显式地图、坐标图或后端。
A44 · 2025-06-23arXiv
多模态与专域
ThermalLoc
ThermalLoc A vision transformer-based approach for robust thermal camera relocalization in large-sc
热红外EfficientNetTransformer
一句话回忆热成像对环境光鲁棒,但跨相机响应、温度季节变化和低空间纹理形成新的域差;不能与 RGB 基准直接混排。
- 针对问题
- 低照、烟雾和昼夜变化下 RGB 特征失效,怎样针对热红外低分辨率/低纹理图像进行 6DoF 回归?
- 过去缺陷
- 单 RGB 在夜间、弱纹理或极端天气中可能缺少可靠信息。
- 核心做法
- Thermal H×W×1(复制/适配通道) → EfficientNet → Transformer → 双 MLP。论文引入 LiDAR、热红外、深度或卫星地图等互补输入。
- 结果记忆
- 在公共热里程计与自建大尺度热数据上优于 PoseNet、MapNet、AtLoc、RobustLoc。
- 改进方向
- 逐模态关闭、模拟不同步/标定偏差/缺失输入,并报告单模态回退能力。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
A43 · 2025-06-10arXiv
语义与鲁棒性
SG-MST
Robust visual localization via semantic-guided multi-scale transformer
语义引导多尺度 Transformer动态环境
一句话回忆语义提升长期稳定性,但分割前端也会受域差;必须把语义模型延迟和冻结/微调策略纳入比较。
- 针对问题
- 照明、天气和动态物体改变外观时,如何用语义稳定区域引导跨尺度特征交互?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → 语义权重/稳定区域引导 → Multi-scale Transformer 交互 → 全局 pose 表示。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 在覆盖多天气、多场景的 TartanAir 协议上降低平移与旋转误差。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
A42 · 2025-05-14arXiv
多模态与专域
APR-Transformer
APR-transformer Initial pose estimation for localization in complex environments through absolute p
图像/LiDAR初始化GNSS 拒止
一句话回忆工程价值取决于初值是否落入后端捕获域;应同时报告初始化成功率、最终后端精度与端到端延迟。
- 针对问题
- GNSS 拒止环境中,怎样用相机或 LiDAR 给后续定位/配准提供可靠初始绝对位姿?
- 过去缺陷
- 单 RGB 在夜间、弱纹理或极端天气中可能缺少可靠信息。
- 核心做法
- Image/LiDAR → EfficientNet 变体 → 位置/方向两个 Transformer query → 两个 MLP。论文引入 LiDAR、热红外、深度或卫星地图等互补输入。
- 结果记忆
- 论文基准和实车 GNSS-denied 测试显示初值优于代表性回归基线。
- 改进方向
- 逐模态关闭、模拟不同步/标定偏差/缺失输入,并报告单模态回退能力。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Hierarchical Attention
Camera Absolute Pose Estimation Using Hierarchical Attention in Multi-Scene
层次注意力多尺度场景分类
一句话回忆层次设计缩短了局部证据到全局坐标的路径;仍需同参数消融排除模型容量与增强策略的影响。
- 针对问题
- 多场景中局部纹理与全局布局的尺度不同,如何层次化聚合并降低坐标系冲突?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB H×W×3 → CNN 多层特征 {Fₗ} → 局部 → 场景分类 + 任务特定位置/旋转头。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 在多场景基准上较共享 CNN 与单层注意力基线降低位姿误差。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Epistemic APR
Quantifying epistemic uncertainty in absolute pose regression
认知不确定性OOD风险覆盖
一句话回忆可部署评估应看校准、风险—覆盖、OOD AUROC 与多峰覆盖,而不仅是方差和误差的相关系数。
- 针对问题
- APR 在训练域外不可靠,怎样量化认知不确定性并识别重复结构造成的观测歧义?
- 过去缺陷
- 普通 APR 只给一个答案,即使图像模糊或场景重复也显得同样自信。
- 核心做法
- RGB → 位姿分布参数 → 采样/证据聚合 → 点位姿 + epistemic score/区间。论文输出采样、协方差或位姿分布。
- 结果记忆
- 在跨域与歧义序列中使不确定性更好地反映失败风险。
- 改进方向
- 除位姿误差外报告 NLL、ECE、覆盖率、风险—覆盖曲线,并在 OOD 与感知混淆集上校准。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
HST Indoor Benchmark
Large-Scale Benchmarking of Vision-Based Indoor Localization Using Absolute Pose Regression
大尺度室内四层建筑长期采集
一句话回忆大数据集仍需统一预训练、分辨率、训练预算与标签误差;否则排行榜混合了实现差异。
- 针对问题
- 经典 7-Scenes 太小且静态,APR 在真实多楼层、重复布局和跨日期室内环境中还能否保持亚米级?
- 过去缺陷
- 不同论文常使用不同标签、裁剪、预训练和系统边界。
- 核心做法
- 跨日期视频采集 → SfM/人工锚定标签 → 统一训练 PoseNet/AtLoc/MS-Transformer 等 → 楼层级位置/方向统计与 CDF。综述或基准把定义与协议对齐,说明哪些数字可比。
- 结果记忆
- 系统暴露经典小场景上的饱和错觉,并展示多楼层实际导航中的显著性能差异。
- 改进方向
- 逐项回链原表格与补充材料,并把不可直接比较的设置分层展示。
- 系统边界
- 分析研究;不适用;额外依赖:评测语料/数据集。
APR+NVS Tracking
Tracking registration method based on absolute pose regression and novel view synthesis
新视角合成等变特征直接匹配
一句话回忆最终精度来自迭代渲染后端,需同时核算场景模型、迭代次数、初值捕获域和总时延。
- 针对问题
- APR 粗位姿如何通过曝光稳健的新视角合成和直接匹配满足跟踪注册精度?
- 过去缺陷
- 一次前向 APR 给出速度快但可能较粗的初值。
- 核心做法
- RGB → 粗 pose → 时序光度一致体渲染 → 反向传播直接匹配。论文用 NeRF 或特征场渲染当前候选位姿,再根据残差修正。
- 结果记忆
- 在 7-Scenes 上较单图 APR 显著改善跟踪注册精度。
- 改进方向
- 扫描初始位姿扰动、迭代步数、场景模型大小和建图时间,绘制精度—成本—捕获域三维曲线。
- 系统边界
- 扩展 APR / 神经精化;可能含测试时迭代;额外依赖:场景模型/粗初值。
CA-Net
A method for absolute pose regression based on cascaded attention modules
级联注意力Non-local多尺度卷积
一句话回忆论文消融较完整,但裁剪协议与部分表格定义存在疑点;优势仍主要落在已知场景内。
- 针对问题
- 多尺度局部卷积与长程空间—通道依赖能否以更高吞吐改善 APR?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → 多尺度分组卷积级联注意力 → 空间/通道双流 non-local → 聚合向量。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 约 26.8M 参数、112 FPS;7-Scenes 平均约 0.19m/7.44°。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
PoseViTNet
PoseViTNet Multi-Scene Absolute Pose Regression Using Vision Transformers
ViTAttention Mask多场景
一句话回忆收益可能同时来自大规模预训练、参数量与场景条件;需固定训练预算才能把贡献归因给自注意力。
- 针对问题
- 在动态或弱纹理环境中,全局自注意力能否比纯 CNN 更好地聚合场景布局?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB H×W×3 → P×P patch → ViT/ConViT + attention mask → 全局描述子 d。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- ViT 版本在论文协议下取得室内外多场景较优结果。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
ConDo
ConDo Continual domain expansion for absolute pose regression
持续域扩展遗忘回放
一句话回忆正确指标不是最终混合精度,而是向后迁移、遗忘量、适配时间、回放存储和每域参数增量。
- 针对问题
- 部署后新天气、新几何与新视点连续到来时,APR 如何学习新域而不过度遗忘旧域?
- 过去缺陷
- 静态 APR 假设所有场景和外观在训练开始前都已收集。
- 核心做法
- 当前域 RGB → 共享 APR 编码器 → 持续更新/回放或正则 → 各域绝对位姿 + 域间保留评估。论文让模型按域或时间持续吸收新数据,同时尽量不忘旧知识。
- 结果记忆
- 建立室内、室外与长期驾驶的持续 APR 基准,并在适应—遗忘之间优于静态微调。
- 改进方向
- 按域到达顺序报告平均精度、遗忘、前向/向后迁移、回放比例和每域新增存储。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
HyperPose
HyperPose Hypernetwork-Infused Camera Pose Localization and an Extended Cambridge Landmarks Dataset
超网络动态权重合成外观
一句话回忆超网络把条件适配从固定特征调制升级为权重生成,增强表达力的同时也带来显著内存与稳定性代价。
- 针对问题
- 固定回归头难适应天气、季节、照明与视角变化,能否由输入特征动态生成位姿头参数?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB → Hypernetwork(d) → 动态 MLPₜ / MLPᵣ → t∈R³ + q∈R⁴。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 单场景与多场景版本多项指标优于对应基线,但 MS-HyperPose 约 571MB。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
APR-BiCA
APR-BiCA LiDAR-based absolute pose regression with bidirectional cross attention and gating unit
LiDARRange Image交叉注意力
一句话回忆两路并非独立传感器,而是同一 LiDAR 的稀疏点集与规则投影;门控学习在遮挡/密度变化时选择更可靠表示。
- 针对问题
- 如何同时利用 LiDAR 原始点集的三维几何与 range image 的稠密卷积结构?
- 过去缺陷
- 单 RGB 在夜间、弱纹理或极端天气中可能缺少可靠信息。
- 核心做法
- 点云 N×3/4 → Range image H×W×C → 线性对齐到 512 维 token → 双向 8 头交叉注意力 + 门控。论文引入 LiDAR、热红外、深度或卫星地图等互补输入。
- 结果记忆
- Oxford/NCLT 表格平均约 6.46m/0.99° 与 2.57m/3.05°。
- 改进方向
- 逐模态关闭、模拟不同步/标定偏差/缺失输入,并报告单模态回退能力。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Transformer Encoders CPR
Learning single and multi-scene camera pose regression with transformer encoders
Encoder-onlyPose Token统一架构
一句话回忆把任务信息放入专用 token 可减少结构分叉,但仍未解决未知场景坐标原点从何而来。
- 针对问题
- 复杂 decoder 是否必要,能否用更简洁的 encoder-only Transformer 统一单场景和多场景 CPR?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- CNN 特征 H×W×C → N=HW token + pose tokens → Transformer Encoder → 位置 token。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 以更简洁编码器取得与复杂编解码器相当或更好的单/多场景结果。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
PoseMap
Learning neural volumetric pose features for camera localization
体特征NVS姿态敏感特征
一句话回忆特征场把场景几何和外观先验显式化,但每场景训练、存储、显存和新场景构建时间必须计入比较。
- 针对问题
- 神经辐射/体场能否不只生成 RGB,而是学习专门对相机位姿敏感的三维特征?
- 过去缺陷
- 一次前向 APR 给出速度快但可能较粗的初值。
- 核心做法
- 多视图 RGB+pose → 体采样/聚合 → 查询视图特征 ↔ 渲染特征 → APR 训练或 SE(3) 精化。论文用 NeRF 或特征场渲染当前候选位姿,再根据残差修正。
- 结果记忆
- 三维姿态特征同时改善直接回归与后验精化,尤其受益于合成视角覆盖。
- 改进方向
- 扫描初始位姿扰动、迭代步数、场景模型大小和建图时间,绘制精度—成本—捕获域三维曲线。
- 系统边界
- 扩展 APR / 神经精化;可能含测试时迭代;额外依赖:场景模型/粗初值。
Activate Self-Attention
Activating Self-Attention for Multi-Scene Absolute Pose Regression
注意力诊断Q-K 对齐位置编码
一句话回忆论文的价值是把性能退化追溯到可测的嵌入几何,而不是简单叠加注意力模块。
- 针对问题
- 多场景 Transformer 为什么出现注意力集中到少数 key 的坍缩,怎样在机制层面修复?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- 特征图 H×W×C → 展平 N=HW 个 C 维 token → Q-K 对齐 + 固定正弦位置编码 → Transformer。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 恢复更分散且更有效的注意力,在多场景基准上改善精度。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
NeFeS
Neural refinement for absolute pose regression with feature synthesis
特征场测试时优化APR 后端
一句话回忆精度来自显式的测试时分析合成闭环;它应被理解为 APR 初始化器加神经场后端,而非单次前向 APR。
- 针对问题
- 怎样在不重建显式点云匹配的前提下,用三维几何把粗 APR 初值精化到厘米级?
- 过去缺陷
- 一次前向 APR 给出速度快但可能较粗的初值。
- 核心做法
- 查询图像 → 初始位姿 P₀ → NeFeS 渲染 fʳ∈R^(n×c) → 约 50 次 SE(3) 更新。论文用 NeRF 或特征场渲染当前候选位姿,再根据残差修正。
- 结果记忆
- 在重标注 7-Scenes 与 Cambridge 上大幅压低粗 APR 误差,达到高精度单图定位。
- 改进方向
- 扫描初始位姿扰动、迭代步数、场景模型大小和建图时间,绘制精度—成本—捕获域三维曲线。
- 系统边界
- 扩展 APR / 神经精化;可能含测试时迭代;额外依赖:场景模型/粗初值。
marepo
Map-Relative Pose Regression for Visual Re-Localization
场景坐标Transformer通用解算器
一句话回忆可迁移的是 2D 射线—3D 坐标—相机位姿之间的几何解算规律,场景本身仍由 ACE 类坐标图提供。
- 针对问题
- 能否把场景内容从回归器权重中剥离,使一个通用网络在新地图上直接求解位姿?
- 过去缺陷
- 经典 APR 把每个场景记在独立模型里,换场景就要重训。
- 核心做法
- 2D 网格 u∈R² + 3D 坐标 X∈R³ → 正弦编码 → 12 层线性 Transformer(3×4) → 全局池化/回归。论文把场景内容放进坐标图/地图,网络只学习通用求解。
- 结果记忆
- 7-Scenes 达到约 3–4 cm / 1.5–1.7°;新场景映射可缩短到分钟级。
- 改进方向
- 对场景坐标加入噪声、空洞和系统偏置,分别测量解算器泛化与地图构建成本。
- 系统边界
- 条件化/混合定位;依赖完整系统;额外依赖:显式地图、坐标图或后端。
UAV-Satellite APR
Absolute pose estimation of UAV based on large-scale satellite image
UAV卫星地图跨视角
一句话回忆输出自由度、地图先验和误差单位不同于标准室内 6DoF;应按跨视角地理定位评价。
- 针对问题
- 无人机地面视角与大范围卫星俯视图存在极端视角、尺度和季节差,如何恢复地理绝对姿态?
- 过去缺陷
- 单 RGB 在夜间、弱纹理或极端天气中可能缺少可靠信息。
- 核心做法
- UAV RGB 与 satellite tile → 双分支跨视角特征 → 相关/注意力对齐 → 地理位置 + 航向/姿态参数。论文引入 LiDAR、热红外、深度或卫星地图等互补输入。
- 结果记忆
- 在大区域跨视角数据上提高 UAV 绝对定位,为 GNSS 弱化场景提供视觉方案。
- 改进方向
- 逐模态关闭、模拟不同步/标定偏差/缺失输入,并报告单模态回退能力。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
TransBoNet
TransBoNet Learning camera localization with transformer bottleneck and attention
Transformer BottleneckSEShuffle Attention
一句话回忆注意力在计算便宜的低分辨率阶段工作;自定义 split 与热图不能替代跨协议、速度和参数量审计。
- 针对问题
- 如何在保持单帧效率的同时,用低分辨率全局依赖和通道/空间注意力抑制动态干扰?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → 低分辨率特征 → SE + Shuffle Attention → 全局向量。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 7-Scenes 平均约 0.20m/8.45°;Oxford 长路线中位约 7.62m/1.47°。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
RobustLoc
RobustLoc Robust Camera Pose Regression in Challenging Driving Environments
神经 ODE驾驶扰动鲁棒
一句话回忆驾驶数据的 GT 融合、帧采样和自定义扰动强度会显著改变结论,复现需锁定完整协议。
- 针对问题
- 长期驾驶中的季节、天气、照明、动态交通和传感噪声如何在连续特征动力学中被抑制?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → 鲁棒/连续神经动力学特征演化 → 扰动不变表示 → 绝对位置 + 方向。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 在原始与扰动驾驶数据上优于代表性 APR,并扩大到多季节道路场景。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
MCAPR
MCAPR Multi-modality cross attention for camera absolute pose regression
RGB-DPointNetCross Attention
一句话回忆精度收益以深度传感器、标定和 PointNet 成本为代价;缺失/噪声深度和异步输入仍需压力测试。
- 针对问题
- RGB 外观与深度几何怎样在位置/方向两个任务中进行双向互补,而不是简单拼接?
- 过去缺陷
- 单 RGB 在夜间、弱纹理或极端天气中可能缺少可靠信息。
- 核心做法
- RGB → Depth/point cloud → 位置/旋转双向 cross-attention → 融合 token。论文引入 LiDAR、热红外、深度或卫星地图等互补输入。
- 结果记忆
- 多场景平均约 0.16m/7.03°,场景识别约 97.5%,优于单 RGB。
- 改进方向
- 逐模态关闭、模拟不同步/标定偏差/缺失输入,并报告单模态回退能力。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
A23 · 2023IEEE TPAMI
多场景共享
C2F-MS-Transformer
Coarse-to-Fine Multi-Scene Pose Regression With Transformers
粗到细区域分类Transformer
一句话回忆局部坐标缩小了回归范围,但错误路由通常不可恢复;oracle 路由与预测路由差值是关键诊断。
- 针对问题
- 多场景直接回归的动态范围过大,能否先判定场景/粗区域再做局部精回归?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB → Transformer → 区域条件 latent → 局部坐标精回归。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 粗到细分解降低坐标冲突并优于直接多场景回归。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
SCR+APR
Combining scene coordinate regression and absolute pose regression for visual relocalization
场景坐标不确定性RANSAC
一句话回忆它是显式—隐式混合系统;推理仍包含坐标图和 RANSAC,不能归入纯一次前向 APR 的同一成本栏。
- 针对问题
- APR 有全局先验但精度有限,SCR 有稠密几何但易受离群点影响,怎样分层互补?
- 过去缺陷
- APR 快但粗,结构法精但依赖匹配并可能初始化失败。
- 核心做法
- RGB → APR 分支 → 深特征条件模块 → 不确定性 RANSAC/PnP。论文让 APR 与 VO、PnP、SCR 或优化后端分工。
- 结果记忆
- 组合网络在室内外基准优于单独 APR 或 SCR,并降低错误坐标对求解的影响。
- 改进方向
- 比较随机初值、检索初值和 APR 初值,报告后端收敛率、迭代数与全链路时延。
- 系统边界
- 条件化/混合定位;依赖完整系统;额外依赖:显式地图、坐标图或后端。
TransAPR
TransAPR Absolute Camera Pose Regression With Spatial and Temporal Attention
空间注意力时间注意力HFA
一句话回忆空间和时间注意力解决不同歧义;在线复现必须披露窗口、是否用未来帧、缓存和丢帧退化。
- 针对问题
- 如何在 CNN 之上分别建模帧内空间关系、帧间运动关系和多层尺度信息?
- 过去缺陷
- 单帧可能被遮挡、模糊或与另一位置外观相似。
- 核心做法
- T×RGB → CNN 多层 {T×Hₗ×Wₗ×Cₗ} → 空间 Transformer + 时间 Transformer → HFA 多尺度聚合。论文同时观察多帧并利用运动连续性。
- 结果记忆
- 在室内外序列基准减少大离群值并优于 CNN/RNN 序列回归器。
- 改进方向
- 比较因果/非因果窗口、不同帧率和窗口长度,并加入丢帧、停顿和剧烈转向实验。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
ORG
Objects matter Learning object relation graph for robust absolute pose regression
对象关系图语义动态图
一句话回忆对象图提供可解释中尺度锚,但系统上限受检测器类别覆盖与域差控制;无显著对象场景可能退化。
- 针对问题
- 动态物体、遮挡与外观变化破坏局部纹理时,稳定对象及其空间关系能否提供更长期的定位证据?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → K 个对象 ROI → 对象关系图 G(V,E) → 全局+对象语义。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 在室内、跨扫描与驾驶场景改善动态/遮挡条件下的鲁棒性。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Camera PAE
Camera pose auto-encoders for improving pose regression
Auto-Encoder姿态流形Teacher-Student
一句话回忆先验只在训练轨迹覆盖内可靠;能从姿态编码反演图像也提醒我们隐式地图并非天然保护训练隐私。
- 针对问题
- 训练姿态集合能否被压缩成轻量流形先验,在不保存原图的情况下修正不合理 APR 输出?
- 过去缺陷
- 无约束回归可能输出远离可行轨迹的离群位姿。
- 核心做法
- pose 7D → MLP Encoder → 近邻/学生先验 → MLP Decoder。论文学习或显式施加位姿流形先验。
- 结果记忆
- 轻量 PAE 可逼近并改善 APR,在低存储下约束输出落入训练姿态流形。
- 改进方向
- 按训练轨迹距离分桶,比较先验强度对内插精度与外插召回的相反影响。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
E-PoseNet
Leveraging equivariant features for absolute pose regression
等变特征群结构旋转
一句话回忆等变性比数据增强更强,因为它限定了特征如何随变换变化;但离散群近似和计算开销限制连续 SE(3) 覆盖。
- 针对问题
- 普通 CNN 特征对相机变换响应不可预测,能否把群等变性作为位姿回归的归纳偏置?
- 过去缺陷
- 直接输出 6DoF 把所有几何证据压成少量数字,难以检查哪里错了。
- 核心做法
- RGB H×W×3 → 等变/方向敏感卷积特征 → 群/方向通道聚合 → 全局特征。论文先预测射线、点图或场景坐标,再由几何求解得到位姿。
- 结果记忆
- 受控变换下特征响应更规律,标准室内外 APR 指标优于普通骨干。
- 改进方向
- 独立评估中间量误差、几何残差、求解成功率和最终位姿,避免只看最后一个数字。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
PDQ-Net
PDQ-net Deep probabilistic dual quaternion network for absolute pose regression on SE(3)
双四元数SE(3)概率回归
一句话回忆表示更符合 SE(3) 结构,但归一化、符号双覆盖和分布校准比普通 3+4 头更复杂。
- 针对问题
- 两个独立欧氏回归头会割裂刚体运动,如何在 SE(3) 上联合表示位姿和概率?
- 过去缺陷
- 普通 APR 只给一个答案,即使图像模糊或场景重复也显得同样自信。
- 核心做法
- RGB → 全局特征 d → 概率参数头 → 双四元数 8D(实部旋转 + 对偶部平移)及分布参数。论文输出采样、协方差或位姿分布。
- 结果记忆
- 在统一刚体表示下兼顾点估计和不确定性,多个标准场景优于欧氏化基线。
- 改进方向
- 除位姿误差外报告 NLL、ECE、覆盖率、风险—覆盖曲线,并在 OOD 与感知混淆集上校准。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
DFNet
DFNet Enhance absolute pose regression with direct feature matching
特征匹配NeRF域不变特征
一句话回忆把残差空间从 RGB 改成学习特征,等价于为直接法学习一个更宽捕获域、更耐曝光的测量函数。
- 针对问题
- 像素光度损失对曝光和合成—真实域差过于敏感,如何改用稳定且仍对位姿敏感的特征残差?
- 过去缺陷
- 一次前向 APR 给出速度快但可能较粗的初值。
- 核心做法
- RGB H×W×3 → VGG-16 blocks 1/3/5 → 统一到 M∈R^(Hₘ×Wₘ×Cₘ) → 逐位置余弦匹配 + 位姿 3+6/9。论文用 NeRF 或特征场渲染当前候选位姿,再根据残差修正。
- 结果记忆
- DFNetdm 在室内外均显著改善 APR;最佳设置含 NeRF 合成和可选测试时优化。
- 改进方向
- 扫描初始位姿扰动、迭代步数、场景模型大小和建图时间,绘制精度—成本—捕获域三维曲线。
- 系统边界
- 扩展 APR / 神经精化;可能含测试时迭代;额外依赖:场景模型/粗初值。
Shared Pose Encoder
Do we really need scene-specific pose encoders
共享编码器检索特征轻量头
一句话回忆低层视觉可以复用,固定世界坐标映射却仍需场景身份;共享参数不等于场景无关定位。
- 针对问题
- 多场景 APR 是否真的需要为每个场景训练专属视觉编码器?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB → 跨场景共享检索/视觉编码器 → 场景条件或轻量回归头 → t∈R³ + q∈R⁴。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 共享编码器与轻量场景组件即可保持有竞争力的已知场景精度。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
MS-Transformer
Learning Multi-Scene Absolute Pose Regression with Transformers
Transformer场景 Query任务解耦
一句话回忆场景 query 同时承担坐标系选择与信息聚合;场景分类错误会把视觉证据送入错误世界坐标。
- 针对问题
- 如何用注意力从共享 CNN 激活中为多个坐标系提取位置/旋转专用表示?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB → 展平 N×C token + 位置编码 → 位置/旋转 Transformer 编解码器 → 场景 query 选择。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 一个模型覆盖多个场景,并成为后续多场景 Transformer 的关键基线。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Direct-PoseNet
Direct-PoseNet Absolute pose regression with photometric consistency
NeRF光度一致性半监督
一句话回忆NeRF 在这里不是最终定位器,而是训练期的可微几何教师;系统成本仍包括每场景辐射场。
- 针对问题
- 仅用位姿标签训练的 APR 缺少像素级几何反馈,能否用可微新视角合成闭环监督?
- 过去缺陷
- 一次前向 APR 给出速度快但可能较粗的初值。
- 核心做法
- RGB H×W×3 → CNN 位姿编码 → 回归 t∈R³ 与 R∈R³ˣ³ → NeRF(训练期)。论文用 NeRF 或特征场渲染当前候选位姿,再根据残差修正。
- 结果记忆
- 在保持测试时一次前向的同时优于基础 APR,并支持无标签目标域适配。
- 改进方向
- 扫描初始位姿扰动、迭代步数、场景模型大小和建图时间,绘制精度—成本—捕获域三维曲线。
- 系统边界
- 扩展 APR / 神经精化;可能含测试时迭代;额外依赖:场景模型/粗初值。
Multi-View GNN
Learning Multi-View Camera Relocalization With Graph Neural Networks
GNN视图图非连续帧
一句话回忆边构建可能引入额外先验,计算与显存随节点/边数增长;在线版本需要限制图窗口。
- 针对问题
- 固定 RNN 链只能顺序传播,怎样让非连续帧也通过图边交换定位信息?
- 过去缺陷
- 单帧可能被遮挡、模糊或与另一位置外观相似。
- 核心做法
- N 帧 RGB → 帧间关系 → 消息传递 GNN ×K → 每节点绝对 6DoF。论文同时观察多帧并利用运动连续性。
- 结果记忆
- 图结构优于固定链式序列模型,尤其适合非均匀采样和跨帧上下文。
- 改进方向
- 比较因果/非因果窗口、不同帧率和窗口长度,并加入丢帧、停顿和剧烈转向实验。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
AtLoc
AtLoc Attention Guided Camera Localization
注意力鲁棒单帧AtLoc+
一句话回忆注意力热图说明模型关注位置,却不能单独证明三维几何理解;单帧与序列结果必须分栏。
- 针对问题
- 怎样让单图 APR 抑制动态对象与无关外观,使全局描述子聚焦更稳定的几何线索?
- 过去缺陷
- 普通特征可能依赖行人、车辆、树叶或短期纹理。
- 核心做法
- RGB → 注意力权重 A(H×W/C) → 加权全局特征 d → MLP。论文用语义、对象关系或注意力强调长期稳定区域。
- 结果记忆
- 成为长期沿用的强 APR 基线;AtLoc+ 在序列条件下进一步减少离群点。
- 改进方向
- 进行同容量消融、动态物体比例分桶、语义误分类扰动和跨季节压力测试。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
MSPN
Extending Absolute Pose Regression to Multiple Scenes
CNN多场景场景路由
一句话回忆真正被共享的是视觉编码,不同世界坐标原点仍保留在轻量回归头中;因此这是参数共享,不是未知场景泛化。
- 针对问题
- 怎样让一个 APR 网络覆盖多个互不共享世界坐标系的场景,而不为每个场景复制完整编码器?
- 过去缺陷
- 每个场景训练一个完整网络会线性增加参数和维护成本。
- 核心做法
- RGB 224×224×3 → ResNet-34 → 全局池化 → 场景分类 S + 场景专属位姿头 3+3。论文共享大部分编码器,只保留场景路由或小型专属部分。
- 结果记忆
- 每增加一个场景仅增加约 1.4 万参数;精度与逐场景 PoseNet/MapNet 具有竞争力。
- 改进方向
- 同时报告场景 oracle、端到端路由、新增场景微调以及随场景数量增长的容量曲线。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Local Supports Global
Local supports global Deep camera relocalization with sequence enhancement
序列增强局部运动全局锚
一句话回忆应审计窗口、未来帧与 GT 自带平滑;否则可能把标签滤波效果误当成模型几何能力。
- 针对问题
- 短序列的局部连续性如何支持单帧全局位置学习并缓解视觉混叠?
- 过去缺陷
- 单帧可能被遮挡、模糊或与另一位置外观相似。
- 核心做法
- T×RGB → 每帧全局特征 T×d → 局部序列关系编码 → 全局 6DoF + 局部一致轨迹。论文同时观察多帧并利用运动连续性。
- 结果记忆
- 序列增强改善单帧歧义并平滑轨迹,在室内外数据上优于纯全局回归。
- 改进方向
- 比较因果/非因果窗口、不同帧率和窗口长度,并加入丢帧、停顿和剧烈转向实验。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
APR Tutorial
Introduction to camera pose estimation with deep learning
综述复现历史
一句话回忆适合建立术语与历史坐标,但任何数值、发表状态和因果判断仍应回到原论文核验。
- 针对问题
- 如何统一理解早期深度相机位姿估计的架构、表示、数据集和可复现性?
- 过去缺陷
- 不同论文常使用不同标签、裁剪、预训练和系统边界。
- 核心做法
- PoseNet 基础 → 损失/骨干/时序分支 → 数据集与协议比较 → 趋势和复现建议。综述或基准把定义与协议对齐,说明哪些数字可比。
- 结果记忆
- 提供早期 APR 脉络、横向比较和实践说明。
- 改进方向
- 逐项回链原表格与补充材料,并把不可直接比较的设置分层展示。
- 系统边界
- 分析研究;不适用;额外依赖:评测语料/数据集。
APR Limits
Understanding the limitations of CNN-based absolute camera pose regression
限制分析检索插值外推
一句话回忆它改变了证据门槛:标准 split 中位数的小幅下降不足以证明几何理解,必须测试未见视点、外观和场景。
- 针对问题
- CNN-APR 究竟学到可外推三维几何,还是主要在训练图附近做检索与姿态插值?
- 过去缺陷
- 不同论文常使用不同标签、裁剪、预训练和系统边界。
- 核心做法
- 查询图像 → APR 全局描述子 → 近邻训练图/插值分析 → 与 3D 结构法在覆盖外视点比较。综述或基准把定义与协议对齐,说明哪些数字可比。
- 结果记忆
- 多种 CNN-APR 可被训练图检索与姿态插值较好解释,训练轨迹外明显弱于结构法。
- 改进方向
- 逐项回链原表格与补充材料,并把不可直接比较的设置分层展示。
- 系统边界
- 分析研究;不适用;额外依赖:评测语料/数据集。
MapNet
Geometry-Aware Learning of Maps for Camera Localization
相对约束VOPGO
一句话回忆贡献不在于更深的回归头,而在于把地图定义成同时支持绝对锚和相对运动的一组网络参数。
- 针对问题
- 单帧绝对位姿回归缺少局部轨迹几何,怎样用相邻帧关系约束隐式地图?
- 过去缺陷
- 纯单帧 APR 逐张预测,相邻帧即使来自连续运动也可能互相矛盾。
- 核心做法
- RGB 341×256×3 → ResNet-34 → 全局描述子 → 绝对位姿 3+3;帧对组成相对位姿。论文把相对运动、投影或轨迹关系写入训练/优化。
- 结果记忆
- 相对约束改善轨迹局部一致性;MapNet+ 和 MapNet+PGO 进一步提高精度但引入额外数据/优化。
- 改进方向
- 分别关闭绝对项、相对项和后端优化,并报告单帧误差、轨迹漂移及端到端延迟。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
LSTM PoseNet
Image-based localization using LSTMs for structured feature correlation
LSTM结构化降维单图
一句话回忆LSTM 在这里建模单张图的空间特征序列,不应与 VidLoc 的视频时序混淆。
- 针对问题
- 全局池化会破坏空间布局,能否把单图 CNN 特征重排成序列,让 LSTM 学习远距离结构相关?
- 过去缺陷
- 传统视觉定位先找图像关键点、建立 2D—3D 对应,再用 PnP 求位姿。
- 核心做法
- RGB → 按空间/通道切片成序列 → 双向 LSTM 结构化降维 → 两个 FC。这类论文尝试让网络直接从图像回归位姿。
- 结果记忆
- 相对 CNN 全局向量显著改善室内外定位,并引入大尺度 TUM-LSI 室内场景。
- 改进方向
- 按到最近训练图像的距离分桶,并分别报告轨迹内插区与外插区误差。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
Geometric Loss
Geometric loss functions for camera pose regression with deep learning
可学习权重重投影多任务
一句话回忆可学习权重首先是任务尺度平衡机制,并不自动产生逐样本置信度;重投影项则把 SE(3) 误差转成成像影响。
- 针对问题
- 平移米与旋转参数的数值尺度不同,如何摆脱每场景手调 β,并让误差反映真实成像几何?
- 过去缺陷
- 纯单帧 APR 逐张预测,相邻帧即使来自连续运动也可能互相矛盾。
- 核心做法
- RGB → 全局特征 → FC → 可选:3D 点投影到 2D 形成统一残差。论文把相对运动、投影或轨迹关系写入训练/优化。
- 结果记忆
- 显著减少手工调参并提高多尺度数据集上的稳定性;几何损失仍落后高精度结构法。
- 改进方向
- 分别关闭绝对项、相对项和后端优化,并报告单帧误差、轨迹漂移及端到端延迟。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
VidLoc
VidLoc A deep spatio-temporal model for 6-DoF video-clip relocalization
BiLSTM视频混合密度
一句话回忆双向 LSTM 使用未来帧,适合离线视频;在线系统需改成因果窗口并重新测量延迟与精度。
- 针对问题
- 单帧观测存在重复纹理与遮挡歧义,视频上下文能否同时平滑轨迹并表达多峰位姿?
- 过去缺陷
- 单帧可能被遮挡、模糊或与另一位置外观相似。
- 核心做法
- 每帧 RGB → CNN → 双向 LSTM → 每帧 3+4;可选 MDN 多分量。论文同时观察多帧并利用运动连续性。
- 结果记忆
- 显著平滑单帧预测,并报告约 97.2% 样本落在 3σ 区间。
- 改进方向
- 比较因果/非因果窗口、不同帧率和窗口长度,并加入丢帧、停顿和剧烈转向实验。
- 系统边界
- 扩展 APR;视版本而定;额外依赖:可能需要序列或相对传感器。
Bayesian PoseNet
Modelling uncertainty in deep learning for camera relocalization
MC Dropout认知不确定性校准
一句话回忆它主要估计模型认知不确定性;相关性不是校准,且多次前向的延迟与按测试分布归一化问题必须显式报告。
- 针对问题
- 点估计 APR 不知道自己何时不可靠,能否低成本近似权重后验并输出置信信息?
- 过去缺陷
- 普通 APR 只给一个答案,即使图像模糊或场景重复也显得同样自信。
- 核心做法
- 224×224×3 → 23 层 GoogLeNet + dropout → T 次 2048 维随机特征 → T 个 7D 位姿。论文输出采样、协方差或位姿分布。
- 结果记忆
- MC 平均提高精度,样本方差与错误程度相关,并用于粗场景识别。
- 改进方向
- 除位姿误差外报告 NLL、ECE、覆盖率、风险—覆盖曲线,并在 OOD 与感知混淆集上校准。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。
PoseNet
PoseNet A Convolutional Network for Real-Time 6-DOF Camera Relocalization
GoogLeNet单图直接回归
一句话回忆网络权重充当压缩的隐式地图;简洁性很强,但手工任务权重、场景绑定与训练视点外插成为后续十年的核心问题。
- 针对问题
- 能否用一个端到端卷积网络把单张 RGB 直接映射到固定世界坐标中的 6DoF 位姿?
- 过去缺陷
- 传统视觉定位先找图像关键点、建立 2D—3D 对应,再用 PnP 求位姿。
- 核心做法
- 224×224×3 → 23 层 GoogLeNet/Inception → 2048 维定位特征 → FC。这类论文尝试让网络直接从图像回归位姿。
- 结果记忆
- 约 50MB、中心裁剪约 5ms;大型室外场景约 2m/3°,首次建立实时单图 APR 基线。
- 改进方向
- 按到最近训练图像的距离分桶,并分别报告轨迹内插区与外插区误差。
- 系统边界
- 纯/专域 APR;通常一次前向;额外依赖:训练后单次输入。