47 PAPERS · 501 PAGES · 2015—2026

绝对位姿回归:从黑盒 6DoF 到可验证几何

本页是完整 HTML 版长篇综述;目录、表格、公式、证据分级和逐篇索引均可在浏览器内阅读与检索。

摘要

绝对位姿回归(Absolute Pose Regression,APR)以单张图像或一段传感器观测为输入,通过神经网络直接预测相机或载体在已知世界坐标系中的六自由度位姿。自 PoseNet 于 2015 年将图像分类网络改造成端到端 6DoF 回归器以来,APR 形成了一个持续演化的研究谱系:从损失权重和贝叶斯不确定性,扩展到时序建模、多场景共享、Transformer 注意力、等变特征、概率 SE(3) 表示、多模态融合、神经辐射场与三维高斯生成式增强,再到 2024–2026 年的地图条件化回归、三维特征场精化、几何中间表示、持续域扩展和场景无关定位。

本文系统精读工作区内 47 篇 PDF,共 501 页、全文抽取约 33.65 万英文词,并补充核验截至 2026 年 7 月 11 日的官方论文与会议资料。综述首先严格区分四类常被混写的方法:一次前向的纯 APR、使用序列/多模态/多场景的扩展 APR、需要场景地图或测试时迭代的混合方法,以及 RPR、SPR、CRR、SCR 等相邻范式;随后统一梳理坐标约定、旋转参数化、损失与评价协议,构建以“信息输入—地图表示—几何约束—场景适配—推理开销—不确定性”为轴的分类体系;最后审计经典数据集的可比性,综合代表性结果并提出研究议程。

本文的核心判断是:APR 并未被结构法淘汰,但其最有前景的角色正在变化。单纯以更强 CNN 或注意力模块替换骨干,通常只能获得渐进收益;真正改变精度、泛化和部署边界的工作,往往显式处理了至少一个结构性瓶颈——训练视点与外观覆盖、场景坐标绑定、三维几何可验证性、测试时精化、跨场景规模化学习,或失败时的可信度估计。未来高价值方向不是继续把所有信息压缩成一个黑盒 6DoF 向量,而是在保持回归速度的同时,输出可解算的几何表示、可校准的位姿分布和可核算的适配成本。

关键词: 绝对位姿回归;相机重定位;视觉定位;SE(3);多场景学习;不确定性;神经渲染;3D Gaussian Splatting

阅读提示: 文中“达到最优”仅在同一论文、同一数据标签和同一评测协议内成立。凡使用测试序列无标签微调、每场景 NeRF/3DGS、显式地图、检索数据库、序列输入或测试时迭代者,均单独披露额外资源,不与纯单图一次前向 APR 合并排名。

关键结论

  • APR 的工程优势仍然成立。 在目标场景固定、训练数据可获得且需要毫秒级前向推理时,APR 的模型式隐式地图、固定存储和简洁推理链具有吸引力;这也是其在车载、热红外、LiDAR、UAV 和行星着陆等专用场景持续出现的原因。
  • 经典局限没有被骨干升级自动消除。 Sattler 等人的分析表明,许多 CNN-APR 更接近训练图像的检索与位姿插值;测试轨迹超出训练覆盖、出现重复结构或长期外观变化时,误差会急剧增加。Transformer 能改善全局依赖建模,却不会凭空提供度量几何或新场景坐标系。
  • 纯 APR、地图条件化回归和后验精化是不同系统。 marepo 的厘米级结果依赖每场景 ACE 场景坐标网络;NeFeS 的结果依赖场景特征场和约 50 次测试时优化;Reloc3r 依赖检索数据库与相对位姿平均。它们值得比较,但成本维度不同。
  • 训练数据的“覆盖质量”正成为第一变量。 早期 NVS 工作主要补充视点,RAP 进一步利用可变外观 3DGS 合成光照、天气和模糊,PoseCompass 则从随机采样转向根据定位难度、覆盖新颖性与渲染可观测性选择高价值姿态。生成更多图像不等于生成更多有效监督。
  • 几何中间表示正在回归。 MapNet 的相对约束、Direct-PoseNet/DFNet 的可微渲染、marepo 的场景坐标图、NeFeS 的三维特征场、CRR 的相机射线以及 GRLoc 的 raymap/pointmap 都说明:把图像直接压成 6DoF 并非唯一回归方式,先预测过参数化但可验证的几何量往往更易学习、更可解释。
  • “多场景”不等于“场景无关”。 共享骨干、场景 token 或场景专属头可以压缩模型数量,但通常仍需已知场景身份、训练过的场景头或目标场景数据。真正的新场景零/少样本能力,应另以目标场景适配时间、地图/数据库需求和未见场景误差评估。
  • 可信定位不能只看中位误差。 中位数会掩盖灾难性尾部。安全关键系统至少应报告 P95/P99、阈值召回、失败率、风险—覆盖曲线、分布外检测与回退策略;位姿不确定性还应区分观测歧义、模型认知不确定性和标注噪声。

1 范围、定义与综述方法

1.1 什么是绝对位姿回归

给定查询观测 I,绝对位姿回归学习参数化函数 f_θ,将观测映射为目标场景世界坐标系中的相机位姿:

$$ f_θ(I)=P̂=(R̂,t̂), R̂∈SO(3), t̂∈R³. $$

在视觉 APR 中,I 通常为单张 RGB 图像;扩展形式也可输入图像序列、RGB-D、语义、热红外、LiDAR 点云、range image、卫星—地面跨视角对或多模态组合。严格意义上的 APR 有三个判据:第一,输出是相对固定世界坐标系的绝对度量位姿;第二,推理主路径由回归器直接给出位姿,而非先显式建立 2D–3D 匹配再运行 PnP/RANSAC;第三,目标场景已经通过训练权重、条件地图或其他明确表示进入系统。

这一定义排除了两个容易混淆的概念。相对位姿回归(RPR)估计查询图与参考图之间的变换,通常必须检索带位姿参考图再合成绝对位姿;视觉里程计(VO)估计相邻帧运动并累积轨迹,世界坐标依赖初始状态且长期漂移。它也提醒我们,地图条件化回归虽然可直接输出绝对位姿,但其地图建模成本不能隐藏在“端到端”一词后面。

1.2 本文的四层边界

层级 判据 典型方法 评价时必须披露
纯 APR 单图/单帧观测,一次网络前向直接输出场景绝对位姿 PoseNet、AtLoc、MS-Transformer、HyperPose 每场景训练、模型大小、单次延迟
扩展 APR 仍回归绝对位姿,但使用序列、多视图、多模态、多场景或持续学习 VidLoc、MapNet、TransAPR、MCAPR、ConDo、APR-BiCA 窗口长度、未来帧、场景 ID、传感器与缓存
条件化/精化/混合 回归器使用显式/隐式地图,或 APR 初值之后运行渲染、优化、PnP、VO/BA marepo、NeFeS、DFNetdm、KANLoc、SCR+APR 建图/渲染/优化时间、地图大小、迭代数、初值
相邻范式 输出相对位姿或几何中间量,再经数据库、序列原点或求解器得到绝对位姿 Reloc3r、SPR-Mamba、CRR/DIMM、SCR 数据库/序列/求解器、坐标原点、是否零样本

1.3 文献覆盖与阅读方法

本地 47 篇材料覆盖 2015–2026 年:从 PoseNet、Bayesian PoseNet、几何损失、LSTM/VidLoc,到 MapNet、AtLoc、MS-Transformer、DFNet、PAE、PDQ-Net,再到 marepo、NeFeS、HyperPose、ConDo、神经体位姿特征、认知不确定性、GRLoc、PoseCompass、APR-BiCA 等。每份 PDF 均完成全文文本抽取和页数审计;对公式、表格与关键图的排版抽取异常,使用保留版式文本或页面图进行交叉核验。

外部补充资料以论文官方页面、CVF/NeurIPS 会议全文或 arXiv 原始记录为准。本文特别补入本地集合未包含但会改变研究判断的工作:CVPR 2025 的 Scene-agnostic Pose Regression 与 Reloc3r、ICCV 2025 的 RAP 和 Camera Ray Regression、WACV 2025 的 FaVoR,以及 CVPR 2026 的结构化平面重定位 PlanaReLoc。GRLoc 与 PoseCompass 截止检索日仍按 arXiv 预印本处理,不将其写成已同行评审结论。

1.4 证据分级

  • 一级证据: 同一论文内、同一数据标签、同一 split 和同一输入/后处理条件下的受控消融或比较。
  • 二级证据: 不同论文使用相同公开数据集但可能存在实现、标签或平均方式差异的报告值,只用于趋势参考。
  • 三级证据: 作者对实时性、隐私、泛化或实际部署的定性主张;若缺少端到端成本、攻击审计或未见场景实验,本文视为待验证假设。

2 数学基础、表示与评价

2.1 坐标系约定:先问 T_wc 还是 T_cw

相机位姿最常写为齐次变换 T∈SE(3):

$$ T = [ R t ; 0 1 ] ∈ SE(3). $$

然而不同论文中的 t 可能含义相反。若 T_cw 把世界点变换到相机坐标,则 x_c=R_cw x_w+t_cw,相机中心为 c_w=−R_cwᵀt_cw;若 T_wc 表示相机坐标到世界坐标,则 t_wc 本身就是相机中心。旋转也可能是 camera-to-world 或 world-to-camera。复现时只看“translation error”而不核对变换方向,容易得到位置正确但朝向相反、或相机中心误算的结果。

本文统一用 P=(R,t) 表示论文实际监督的六自由度参数,并在讨论具体方法时保留其原约定;跨论文比较只使用论文已换算的相机中心距离和旋转夹角。

2.2 旋转参数化

表示 维度 优点 主要问题 APR 中的代表
单位四元数 q 4 紧凑、可微、无欧拉万向节锁 q 与 −q 双覆盖;需归一化;欧氏差并非测地距离 PoseNet、VidLoc
log-quaternion/轴角 3 无冗余,适合直接回归 π 附近不连续;仍需明确指数映射与符号 MapNet、MSPN、SPR-Mamba
旋转矩阵 9 直接对应几何与投影 输出冗余;需 SVD/Gram-Schmidt 投影到 SO(3) Direct-PoseNet、DFNet
6D 连续旋转 6 连续性与优化稳定性较好 需正交化构造第三轴 marepo、部分 Transformer APR
李代数 so(3) 3 便于局部增量与测试时优化 大旋转全局参数化需谨慎 NeFeS 直接位姿精化
双四元数 8 统一表示旋转和平移,适合 SE(3) 概率建模 单位/正交约束与分布设计复杂 PDQ-Net
射线图/点图 高维 过参数化、可做像素/patch 几何一致性检查 需确定性求解器,预测与求解成本增加 CRR、GRLoc

标准旋转误差通常取相对旋转 ΔR=R̂Rᵀ 的测地角:

$$ e_R = arccos((tr(ΔR)−1)/2) · 180/π. $$

数值实现必须把 arccos 的输入截断到 [−1,1]。四元数形式则应取绝对内积以消除双覆盖:e_R=2 arccos(|q̂ᵀq|)。

2.3 从手工 β 到几何与概率损失

PoseNet 的基本形式把平移和四元数误差加权:

$$ L_β=||t−t̂||₂+β||q−q̂/||q̂||₂||₂. $$

β 同时承担单位换算和任务权衡,依赖场景尺度,手工调参难以跨数据集复用。Kendall 与 Cipolla 随后以同方差任务不确定性学习权重:

$$ L = ||t−t̂||e^(−s_t)+s_t+||r−r̂||e^(−s_r)+s_r. $$

这里 s_t、s_r 是可学习的对数方差参数。该方法改善了平移/旋转平衡,却不等同于为每个样本输出可靠的预测置信度;它首先是多任务损失缩放机制。

后续监督可分为六类:

  • 位姿参数损失: L1/L2、旋转测地距离、矩阵或四元数差;计算便宜,但难以反映场景结构。
  • 重投影/几何损失: 用场景点在预测与真值位姿下的像素差统一平移和旋转,受深度分布和可见性影响。
  • 相对约束: MapNet 同时约束帧对相对位姿,使预测轨迹在局部几何上更一致;也可利用 VO/GPS/IMU 无标签更新。
  • 光度与特征一致性: Direct-PoseNet 通过 NeRF 渲染图像,DFNet/NeFeS 转向更稳健的特征匹配;它们引入场景渲染模型和捕获域。
  • 概率负对数似然: Bayesian PoseNet、VidLoc mixture density、PDQ-Net 和 2025 年认知不确定性工作试图表示模型不确定性、观测歧义或 SE(3) 分布。
  • 多任务/域对齐损失: 场景分类、对象关系、语义、深度、跨模态对齐或 RAP 的对抗判别器为回归器提供额外结构。

2.4 评价指标与“被平均掉的失败”

平移误差通常为 e_t=||ĉ−c||₂,旋转误差为上述测地角。7-Scenes 与 Cambridge 常报告每场景测试集的中位 (m,°),再对场景中位数做算术平均。中位数抗离群,但也会隐藏少数数十米或 180° 的灾难性预测。因此建议同时报告:

  • 均值、中位数、P90/P95/P99 与最大误差;
  • 5 cm/5°、10 cm/5°、0.5 m/5° 等阈值召回,以及累积曲线 AUC;
  • 序列系统的绝对轨迹误差、相对位姿误差和失跟率;
  • 不确定性的 NLL、校准误差、风险—覆盖曲线、OOD AUROC 与多峰覆盖;
  • 模型参数、峰值显存、单帧延迟、吞吐率,并区分 GPU 核心前向与数据预处理;
  • 每场景采集、SfM/ACE/NeRF/3DGS 建图、合成、训练、微调和测试时优化的总成本。

协议警告: “56 fps 的 marepo”“50 步 NeFeS 后的 2 cm”“一次前向 PoseNet 的毫秒延迟”分别测量了不同系统边界。若不把建图、初值、检索、渲染和迭代计入,就无法做工程意义上的速度—精度比较。

2.5 经典数据标签的陷阱

7-Scenes 的原始真值来自 KinectFusion RGB-D SLAM;部分新工作改用 COLMAP/SfM 重建位姿,NeFeS 明确指出异步 RGB/深度会使原标签训练出的 NeRF 质量较差。使用 SfM GT 后,DFNet 与 NeFeS 的绝对数字显著变化。Cambridge 也存在场景选择、重建版本和 Great Court/Street 是否纳入平均的差异。任何跨论文表都必须标出标签版本、场景集合和是否重训练基线。

3 APR 与其他视觉定位范式

3.1 结构法:显式对应与鲁棒求解

结构法通常先由 SfM 构建带描述子的三维点云;查询时检索候选图像、匹配 2D 特征与 3D 地标,再以 PnP+RANSAC 求位姿。其优势是几何可验证:内点数、重投影误差和空间分布都能作为失败证据;其短板是地图和描述子存储、匹配开销以及大视角/外观变化下的对应失败。

现代结构法已通过学习特征、LightGlue 等快速匹配器、层次检索和压缩地图显著提高速度。因此 APR 的竞争对象不是 2015 年的传统 SIFT 管线,而是持续进步的几何系统。2026 年 PlanaReLoc 甚至以区域级 3D 平面替代点特征,说明显式几何也在改变表示粒度。

3.2 场景坐标回归:网络地图 + PnP/RANSAC

SCR 为图像像素或 patch 回归世界坐标,再由鲁棒求解器估计位姿。它把大部分地图压入网络,却保留 2D–3D 几何验证。ACE 将逐场景训练缩短到约 5 分钟,显著削弱了“APR 建图更快”的传统优势;marepo 进一步把 ACE 坐标图交给通用 Transformer 直接解算位姿,形成 SCR 与 APR 的交叉地带。

3.3 相对位姿回归:泛化换数据库

RPR 输入查询/参考图像对,学习相对变换;在新场景可沿用模型,但必须有带绝对位姿数据库图像并保证视图重叠。Reloc3r 用约 800 万图像对和对称 ViT 编解码器训练,在完全未见的 7-Scenes 上报告约 0.04 m/1.02°,展示规模化跨场景预训练的力量;然而其绝对定位仍需 NetVLAD 检索前 10 个参考图像和运动平均,存储与检索不能视为零成本。

3.4 场景无关序列回归:重新定义坐标原点

CVPR 2025 的 SPR 把序列首帧定义为原点,直接回归查询帧相对首帧位姿。它不依赖大型参考库,也不像 VO 逐帧累积,因此避免开放轨迹的递推漂移;SPR-Mamba 在全景序列上通过局部/全局双分支建模。但这不是固定场景世界坐标的传统 APR:坐标原点随每条轨迹变化,且推理需要从首帧到查询帧的序列。它的价值是揭示“场景专属坐标绑定”本身就是 APR 泛化困难的重要来源。

3.5 APR 的独特位置

APR 的真正优势不是在所有条件下精度最高,而是在一个小型模型中把特征提取、场景记忆与位姿预测合并为固定时延模块。当平台没有空间存储大地图、查询必须快速且目标场景稳定时,这种取舍合理。问题在于,模型对训练分布外的错误往往缺少显式证据;一旦追求结构法精度,又常重新引入地图、渲染场或迭代优化,系统边界便发生变化。

范式 新场景模型/地图 推理输入 显式几何检查 典型优势 典型瓶颈
结构法 SfM/平面/地标地图 查询图+地图 精度高、可验证 地图与匹配成本
SCR 每场景坐标网络 查询图 PnP/RANSAC 厘米级、地图紧凑 逐场景训练与求解器
APR 每场景或多场景权重 查询图/传感器 简洁、固定内存、快 覆盖依赖、OOD 失败
RPR 通用模型+参考库 查询—参考对 中等 新场景泛化 检索库与尺度恢复
地图条件化回归 通用解算器+轻量场景地图 查询图/坐标图 中等至强 兼顾速度和几何 仍需建图
APR+精化 APR+NeRF/特征场/3DGS 初值+查询+场景场 中等 精度高 捕获域、迭代、场景成本

4 历史演进:2015–2026

4.1 2015–2017:可行性、损失与时序

PoseNet(Kendall et al., 2015)证明 ImageNet 预训练 CNN 可以从单张 RGB 图像回归平移和四元数,并在当时实现实时推理。其历史贡献大于绝对精度:它把相机重定位从显式特征匹配转化为可端到端训练的问题,也创建了 Cambridge Landmarks 基准。

2016 年的 Bayesian PoseNet 用测试时 dropout 近似权重后验,通过多次前向估计模型认知不确定性;2017 年的几何损失工作一方面以可学习同方差权重代替手工 β,另一方面尝试用重投影误差把平移与旋转统一到图像几何。Walch 等以空间 LSTM 重排 CNN 特征,VidLoc 则以双向 LSTM 利用视频上下文,并探索 mixture density 多峰位姿分布。这个阶段已经提出此后十年反复出现的三个问题:姿态参数如何度量、时序能否消除单帧歧义、网络是否知道自己何时不可靠。

4.2 2018–2020:相对约束、限制分析与多场景

MapNet(Brahmbhatt et al., 2018)是从独立单帧回归走向几何一致性的关键节点。它同时监督绝对位姿和帧对相对位姿;MapNet+ 可用 VO/GPS/IMU 提供无标签相对约束;MapNet+PGO 在推理时以滑窗图优化融合 APR 的全局锚与 VO 的局部平滑。其系列也清楚展示了系统边界变化:精度提高伴随外部传感器、无标签目标序列或测试时优化。

Sattler 等(2019)用理论模型和受控实验指出,多种 CNN-APR 可以由基于训练图像检索与插值的基线解释,未表现出结构法那样的三维外推能力。该结论不是说神经网络永远不能学习几何,而是要求后续工作用训练轨迹外、未见视点、跨外观和新场景实验证明超越记忆。

同一时期,Local Supports Global 与多视图 GNN 尝试利用局部/全局序列关系;AtLoc 以注意力抑制动态或不相关区域;Blanton 等的 Multi-Scene PoseNet 用共享 ResNet-34 加场景分类与极小的场景专属线性头,将每新增场景参数降到约 1.4 万。多场景模型开始把“每场景一整网”改造成共享表示加条件头,但尚未解决未知场景。

4.3 2021–2022:Transformer、直接匹配与位姿流形

MS-Transformer 将多尺度 CNN 激活图转为序列,以 Transformer 编解码器和场景编码同时回归多场景位姿;后续工作用更简单的双编码器、专用平移/旋转 token 和粗到细场景分类—回归改进容量与训练稳定性。与此同时,研究开始质疑“场景专属编码器是否必要”,推动共享骨干与轻量条件模块。

Direct-PoseNet(2021)把预测位姿送入场景 NeRF 渲染查询视图,以像素光度一致性监督 APR;DFNet(2022)指出光度对曝光、动态物体和合成伪影敏感,转而学习既跨真实/合成域稳定、又对位姿变化敏感的稠密特征,并通过特征直接匹配细化。这条路线把 APR 与神经场连接起来,也引入了每场景渲染模型和测试时优化成本。

等变特征工作尝试把相机运动的群结构注入表示;PDQ-Net 用概率双四元数在 SE(3) 上联合建模平移与旋转;Camera Pose Auto-Encoder 以教师—学生方式学习姿态流形,用训练位姿的低存储编码在测试时修正预测。它们共同表明,输出空间的结构与先验并不比图像骨干次要。

4.4 2023–2024:对象、模态、注意力诊断与显式几何回归

2023 年的研究沿四条线扩展:Objects Matter 用对象关系图提升动态/遮挡场景鲁棒性;TransAPR 联合空间与时间注意力;MCAPR 以跨模态注意力融合 RGB、深度等信息;RobustLoc 针对驾驶环境中的长期变化与噪声。粗到细多场景 Transformer 则通过场景分类和局部回归缓解跨场景坐标冲突。

2024 年,TransBoNet 等继续改造 Transformer 瓶颈,但 NeurIPS 2024 的 Activating Self-Attention 给出更具体的诊断:多场景 APR 的 query/key 嵌入空间发生扭曲,少数 key 吞噬注意力,形成 attention collapse;作者以 query-key 对齐辅助损失和固定正弦位置编码恢复注意力。这比笼统声称“注意力能学习全局关系”更可检验。

同年最重要的结构变化来自 marepo 与 NeFeS。marepo 用场景坐标图作为显式度量条件,让通用 Transformer 学习从 2D–3D 对应到姿态的跨场景解算关系;NeFeS 在测试时渲染三维特征并反传精化 APR。二者把几何重新引入回归,但一个把地图放在输入条件,另一个把地图放在可微优化器中,不能与纯 APR 混为一类。

4.5 2025–2026:泛化、生成式数据与几何中间表示

2025 年 HyperPose 用超网络根据每张图像动态生成回归头权重,并发布多季节 Extended Cambridge Landmarks;ConDo 研究持续域扩展与灾难性遗忘;神经体位姿特征以增强 NeRF/体表示为 APR 提供三维先验;ThermalLoc 将 ViT 扩展到大尺度热红外重定位;层次/级联注意力、语义多尺度 Transformer 和 APR-Transformer 则继续追求复杂环境特征聚合。大规模室内 benchmark 与认知不确定性研究开始把焦点从经典小场景中位误差转向规模、OOD 和置信度。

生成式数据成为最活跃的方向之一。ICCV 2025 的 RAP 不仅扰动相机姿态,还让 3DGS 合成光照、天气和模糊变化,并以对抗判别器缩小真实—合成特征域差;在 7-Scenes 中,纯 APR 平均位置约从 10 cm 降至 5 cm、旋转从 3.24° 降至 2.18°。它也发现简单把 NeRF 换成 3DGS 会退化,说明表示速度不是充分条件。2026 年预印本 PoseCompass 进一步用定位难度、覆盖新颖性和渲染可观测性为候选姿态打分,在 7-Scenes 报告适配时间由 15.2 分钟降至 5.1 分钟,并将中位位姿误差降低 53.8%;其结论仍待更多数据集和同行评审验证。

几何表示也从“给网络更多特征”转向“改变预测对象”。ICCV 2025 的 CRR 为每个 patch 回归 Plücker 相机射线,再以鲁棒线性问题求旋转与相机中心;GRLoc 预印本预测世界坐标系 raymap 与 pointmap,并由可微确定性求解器恢复位姿。这些方法试图把最终 6DoF 的高度压缩监督替换为稠密、过参数化、可检查的几何监督。

与此同时,输入模态和应用边界继续扩张。APR-BiCA 以 LiDAR 点云和同源 range image 双支路融合,在 Oxford/NCLT 上以较低训练时间取得次优精度;KANLoc 把轻量绝对回归锚嵌入行星着陆 VO/BA,承认单独 APR 与单独 VO 都不足。到 2026 年,APR 更像定位系统中的高效模块,而不再只是“单网替代所有几何”的命题。

5 统一方法分类

5.1 视觉编码:从全局向量到任务特定 token

早期 APR 大多沿用分类 CNN:PoseNet 用 GoogLeNet,后续常换成 VGG、ResNet、EfficientNet 或 MobileNet,再用全连接层分别回归平移和旋转。性能提升的一部分来自更好的 ImageNet 表示,而不是定位原理本身。Walch 等人的空间 LSTM 把卷积特征切片重排成序列,以学习长程空间相关性;AtLoc 则在 ResNet-34 特征上加入注意力,引导模型降低动态物体和无关区域的权重。两者共同把“最后一层全局池化是否丢失空间结构”变成显式问题。

Transformer APR 通常把中高层激活图展平成 patch/token 序列,用自注意力聚合全局关系,并为平移与旋转设置独立 token 或解码器。其主要变体可概括为:

  • 瓶颈式: TransBoNet、TransAPR 等在 CNN 与回归头之间插入 Transformer,保留卷积的局部归纳偏置。
  • 双任务 token: 单独的 translation token 与 rotation token 从同一激活图选择不同证据,缓解两个任务对尺度、纹理和语义线索的需求差异。
  • 层次/多尺度注意力: 汇聚不同骨干层或局部—全局分辨率,在小尺度室内与大尺度室外之间取得折中。
  • 场景 token/解码器: 多场景模型把场景身份作为条件,将共享视觉 token 解码到不同世界坐标系。
  • 注意力诊断: Lee 等(NeurIPS 2024)不再把注意力当作不可解释模块,而是测量 query/key 空间扭曲与注意力坍缩,再用辅助对齐损失和固定位置编码修复。

级联注意力 CA-Net、语义引导多尺度 Transformer 等 2025 年工作在重复纹理、模糊和遮挡场景取得改善,但应警惕一个常见证据缺口:如果训练数据、分辨率、增强和标签版本同时变化,就无法把收益唯一归因于新注意力模块。高质量消融应在同一骨干、同一输入、同一训练预算下逐项移除空间、通道、语义或多尺度组件。

归纳: 骨干和注意力决定“从图像中取什么证据”,但不决定“世界坐标从哪里来”。新场景泛化、训练轨迹外插和尺度恢复仍需要地图、跨场景监督或几何条件。

5.2 姿态解耦、连续表示与流形先验

绝大多数 APR 把平移与旋转分成两个回归头,因为平移依赖场景尺度与全局位置,旋转更依赖消失线、布局和视角。分头不等于独立:AtLoc、Transformer token 和双流注意力都允许共享骨干后进行任务特定聚合。

表示演进包含三类思路。第一类改善参数化连续性,例如从归一化四元数改用 log-quaternion、6D 连续旋转或旋转矩阵投影。第二类把 SE(3) 看作整体,PDQ-Net 以概率双四元数联合描述旋转和平移,减少两个独立欧氏头对刚体结构的破坏。第三类不直接输出最终 6DoF:PAE 学习训练位姿流形并在潜空间寻找近邻修正;CRR/GRLoc 输出射线、点图等高维几何量,再由确定性求解器恢复位姿。

Camera Pose Auto-Encoder 的价值不只在小幅提高中位位置精度。它证明“训练位姿集合”本身可以压缩为一个轻量先验,推理时无需保存原图即可限制不合理预测;同时,作者能从 pose encoding 重建训练图像,提示隐式地图仍可能携带可反演的场景外观,所谓模型式地图的隐私优势不能想当然。

5.3 时序、多视图与图结构

单帧 APR 面临不可观测性:重复走廊、纹理稀疏表面或动态遮挡可能使多处位置产生相似图像。时序方法通过运动连续性和跨帧共同可见结构消除歧义。

VidLoc 使用双向 LSTM,20 帧已能显著平滑轨迹;其不足是依赖未来帧。Local Supports Global 把局部短序列与全局位置学习结合;Xue 等的多视图 GNN 以帧为节点、相对关系为边,允许非固定拓扑的信息传播。MapNet 把相对约束写入损失,MapNet+PGO 则在推理时显式图优化。TransAPR 以空间和时间注意力替代纯 RNN,RobustLoc 面向驾驶场景利用连续帧抵御天气、动态物体和传感器噪声。

序列收益应与四项代价一起报告:窗口长度与帧率、是否使用未来帧、缓存/显存、丢帧或运动突变时的退化。若序列方法的 GT 本身由平滑 SLAM/VO 产生,还需避免把标签平滑误当成模型几何能力。对于机器人在线导航,因果模型、固定延迟和恢复机制比离线双向最优误差更重要。

KANLoc 提供了更工程化的结论:行星着陆中,VO 的局部运动准确但长期漂移,绝对回归在纹理稀疏与低光下不稳定。其 KAN 回归器只生成稀疏可靠的全局锚,再由 bundle adjustment 与 VO 融合。这里 APR 的价值是“偶尔把轨迹拉回全球坐标”,而不是逐帧替代 VO。

5.4 多场景:共享参数、坐标条件与容量冲突

多场景 APR 的难点不是普通多任务分类。不同场景可能共享视觉外观,却对应完全不同的世界原点、尺度和方向;同一图像特征必须先确定场景,再映射到对应坐标系。主要架构包括:

  • 共享骨干 + 场景专属头: Multi-Scene PoseNet 每场景只增加约 1.4 万参数,参数效率高,但推理场景分类错误会选择错误坐标系。
  • 共享编码器 + 场景编码: 研究“是否需要场景专属 pose encoder”,用场景向量、场景 token 或条件解码器控制共享特征到位姿的映射。
  • Transformer 多场景解码: MS-Transformer、Coarse-to-Fine Transformer 和后续双编码器方法用场景分类、粗位置分类与精回归共同降低坐标冲突。
  • 自适应参数: HyperPose 的超网络根据输入生成回归头权重,针对季节、光照和视角条件动态调整;它比固定场景头更细粒度,但仍在已知场景集合与训练域中工作。
  • 持续域扩展: ConDo 关注按序加入新环境时如何保留旧场景能力,评价重点应从最终平均误差扩展到遗忘量、前向迁移、每场景增量参数和回放数据成本。

多场景模型的存储优势在场景数 N 增大时明显,但“一个模型覆盖 N 场景”不代表能处理第 N+1 个未知场景。若新场景仍需增加头、提供场景 ID 或整体微调,正确术语是参数共享和快速适配,而非零样本场景无关定位。

5.5 几何监督、地图条件化与确定性求解

APR 研究中最具持续性的主线,是逐步恢复被端到端压缩丢失的几何。

  1. 损失层几何。 几何重投影损失用场景深度/点云统一平移与旋转;MapNet 的相对位姿约束使预测轨迹局部一致。这类方法推理仍可保持纯前向,但训练需要额外几何或序列关系。
  2. 可微渲染监督。 Direct-PoseNet 将预测位姿送入 NeRF,以光度误差监督;DFNet 用曝光可控 NeRF 和域不变稠密特征替代脆弱像素差。若只在训练使用渲染器,推理仍是 APR;若对目标测试图迭代,则属于传导式精化。
  3. 场景坐标条件。 Ruan 等将 SCR 和 APR 组合;marepo 直接输入场景坐标图,让通用 Transformer 学习几何解算。它不运行 RANSAC,但场景地图仍显式参与推理。
  4. 三维特征场精化。 NeFeS、神经体位姿特征和 FaVoR 从给定初值渲染视点条件特征,再以特征误差更新位姿或回归器。它们能达到极高精度,却受初值捕获域和场景建模成本约束。
  5. 预测几何中间量。 CRR 为 patch 回归 Plücker ray;GRLoc 将旋转与平移分别转化为 raymap 与 pointmap,再用可微确定性求解器恢复位姿。这一范式把“学习图像到几何”与“几何到位姿”解耦,便于检查残差和开发新损失。

marepo 的消融尤其有说明力:逐场景从零训练巨大 Transformer 几乎失败,而在数百场景上训练通用 M 后能直接处理未见坐标图。这表明模型需要学习的是跨场景稳定的投影几何关系;场景内容则由轻量 GS 提供。换言之,真正可迁移的不是绝对坐标本身,而是“图像射线—三维坐标—相机位姿”的解算规律。

5.6 神经渲染与合成数据:视点、外观和样本价值

APR 对训练覆盖高度敏感,因此 NVS 很自然:在真实相机轨迹间合成带精确位姿的新图,填补插值空洞。早期 SPP-Net/LENS 等使用稀疏描述子或 NeRF 合成视点;DFNet 的随机视图合成在训练中在线扰动位姿;PMNet/神经体位姿特征把体表示直接用于定位特征。

但合成数据有三个不同问题:

  • 几何覆盖: 候选位姿是否覆盖真实测试可达空间,而不是在训练轨迹附近重复采样。
  • 外观覆盖: 同一位姿是否包含昼夜、季节、天气、曝光、模糊、动态物体和设备响应变化。
  • 合成可信度: NeRF/3DGS 在少观测、反光、动态或边界区域会产生伪影;错误图像配上“精确”位姿会形成有害监督。

RAP 用外观可变、可去模糊的 3DGS 同时改变姿态与外观;一条分支用真实/同位姿合成图并通过 LSGAN 式判别器对齐特征,另一条分支渐进采样新姿态和外观。其消融从普通 VGG PoseNet 的 Shop 174 cm/5.45°,经更强骨干、姿态扩增、外观扩增、卷积/Transformer 解码与判别器,逐步降到 33 cm/1.48°,说明数据、架构和域对齐共同贡献。

PoseCompass 把采样本身定义为决策问题:定位难度偏好当前回归器薄弱区域,覆盖新颖性寻找训练集稀疏区域,渲染可观测性过滤重建质量差的视点,再在轨迹可达约束下选 top-K。这个方向比“合成十倍数据”更接近主动学习:优化单位渲染与适配时间带来的误差下降。

5.7 概率、不确定性与失败拒绝

APR 不确定性至少包含三种来源。认知不确定性来自训练覆盖不足或模型参数未知,通常在 OOD/新视点增大;偶然不确定性来自图像噪声、模糊、遮挡和标注噪声;多模态观测歧义来自不同位置产生相似外观,此时真实后验可能有多个峰,单一高斯均值会落在不可行位置。

Bayesian PoseNet 用 MC dropout 采样模型权重,主要接近认知不确定性;VidLoc 的 mixture density network 直接拟合多峰输出,但在欧氏化位姿空间中实现;PDQ-Net 试图在双四元数/SE(3) 上构造联合概率;Zangeneh 等(2025)以变分框架估计观测似然,用统一模型同时处理训练域外置信和重复结构歧义。

评价不应只画“误差与方差相关”散点。一个可部署的置信系统需要回答:按不确定性拒绝最危险的 10% 样本后,剩余风险下降多少;置信区间覆盖是否校准;错误姿态的方向/尺度是否被分布覆盖;跨季节、跨设备和场景外样本能否被识别;输出多峰是否对应真实几何假设而非数值噪声。

5.8 多模态与专用领域

多模态 APR 试图在纹理失败时引入互补几何或语义。MCAPR 以跨注意力在模态间交换信息;语义引导对象关系图和多尺度 Transformer 强化长期稳定物体;ThermalLoc 面向低光、烟雾或昼夜变化,但热红外纹理与公开 RGB 基准不同,必须在同模态数据上评估。APR-BiCA 将原始 LiDAR 点云与其球面 range image 双支路融合:点云保留三维几何,range image 适配成熟 CNN 并提供稠密深度结构;这属于同一传感器的多表示互补,而非完全独立传感器冗余。

UAV—卫星绝对定位面对极端跨视角、尺度和季节差异,输出有时是地理 3DoF 而非通用 6DoF;APR-Transformer 可使用图像或 LiDAR 为 GNSS 拒止环境提供初值;行星着陆还要处理无 GPS、重复地貌、低照与算力限制。将这些结果纳入 APR 谱系有助于发现通用设计,但不能把不同自由度、地图先验和场景尺度的误差混成统一排行榜。

5.9 分类矩阵

研究主轴 代表工作 改变的系统要素 仍未解决的问题
更强视觉聚合 AtLoc、TransBoNet、CA-Net、层次注意力 图像证据选择 新场景坐标、几何验证
时序/多视图 VidLoc、LSG、GNN、TransAPR、RobustLoc 输入上下文与运动连续性 延迟、未来帧、漂移/失跟
多场景/持续学习 MSPN、MS-Transformer、Coarse-to-Fine、HyperPose、ConDo 参数共享与场景条件 真正零样本、遗忘与容量
几何约束 Geometric PoseNet、MapNet、DFNet 训练目标与一致性 地图/渲染成本、捕获域
地图条件化 marepo、SCR+APR 场景表示进入推理 仍需每场景映射
后验精化 NeFeS、FaVoR、PAE refinement 测试时优化与先验 实时性、初值、场景变化
几何表示回归 CRR、GRLoc 预测对象与确定性求解 稠密监督、求解稳定性
生成式数据 LENS、PMNet、RAP、PoseCompass 训练覆盖与域对齐 重建质量、成本与真实性
概率可信度 Bayesian PoseNet、VidLoc MDN、PDQ-Net、Epistemic APR 输出从点估计到分布 校准、OOD、多峰 SE(3)
多模态/专域 MCAPR、ThermalLoc、APR-BiCA、UAV、KANLoc 传感器与任务边界 标定、缺失模态、跨设备

6 数据集与评测协议审计

6.1 经典小场景为何仍重要、又为何不够

7-Scenes 与 Cambridge Landmarks 之所以主导 APR 十年,不只是历史惯性。它们分别提供小尺度室内和中尺度室外的标准化训练/测试划分,足以暴露模糊、重复纹理、运动轨迹和尺度差异,又允许研究者以有限资源逐场景训练。但二者的场景数量小、拍摄设备与标签流程固定,容易让模型和超参数围绕 benchmark 过拟合;在这些数据上达到厘米级,不能自动推导到商场、校园、道路网络或跨季节部署。

6.2 主要数据集

数据集 环境/模态 规模与结构 常用指标 关键挑战 协议风险
7-Scenes 7 个小型室内 RGB-D 场景 多段手持序列,约 1–18 m³ 场景中位 m/° 模糊、重复纹理、遮挡、楼梯 KinectFusion GT 与 SfM 重建 GT 不同;是否使用测试序列微调
Cambridge Landmarks 城市地标 RGB 常用 4–6 个室外场景,面积约数百至数千 m² 场景中位 m/° 尺度大、树木/行人、曝光与季节 Street/Great Court 是否纳入;重建与场景平均方式
12-Scenes 多房间室内 RGB-D 12 个场景/房间,序列式采集 中位 m/° 跨房间外观相似、尺度变化 不同工作选取子集或不同预处理
Oxford RobotCar / Radar RobotCar 长期城市驾驶,多相机/LiDAR/雷达/GPS/INS 同一路线跨一年、天气与光照丰富 均值/中位 m/°、轨迹图 长期外观、动态交通、大尺度 训练/测试日期、GT 融合、采样频率差异很大
NCLT 校园长期混合室内外,LiDAR/相机/GPS 27 条跨一年序列 平均绝对 m/° 季节、植被、天气、室内外切换 序列选取与 SLAM 插值 GT
4Seasons 城市/郊区长期视觉定位 跨季节、天气、昼夜 阈值召回、轨迹误差 真正长期变化 APR 论文常只选部分路线
ECL Extended Cambridge Landmarks 原 Cambridge 场景的多季节/多外观扩展 中位 m/°、跨条件性能 域差异与外观漂移 与原 Cambridge 训练集的重叠和采集条件需审计
Indoor-6 多日多房间室内 RGB 6 个较大室内场景 中位 cm/°,Recall@5cm/5° 重复/无纹理、跨日变化 不宜与 7-Scenes 数字直接合并
Map-Free 两次扫描构成 mapping/query 的多场景数据 大量小型室内外地点 相对/绝对阈值召回 少重叠、新场景、尺度 不同工作使用的场景子集不同
Wayspots 10 个小型室外扫描地点 mapping/query 序列,VIO GT 10cm/5°、0.5m/5° 召回 若干场景连几何法也失败 平均召回会掩盖全失败场景
360Loc 4 个真实全景室内场景 约 9.3K 全景、18 条轨迹 平均中位/均值 m/° 全景畸变、跨设备 场景少、固定传感器高度
360SPR 仿真全景室内 270 场景、20K 轨迹、>200K 全景、约 3.6M 针孔图 已见/未见场景 m/° 不同轨迹长度、间隔与三种高度 仿真—真实域差;SPR 坐标原点不同于 APR
Thermal/专用数据 热红外、UAV—卫星、行星或自建车载 通常规模与公开性不一 m/°、地理 3DoF 或任务指标 低光、跨视角、地貌重复 自建 split、自由度与地图先验不可直接横比

6.3 标签、场景平均与数据泄漏

标签来源。 室内 GT 可能来自 RGB-D SLAM,室外来自 SfM、GPS/INS、VIO 或多传感器融合。标签噪声有时已接近论文声称的模型改进量。NeFeS 在 7-Scenes 上改用 SfM GT,因而其 2 cm/0.79° 与使用原标签的结果只能作为不同协议报告值。

平均方式。 “平均中位误差”通常先对每场景取中位,再对场景平均;“全测试集均值”会让大场景或长序列占更高权重。APR-BiCA 在 Oxford/NCLT 报平均绝对误差,不能与 7-Scenes 中位数同表排序。

传导式使用测试数据。 MapNet+、Direct-PoseNet+U、DFNetdm 等实验有时利用无标签测试序列或验证序列微调。它们证明可用目标域图像适配,却不是标准归纳式测试;必须标注“目标域无标签适配”,并报告适配图像数量和时间。

合成数据泄漏。 若 NeRF/3DGS 用包含测试视角或与测试高度重合的数据建场,再把合成视图用于训练,测试集不再独立。高质量协议应只使用 mapping/train 图像重建,按真实轨迹或空间区域划分,并报告候选姿态与测试姿态的最近邻距离。

6.4 建议的统一报告模板

  1. 明确 T_wc/T_cw、相机中心和旋转误差公式。
  2. 列出每个场景的训练/验证/测试图像数、空间范围与标签来源。
  3. 同时报每场景中位、P95、阈值召回和总体失败率,不只报平均中位。
  4. 单列模型前向、预处理、检索、地图读取、渲染与优化时间。
  5. 报模型权重、场景专属参数、数据库/地图/NeRF/3DGS 的总存储。
  6. 报一次性预训练与每场景采集、建图、合成、微调的 GPU 小时。
  7. 对多场景/持续学习,报告每新增场景的参数、旧场景遗忘与目标场景样本数。
  8. 对不确定性,报告校准、选择性风险和 OOD,而非仅可视化方差。

7 实证结果:怎样比较,能够得到什么结论

7.1 比较前先把系统边界对齐

APR 文献中的数字经常比方法名称更具迷惑性。同一个“相机位姿回归”标签,可能分别指单图纯前向、20 帧双向序列、使用无标签测试序列适配、读取场景坐标图、从初值迭代 50 次,或在外部数据库中检索后再做运动平均。若不先列清系统边界,厘米级结果与米级结果并排并不能说明模型孰优孰劣。

本文采用五个比较维度:输入是否单帧;推理是否读取显式地图/数据库;是否使用目标测试域图像;是否执行测试时优化;场景是否在训练中出现。只有五项均相同,数值才适合直接排序。对于不同论文和不同标签版本,以下表格只保留“论文报告值”,用于量级判断,不宣称跨论文绝对排名。

类型 代表方法 输入与额外资源 典型报告值 正确解读
经典纯 APR PoseNet 单张 RGB;每场景训练;一次前向 原始 2015 论文:7-Scenes 约 0.29–0.59 m/3.84–7.33°;Cambridge 约 1.46–3.67 m/2.70–4.24° 证明 CNN 可把场景压进权重,但误差与长尾明显;后续表格曾出现约 2 倍角度口径差异
时序 APR VidLoc 视频片段;双向 LSTM;可用未来帧 7-Scenes 各场景位置中位约 0.14–0.36 m 时序显著平滑位置;离线双向结果不等于在线延迟
多场景纯 APR Multi-Scene PoseNet、MS-Transformer 系列 共享主干,场景分类/条件头 可用一个模型覆盖多个已知场景;每场景附加参数可降至约 1.4 万 主要收益是参数共享,不是未知场景零样本
数据增强纯 APR RAP 每场景 3DGS 合成;训练时外观与位姿扩增;推理一次前向 Cambridge 四场景平均约 0.56 m/1.28°;7-Scenes 平均约 0.05 m/2.18° 回归器前向很轻,但场景重建与合成训练不能从成本中删除
地图条件回归 marepo 查询图像 + 场景坐标图;通用 Transformer 7-Scenes 约 3.9 cm/1.68°,小模型约 3.2 cm/1.54°;Wayspots 约 47.2% @10cm/5° 跨场景通用的是几何解算器,仍需每场景坐标地图
APR 后精化 NeFeS APR 初值 + 每场景神经特征场 + 约 50 次更新 Cambridge DFNet 1.19 m/2.90°→0.35 m/0.77°;7-Scenes(SfM GT)0.06 m/1.93°→0.02 m/0.79° 提升来自三维场和迭代优化;受捕获域与时间约束
显式特征场精化 FaVoR 初值 + 体素描述子 + PnP-RANSAC,约三轮 7-Scenes 约 1.3 cm/0.4°;Cambridge 约 15.6 cm/0.3° 是强相邻几何系统,不是 APR 最终头
几何中间表示 CRR/DIMM DINOv2 特征;patch 射线;RC-RANSAC Indoor-6 约 4.2 cm/1.1°,5cm/5° 召回约 63.2% 稠密射线监督和确定性求解优于直接 6DoF 压缩
未见场景 RPR Reloc3r 检索带姿态数据库图;成对回归 + 运动平均 未见 7-Scenes 约 0.04 m/1.02°;Cambridge 约 0.38 m/0.52° 泛化强但数据库、检索和多对推理都在系统内
场景无关序列回归 SPR-Mamba 以首帧为原点的序列;无固定世界地图 360Loc 未见场景平均中位约 1.94 m/1.44° 解决的是轨迹内相对首帧坐标,不是传统固定世界 APR

7.2 经典基准上的四条稳健结论

第一,直接回归已从“米级可行性”推进到“小场景厘米级”,但提升并非单一架构革命。 PoseNet 之后的可学习损失、注意力、Transformer、时序约束与更强预训练都有效;更大的跨越通常来自标签修正、目标域适配、场景坐标、神经渲染数据或测试时精化。把这些因素统称为“更好的 APR 网络”会掩盖真正贡献。

第二,位置和旋转没有同步饱和。 7-Scenes 空间范围小,几厘米位置误差仍可能伴随 1–3°旋转;狭窄视场下 2°方向误差会使远处射线偏移显著。Cambridge 的位置尺度大且外观变化强,位置常是主要瓶颈;结构化求解或外观多样化训练的收益更明显。

第三,纯回归和几何精化的误差量级已经分层。 在相同或接近协议下,APR 提供快速、稳定的初值,而 NeFeS、FaVoR、SCR/PnP 类方法通过显式残差检验继续压到低厘米级。这个分层并不意味着 APR 失败:若系统只允许数毫秒与固定模型内存,低延迟初值本身有价值;若允许地图、数据库和数十次优化,就应与完整几何系统比较。

第四,中位数改善不代表部署风险同步下降。 重复走廊、训练覆盖边界、夜间、强模糊和动态遮挡产生的灾难性错误,可能只占少数样本,因而几乎不改变中位数。安全关键应用更关心 P95/P99、阈值召回、最大连续失效时长以及错误是否可被置信度拒绝。

7.3 多场景、跨条件与持续学习

多场景实验应同时画两条曲线:误差随场景数的变化,以及总参数/每场景增量随场景数的变化。Multi-Scene PoseNet 证明场景专属部分可以很小;MS-Transformer 与粗到细模型通过场景分类、场景 token 或分层解码改善坐标冲突;Lee 等进一步发现多场景下 query/key 表示扭曲可导致少数 token 吞噬注意力。若只报固定 7 或 12 个场景的最终精度,就无法区分容量不足、场景识别错误和负迁移。

跨季节问题更接近真实部署。HyperPose 的扩展 Cambridge 数据强调同一场景在不同季节、天气和植被状态下并非同分布;输入条件超网络可动态生成回归头,但仍依赖见过的场景坐标。ConDo 把按时间加入新域定义为持续域扩展:一个合理结果至少包含旧域保持、新域适应、回放样本和适配时间。最终平均误差较低,却以完全重训和保存全部旧数据换得,不能称为有效持续学习。

7.4 时间、存储与适配成本

“推理 20 ms”只有在计时边界明确时才有意义。纯 APR 通常只含图像缩放、主干和回归头;结构法还含局部特征、检索、匹配、PnP/RANSAC;marepo 含场景坐标读取和 Transformer;NeFeS/FaVoR 含多轮渲染与优化。更容易被忽略的是离线成本:SfM/SCR 建图、NeRF/3DGS 训练、合成数据生成、目标场景微调以及数据库存储。

marepo 报告其通用 Transformer 在约 450 个 Map-Free 场景、约 50 万帧和 900 个坐标图上训练,需约 10 天、8 张 V100;代价换来新场景只训练轻量场景坐标映射、通常数分钟完成。APR-BiCA 报告 Oxford/NCLT 上较短训练与约毫秒级前向,但其表格与正文平均值存在小幅不一致;此类内部差异应以逐场景表为准并在复现时重新计算。一个公平的工程表应同时列“全球一次性预训练、每场景准备、每查询在线”三层成本。

7.5 结果阅读的最低规则

  1. 先确认是否同一 GT 版本、同一场景集合、同一分辨率和同一训练/测试划分。
  2. 同时看平移、旋转、召回和尾部;不从单一平均中位数推断鲁棒性。
  3. 把测试域微调、未来帧、数据库、地图和优化轮数写进方法名称旁。
  4. 把一次性大规模预训练与每场景适配分开核算;两者服务不同部署规模。
  5. 优先相信同一论文内的受控消融和统一复现,谨慎对待跨论文排行榜。

8 关键争议与失败机理

8.1 “学到几何”还是“检索后插值”

Sattler 等的核心批评不是 APR 不能输出正确位姿,而是多种 CNN-APR 的行为可被训练图像检索与姿态插值解释。有限训练轨迹内,高维视觉特征足以记忆外观到坐标的平滑映射;离开凸包、改变视角或遮住记忆区域后,模型缺少显式对应和可验证几何,输出会被拉回训练姿态分布。

后续研究给出三种回应。第一种用相对约束、重投影或可微渲染让训练目标具有几何意义;第二种将坐标图、特征场等地图条件送入推理;第三种回归 raymap、pointmap 或 camera ray,再由确定性求解器恢复位姿。证据强度依次不能只看网络图:真正能证明超越插值的实验,是训练轨迹外视点、未见场景、跨设备/跨季节,以及对几何残差的显式分析。

8.2 固定世界坐标造成的场景绑定

绝对坐标不是图像的内在属性。相同走廊纹理在两个场景可对应完全不同的原点、朝向和尺度;普通 APR 的最后几层因此不可避免地吸收场景坐标系。多场景共享只能减少重复参数,不能消除这一矛盾。场景 ID 错误时,模型可能在错误坐标系中给出看似连续却完全无效的姿态。

marepo 的分解提供了重要线索:用场景坐标图承载“这个世界在哪里”,用跨场景预训练 Transformer 承载“如何从 2D–3D 关系解算相机”。SPR 则改变问题,以首帧为临时原点;RPR 保留带姿态数据库;结构法保留显式地图。这些方法的泛化来自坐标的外置或重定义,而不是让单张图像凭空包含全球原点。

8.3 感知混叠、动态遮挡与不可观测性

重复纹理和对称布局会产生多峰后验;纹理贫乏表面不提供足够方向或尺度线索;动态车辆、人群、植被和季节变化会遮挡训练时最具区分性的区域。点估计网络在多峰情况下常输出多个合理姿态的均值,而该均值可能落在墙内。注意力只能改变证据权重,不能从完全不可观测的单帧中创造信息。

可行的缓解包括时序/多视图、多模态、对象级稳定语义、显式地图匹配以及输出多峰分布。评测应专门构造别名对、遮挡比例、动态区域掩码与视场裁剪,而不是只在随机测试帧上平均。对于序列,还要测试停滞、回头、快速旋转、丢帧和时间戳错位。

8.4 训练覆盖边界与长尾

APR 的误差通常与到最近训练相机的空间/视角距离相关。训练轨迹稠密时,中位数好看;边界、楼层连接处和未见高度的错误集中爆发。随机按帧划分会让相邻视频帧跨入训练和测试集,测到的是插值,而非空间泛化。

更有诊断力的划分是按轨迹、时间、空间体素、视角扇区或设备隔离,并绘制误差对最近训练位姿距离、可见表面重叠和外观差异的曲线。生成式增强需要在这些覆盖空洞中选择可观测、可到达且高价值的视点;PoseCompass 正是把“生成哪些姿态”从随机采样变成价值排序。

8.5 标签、尺度与基准饱和的错觉

7-Scenes 的原始标签、SfM 重标注与不同图像预处理并不等价;Cambridge 的场景集合、Court 是否纳入以及尺度计算会改变平均值。当模型改进只有数厘米或零点几度时,GT 系统误差、时间同步和内参漂移可能与改进同量级。大规模室内 benchmark 的意义因此不只是增加场景,而是把楼层跨度、长路径、跨日和重复布局重新带回问题。

论文应报告标签生成管线与估计不确定度;若可能,在同一图像上比较多个 GT 来源,或使用阈值召回而不是把小于标签噪声的差异排序。复现实验不应从论文摘要中的平均数反推逐场景表现。

8.6 合成数据的两面性

NeRF/3DGS 可以低成本生成密集位姿标签,但合成监督并不天然正确。少观测区域、镜面、动态物体、曝光外推和几何边界可能产生漂浮物或模糊;“看起来逼真”的图不一定保留定位所需的小结构。若模型学会渲染器伪影,还会在真实域产生新的捷径。

因此需要同时测渲染质量、特征域差异和定位价值。RAP 的重要发现之一是简单用更快的 3DGS 替代 NeRF反而可能退化;只有外观控制、去模糊、渐进采样与对抗域对齐共同作用,合成数据才稳定增益。未来协议还应公布重建只使用哪些 mapping 图像,排除测试视角泄漏。

8.7 不确定性不等于可信度

MC dropout 的采样方差、MDN 的分量方差或变分似然,都可能与误差相关,却未必校准。模型可在未见场景上“自信地错”,也可能对可正确定位的模糊帧过度保守。四元数归一化与旋转流形还使普通欧氏高斯的置信区间难以解释。

可信评估至少包含:可靠性图与覆盖率;负对数似然/适当评分规则;风险—覆盖曲线;已知域到 OOD 的分离 AUROC;对多峰歧义的假设召回;阈值拒绝后的任务损失。系统层面应定义拒绝后做什么,例如请求下一帧、调用结构法、切换 SLAM 或进入安全停车,而不是只输出一个不确定性数字。

8.8 隐式地图、隐私与维护

APR 常被描述为“无需存图,因而隐私友好”。权重确实比原图数据库紧凑,但模型可能记忆场景外观;PAE 能从姿态编码重建训练图像的观察,提示模型反演风险不能忽略。神经渲染、场景坐标图和体素描述子又重新引入可视化或可反演地图。

隐私审计应包括成员推断、场景/物体反演、敏感区域删除,以及模型更新后旧场景信息是否仍存在。维护同样关键:场景装修、道路施工或季节变化后,完全重训、增量更新、局部地图替换和持续学习的成本不同。定位精度之外,系统需要版本化地图和可撤销数据机制。

9 2024–2026 科研动态:从黑盒终点到可组合模块

9.1 通用几何解算器与轻量场景地图

marepo 代表一种比“一个全球 APR”更现实的泛化路径:场景几何由轻量坐标回归器建立,跨场景 Transformer 则预训练成通用位姿解算器。该分工把新增场景成本从训练完整 APR 降为数分钟级建图,同时保持约 55.6 fps 的报告速度。它仍不是无地图定位,却将每场景参数与通用几何能力清楚解耦。

GRLoc 和 CRR 更进一步改变监督对象。直接 6DoF 是极度压缩、不同自由度耦合且难验证的输出;稠密 ray/point 表示提供更多监督样本,并允许用线性求解、RANSAC 或可微最小二乘恢复姿态。它们与 SCR 的差别在于预测的几何量和地图暴露程度,与 APR 的联系则在于网络仍承担主要图像到场景几何映射。

9.2 神经场从监督器变成定位基础设施

Direct-PoseNet 把 NeRF 当训练时光度监督,DFNet 把它变成域稳定特征合成器,NeFeS 在测试时直接优化查询位姿;PMNet/神经体位姿特征与 FaVoR 则探索更适合匹配或回归的三维特征存储。研究问题已从“能否渲染新视角”转向“如何让场景表征对位姿可导、对外观稳定、对初始化有宽捕获域”。

这条路线的瓶颈是场景维护和在线预算。每个场景的神经场训练、显存、更新与版本管理可能超过回归器本身;测试时 10–50 轮优化也改变延迟分布。未来更有价值的比较是同一场景表征同时支持渲染、定位、建图更新与语义查询,摊薄基础设施成本。

9.3 3DGS 从视点补洞走向外观数据引擎

2025 年 RAP 表明生成式增强的重点已从“更多相机姿态”扩展到“更多成像条件”。可控光照、天气和模糊使网络看到同一几何下的多种外观,对抗训练则阻止它利用合成域捷径。2026 年 PoseCompass 进一步关注单位适配时间的收益,用难度、覆盖和可观测性选择少量姿态,而非无差别渲染。

由此出现三个可复现问题:候选姿态是否物理可达;渲染质量是否足以保留定位特征;新增样本是否真正补充当前模型而非重复训练集。后续工作应报告每 1,000 张合成图、每 GPU 小时和每 GB 场景模型带来的误差/召回改进。

9.4 大规模预训练正在改写相邻范式的基线

Reloc3r 用约 800 万图像对和多数据集训练,使完全未见场景的 RPR 在 7-Scenes/Cambridge 达到很强精度;SPR-Mamba 通过 360SPR 的 270 个仿真场景和约 360 万针孔图,学习不依赖固定世界坐标的序列定位。它们说明,跨场景能力往往来自更可迁移的目标——相对姿态或以首帧为原点的轨迹——以及数据规模,而非在固定全球坐标上强迫零样本输出。

对 APR 的启示不是简单改名,而是引入预训练—适配分解:大模型学习视觉几何与姿态先验,新场景只提供轻量坐标锚、地图 token 或少量校准样本。评价应比较适配样本数、适配时间与最终场景特定存储。

9.5 从平均精度走向可信、持续和专域定位

2025–2026 的文献明显扩大了输入与部署场景:ThermalLoc 处理热红外;APR-BiCA 融合 LiDAR 点云与 range image;UAV—卫星工作应对跨视角地理定位;KANLoc 将 APR 作为行星着陆 VO/BA 的稀疏全局锚。共同规律是单一观测并不总能闭合 6DoF,APR 更适合作为可与几何、惯性和时序互补的模块。

同时,Zangeneh 等把认知不确定性和观测歧义提到核心位置,ConDo 关注场景按时间扩展,Yu 等的大规模室内评测检验小基准之外的容量与泛化。这些工作推动评价从“每场景中位误差”转向风险、遗忘、适配和系统可维护性。

9.6 截至 2026 年 7 月的证据分级

正式同行评审的 2024–2026 代表包括 marepo、NeFeS、NeurIPS 2024 注意力诊断、WACV 2025 FaVoR、CVPR 2025 Reloc3r 与 SPR、ICCV 2025 RAP 与 CRR,以及 CVPR 2026 PlanaReLoc。GRLoc(arXiv:2511.13864,2026 年 5 月 v2)和 PoseCompass(arXiv:2605.12144)截至检索日仍按预印本处理;它们可用于识别趋势和提出假设,但不应与已复核的正式结果使用相同证据权重。

10 工程选型:从约束出发,而不是从排行榜出发

10.1 决策矩阵

部署约束 优先方案 为什么 必须补的安全措施
已知单场景、边缘设备、单帧数毫秒 轻量纯 APR 或共享骨干 + 小头 固定内存、无检索、延迟稳定 OOD/置信拒绝;定期覆盖审计;几何回退
已知场景、允许建图、要求厘米级 SCR/结构法;或 marepo 类地图条件回归 显式地图与鲁棒求解提供可验证几何 地图版本、特征/坐标质量检查、长尾召回
已有较好初值、GPU 充足、离线/AR 精配准 APR + NeFeS/FaVoR/特征场精化 快速全局初始化加局部高精度 捕获域检测;最大迭代和失败残差阈值
多个已知场景、模型存储受限 Multi-Scene PoseNet/MS-Transformer/条件头 共享视觉表示,场景增量参数小 场景识别置信;负迁移和容量曲线
场景持续新增或外观长期变化 ConDo 类增量训练 + 回放/正则;HyperPose/RAP 外观增强 降低完全重训频率,适应季节/天气 遗忘测试;数据治理;旧域回归门禁
新场景零样本,但有带姿态数据库 Reloc3r 等 RPR + 运动平均 相对目标跨场景可迁移 计入检索数据库;数据库覆盖/OOD 检测
新场景、无地图,但有短序列 SPR/VO/视觉惯性 以首帧或局部坐标定位,避免固定世界绑定 漂移监测;需要全球坐标时另加锚
黑夜、烟雾或可见光退化 ThermalLoc/热红外;多模态融合 传感器互补 标定漂移、缺失模态和跨设备测试
GNSS 拒止驾驶、行星或无人机 APR 全局锚 + VO/IMU/BA;LiDAR APR 或跨视角地图 用绝对锚抑制局部漂移 传感器健康监测;时间同步;安全状态机
隐私/带宽严格 压缩场景模型或受控地图条件化 避免传输原始图像数据库 模型反演审计;可删除性;加密与访问控制

10.2 推荐的系统分层

一个稳健定位栈可分为四层。第一层是快速候选:APR、检索或上一帧传播在固定时限内给出一个或多个姿态。第二层是可验证几何:PnP、ray/point 求解、特征场残差或多传感器一致性判断候选是否可信。第三层是时间融合:VO/IMU/图优化在短时保持连续,并用绝对锚消除漂移。第四层是风险管理:不确定性、OOD、覆盖地图和状态机决定接受、重试、降级或停止。

APR 在第一层极具优势,也可通过 marepo/GRLoc 跨入第二层。让一个点估计网络独自承担四层责任,既不是端到端的必然要求,也不符合安全工程。

10.3 部署前验收清单

  1. 用真实空间隔离而非相邻帧随机划分建立独立测试集。
  2. 覆盖光照、季节、天气、设备、速度、模糊、遮挡和地图变化。
  3. 报 P50/P95/P99、阈值召回、连续失效长度和恢复时间。
  4. 对置信阈值做冻结后的校准;测拒绝率与剩余风险。
  5. 分别计量模型、场景地图、数据库、缓存、显存和峰值内存。
  6. 在目标硬件上测预处理到输出的端到端延迟分布,不只测网络前向均值。
  7. 注入传感器缺失、时间错位、错误内参和场景 ID 错误。
  8. 预定义回退路径,并在失效注入中验证它确实被触发。
  9. 对场景更新执行回归测试与版本回滚;记录训练/建图数据谱系。

11 研究议程

11.1 统一成本—精度—泛化三维评价

未来 benchmark 应把一次性预训练、每场景 mapping/adaptation 和每查询推理分开报告,并同时给出模型、地图、数据库和缓存大小。只有这样,才能回答“大规模预训练 + 轻适配”在多少场景后优于逐场景训练,也能公平比较纯 APR、RPR、SCR 和神经场精化。

11.2 从随机帧测试转向覆盖外推测试

应按空间体素、视角、轨迹、日期、设备与环境条件建立组合外推 split,并提供到训练覆盖的距离、可见表面重叠和外观差异元数据。排行榜应以阈值召回和尾部风险为主,中位数为辅;大规模室内、长期室外和跨设备数据需要统一开放协议。

11.3 面向 SE(3) 多峰后验的概率模型

重复结构要求多峰而非单高斯输出。需要尊重 SO(3) 拓扑、联合建模旋转和平移、可被适当评分规则训练的分布,同时能在实时预算内产生有限个几何可验证假设。PDQ-Net、MDN 和变分 APR 提供起点,但校准、模式覆盖与 OOD 仍缺统一基准。

11.4 可验证的几何中间表示

ray、point、scene coordinate、plane 和局部描述子为直接 6DoF 提供替代。研究重点应从“哪个表示在一个基准更低”推进到可观测性、数值条件、噪声传播、RANSAC 样本效率、地图隐私和存储的系统比较。学习模块应输出残差、内点或条件数,使失败可诊断。

11.5 场景无关编码器与轻量坐标锚

完全无条件输出未知世界绝对坐标在定义上不可识别;更可行的目标是通用视觉几何编码器,加一个轻量、可更新且带尺度的场景锚。锚可以是少量带姿态图、坐标图、平面、语义地标或首帧。研究应报告锚的采集量、构建时间、更新粒度和新场景少样本曲线。

11.6 生成式数据的价值、真实性与治理

生成式增强应从数量竞赛转向价值学习:预测哪些姿态/外观最能降低当前风险,并过滤不可观测或合成失真的样本。需要跨渲染器和跨场景的质量指标、测试视角泄漏审计、物理可达约束,以及合成内容的版权/隐私记录。RAP 与 PoseCompass 只打开了这一问题。

11.7 持续学习与可撤销场景记忆

现实地图不断变化。未来系统既要在新域上学习,又要防止旧域遗忘,还应支持删除某一时间段或敏感区域的影响。除平均精度外,应报告向后/向前迁移、最坏场景退化、回放存储、更新能耗与数据删除验证。

11.8 缺失、失配和退化条件下的多传感器融合

多模态论文常假设同步、标定准确且所有模态可用。真正鲁棒的模型需要在训练和测试中随机缺失模态、加入外参/时间偏差,并估计每个传感器的健康度。融合器应能退化为单模态而不是输出不可控姿态。

11.9 以任务风险定义定位质量

同样的 20 cm 误差,在宽阔道路与狭窄着陆区风险不同。定位评价应与下游控制、AR 对齐、导航或救援任务连接,报告误差方向、持续时间和置信度对任务损失的影响。选择性预测、回退策略和恢复时间应成为正式基准的一部分。

12 结论

从 2015 年 PoseNet 到 2026 年几何表示回归与价值驱动合成,APR 的十年历史并不是“网络逐步取代几何”的直线。早期工作证明场景可被压缩进网络权重;随后损失、时序、注意力和多场景共享提高了可用性;限制研究则揭示训练轨迹插值、固定坐标绑定和不可验证长尾。最新进展正在把几何、地图与数据覆盖重新放回系统:marepo 外置场景坐标,NeFeS/FaVoR 用三维特征场精化,CRR/GRLoc 预测可求解的几何中间量,RAP/PoseCompass 把神经渲染变成有选择的数据引擎,Reloc3r 与 SPR 则从相邻范式展示大规模跨场景预训练的力量。

因此,APR 没有被淘汰,但它最合理的角色已经改变。它可以是毫秒级绝对候选、VO/BA 的全局锚、地图条件化的通用几何解算器、神经场优化的初始化,或风险感知混合系统中的一个模块。若要求真正可靠,系统必须明确地图/数据库/序列/适配边界,核算全生命周期成本,用尾部和校准评价失败,并为不可信预测配置几何验证与回退。

最值得持续投入的方向,不是单纯更换一个注意力模块,而是同时保留回归的速度优势、恢复可验证几何、扩大真实训练覆盖,并让不确定性真正服务于决策。只有当“能定位、知道何时不能定位、能够低成本适应变化”三者同时成立,APR 才能从基准方法成长为长期部署的定位基础能力。


附录 A 本地 47 篇 PDF 逐篇注释

以下注释按工作区文件名字母顺序排列。每条同时给出核心贡献、主要证据和应保留的解释边界;“预印本”按截至 2026 年 7 月 11 日可核验的发表状态标注。

A.1 基础范式、几何约束与早期扩展(01–12)

A10 Blanton 等(2020),Extending Absolute Pose Regression to Multiple Scenes。 将单场景 APR 扩为共享 ResNet-34、场景分类与场景专属轻量线性位姿头;每增加场景只需约 1.4 万参数,显著降低多模型存储。它解决已知场景间的参数复用,但推理仍需正确场景路由,未证明对未知场景泛化。

A06 Brahmbhatt 等(2018),MapNet。 在绝对姿态监督之外加入帧对相对位姿约束,使回归轨迹满足局部几何一致性;MapNet+ 可利用无标签 VO/GPS/IMU,MapNet+PGO 再以图优化融合全局锚与局部运动。系列精度提升伴随额外序列、传感器或优化,比较时必须区分纯前向版本。

A13 Chen 等(2021),Direct-PoseNet。 把 APR 预测位姿送入场景 NeRF 渲染查询视图,以光度一致性强化几何监督,并探索使用无标签目标域图像适配。其价值是建立“回归—神经场”可微闭环;局限是每场景 NeRF 成本、光照/曝光敏感性以及传导式设置与标准归纳测试的差异。

A16 Chen 等(2022),DFNet。 针对像素光度误差对域差与曝光脆弱的问题,学习对真实/合成域稳定、又对位姿敏感的稠密特征,并以直接特征匹配改进 APR 或测试时位姿。论文把 NeRF 从图像生成器转为定位特征监督器,但最佳结果包含合成场景模型与迭代细化,不能只计回归器前向。

A28 Chen 等(2024),Map-Relative Pose Regression(marepo)。 用 ACE 类场景坐标图承载每个场景几何,以跨数百场景训练的 Transformer 从射线与 3D 坐标关系直接回归位姿;7-Scenes 报约 3–4 cm/1.5–1.7°,新场景映射约数分钟。它展示通用几何解算器,但不是无地图、无适配的传统 APR。

A29 Chen 等(2024),Neural Refinement for APR with Feature Synthesis(NeFeS)。 从 APR 初值在三维神经特征场中渲染特征,通过约 50 次梯度更新精化位姿;Cambridge 和重标注 7-Scenes 可显著降低误差。性能依赖每场景建场、初值捕获域与测试时优化,属于“APR 初始化 + 神经场后端”。

A03 Clark 等(2017),VidLoc。 用 CNN 与双向 LSTM 对视频片段联合回归 6DoF,利用前后帧消除单帧歧义;还以混合密度网络表达多峰姿态并展示约 97.2% 样本落在 3σ 内。双向上下文包含未来帧,离线精度与在线机器人时延不能等同;位姿分布仍在欧氏化空间近似。

A33 Dai 等(2026),APR-BiCA。 以 PointNet++ 处理 LiDAR 点云、ResNet-34 处理同源 range image,再用双向跨注意力和门控融合;Oxford/NCLT 表格平均约 6.46 m/0.99°与 2.57 m/3.05°。它体现同一传感器多表示互补;正文与表格平均值有小幅不一致,且跨数据协议不宜与 RGB 室内中位误差横比。

A34 Ferens 与 Keller(2025),HyperPose。 超网络根据输入特征动态生成位置/方向回归头参数,并给出单场景、AtLoc 与多场景版本;正式 CVPR 2025 论文还构建合成外观的 Extended Cambridge Landmarks。收益在多项指标成立,但 MS-HyperPose 约 571 MB、远大于 MS-Transformer,ECL 由指令式图像编辑生成并非真实季节复拍。

A01 Kendall、Grimes 与 Cipolla(2015),PoseNet。 首次系统展示单张 RGB 经 GoogLeNet 直接回归固定世界坐标中的位置与四元数,约 50 MB、单裁剪约 5 ms,并发布 Cambridge Landmarks。它奠定 APR 范式,也留下场景专属训练、手工 β、点估计、多峰不可表达和精度落后显式几何等根本问题。

A02 Kendall 与 Cipolla(2016),Modelling Uncertainty / Bayesian PoseNet。 将测试时 dropout 解释为权重后验近似,以 Monte Carlo 样本平均和协方差估计认知不确定性,可辅助场景识别与错误预测。其跨场景“归一化”使用每场景测试分布,严格部署会形成校准泄漏;方差与误差相关不等于概率校准。

A04 Kendall 与 Cipolla(2017),Geometric Loss Functions。 用可学习同方差参数替代人工 β,并提出基于场景几何/重投影的统一尺度损失,使位置与旋转按对图像几何的实际影响权衡。几何损失需要可见 3D 点与内参,且遮挡、动态和错误深度会污染监督;其最大历史影响是确立学习式多任务权重。

A.2 多场景、概率表示与 2022–2023 转向(13–24)

A30 Lee 等(2024),Activating Self-Attention for Multi-Scene APR。 NeurIPS 2024 正式论文从 query/key 嵌入扭曲解释注意力坍缩:少数 key 获得过高权重,限制多场景信息聚合;通过 query–key 对齐辅助损失与固定正弦位置编码恢复注意力。其贡献是可测量的机制诊断,而不只是增加注意力层。

A17 Li 等(2022),PDQ-Net。 以概率双四元数在 SE(3) 上联合描述旋转和平移,试图避免两个独立欧氏回归头破坏刚体结构,并输出可用于置信推断的分布。优势是表示层面的整体性;局限在于概率分布、归一化和损失实现复杂,实验规模仍不足以证明跨场景校准。

A35 Li 等(2025),ConDo。 将 APR 从静态域适配扩为持续域扩展,研究场景/条件按顺序到来时如何学习新域并抑制旧域遗忘。它提醒评测应包含向后迁移、回放成本和新域适配时间,而非只报最终混合测试平均;若保留全部旧数据并完全重训,持续学习价值会被高估。

A47 Li 等(2026),GRLoc。 预印本将直接 6DoF 改写为世界坐标 raymap 与 pointmap 回归,再由可微确定性求解器恢复旋转和平移;稠密几何监督有利于优化和诊断。截至 2026-07-11 尚无正式会议/期刊信息,应把其强结果视为待独立复现的最新方向而非定论。

A31 Lin 等(2025),Learning Neural Volumetric Pose Features。 从多视图辐射/体表示中学习对相机姿态敏感的三维特征,再用于 APR 训练或位姿细化,延续 DFNet/NeFeS 的神经场定位路线。改进来自三维先验与合成覆盖,但每场景体模型、训练显存和新场景构建时间必须计入系统成本。

A44 Liu 等(2025),ThermalLoc。 以 Vision Transformer 面向大尺度热红外相机重定位,利用热成像在低照、烟雾或昼夜变化下的稳定性,并针对热纹理稀疏设计特征聚合。其结果扩展 APR 的传感器边界,但数据多为专用采集,不能直接与 RGB 基准混排;跨热相机响应和季节泛化仍需验证。

A36 Loulou 与 Unel(2025),PoseViTNet。 用 ViT/Transformer 表示替代或增强传统 CNN,构建多场景 APR,并通过场景条件输出处理不同坐标系。论文展示视觉 Transformer 的全局依赖潜力;但数据规模较小,预训练、参数量和场景路由可能共同贡献,尚不能把收益唯一归于自注意力。

A41 Lu 等(2025),Hierarchical Attention in Multi-Scene。 以层次注意力融合局部细节与全局布局,并为多场景分类—回归提供任务特定特征。它面向尺度差异、重复纹理和跨场景干扰;需要用固定骨干与训练预算的消融区分层次结构、增强和模型容量的贡献。

A45 Luo 等(2026),Learning to Anchor Visual Odometry / KANLoc。 在行星着陆仿真中用轻量 KAN 位姿回归器产生稀疏全局锚,并与 VO、bundle adjustment 融合;承认单独 APR 在低照/重复地貌不稳、单独 VO 又会漂移。其最重要结论是模块化互补,而非纯 APR 的单项排行榜。

A18 Musallam 等(2022),Leveraging Equivariant Features。 将相机运动的群变换结构注入图像特征,使表示对旋转/位移变化具有更可预测响应,并用于绝对姿态回归。等变性提供比普通数据增强更强的归纳偏置;实际收益仍受场景坐标、离散群近似和骨干计算开销限制。

A20 Qiao 等(2023),Objects Matter。 检测场景对象并构建对象关系图,用较长期稳定的语义和空间关系抵御动态遮挡、外观变化与局部纹理歧义。对象级解释性优于纯全局向量;性能依赖检测器、对象类别覆盖和训练域,低纹理但无显著对象的场景可能退化。

A21 Qiao 等(2023),TransAPR。 将空间注意力与时间注意力结合,对图像序列学习任务相关区域和跨帧运动一致性,再回归绝对位姿。它比纯 RNN 更容易并行并捕获长程关系;在线部署必须说明窗口、因果性、缓存与丢帧,不能把使用未来帧的离线结果直接视为实时性能。

A.3 混合方法、Transformer 与表示先验(25–36)

A42 Ravuri 等(2025),APR-Transformer。 面向复杂环境的初始位姿估计,用 Transformer 聚合全局观测并将 APR 作为后续定位/配准的起点。该定位比“直接替代几何”更符合工程需要;评估应同时报告初值捕获率、后端最终精度与总延迟,而不能只看初值中位误差。

A22 Ruan 等(2023),Combining SCR and APR。 把场景坐标回归的稠密几何证据与 APR 的全局先验组合,利用两者在精度、速度和失败模式上的互补。它属于显式/隐式混合:若 PnP/RANSAC、坐标图或候选验证参与推理,就应与纯 APR 分栏核算。

A07 Sattler 等(2019),Understanding the Limitations of CNN-based APR。 用理论与受控实验表明多种 CNN-APR 可被训练图检索和姿态插值解释,在训练轨迹外不具结构法的 3D 外推能力。论文建立了后续工作的证据门槛:未见视点、外观和场景测试比标准 split 上的小幅中位改进更重要。

A14 Shavit 等(2021),Learning Multi-Scene APR with Transformers(MS-Transformer)。 从 CNN 多尺度激活构造 token,以位置/旋转 Transformer 分支和场景 query 同时覆盖多个已知场景。它把场景条件化与任务解耦系统化;参数、场景分类和数据量随场景数增长的曲线仍是关键瓶颈。

A23 Shavit 等(2023),Coarse-to-Fine Multi-Scene Pose Regression。 先进行场景/粗区域判别,再在局部坐标或对应分支中精回归,减少不同世界坐标间的冲突。粗到细结构能缩小回归动态范围,但上游分类错误会不可恢复地传播;应报告 oracle 路由与预测路由差距。

A32 Shavit 等(2024),Single and Multi-Scene CPR with Transformer Encoders。 探索以更简洁的 Transformer encoder、位置/旋转专用 token 同时服务单场景和多场景 APR,减少复杂 decoder 依赖。它提供架构统一与消融基线;对未知场景和真实长期外观变化的证据仍有限。

A08 Shavit 与 Ferens(2019),Introduction to Camera Pose Estimation with Deep Learning。 以教程/综述形式梳理深度相机姿态估计、PoseNet 系列、表示与数据集,为早期 APR 的术语和问题设置提供背景。作为二手综述不能替代原论文数值核验,其价值在于历史脉络而非最新性能结论。

A15 Shavit 与 Ferens(2021),Do We Really Need Scene-Specific Pose Encoders? 质疑多场景 APR 为每个场景复制编码器的必要性,实验共享视觉编码器与轻量场景条件/回归头。结果支持低层视觉可跨场景复用,但固定世界坐标映射仍需场景信息;共享参数不等于场景无关。

A19 Shavit 与 Keller(2022),Camera Pose Auto-Encoders(PAE)。 对训练姿态学习低维自编码流形,在测试时用姿态编码近邻/教师—学生先验修正 APR,无需保存原训练图。它展示低存储姿态先验,也暴露隐式地图可能可反演训练外观;改进受训练轨迹流形覆盖限制。

A24 Shu 等(2023),MCAPR。 对 RGB 与深度点云分别编码,用位置/旋转双向跨注意力融合,并在 7-Scenes 多场景回归;平均约 0.16 m/7.03°,场景识别约 97.5%。融合优于单 RGB,但增加深度、标定和 PointNet,缺少缺失/噪声深度试验与完整推理成本。

A26 Song 等(2024),TransBoNet。 在 ResNet-50 低分辨率阶段用位置感知 Transformer bottleneck,并结合 SE 与 Shuffle Attention,单帧抑制动态干扰;7-Scenes 平均约 0.20 m/8.45°,Oxford 长路线中位约 7.62 m/1.47°。鲁棒性主要由自定义 split 与热图支持,未报告完整速度/参数。

A37 Song 等(2025),Cascaded Attention / CA-Net。 用多尺度分组卷积级联注意力和空间—通道双流 non-local 模块替代 TransBoNet,约 26.8M 参数、112 FPS;7-Scenes 平均约 0.19 m/7.44°。消融相对充分,但裁剪协议、CAM 核配置和 RobotCar 表格指标存在表述疑点,收益仍局限于已知场景。

A.4 鲁棒性、序列、专域与最新方向(37–47)

A43 Tian 等(2025),Semantic-Guided Multi-Scale Transformer。 将语义稳定性与多尺度 Transformer 结合,期望在动态遮挡、重复纹理和尺度变化下选择更可靠区域。语义可提高长期稳定性,但分割器本身受域差影响;需要无语义、冻结语义和同参数注意力对照,并计入语义前端延迟。

A05 Walch 等(2017),Image-Based Localization Using LSTMs for Structured Feature Correlation。 把 CNN 特征切片重排为序列,用双向 LSTM 学习远距离空间相关性,再回归位置与旋转;它较早指出全局池化会损失布局。序列是单图内部特征序列而非视频,收益也混合了更强回归头与空间结构建模。

A11 Wang 等(2020),AtLoc。 在 ResNet-34 全局特征上加入注意力,抑制动态和无关区域,并以可学习权重回归姿态;AtLoc+ 再利用时序一致性。它成为后续 APR 常用强基线;注意力热图不能单独证明几何理解,单帧与序列版本必须分开比较。

A25 Wang 等(2023),RobustLoc。 面向驾驶环境的天气、动态交通和传感噪声,利用序列/鲁棒特征聚合改善长轨迹相机位姿回归。其价值在于把 APR 从小型静态基准带到长期道路;自定义序列、GT 融合和帧采样会显著影响结果,需按同协议复现。

A27 Wang 等(2024),UAV Absolute Pose from Large-Scale Satellite Image。 研究无人机视角与大范围卫星地图之间的极端跨视角、尺度和季节差异,用学习式匹配/回归估计地理绝对姿态。输出自由度、地图先验和误差单位可能不同于标准 6DoF APR,应按跨视角地理定位而非 7-Scenes 排榜解释。

A38 Wei 与 Feng(2025),Tracking Registration Based on APR and Novel View Synthesis。 将绝对位姿回归与新视角合成用于跟踪/注册,使合成视图补足真实训练覆盖并为配准提供初值。论文展示 APR 在下游系统中的组合价值;小规模实验、渲染成本和合成—真实差异限制了通用结论。

A09 Xue 等(2019),Local Supports Global。 用局部序列关系辅助全局绝对位置学习,在短时连续性与全球坐标之间建立互补;可改善单帧歧义与轨迹平滑。其性能依赖序列窗口和运动分布,在线因果性、未来帧与标签本身的 SLAM 平滑需要单独审计。

A12 Xue 等(2020),Multi-View Camera Relocalization with GNNs。 把多帧视图建为图,以节点特征和边关系传播信息,不再受固定长度 RNN 链约束;适合非均匀采样和多视角上下文。图构建、窗口选择和边信息可能使用额外先验,推理延迟随节点/边数增长。

A39 Yu 等(2025),Large-Scale Benchmarking of Indoor APR。 在更大室内空间与更多路线系统比较视觉 APR,检验经典 7-Scenes 小场景之外的尺度、重复布局和跨区域泛化。其主要贡献是暴露基准饱和错觉;不同模型若未统一预训练、分辨率和训练预算,排行榜仍需谨慎解释。

A40 Zangeneh 等(2025),Quantifying Epistemic Uncertainty in APR。 用变分/概率框架刻画训练覆盖不足与观测歧义,强调 OOD 和重复结构中的置信度,而非只优化点估计。它推动选择性定位,但“误差相关”仍不能替代校准、风险—覆盖、多峰假设和跨场景 OOD 评价。

A46 Zhou 等(2026),PoseCompass。 预印本为候选合成姿态综合定位难度、覆盖新颖性和渲染可观测性,在轨迹约束下选择高价值样本;报告 7-Scenes 适配约 15.2→5.1 分钟、中位位姿误差降低约 53.8%。结果有吸引力但篇幅短、数据集有限且尚待同行评审。

附录 B 符号、坐标与指标速查

符号/术语 本文约定 常见混淆
R SO(3) 中的 3×3 旋转矩阵 论文可能写世界到相机或相机到世界
t 齐次变换中的平移列向量 不一定等于世界坐标中的相机中心
c 世界坐标中的相机中心 若 T_cw=[R, t],则 c=−Rᵀt
q 单位四元数 q 与 −q 表示同一旋转;欧氏损失需处理双覆盖
ξ se(3) 李代数/扭量坐标 平移与旋转尺度仍需权衡
T_wc 相机坐标到世界坐标 有些论文下标顺序采用相反语义,必须查定义
T_cw 世界坐标到相机坐标 与 T_wc 互逆,不可直接比较平移列
APR 固定世界坐标中的绝对位姿回归 多场景共享仍可属于 APR
RPR 图像对相对位姿回归 要得到绝对位姿通常需带姿态数据库和运动平均
SCR 像素/patch 到世界场景坐标回归 常配 PnP/RANSAC,是显式几何定位
SPR 以序列首帧为原点的场景无关回归 原点随序列改变,不是固定世界 APR
中位 m/° 每场景测试样本的平移/旋转中位误差 “平均中位”与全样本平均不同
Recall@x/y 平移≤x 且旋转≤y 的样本比例 阈值、是否同时满足、场景加权要写明
P95/P99 误差分布尾部百分位 比中位数更接近部署长尾风险
NLL/ECE 概率预测的似然与校准指标 低 NLL 不保证 OOD 可拒绝

附录 C 复现实验与论文报告清单

C.1 数据与坐标

  • 公布场景、序列、时间、设备和 train/validation/test 的精确列表。
  • 说明 GT 来源、版本、坐标原点、尺度、T_wc/T_cw 与内外参处理。
  • 报空间范围、相机高度/朝向分布、最近训练位姿距离和图像重叠。
  • 确认随机裁剪、缩放或翻转是否改变了有效内参与姿态标签。
  • 对合成/目标域适配,证明测试图像、姿态或未来帧没有进入建图与训练。

C.2 模型与训练

  • 给出骨干预训练来源、输入分辨率、参数量、FLOPs、优化器、学习率、批量、epoch、增强和随机种子。
  • 明确位置/旋转表示、四元数规范化与符号处理、损失权重初始化和单位。
  • 对多场景列场景 ID 的训练/推理路由、每场景参数及分类准确率。
  • 对时序列窗口、采样频率、是否双向/使用未来帧、缓存和丢帧策略。
  • 对多模态列标定、同步、缺失/噪声模态训练和单模态退化结果。

C.3 系统资源与评价

  • 分开报告一次性预训练、每场景建图/渲染/适配和每查询推理时间。
  • 计入模型、数据库、场景坐标、NeRF/3DGS、体素特征与缓存的总存储。
  • 在目标硬件上给端到端延迟 P50/P95、吞吐、峰值显存和能耗。
  • 同时报逐场景 P50/P95/P99、阈值召回、失败率与置信区间。
  • 对不确定性报告 NLL、覆盖率、风险—覆盖、OOD 与多峰假设召回。
  • 至少运行三个随机种子;小于标签噪声的差异不作强 SOTA 结论。
  • 发布代码、模型、配置和逐样本预测,使坐标转换与平均方式可复算。

参考文献

[1] H. Blanton, C. Greenwell. Extending Absolute Pose Regression to Multiple Scenes. IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2020.

[2] S. Brahmbhatt, J. Gu, K. Kim, J. Hays, J. Kautz. Geometry-Aware Learning of Maps for Camera Localization. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2018, 2616–2625.

[3] S. Chen, Z. Wang, V. Prisacariu. Direct-PoseNet: Absolute Pose Regression with Photometric Consistency. International Conference on 3D Vision (3DV), 2021. DOI 10.1109/3DV53792.2021.00125

[4] S. Chen, X. Li, Z. Wang, V. A. Prisacariu. DFNet: Enhance Absolute Pose Regression with Direct Feature Matching. European Conference on Computer Vision (ECCV), 2022.

[5] S. Chen, T. Cavallari, V. A. Prisacariu, E. Brachmann. Map-Relative Pose Regression for Visual Re-Localization. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024. DOI 10.1109/CVPR52733.2024.01953

[6] S. Chen, Y. Bhalgat, J.-W. Bian, K. Li, X. Li, Z. Wang, V. A. Prisacariu. Neural Refinement for Absolute Pose Regression with Feature Synthesis. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024. DOI 10.1109/CVPR52733.2024.01983

[7] R. Clark, S. Wang, A. Markham, N. Trigoni, H. Wen. VidLoc: A Deep Spatio-Temporal Model for 6-DoF Video-Clip Relocalization. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2017.

[8] J. Dai, H. Wang, Y. Zhao, Z. Liu. APR-BiCA: LiDAR-Based Absolute Pose Regression with Bidirectional Cross Attention and Gating Unit. Neurocomputing, 668:132404, 2026. DOI 10.1016/j.neucom.2025.132404

[9] R. Ferens, Y. Keller. HyperPose: Hypernetwork-Infused Camera Pose Localization and an Extended Cambridge Landmarks Dataset. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, 11547–11557. DOI 10.1109/CVPR52734.2025.01078

[10] A. Kendall, M. Grimes, R. Cipolla. PoseNet: A Convolutional Network for Real-Time 6-DOF Camera Relocalization. IEEE International Conference on Computer Vision (ICCV), 2015, 2938–2946. DOI 10.1109/ICCV.2015.336

[11] A. Kendall, R. Cipolla. Modelling Uncertainty in Deep Learning for Camera Relocalization. IEEE International Conference on Robotics and Automation (ICRA), 2016, 4762–4769. DOI 10.1109/ICRA.2016.7487679

[12] A. Kendall, R. Cipolla. Geometric Loss Functions for Camera Pose Regression with Deep Learning. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2017, 5974–5983.

[13] H. Lee, S. Kim, T.-H. Oh. Activating Self-Attention for Multi-Scene Absolute Pose Regression. Advances in Neural Information Processing Systems 37 (NeurIPS), 2024, 38508–38529. DOI 10.52202/079017-1216

[14] W. Li, W. Naeem, J. Liu, D. Zheng, W. Hao, L. Chen. PDQ-Net: Deep Probabilistic Dual Quaternion Network for Absolute Pose Regression on SE(3). Conference on Uncertainty in Artificial Intelligence (UAI), 2022.

[15] Z. Li, Z. Cai, B. Yang, X. Shen, S. Shen, X. Fan, M. Paulitsch, C. Wang. ConDo: Continual Domain Expansion for Absolute Pose Regression. AAAI Conference on Artificial Intelligence, 2025.

[16] C. Li, X. Ma, L. Liu, Z. Li, Q. Yan, Y. Xu. GRLoc: Geometric Representation Regression for Visual Localization. arXiv:2511.13864, v2, 2026. arXiv

[17] J. Lin, J. Gu, B. Wu, L. Fan, R. Chen, L. Liu, J. Ye. Learning Neural Volumetric Pose Features for Camera Localization. ECCV 2024, LNCS 15103, 198–214, Springer, 2025. DOI 10.1007/978-3-031-72995-9_12

[18] Y. Liu, Y. Meng, X. Pan, J. Jiang, C. Chen. ThermalLoc: A Vision Transformer-Based Approach for Robust Thermal Camera Relocalization in Large-Scale Environments. arXiv:2506.18268, 2025. arXiv

[19] A. Loulou, M. Unel. PoseViTNet: Multi-Scene Absolute Pose Regression Using Vision Transformers. IEEE Intelligent Vehicles Symposium (IV), 2025.

[20] X. Lu, J. Miao, Q. Xue, H. Wan, H. Zhang. Camera Absolute Pose Estimation Using Hierarchical Attention in Multi-Scene. IEEE Access, 13, 19624–19636, 2025. DOI 10.1109/ACCESS.2025.3531896

[21] X. Luo, Z. Li, X. Wan, W. Zhang, L. Shu. Learning to Anchor Visual Odometry: KAN-Based Pose Regression for Planetary Landing. IEEE Robotics and Automation Letters, 11(3), 3574–3581, 2026.

[22] M. A. Musallam, V. Gaudillière, M. Ortiz del Castillo, K. Al Ismaeil, D. Aouada. Leveraging Equivariant Features for Absolute Pose Regression. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022. DOI 10.1109/CVPR52688.2022.00675

[23] C. Qiao, Z. Xiang, X. Wang, S. Chen, Y. Fan, X. Zhao. Objects Matter: Learning Object Relation Graph for Robust Absolute Pose Regression. Neurocomputing, 521:11–26, 2023.

[24] C. Qiao, Z. Xiang, Y. Fan, T. Bai, X. Zhao, J. Fu. TransAPR: Absolute Camera Pose Regression with Spatial and Temporal Attention. IEEE Robotics and Automation Letters, 8(8):4633–4640, 2023.

[25] S. Ravuri, Y. Xu, M. L. Zehetner, K. Motlag, S. Albayrak. APR-Transformer: Initial Pose Estimation for Localization in Complex Environments through Absolute Pose Regression. arXiv:2505.09356, 2025. arXiv

[26] J. Ruan, L. He, Y. Guan, H. Zhang. Combining Scene Coordinate Regression and Absolute Pose Regression for Visual Relocalization. IEEE International Conference on Robotics and Automation (ICRA), 2023. DOI 10.1109/ICRA48891.2023.10160317

[27] T. Sattler, Q. Zhou, M. Pollefeys, L. Leal-Taixé. Understanding the Limitations of CNN-Based Absolute Camera Pose Regression. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2019.

[28] Y. Shavit, R. Ferens, Y. Keller. Learning Multi-Scene Absolute Pose Regression with Transformers. IEEE/CVF International Conference on Computer Vision (ICCV), 2021. DOI 10.1109/ICCV48922.2021.00273

[29] Y. Shavit, R. Ferens, Y. Keller. Coarse-to-Fine Multi-Scene Pose Regression with Transformers. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(12):14222–14233, 2023.

[30] Y. Shavit, R. Ferens, Y. Keller. Learning Single and Multi-Scene Camera Pose Regression with Transformer Encoders. Computer Vision and Image Understanding, 243:103982, 2024. DOI 10.1016/j.cviu.2024.103982

[31] Y. Shavit, R. Ferens. Introduction to Camera Pose Estimation with Deep Learning. arXiv:1907.05272, 2019. arXiv

[32] Y. Shavit, R. Ferens. Do We Really Need Scene-Specific Pose Encoders? 25th International Conference on Pattern Recognition (ICPR), 2021. DOI 10.1109/ICPR48806.2021.9412225

[33] Y. Shavit, Y. Keller. Camera Pose Auto-Encoders for Improving Pose Regression. European Conference on Computer Vision (ECCV), 2022.

[34] Q. Shu, Z. Luan, S. Poslad, M.-L. Bourguet, M. Xu. MCAPR: Multi-Modality Cross Attention for Camera Absolute Pose Regression. International Conference on Artificial Neural Networks (ICANN), LNCS 14255, 434–445, 2023. DOI 10.1007/978-3-031-44210-0_35

[35] X. Song, H. Li, L. Liang, W. Shi, G. Xie, X. Lu, X. Hei. TransBoNet: Learning Camera Localization with Transformer Bottleneck and Attention. Pattern Recognition, 146:109975, 2024. DOI 10.1016/j.patcog.2023.109975

[36] X. Song, J. Tang, K. Yang, W. Guo, X. Lu, X. Hei. A Method for Absolute Pose Regression Based on Cascaded Attention Modules. Computer Vision and Image Understanding, 259:104440, 2025. DOI 10.1016/j.cviu.2025.104440

[37] Z. Tian, W. Huang, Z. Chen, X. W. Sun. Robust Visual Localization via Semantic-Guided Multi-Scale Transformer. arXiv:2506.08526, 2025. arXiv

[38] F. Walch, C. Hazirbas, L. Leal-Taixé, T. Sattler, S. Hilsenbeck, D. Cremers. Image-Based Localization Using LSTMs for Structured Feature Correlation. IEEE International Conference on Computer Vision (ICCV), 2017.

[39] B. Wang, C. Chen, C. X. Lu, P. Zhao, N. Trigoni, A. Markham. AtLoc: Attention Guided Camera Localization. AAAI Conference on Artificial Intelligence, 2020.

[40] S. Wang, Q. Kang, R. She, W. P. Tay, A. Hartmannsgruber, D. N. Navarro. RobustLoc: Robust Camera Pose Regression in Challenging Driving Environments. AAAI Conference on Artificial Intelligence, 2023.

[41] H. Wang, Q. Shen, Z. Deng, X. Cao, X. Wang. Absolute Pose Estimation of UAV Based on Large-Scale Satellite Image. Chinese Journal of Aeronautics, 37(6):219–231, 2024. DOI 10.1016/j.cja.2023.12.028

[42] C. Wei, Y. Feng. Tracking Registration Method Based on Absolute Pose Regression and Novel View Synthesis. 5th International Conference on Computer, Control and Robotics (ICCCR), 2025. DOI 10.1109/ICCCR65461.2025.11072594

[43] F. Xue, X. Wang, Z. Yan, Q. Wang, J. Wang, H. Zha. Local Supports Global: Deep Camera Relocalization with Sequence Enhancement. IEEE/CVF International Conference on Computer Vision (ICCV), 2019.

[44] F. Xue, X. Wu, S. Cai, J. Wang. Learning Multi-View Camera Relocalization with Graph Neural Networks. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020.

[45] J. Yu, Y. Yang, V. Namboodiri. Large-Scale Benchmarking of Vision-Based Indoor Localization Using Absolute Pose Regression. International Conference on Indoor Positioning and Indoor Navigation (IPIN), 2025. DOI 10.1109/IPIN66788.2025.11213320

[46] F. Zangeneh, A. Dekel, A. Pieropan, P. Jensfelt. Quantifying Epistemic Uncertainty in Absolute Pose Regression. Scandinavian Conference on Image Analysis (SCIA), LNCS 15726, 180–195, 2025. DOI 10.1007/978-3-031-95918-9_13

[47] Y. Zhou, Z. Qian, Y. Li, N. Yang, Z. Guo, D. Yuan. PoseCompass: Intelligent Synthetic Pose Selection for Visual Localization. arXiv:2605.12144, 2026. arXiv

[48] C. Zheng et al. Scene-Agnostic Pose Regression for Visual Localization. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. 官方全文

[49] Z. Li et al. Adversarial Exploitation of Data Diversity Improves Visual Localization. IEEE/CVF International Conference on Computer Vision (ICCV), 2025. 官方全文

[50] S. Dong et al. Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable Visual Localization. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. 官方全文

[51] H. Zhang, Y. Zhao. Semantic-Guided Camera Ray Regression for Visual Localization. IEEE/CVF International Conference on Computer Vision (ICCV), 2025. 官方全文

[52] S. Polizzi et al. FaVoR: Features via Voxel Rendering for Camera Relocalization. IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2025. 官方全文

[53] Y. Ye et al. PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 官方页面

[54] E. Brachmann, C. Rother. Expert Sample Consensus Applied to Camera Re-Localization. IEEE/CVF International Conference on Computer Vision (ICCV), 2019.

逐篇入口 · 按上线时间正序

47 篇论文索引

A01 · 2015PoseNetA02 · 2016Bayesian PoseNetA03 · 2017VidLocA04 · 2017Geometric LossA05 · 2017LSTM PoseNetA06 · 2018MapNetA07 · 2019APR LimitsA08 · 2019APR TutorialA09 · 2019Local Supports GlobalA10 · 2020MSPNA11 · 2020AtLocA12 · 2020Multi-View GNNA13 · 2021Direct-PoseNetA14 · 2021MS-TransformerA15 · 2021(会议届次 2020)Shared Pose EncoderA16 · 2022DFNetA17 · 2022PDQ-NetA18 · 2022E-PoseNetA19 · 2022Camera PAEA20 · 2022-12-05(2023 卷期)ORGA21 · 2023TransAPRA22 · 2023SCR+APRA23 · 2023C2F-MS-TransformerA24 · 2023MCAPRA25 · 2023RobustLocA26 · 2023-09-21(2024 卷期)TransBoNetA27 · 2023-12-26(2024 卷期)UAV-Satellite APRA28 · 2024marepoA29 · 2024NeFeSA30 · 2024Activate Self-AttentionA31 · 2024(LNCS 2025)PoseMapA32 · 2024Transformer Encoders CPRA33 · 2025(2026 卷期)APR-BiCAA34 · 2025HyperPoseA35 · 2025ConDoA36 · 2025PoseViTNetA37 · 2025CA-NetA38 · 2025APR+NVS TrackingA39 · 2025HST Indoor BenchmarkA40 · 2025Epistemic APRA41 · 2025-01-20Hierarchical AttentionA42 · 2025-05-14APR-TransformerA43 · 2025-06-10SG-MSTA44 · 2025-06-23ThermalLocA45 · 2026-01-13KANLocA46 · 2026-05-12PoseCompassA47 · 2026-05-18(v2)GRLoc