[论文解读] HyperPose: Camera Pose Localization using Attention Hypernetworks
本文提出 HyperPose,一种新颖的绝对位姿回归方法,利用 Transformer-encoder 作为注意力超网络,根据输入图像特征动态生成自适应的回归头权重。通过在视觉变化下实现动态权重调制,HyperPose 在室内和室外基准测试中均实现了最先进(SOTA)的精度,相较于现有 APR 方法,在应对光照、视角和场景变化引起的域偏移时表现更优。
In this study, we propose the use of attention hypernetworks in camera pose localization. The dynamic nature of natural scenes, including changes in environment, perspective, and lighting, creates an inherent domain gap between the training and test sets that limits the accuracy of contemporary localization networks. To overcome this issue, we suggest a camera pose regressor that integrates a hypernetwork. During inference, the hypernetwork generates adaptive weights for the localization regression heads based on the input image, effectively reducing the domain gap. We also suggest the use of a Transformer-Encoder as the hypernetwork, instead of the common multilayer perceptron, to derive an attention hypernetwork. The proposed approach achieves superior results compared to state-of-the-art methods on contemporary datasets. To the best of our knowledge, this is the first instance of using hypernetworks in camera pose regression, as well as using Transformer-Encoders as hypernetworks. We make our code publicly available.
研究动机与目标
- 解决由光照、视角和场景变化等动态环境变化引起的相机位姿定位域差距问题。
- 通过实现回归头权重的动态、输入相关自适应,提升绝对位姿回归(APR)模型的鲁棒性和精度。
- 探索超网络在相机位姿估计中的应用,这是此前在该背景下未被研究过的新型应用。
- 评估使用 Transformer-Encoder 作为超网络(相较于传统的 MLP 基超网络)在生成回归头参数方面的有效性,用于位姿估计。
- 通过基于注意力的自适应权重生成,实现在标准室外和室内定位基准测试中的最先进性能。
提出的方法
- 该模型采用双分支架构,其中 EfficientNet-B0 主干网络的中间激活图分别由独立的 Transformer-Encoder 头处理,用于预测平移和旋转。
- 一个注意力超网络(实现为 Transformer-Encoder)接收主干网络的潜在表征,并根据输入图像生成动态、任务特定的回归头权重。
- 超网络输出残差权重,加到主网络的回归头中,从而实现对回归过程的自适应调制。
- 该架构将位姿回归视为两个独立的序列到单个输出问题,使模型能够独立关注每个位姿分量的有用视觉线索。
- 采用 4D-Norm 旋转表示法,并基于旋转矩阵设计旋转损失,相较于四元数或 6D 表示法,显著提升了方向估计的准确性。
- 整个系统通过反向传播进行端到端训练,超网络与主网络联合优化。
实验结果
研究问题
- RQ1超网络架构是否能提升在不同环境条件下相机位姿回归的泛化能力?
- RQ2使用 Transformer-Encoder 作为超网络是否优于传统的 MLP 基超网络,在生成位姿估计回归权重方面表现更优?
- RQ3通过超网络实现的动态、输入依赖的权重调制,是否能有效减小训练与测试数据之间的域差距?
- RQ4与直接回归相比,基于残差的超网络设计在位姿估计精度上表现如何?
- RQ5对于位姿回归任务,超网络的最优配置(如深度、嵌入维度和输出层结构)是什么?
主要发现
- HyperPose 在 Cambridge Landmarks 数据集上实现了最先进性能,分别在 ShopFacade 场景中达到 0.53 米的中位数位置误差和 3.55 度的中位数方向误差。
- 残差超网络架构优于直接回归,分别将位置误差降低 0.02 米,方向误差降低 0.51 度。
- 使用 Transformer-Encoder 作为超网络的性能更优(位置误差 0.57 米,方向误差 4.06°),优于基于 MLP 的超网络(位置误差 0.68 米,方向误差 4.29°),证明了注意力机制的优势。
- 消融实验表明,256/512 嵌入维度配置达到最佳平衡,误差为 0.53 米和 3.55°,优于 256/256 和 512/512 配置。
- 采用基于矩阵的损失的 4D-Norm 旋转表示法实现了最低的方向误差(4.08°),优于四元数(3.55°)和 6D 表示法(4.54°),表明其在本任务中的适用性。
- 模型对视觉变化表现出稳健的适应能力,表现为超网络能为不同图像输入生成独特且上下文感知的权重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。