[论文解读] Benchmarking Visual-Inertial Deep Multimodal Fusion for Relative Pose Regression and Odometry-aided Absolute Pose Regression
该论文针对相对位姿回归(RPR)与航位推算增强的绝对位姿回归(APR)任务,对深度视觉-惯性多模态融合进行了基准测试,提出了一种新颖的融合框架,结合位姿图优化(PGO)、多模态转换模块(MMTM)以及辅助/贝叶斯学习。该方法在EuRoC MAV、PennCOSYVIO以及一个新的大规模工业级IndustryVI数据集上实现了最先进精度,其中基于MMTM的融合与PGO在图像退化与传感器噪声条件下展现出更优的泛化能力与鲁棒性。
Visual-inertial localization is a key problem in computer vision and robotics applications such as virtual reality, self-driving cars, and aerial vehicles. The goal is to estimate an accurate pose of an object when either the environment or the dynamics are known. Absolute pose regression (APR) techniques directly regress the absolute pose from an image input in a known scene using convolutional and spatio-temporal networks. Odometry methods perform relative pose regression (RPR) that predicts the relative pose from a known object dynamic (visual or inertial inputs). The localization task can be improved by retrieving information from both data sources for a cross-modal setup, which is a challenging problem due to contradictory tasks. In this work, we conduct a benchmark to evaluate deep multimodal fusion based on pose graph optimization and attention networks. Auxiliary and Bayesian learning are utilized for the APR task. We show accuracy improvements for the APR-RPR task and for the RPR-RPR task for aerial vehicles and hand-held devices. We conduct experiments on the EuRoC MAV and PennCOSYVIO datasets and record and evaluate a novel industry dataset.
研究动机与目标
- 评估并比较在复杂现实环境中视觉-惯性位姿估计的深度多模态融合技术。
- 通过融合视觉APR与惯性RPR,并利用航位推算实现轨迹一致性,以提升绝对位姿回归(APR)性能。
- 通过自适应融合机制与不确定性估计,增强对图像退化与传感器噪声的鲁棒性。
- 在多样化数据集上建立全面基准,包括一个全新的大规模工业室内数据集(IndustryVI)。
- 利用激活分析与不确定性量化,研究在输入受损条件下传感器偏差与模态可靠性的影响。
提出的方法
- 提出一种多阶段融合框架,结合视觉APR(PoseNet)、惯性RPR(IMUNet)与视觉RPR(FlowNet)作为基线模型。
- 采用位姿图优化(PGO)以在融合的视觉与惯性序列间强制实现轨迹估计的全局一致性。
- 引入多模态转换模块(MMTM)用于中间层融合,实现模态间可学习的、动态的注意力加权特征融合。
- 通过拼接与BiLSTM层实现的软融合,对比不同模态间的融合策略。
- 集成辅助学习以提升主任务性能,并采用贝叶斯神经网络(BNNs)进行厄贝克不确定性估计。
- 使用图像退化技术(模糊、噪声、遮挡)评估模态可靠性与融合策略在退化条件下的适应能力。
实验结果
研究问题
- RQ1与单模态基线相比,视觉-惯性多模态融合在绝对位姿回归(APR)精度上提升如何?
- RQ2在图像退化条件下,哪种融合策略——晚期融合、中间融合或基于注意力的融合——能实现最鲁棒且准确的位姿估计?
- RQ3位姿图优化(PGO)在APR与RPR任务中在多大程度上提升了轨迹平滑性与全局一致性?
- RQ4辅助学习与贝叶斯不确定性估计在复杂条件下如何提升模型的鲁棒性与可靠性?
- RQ5在图像退化条件下,模态可靠性如何变化?融合网络能否自适应地优先选择惯性数据?
主要发现
- APR_V-RPR_I + PGO 融合方法在EuRoC MAV数据集上表现最佳,生成的轨迹比其他融合策略更平滑、更精确。
- 使用MMTM模块的中间融合优于晚期融合与拼接方法,尤其在PennCOSYVIO与IndustryVI数据集上,得益于更优的模态交互与表征学习能力。
- 融合三个MMTM模块的性能优于仅使用一个或两个,表明在复杂运动动态下,更深层次的融合具有优势。
- 辅助学习在所有数据集上均显著提升了主任务性能,证明其在多任务位姿回归学习中的价值。
- 贝叶斯不确定性估计能有效捕捉模型置信度,退化视觉输入下观察到更高的厄贝克不确定性,验证了其在鲁棒性分析中的适用性。
- 在图像退化条件下,网络将注意力更多转向惯性特征,表现为RPR_I分支的激活权重显著增加,证实了在挑战性条件下具备自适应融合能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。