[论文解读] Probabilistic orientation estimation with matrix Fisher distributions
本文提出了一种基于矩阵冯米斯特定律的深度学习方法,用于使用矩阵冯米斯特定律对旋转不确定性进行概率化3D方向估计。通过训练神经网络以预测该分布的无约束参数,并利用凸负对数似然损失进行优化,该方法在Pascal3D+、ModelNet10-SO(3)和UPNA头朝向数据集上实现了最先进性能,同时提升了训练稳定性和不确定性校准效果。
This paper focuses on estimating probability distributions over the set of 3D rotations ($SO(3)$) using deep neural networks. Learning to regress models to the set of rotations is inherently difficult due to differences in topology between $\mathbb{R}^N$ and $SO(3)$. We overcome this issue by using a neural network to output the parameters for a matrix Fisher distribution since these parameters are homeomorphic to $\mathbb{R}^9$. By using a negative log likelihood loss for this distribution we get a loss which is convex with respect to the network outputs. By optimizing this loss we improve state-of-the-art on several challenging applicable datasets, namely Pascal3D+, ModelNet10-$SO(3)$ and UPNA head pose.
研究动机与目标
- 为解决使用深度神经网络对SO(3)(3D旋转的流形)上的概率分布进行估计的挑战。
- 克服神经网络无约束输出(R^9)与SO(3)非线性闭流形之间的拓扑不匹配问题。
- 通过使用凸且梯度有界的损失函数,实现3D旋转估计的稳定有效训练。
- 提供一种概率框架,无需复杂约束强制,即可对3D旋转的众数和不确定性进行建模。
- 与现有方法相比,在多个基准数据集上展示出更优的性能和鲁棒性。
提出的方法
- 该方法使用深度神经网络回归矩阵冯米斯特定律的参数,这些参数无约束且微分同胚于R^9,从而实现直接回归。
- 将矩阵冯米斯特定律的负对数似然用作训练损失,该损失相对于网络输出是凸的,确保优化过程稳定。
- 在训练期间使用可微近似高效计算矩阵冯米斯特定律中难以计算的归一化常数。
- 网络端到端训练以预测旋转的完整分布,从而支持众数估计和不确定性量化。
- 该方法包含数据增强、类别嵌入以及通过单应性进行图像预处理,以提升泛化能力和鲁棒性。
- 预测的矩阵冯米斯特定律用于估计最可能的旋转及其在下游任务中的相关不确定性。
实验结果
研究问题
- RQ1是否可以训练深度神经网络,使其使用无约束参数化输出3D旋转的完整概率分布?
- RQ2将矩阵冯米斯特定律的负对数似然作为损失是否能形成一个具有有界梯度的凸优化问题?
- RQ3该方法是否能在Pascal3D+、ModelNet10-SO(3)和UPNA头朝向等3D旋转估计基准上实现最先进性能?
- RQ4该方法如何处理旋转对称性和模糊姿态?其在不确定性估计中的表现如何?
- RQ5数据增强、类别嵌入和图像预处理对整体性能的相对贡献是什么?
主要发现
- 所提方法在Pascal3D+数据集上实现了最先进性能,中位误差为8.9度,π/6精度达到90.8%。
- 在ModelNet10-SO(3)基准上,该方法优于先前方法,展现出对物体级3D旋转估计的强大泛化能力。
- 在UPNA头朝向数据集上,该方法实现了高精度,表现出对真实世界头朝向变化的鲁棒性。
- 消融研究显示,数据增强是最关键的组件,而类别嵌入和基于单应性的预处理在Pascal3D+上仅带来微小或无额外增益。
- 由于负对数似然损失的凸性,该方法表现出稳定的训练过程,避免了欧拉角或四元数方法中常见的局部极小值问题。
- 网络能够适当地学习不确定性建模:训练初期,模糊轴被分配接近均匀的分布;随着训练推进,当正确姿态被学习后,不确定性逐渐降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。