Skip to main content
QUICK REVIEW

[论文解读] Revisiting the Continuity of Rotation Representations in Neural Networks

Sitao Xiang, Hao Li|arXiv (Cornell University)|Jun 11, 2020
Advanced Numerical Analysis Techniques参考文献 9被引用 8
一句话总结

本文证明了由于SO(3)中的拓扑约束,将旋转矩阵转换为四元数或欧拉角的神经网络必然会产生高达180°的误差,并表明标准的R⁵或R⁶嵌入方法在输入对称性下会失效。作者提出一种自选集成方法,通过多个在不同区域学习的网络实现,成功将最大误差降至接近零(4.62°),并优于标准方法,避免了拓扑陷阱。

ABSTRACT

In this paper, we provide some careful analysis of certain pathological behavior of Euler angles and unit quaternions encountered in previous works related to rotation representation in neural networks. In particular, we show that for certain problems, these two representations will provably produce completely wrong results for some inputs, and that this behavior is inherent in the topological property of the problem itself and is not caused by unsuitable network architectures or training procedures. We further show that previously proposed embeddings of $\mathrm{SO}(3)$ into higher dimensional Euclidean spaces aimed at fixing this behavior are not universally effective, due to possible symmetry in the input causing changes to the topology of the input space. We propose an ensemble trick as an alternative solution.

研究动机与目标

  • 理论分析神经网络在使用欧拉角或四元数表示3D旋转时为何无法准确实现。
  • 证明从SO(3)到R⁴(四元数)的连续映射中,高达180°的误差在拓扑上不可避免。
  • 表明当输入对称性改变输入空间的拓扑结构时,现有R⁵或R⁶中的嵌入方法会失效。
  • 开发一种鲁棒且可泛化的解决方案,避免旋转表示中的拓扑障碍。
  • 通过神经网络集成实验验证理论假设。

提出的方法

  • 证明任何从SO(3)到R⁴(四元数)的连续函数,必然存在某个输入使得输出与真实旋转相差180°。
  • 利用代数拓扑方法,证明当输入对称性使输入空间非单连通时,R⁵或R⁶中的嵌入方法会失效。
  • 提出一种自选集成方法,其中每个网络学习SO(3)的不同区域,从而避开拓扑障碍。
  • 设计一种改进的损失函数,对超出每个网络指定区域的输出施加惩罚,强制实现正确的局部行为。
  • 采用两阶段训练策略:首先使用区域特定损失进行训练,然后使用标准损失进一步优化性能。
  • 利用SO(4)作为覆盖空间,构建四个网络,其联合正确区域可完全覆盖SO(3)且无拓扑冲突。

实验结果

研究问题

  • RQ1连续的神经网络将旋转矩阵映射到四元数时,能否避免超过180°的误差?
  • RQ2为何SO(3)在R⁵或R⁶中的标准嵌入方法在输入对称性下会失效?
  • RQ3网络集成能否克服旋转表示中的拓扑障碍?
  • RQ4是否可能构建一个神经网络集成,使旋转预测的最大误差接近零?
  • RQ5输入对称性如何影响输入空间的拓扑结构以及旋转表示的性能?

主要发现

  • 由于拓扑约束,任何从SO(3)到R⁴的连续神经网络映射,必然在某些输入上产生至少180°的误差。
  • 当输入对称性使输入空间非单连通时,R⁵或R⁶中的嵌入方法并非普遍有效,拓扑障碍会重新出现。
  • 自选集成方法成功将最大误差降低至4.62°,使用四个网络时表现优于标准集成方法。
  • 采用所提方法训练的五个网络集成,最大误差仅为8.71°,展现出良好的鲁棒性。
  • 基于定理14中理论构造的手动设计集成,达到最大误差4.62°,验证了理论框架的正确性。
  • 使用区域特定损失函数显著提升了拓扑泛化能力,尤其在结合两阶段训练策略时效果更佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。