Skip to main content
QUICK REVIEW

[論文レビュー] Rotation-Invariant Transformer for Point Cloud Matching

Hao Yu, Zheng Qin|arXiv (Cornell University)|Mar 14, 2023
Image Processing and 3D Reconstruction被引用数 4
ひとこと要約

RoITrは、点群の対特徴(PPF)を自己注意メカニズムに埋め込むことで、内在的な姿勢に依存しない幾何表現を実現する回転不変型Transformerを提案する。回転不変型のグローバルなクロスフレーム空間的認識を持つ注目ベースのエンコーダデコーダアーキテクチャを導入し、3DLoMatchベンチマークにおける大回転条件下で、SOTA手法よりもインライア比率および登録リコールで13–5パーセンテージポイントの優位性を示した。

ABSTRACT

The intrinsic rotation invariance lies at the core of matching point clouds with handcrafted descriptors. However, it is widely despised by recent deep matchers that obtain the rotation invariance extrinsically via data augmentation. As the finite number of augmented rotations can never span the continuous SO(3) space, these methods usually show instability when facing rotations that are rarely seen. To this end, we introduce RoITr, a Rotation-Invariant Transformer to cope with the pose variations in the point cloud matching task. We contribute both on the local and global levels. Starting from the local level, we introduce an attention mechanism embedded with Point Pair Feature (PPF)-based coordinates to describe the pose-invariant geometry, upon which a novel attention-based encoder-decoder architecture is constructed. We further propose a global transformer with rotation-invariant cross-frame spatial awareness learned by the self-attention mechanism, which significantly improves the feature distinctiveness and makes the model robust with respect to the low overlap. Experiments are conducted on both the rigid and non-rigid public benchmarks, where RoITr outperforms all the state-of-the-art models by a considerable margin in the low-overlapping scenarios. Especially when the rotations are enlarged on the challenging 3DLoMatch benchmark, RoITr surpasses the existing methods by at least 13 and 5 percentage points in terms of Inlier Ratio and Registration Recall, respectively.

研究の動機と目的

  • 外部データ拡張に依存しない未観測回転下でのディープな点群マッチャーの不安定性を解消すること。
  • 回転拡張トレーニングに依存せずに、局所幾何の内在的回転不変性を達成すること。
  • 回転不変の方法でフレーム間空間的関係をモデル化することで、特徴の特徴的差別性を向上させること。
  • 新しいグローバルトランスフォーマー設計により、低オーバーラップおよび非剛性マッチング状況でのロバスト性を向上させること。
  • 既存手法がグローバルな文脈を失うか、複雑な空間的関係を効果的にモデル化できないという限界を克服すること。

提案手法

  • PPFから導出される座標を用いることで、姿勢に依存しない局所幾何をエンコードするPPFに基づく注目メカニズム(PPF注目メカニズム、PAM)を導入する。
  • 階層的で回転不変な特徴学習を実現するため、注目ベースのエンコーダデコーダアーキテクチャ(PPFTrans)を設計し、注目抽象化層(AAL)、PPF注目層(PAL)、遷移アップ層(TUL)を含む。
  • 自己注意を用いて、姿勢依存なしに点群間の相対的位置関係をモデル化する、回転不変型のクロスフレーム空間的認識を持つグローバルトランスフォーマーを提案する。
  • グローバルトランスフォーマーを統合することで、フレーム間の長距離空間的依存関係を捉え、特徴の特徴的差別性を向上させる。
  • 対照的損失を用いてエンドツーエンドで訓練し、内在的不変性を活用してデータ拡張への依存度を低減する。
  • 幾何的構造を保持しながら、学習可能な注目を用いたマルチスケール抽象化戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1PPFに基づく座標を用いた自己注意メカニズムは、局所点群幾何の内在的回転不変性を達成できるか?
  • RQ2注目ベースのエンコーダデコーダアーキテクチャは、PointNet や KPConv と比較して、代表的で姿勢に依存しない局所特徴を学習できるか?
  • RQ3回転不変型のクロスフレーム空間的認識は、特徴の特徴的差別性およびマッチングのロバスト性をどの程度向上させるか?
  • RQ4RoITrは極端な回転および低オーバーラップ条件下で、データ拡張に基づくSOTA手法と比較してどの程度の性能を示すか?
  • RQ5グローバルトランスフォーマーの深さとアーキテクチャの影響は、点群マッチングにおける性能と一般化能力にどのような影響を及ぼすか?

主な発見

  • RoITrは、回転させた3DLoMatchで89.6%の特徴マッチングリコール(FMR)と53.2%の登録リコール(RR)を達成し、次の最高性能の手法よりもRRで少なくとも5パーセンテージポイント優位であった。
  • 大回転を伴う3DLoMatchベンチマークにおいて、RoITrは最強のベースラインよりもインライア比率を13パーセンテージポイント向上させた。
  • アブレーションスタディにより、PPFに基づく注目メカニズムが、最大/平均プーリングやPointTransformerの注目と比較して、精度および効率の両面で顕著に優れていることが確認された。
  • 回転不変型の空間的認識を持つグローバルトランスフォーマーは、そのような認識を持たないGeoTransと比較して、性能を2.5–3.5%向上させた。
  • グローバルトランスフォーマーの数を3つを超えて増加させると、過学習のため性能が劣化する傾向にあり、一般化のための最適な深さが存在することが示された。
  • パrameter数を正規化してもRoITrは優れた性能を維持しており、PointTransformer や KPConvベースのベースラインと比較して、より高いパrameter効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。