Skip to main content
QUICK REVIEW

[論文レビュー] REGTR: End-to-end Point Cloud Correspondences with Transformers

Zi Jian Yew, Gim Hee Lee|arXiv (Cornell University)|Mar 28, 2022
3D Shape Modeling and AnalysisEngineering被引用数 17
ひとこと要約

REGTRは、最近傍探索やRANSACに依存せずに、クリーンで一貫性のある対応点を直接予測するトランスフォーマーを用いたエンドツーエンドの点群登録フレームワークを提案する。位置符号化を用いたマルチヘッド自己注意およびクロス注意メカニズムを活用することで、3DMatchおよびModelNetベンチマークで最先端の性能を達成し、推論が高速かつより頑健であることが示された。

ABSTRACT

Despite recent success in incorporating learning into point cloud registration, many works focus on learning feature descriptors and continue to rely on nearest-neighbor feature matching and outlier filtering through RANSAC to obtain the final set of correspondences for pose estimation. In this work, we conjecture that attention mechanisms can replace the role of explicit feature matching and RANSAC, and thus propose an end-to-end framework to directly predict the final set of correspondences. We use a network architecture consisting primarily of transformer layers containing self and cross attentions, and train it to predict the probability each point lies in the overlapping region and its corresponding position in the other point cloud. The required rigid transformation can then be estimated directly from the predicted correspondences without further post-processing. Despite its simplicity, our approach achieves state-of-the-art performance on 3DMatch and ModelNet benchmarks. Our source code can be found at https://github.com/yewzijian/RegTR .

研究の動機と目的

  • 点群登録におけるRANSAC や最近傍探索による特徴マッチングなどの後処理手順の必要性を排除すること。
  • 注意メカニズムが、判別的特徴を学習するのではなく、直接的に最終的な対応点を予測できるかを調査すること。
  • エンドツーエンドで、クリーンで剛体的一致性のある対応点を出力するモデルを学習することで、登録の正確性と効率を向上させること。
  • 高解像度のキーポイント抽出や特徴工学的設計への依存を減らすために、グリッド補間された点を用い、注意に基づく対応点予測を採用すること。
  • トランスフォーマーによる直接的対応点予測が、学習された特徴とRANSACを組み合わせた従来のパイプラインを上回ることを実証すること。

提案手法

  • 入力点群をダウンサンプリングし、初期特徴を抽出するためにポイントコンボリューションバックボーンを用いる。
  • 位置符号化を介して剛体制約を強制するマルチヘッド自己注意およびクロス注意を有する複数のトランスフォーマーレイヤーを用いて、グローバルな文脈を統合する。
  • ダウンサンプリングされた各点について、(1) もう一方の点群における対応位置、および (2) 重複確率スコアを予測する。
  • 微分可能な最小二乗ソルバーを用いて、予測された対応点から直接最終的な剛体変換を推定する。
  • 最終トランスフォーマーレイヤーでの円形損失(Circle Loss)を含む、重複損失($\mathcal{L}_o$)、特徴損失($\mathcal{L}_f$)の組み合わせを用いてネットワークを訓練する。
  • 中間層への監視を回避することで性能低下を防ぎ、損失はすべて最終出力層にのみ適用する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー内の自己注意およびクロス注意メカニズムは、明示的な特徴マッチングなしに、直接的に最終的な点対応点を予測できるか?
  • RQ2対応点予測のためのトランスフォーマーに基づくエンドツーエンド学習は、RANSACを含む従来のパイプラインよりも高い登録正確性を達成できるか?
  • RQ3標準ベンチマーク上で、最近傍探索およびRANSACに依存する手法と比較して、直接的対応点予測の性能はどのように異なるか?
  • RQ4異なる損失関数および監視戦略は、予測された対応点の品質にどのような影響を与えるか?
  • RQ5ダウンサンプリングされたグリッドベースの点を用いた場合、複雑な特徴学習パイプラインよりも単純な直接予測アプローチが優れた性能を示せるか?

主な発見

  • REGTRは3DMatchベンチマークで92.0%の登録リcallを達成し、以前のSOTAを上回り、RANSACベースのベースラインよりも優れている。
  • 3DLoMatchデータセットでは、REGTRは64.8%の登録リcallを達成し、低オーバーラップの困難なシーンに対しても優れた一般化性能を示している。
  • 3DMatchでは回転誤差を1.567°、並進誤差を0.049mにまで低減し、RANSACベースラインおよび特徴マッチングアプローチを上回った。
  • アブレーションスタディの結果、特徴損失を除去すると3DMatchでの登録リcallが1.6%低下し、正確な対応点予測においてその重要性が示された。
  • すべてのトランスフォーマーレイヤーに損失を適用した場合、3DMatchでの性能は8.1%低下し、最終レイヤーでの監視が最適であることを確認した。
  • REGTRの予測対応点にRANSACを適用しても結果はわずかに悪化したため、予測された対応点はすでに一貫性があり、頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。