[論文レビュー] Learnable Motion Coherence for Correspondence Pruning
本稿では、スパースでノイズの多い対応関係におけるロバストな対応関係の刈り込みを実現するため、運動の一貫性をモデル化する学習可能なニューラルネットワーク、LMCNetを提案する。グラフラプラシアンに基づく滑らかさ関数フィッティングを用いて運動の一貫性を定式化することで、微分可能に一貫した運動パターンを学習可能とし、局所的およびグローバルな一貫性を統合することで、相対カメラポーズ推定および動的シーンにおける対応関係の刈り込みにおいて、最先端の手法を上回る性能を達成する。
Motion coherence is an important clue for distinguishing true correspondences from false ones. Modeling motion coherence on sparse putative correspondences is challenging due to their sparsity and uneven distributions. Existing works on motion coherence are sensitive to parameter settings and have difficulty in dealing with complex motion patterns. In this paper, we introduce a network called Laplacian Motion Coherence Network (LMCNet) to learn motion coherence property for correspondence pruning. We propose a novel formulation of fitting coherent motions with a smooth function on a graph of correspondences and show that this formulation allows a closed-form solution by graph Laplacian. This closed-form solution enables us to design a differentiable layer in a learning framework to capture global motion coherence from putative correspondences. The global motion coherence is further combined with local coherence extracted by another local layer to robustly detect inlier correspondences. Experiments demonstrate that LMCNet has superior performances to the state of the art in relative camera pose estimation and correspondences pruning of dynamic scenes.
研究の動機と目的
- 複数の幾何的モデルが存在する可能性がある、不均一に分布したスパースな対応関係における誤対応関係の刈り込みの課題に対処すること。
- 手作業でチューニングが必要で、複雑な運動パターンでは失敗する、手作業で設計された運動一貫性ルールの限界を克服すること。
- スパースな対応関係からグローバルな運動一貫性を微分可能に学習するフレームワークを設計し、ニューラルネットワークにおけるエンドツーエンド学習を可能にすること。
- 局所的およびグローバルな運動一貫性を統合することで、高い外れ値比率および複雑な運動構造下でも、インライア検出のロバスト性を向上させること。
提案手法
- グラフラプラシアン分解を用いて、対応関係グラフ上での滑らかさ関数フィッティングとして運動一貫性をモデル化する、新規な定式化であるラプラシアン運動フィッティング(LMF)を提案する。
- グラフラプラシアンの固有値分解を用いてLMFの閉形式解を導出し、ニューラルネットワーク内での微分可能計算を可能にする。
- 閉形式LMF解を用いて、仮の対応関係からグローバルな運動一貫性を学習する微分可能なコherエンスリーダーレイヤー(CR-Layer)を設計する。
- 対応関係の局所的近傍から運動的に一貫したサポートを抽出するローカルコヒーレンスレイヤー(LC-Layer)を設計する。
- CR-LayerとLC-Layerを統合したLMCNetを構築し、対応関係の座標または特徴量を入力として受け取り、インライア確率を出力する深層ネットワークを実現する。
- CR-Layerの微分可能性を活用して、インライアラベルの教師付き学習を用いてエンドツーエンドでLMCNetを訓練する。
実験結果
リサーチクエスチョン
- RQ1高い外れ値比率および複雑な運動パターンが存在する状況下でも、学習可能で微分可能な運動一貫性の定式化は、対応関係の刈り込み性能を向上させ得るか?
- RQ2グラフラプラシアンに基づく滑らかさ関数フィッティングでモデル化されるグローバルな運動一貫性は、手作業で設計されたルールと比較して、インライア検出をどの程度向上させるか?
- RQ3グローバルおよびローカルの運動一貫性を統合することで、動的シーンおよび相対ポーズ推定タスクにおけるロバスト性はどの程度向上するか?
- RQ4グラフラプラシアン分解における固有ベクトルの数は、LMCNetの性能にどの程度感度を示すか?
- RQ5LMCNetは、現代の学習ベースの特徴抽出器およびマッチャーと効果的に組み合わせられ、下流のポーズ推定精度を向上させ得るか?
主な発見
- LMCNetは、相対カメラポーズ推定において最先端の性能を達成し、YFCC100MデータセットにおいてAUC@5°が34.62%を記録し、すべてのベースラインを上回った。
- 動的シーンにおける対応関係の刈り込みを対象としたDETRACデータセットでは、LMCNetがAUC@20°で70.53%を達成し、比較されたすべての手法を上回った。
- アブレーションスタディの結果、CR-Layerの追加によりベースライン比でAUC@20°が2.89%向上し、さらにLC-Layerの追加で1.67%のさらなる向上が得られた。
- CR-Layerで16個の固有ベクトルを使用すると性能が著しく低下する一方、64個に増加させてもさらなる向上は得られず、32が最適な選択であることを裏付けた。
- 高い外れ値比率下でも高い精度を維持し、インライア数が減少するにつれて精度が向上する傾向を示しており、信頼性の高い信頼度キャリブレーションを実現している。
- SuperPointおよびSuperGlueと組み合わせた場合、LMCNetはAUC@20°を33.26%から37.55%まで向上させ、現代の学習ベースのパイプラインと高い互換性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。