Skip to main content
QUICK REVIEW

[論文レビュー] RANSAC-Flow: generic two-stage image alignment

Xi Shen, François Darmon|arXiv (Cornell University)|Apr 3, 2020
Advanced Vision and Imaging参考文献 97被引用数 4
ひとこと要約

RANSAC-Flow は、RANSAC を用いたホモグラフィ推定と、SSIM およびサイクル整合性損失を用いてアライメントを精緻化する自己教師付きディープニューラルネットワークを組み合わせることで、一般化された2段階の教師なし手法を提案する。この手法は、光学フロー、ビジュアルロケーション、アートワークアライメントといった多様なタスクにおいて競争力ある性能を達成し、芸術史やテクスチャ転送分野における新規な応用を可能にする。

ABSTRACT

This paper considers the generic problem of dense alignment between two images, whether they be two frames of a video, two widely different views of a scene, two paintings depicting similar content, etc. Whereas each such task is typically addressed with a domain-specific solution, we show that a simple unsupervised approach performs surprisingly well across a range of tasks. Our main insight is that parametric and non-parametric alignment methods have complementary strengths. We propose a two-stage process: first, a feature-based parametric coarse alignment using one or more homographies, followed by non-parametric fine pixel-wise alignment. Coarse alignment is performed using RANSAC on off-the-shelf deep features. Fine alignment is learned in an unsupervised way by a deep network which optimizes a standard structural similarity metric (SSIM) between the two images, plus cycle-consistency. Despite its simplicity, our method shows competitive results on a range of tasks and datasets, including unsupervised optical flow on KITTI, dense correspondences on Hpatches, two-view geometry estimation on YFCC100M, localization on Aachen Day-Night, and, for the first time, fine alignment of artworks on the Brughel dataset. Our code and data are available at http://imagine.enpc.fr/~shenx/RANSAC-Flow/

研究の動機と目的

  • 顕著な外観および視点の変化を伴う多様な画像ペアに対して、一般化可能な高密度画像アライメントの課題に取り組む。
  • 純粋なパrametric(例:ホモグラフィを用いたRANSAC)および non-parametric(例:光学フロー)手法の限界を克服し、両者の長所を統合する。
  • 特にレアまたは芸術的画像ペアにおいて、教師ありフローや対応点が存在しない状況でも教師なしアライメントを可能にする。
  • 視覚的に異なる画像の細粒度なアライメントを可能にすることで、歴史的アートワークにおける複製プロセスの分析を含む、芸術史分野における新規な応用を実現する。
  • タスク固有の再訓練を必要とせず、複数のデータセットおよびタスクに即座に適用可能なプラグアンドプレイソリューションを提供する。

提案手法

  • 段階1:SuperPoint などの市販の深層特徴を用いて RANSAC を実行し、大規模な視点および外観変化に耐える粗いホモグラフィを推定する。
  • 段階2:SSIM を最小化するように、歪み補正済み画像とターゲット画像間の類似度を最適化する自己教師付きのディープフローネットワークを訓練する。
  • 前後方向の歪みが一貫するようサイクル整合性損失を強制し、耐性を向上させる。
  • 1つのホモグラフィではなく複数のホモグラフィを用いることで、ピecewise-planar なシーン構造をモデル化し、単一ホモグラフィ法よりも高いアライメント精度を実現する。
  • 一致する対応点を除去してプロセスを再実行することで、繰り返しアライメントを精緻化し、複雑で一様でない変換に対応する。
  • 事前学習済み特徴と微分可能なフローネットワークを活用し、教師なしでエンドツーエンド最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1パrametric および non-parametric 手法を組み合わせたシンプルで一般化可能な2段階アプローチが、タスク固有の設計を施さずに、多様な画像アライメントタスクで競争力ある性能を達成できるか?
  • RQ2顕著な外観および視点の違いが生じる状況下で、市販の深層特徴を用いた RANSAC による粗いアライメントはどの程度有効か?
  • RQ3SSIM およびサイクル整合性損失に基づいて自己教師付きで学習されたディープニューラルネットワークは、教師ありフローが存在しない状況でも高精度な高密度アライメントを達成できるか?
  • RQ4この手法により、視覚的に異なるバージョンを有する歴史的アートワークの複製プロセスを分析する芸術史分野における新規な応用が可能になるか?
  • RQ5複雑なシーンにおいて、複数のホモグラフィを用いることで、単一ホモグラフィと比較して顕著にアライメント精度が向上するか?

主な発見

  • RANSAC-Flow は、KITTI および Hpatches における教師なし光学フロー推定において、教師なし条件下で最先端の手法と同等またはそれを上回る性能を達成する。
  • Aachen Day-Night ベンチマークにおいて、画像マッチングと COLMAP のみを用いた状況でも、最先端の手法と同等の正確なビジュアルロケーションを実現する。
  • YFCC100M において、画像ペアのみを用いて2視点幾何推定を実現し、顕著な外観および視点の変化に対しても高い耐性を示す。
  • Brughel データセットにおいて、高品質な高密度アライメントを達成し、初めてアートワークの複製プロセスをフロー可視化によって細粒度に分析可能にする。
  • 微細なフローフィールドは、一部のアートワークでは空間的に一貫した複製を示し、他のアートワークでは不連続で不規則な変位を示し、芸術的技法に関する新たな知見を提供する。
  • この手法は、効果的なテクスチャ転送およびインターネット画像の平均化を可能にし、ベースラインのアライメント手法と比較して、よりシャープで一貫性のある結果を生成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。