Skip to main content
QUICK REVIEW

[論文レビュー] DeepMeshFlow: Content Adaptive Mesh Deformation for Robust Image Registration

Nianjin Ye, Chuan Wang|arXiv (Cornell University)|Dec 11, 2019
Advanced Vision and Imaging参考文献 30被引用数 10
ひとこと要約

本稿では、メッシュフローの非線形運動モデリングとディープホモグラフィーのテクスチャ耐性を組み合わせた、不確実な深層学習フレームワークであるDeepMeshFlowを提案する。コンテンツに適応したマスクとマルチスケールメッシュ変形を用いて、低テクスチャ、低照度、複雑なシーンにおける外れ値を排除し、アライメントを向上させる。新しいベンチマークデータセット上で、平均L2誤差1.99という最先端の性能を達成した。

ABSTRACT

Image alignment by mesh warps, such as meshflow, is a fundamental task which has been widely applied in various vision applications(e.g., multi-frame HDR/denoising, video stabilization). Traditional mesh warp methods detect and match image features, where the quality of alignment highly depends on the quality of image features. However, the image features are not robust in occurrence of low-texture and low-light scenes. Deep homography methods, on the other hand, are free from such problem by learning deep features for robust performance. However, a homography is limited to plane motions. In this work, we present a deep meshflow motion model, which takes two images as input and output a sparse motion field with motions located at mesh vertexes. The deep meshflow enjoys the merics of meshflow that can describe nonlinear motions while also shares advantage of deep homography that is robust against challenging textureless scenarios. In particular, a new unsupervised network structure is presented with content-adaptive capability. On one hand, the image content that cannot be aligned under mesh representation are rejected by our learned mask, similar to the RANSAC procedure. On the other hand, we learn multiple mesh resolutions, combining to a non-uniform mesh division. Moreover, a comprehensive dataset is presented, covering various scenes for training and testing. The comparison between both traditional mesh warp methods and deep based methods show the effectiveness of our deep meshflow motion model.

研究の動機と目的

  • 手作業で特徴を設計する従来のメッシュフローメソッドが、低テクスチャまたは低照度条件下で失敗することを是正すること。
  • ホモグラフィーに基づく手法の平面的運動制約を克服し、スパースメッシュ変形によって非線形運動表現を可能にすること。
  • トレーニング中にコンテンツに適応したマスクを学習することで、動的物体や深度の不連続性に対する耐性を高めること。
  • 真値のオプティカルフローまたは密度付きアノテーションに依存しない、非教師ありトレーニングパラダイムを構築すること。
  • 複数の困難なカテゴリにわたる2視点画像アライメントを対象とする包括的かつ多様なベンチマークデータセットを確立すること。

提案手法

  • ネットワークは2つの入力画像を受け取り、メッシュ頂点で定義されたスパースな運動場を予測することで、効率的な非線形運動モデリングを可能にする。
  • メッシュ変形に不適切な領域(移動物体やテクスチャのない領域など)を特定・除外するコンテンツに適応したマスクを学習するための新規トリプレット損失を導入する。
  • 複数のメッシュ解像度を適応的に学習することで、複雑な領域に集中させつつ効率性を維持する非一様なメッシュ分割を可能にする。
  • 微分可能なワーピング層とピクセルレベル再構成ではなく、ディープ特徴類似度に基づく損失関数を用いた非教師ありトレーニングを実施する。
  • バックボーンネットワーク(例:ResNet)を統合し、ディープ特徴を抽出。これらの特徴を用いてメッシュ変形と適応的マスクの両方を予測する。
  • ピクセルレベルの監督を直接避けることで、変換されたソース画像の特徴とターゲット画像の特徴を比較し、困難な条件下での一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースのメッシュ変形モデルは、従来の特徴ベース手法が失敗する低テクスチャおよび低照度シーンでも、ロバストな画像アライメントを達成できるか?
  • RQ2コンテンツに適応したマスクは、動的物体や深度の不連続性が存在する状況で、メッシュベースのアライメントの耐性をどのように向上させるか?
  • RQ3固定解像度のメッシュと比較して、適応的メッシュ解像度は複雑なシーンでどの程度性能を向上させるか?
  • RQ4真値の運動場やオプティカルフローが存在しない状況でも、非教師ありトレーニング戦略が正確なメッシュフローを効果的に学習できるか?
  • RQ5提案手法は、多様なシーンカテゴリにわたり、古典的メッシュフローおよびディープホモグラフィーベースラインと比較して、定量的および定性的にどの程度優れているか?

主な発見

  • 提案手法はテストセットで平均L2誤差1.99を達成し、Meshflow(2.44)および非教師ありディープホモグラフィー(2.45)を顕著に上回った。
  • アブレーションスタディの結果、適応的マスクを削除すると平均誤差が2.50に上昇し、低テクスチャカテゴリで0.96ポイントの劣化を示し、マスクのロバスト性における中心的役割を裏付けた。
  • 固定解像度メッシュ(1×1、4×4、16×16)は、適応的メッシュ解像度に比べて性能を達成できず、非一様なメッシュ分割の利点を示した。
  • 視覚的比較では、DeepMeshFlowが、建物の外壁や地面などの深度境界で、ゴースト化やぼやけを低減していることが明らかになった。
  • 本手法は、すべての5つのデータセットカテゴリ(通常、低テクスチャ、低照度、小規模な前面物体、大規模な前面物体)で優れた性能を発揮し、広範なロバスト性を示した。
  • ピクセルレベル再構成ではなくディープ特徴ベースの損失を使用することで、テクスチャのない領域やノイズの多い領域でのアライメント品質が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。