Skip to main content
QUICK REVIEW

[論文レビュー] AdaStereo: A Simple and Efficient Approach for Adaptive Stereo Matching

Xiao Song, Guorun Yang|arXiv (Cornell University)|Apr 9, 2020
Advanced Vision and Imaging参考文献 95被引用数 14
ひとこと要約

AdaStereoは、入力画像(非敵対的プログレッシブカラートランスファーを通じて)、内部特徴(パラメータフリーのコスト正規化を通じて)、出力差分(自己教師型オクルージョン対応再構成を通じて)の3レベルで、合成データと現実世界のデータの間で特徴を整合させる、シンプルで効果的かつ包括的なドメイン適応パイプラインを提案する。本手法は、ターゲットドメインの真値データに対する微調整なしに、KITTI、Middlebury、ETH3D、DrivingStereoの4つのベンチマークで最先端のクロスドメイン性能を達成する。

ABSTRACT

Recently, records on stereo matching benchmarks are constantly broken by end-to-end disparity networks. However, the domain adaptation ability of these deep models is quite poor. Addressing such problem, we present a novel domain-adaptive pipeline called AdaStereo that aims to align multi-level representations for deep stereo matching networks. Compared to previous methods for adaptive stereo matching, our AdaStereo realizes a more standard, complete and effective domain adaptation pipeline. Firstly, we propose a non-adversarial progressive color transfer algorithm for input image-level alignment. Secondly, we design an efficient parameter-free cost normalization layer for internal feature-level alignment. Lastly, a highly related auxiliary task, self-supervised occlusion-aware reconstruction is presented to narrow down the gaps in output space. Our AdaStereo models achieve state-of-the-art cross-domain performance on multiple stereo benchmarks, including KITTI, Middlebury, ETH3D, and DrivingStereo, even outperforming disparity networks finetuned with target-domain ground-truths.

研究の動機と目的

  • 合成データで学習されたエンドツーエンドのステレオマッチングネットワークのドメイン一般化性能の低さを是正すること。
  • 合成データ(例:SceneFlow)と現実世界データ(例:KITTI、Middlebury)の間のドメインギャップを、入力、内部特徴、出力差分の3レベルで同定し、埋め合わせること。
  • GAN由来の歪みを回避し、ターゲットドメインのアノテーションに依存するのを減らす、非敵対的で効率的なステレオマッチング用の包括的ドメイン適応パイプラインを開発すること。
  • ターゲットドメインの真値アノテーションを一切使用せずに、合成データでの事前学習のみで、現実世界のベンチマークで最先端の性能を達成すること。

提案手法

  • GAN由来の幾何的アーティファクトを避けるために、訓練中にソース(合成)ドメインとターゲット(現実)ドメインの間で入力カラーデータの分布を整合させる非敵対的プログレッシブカラートランスファー法を採用する。
  • チャネルおよびピクセル単位の正規化を適用することで、内部のマッチングコストボリュームを整合化するパラメータフリーのコスト正規化レイヤーを導入し、ドメイン間での特徴の一貫性を向上させる。
  • オクルージョンマスクを予測しながらターゲットドメインの画像を再構成することで、出力差分マップの整合性を高める自己教師型オクルージョン対応再構成タスクを用いる。
  • 再構成がオクルージョン領域で不適切になりがちな問題を緩和するため、ソースドメインとターゲットドメインを同時に学習するドメイン協調学習戦略を採用し、オクルージョンマスクの予測精度を向上させる。
  • 標準的なステレオマッチングネットワーク(例:PSMNet)にパイプライン全体を統合し、最小限のアーキテクチャ変更でエンドツーエンド学習を可能にする。
  • ターゲットドメインの微調整を一切行わず、SceneFlowでの事前学習に依存して、複数のベンチマークで評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1非敵対的でプログレッシブなカラートランスファー法は、幾何的歪みを引き起こさずに、ステレオマッチングにおける入力レベルのドメインギャップを効果的に整合できるか?
  • RQ2学習可能なパラメータを導入せずに、合成ドメインと現実ドメインの間で内部特徴分布(コストボリューム)をどのように正規化できるか?
  • RQ3自己教師型でオクルージョン対応の再構成タスクは、出力空間の整合性を向上させ、クロスドメイン差分予測の精度を向上させられるか?
  • RQ4入力、特徴、出力レベルの整合化を統合することで、従来のドメイン一般化や適応手法と比較して、現実世界のステレオベンチマークにおける一般化性能が顕著に向上するか?
  • RQ5合成データで事前学習したドメイン適応型ステレオモデルは、現実世界の真値アノテーションで微調整されたモデルを上回る性能を発揮できるか?

主な発見

  • AdaStereoはETH3Dベンチマークで、ターゲットドメインの微調整なしに2ピクセル誤差指標で1位を達成し、最先端の性能を発揮した。
  • Middleburyベンチマークでは、SceneFlowで事前学習したAda-PSMNetが2ピクセル誤差率13.7%を達成し、PSMNet、iResNet、EdgeStereoを含むすべての微調整済みエンドツーエンドステレオネットワークを上回った。
  • KITTI 2015ベンチマークでは、Ada-PSMNetがD1誤差3.08%を達成し、自己教師型および弱教師型手法を上回り、KITTIで微調整されたGC-Netと同等の性能を発揮した。
  • アブレーションスタディの結果、カラートランスファー、コスト正規化、オクルージョン対応再構成の3つのモジュールが最終性能に顕著な寄与をしていることが確認され、特に再構成モジュールが最大の向上をもたらした。
  • 本手法はドメイン一般化ベースラインをも凌駕するだけでなく、すべての評価ベンチマークでターゲットドメインの真値アノテーションで微調整されたモデルを上回り、強力なゼロショットドメイン適応能力を示した。
  • 自己教師型オクルージョン対応再構成モジュールは、明示的なアノテーションがなくても、訓練中に現実世界データからのシーンジオメトリを組み込むことで、差分予測の精度を効果的に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。