Skip to main content
QUICK REVIEW

[論文レビュー] Improving Deep Stereo Network Generalization with Geometric Priors

Jialiang Wang, Varun Jampani|arXiv (Cornell University)|Aug 25, 2020
Advanced Vision and Imaging参考文献 31被引用数 7
ひとこと要約

本稿では、学習中に幾何的事前知識—勾配ドメインにおける滑らかさと隠蔽の推論—をエンドツーエンドのディープステレオネットワークに統合することで、推論コストを増加させずに現実世界のデータに対する一般化性能を向上させることを提案する。FlyingThings3Dなどの合成データセットで学習することで、PSM-NetのMiddleburyベンチマークにおけるMAEを5.37から3.21に低下させ、テクスチャが乏しく、隠蔽領域がある状況でも顕著に耐性を高めつつ、処理速度を維持した。

ABSTRACT

End-to-end deep learning methods have advanced stereo vision in recent years and obtained excellent results when the training and test data are similar. However, large datasets of diverse real-world scenes with dense ground truth are difficult to obtain and currently not publicly available to the research community. As a result, many algorithms rely on small real-world datasets of similar scenes or synthetic datasets, but end-to-end algorithms trained on such datasets often generalize poorly to different images that arise in real-world applications. As a step towards addressing this problem, we propose to incorporate prior knowledge of scene geometry into an end-to-end stereo network to help networks generalize better. For a given network, we explicitly add a gradient-domain smoothness prior and occlusion reasoning into the network training, while the architecture remains unchanged during inference. Experimentally, we show consistent improvements if we train on synthetic datasets and test on the Middlebury (real images) dataset. Noticeably, we improve PSM-Net accuracy on Middlebury from 5.37 MAE to 3.21 MAE without sacrificing speed.

研究の動機と目的

  • 合成データまたは限定的な実データで学習したディープステレオネットワークが、多様な現実世界のシーンでテストされた際に一般化性能が低いという問題に対処すること。
  • 標準的なネットワークが失敗するテクスチャが乏しく、隠蔽領域がある状況での耐性を高めること。
  • 推論時間やモデルの複雑さを増加させずに一般化性能を向上させること。
  • エンドツーエンドのステレオネットワークに幾何的事前知識を統合できる微分可能で逆誤差伝搬可能なモジュールを開発すること。
  • Middleburyなどの現実世界のベンチマークを用いて、PSM-Net や HSM-Net といった強力なベースラインに対して本手法を検証すること。

提案手法

  • 実際のシーンが連続する表面で構成されることを踏まえ、予測された差し引きマップにおける区分的滑らかさを促進する勾配ドメインにおける滑らかさ事前知識を導入する。
  • 補正されたステレオ幾何学的構造を用いて、差し引きと隠蔽の幾何的関係をモデル化する隠蔽推論モジュールを追加する。
  • 両モジュールとも微分可能であり、推論時とは異なり学習時のみに適用され、元のネットワークアーキテクチャに変更を加えない。
  • これらのモジュールは学習時の損失関数に組み込まれ、アーキテクチャの変更なしにエンドツーエンド最適化が可能である。
  • 本手法は、PSM-Net および HSM-Net に対して評価され、FlyingThings3D や Falling Things などの合成データセットを用いて事前学習済み重みからの微調整が行われた。
  • 本手法は、ステレオネットワークの種類に依存せず、訓練時の正則化子として機能するため、あらゆるステレオネットワークと互換性がある。

実験結果

リサーチクエスチョン

  • RQ1合成データで学習したディープステレオネットワークに対して、幾何的事前知識を統合することで、現実世界のデータに対する一般化性能が向上するか?
  • RQ2勾配ドメインにおける滑らかさを組み込むことで、テクスチャが乏しく、低テクスチャ領域での性能が向上するか?
  • RQ3明示的な隠蔽推論を組み込むことで、隠蔽領域における差し引き推定性能が向上するか?
  • RQ4提案手法は、推論速度を低下させず、モデルパラメータ数を増加させずに性能向上を達成するか?
  • RQ5合成学習データの選択(例:FlyingThings3D と Falling Things)が一般化性能に与える影響は何か?

主な発見

  • 両幾何的事前知識を用いた微調整後、PSM-NetのMiddleburyベンチマークにおけるMAEは5.37から3.21に低下し、相対的に40%の改善が達成された。
  • GradSmoothモジュール単体でも、PSM-NetのMAEは5.37から4.62に低下し、複数のデータセットで一貫した改善が確認された。
  • 隠蔽モジュールを追加することで、PSM-Netの性能はさらに向上し、MAEが3.21に低下したが、HSM-Netにはそれほど顕著な効果が見られず、これは同ネットワーク自身のデータ拡張戦略による可能性がある。
  • FlyingThings3Dの代わりにFalling Thingsデータセットで学習した場合、PSM-NetのMiddleburyにおけるMAEは5.37から1.41に低下し、データセットの品質が一般化性能に大きく影響することが示された。
  • Falling Thingsで学習した際、GradSmoothモジュールにより、不良ピクセル(bad-2.0)の割合は11.48%から10.35%に低下し、より高い耐性が確認された。
  • 提案手法は推論速度を維持しており、モデルパラメータ数も増加させない。これは、推論時には元のネットワークのみが使用されるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。