Skip to main content
QUICK REVIEW

[論文レビュー] ActiveStereoNet: End-to-End Self-Supervised Learning for Active Stereo Systems

Yinda Zhang, Sameh Khamis|arXiv (Cornell University)|Jul 16, 2018
Advanced Vision and Imaging参考文献 43被引用数 9
ひとこと要約

ActiveStereoNetは、自己教師ありな窓ベース損失と適応的サポート重み、およびオクルージョンを処理する自己教師あり無効化ネットワークを用いて、アクティブステレオ深度推定のための最初のエンドツーエンド自己教師あり深層学習手法を提示する。1/30ピクセルのサブピクセル精度を達成し、鋭いエッジ、最小限の過剰平滑化、照明変化やテクスチャの欠如領域に対する頑健性を備え、実データおよび合成データのベンチマークで先行手法を上回る性能を発揮する。

ABSTRACT

In this paper we present ActiveStereoNet, the first deep learning solution for active stereo systems. Due to the lack of ground truth, our method is fully self-supervised, yet it produces precise depth with a subpixel precision of $1/30th$ of a pixel; it does not suffer from the common over-smoothing issues; it preserves the edges; and it explicitly handles occlusions. We introduce a novel reconstruction loss that is more robust to noise and texture-less patches, and is invariant to illumination changes. The proposed loss is optimized using a window-based cost aggregation with an adaptive support weight scheme. This cost aggregation is edge-preserving and smooths the loss function, which is key to allow the network to reach compelling results. Finally we show how the task of predicting invalid regions, such as occlusions, can be trained end-to-end without ground-truth. This component is crucial to reduce blur and particularly improves predictions along depth discontinuities. Extensive quantitatively and qualitatively evaluations on real and synthetic data demonstrate state of the art results in many challenging scenes.

研究の動機と目的

  • アクティブステレオシステムのための大規模な真値深度データの不足に対処する。
  • 教師なしで高精度な深度推定を達成できる自己教師あり深層学習フレームワークを開発する。
  • アクティブステレオにおいて、細部やエッジの保持、過剰平滑化の低減、オクルージョンの処理を実現する。
  • アクティブステレオ撮影における照明変化および高周波成分のアーチファクトに対して頑健性を高める。
  • 真値アノテーションなしで、深度推定とオクルージョン検出の両方をエンドツーエンドで訓練可能にする。

提案手法

  • コストボリュームの集約を改善し、識別能を高めるために、適応的サポート重み(ASW)を備えた窓ベースの再構成損失を提案する。
  • 低周波成分を除去し、距離に伴うパターンの褪色に適応するため、局所的コントラスト正規化(LCN)損失を導入する。
  • LCNに基づく損失のための特徴抽出を実現するためのシアンプスネットワークタワーを採用し、照明変動およびテクスチャの変動に対して頑健性を向上させる。
  • オクルージョン領域を予測し、損失計算から除外する自己教師あり無効化ネットワークを設計する。
  • 無効化ネットワークから得られる信頼度マップを副産物として得られ、オクルージョン推論を要する高レベルな応用に活用可能である。
  • 局所的最小値の低減およびエッジの太り具合の低減を実現する微分可能な窓ベースコスト集約を用いて、ネットワーク全体をエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり深層学習手法は、真値の教師なしでアクティブステレオにおいてサブピクセル精度の深度推定を達成できるか?
  • RQ2アクティブステレオにおける照明変化および高周波成分のアーチファクトに対して頑健な損失関数はどのように設計できるか?
  • RQ3真値ラベルなしで、オクルージョン処理をエンドツーエンドで学習可能か?
  • RQ4窓ベースコスト集約における適応的サポート重みは、エッジ保持および細い構造の回復を改善するか?
  • RQ5無効化ネットワークは信頼度マップを信頼できる精度で生成できるか?また、左-右整合性などの従来手法と比較してどうか?

主な発見

  • ActiveStereoNetは1/30ピクセルのサブピクセル精度を達成し、先行するアクティブステレオ手法を著しく上回る。
  • 適応的サポート重み(ASW)を備えた提案された窓ベース損失は、単一ピクセルまたは非適応的手法と比較してエッジの太り具合を低減し、細い構造の回復をより正確に実現する。
  • LCNに基づく再構成損失はノイズを低減し、明示的な光度学習がなくても、テクスチャの欠如領域や低コントラスト領域での性能を向上させる。
  • 無効化ネットワークはオクルージョン検出で平均80.7%の正確度を達成し、左-右チェック(80.9%)を上回り、光度誤差(51.3%)を大きく上回る。
  • 飛行ピクセルが最小限で、過剰平滑化もほとんどない完全な深度マップを生成し、特に深度不連続領域で顕著である。
  • Titan X上で1フレーム15msで実行可能であり、実用的デプロイメントに向けたリアルタイム実現可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。