Skip to main content
QUICK REVIEW

[論文レビュー] FADNet: A Fast and Accurate Network for Disparity Estimation

Qiang Wang, Shaohuai Shi|arXiv (Cornell University)|Mar 24, 2020
Advanced Vision and Imaging参考文献 25被引用数 12
ひとこと要約

FADNet は、2次元相関層、残差ブロック、マルチスケール監視を組み合わせることで、3D畳み込みベースのモデル(例:PSMNet)と比較して 20 倍速く、GPUメモリを 10 倍少なく使用しながら、最先端の精度を達成する高速で正確なディーブラーニングフレームワークです。このため、性能を犠牲にすることなくリソース制限のあるデバイスへのリアルタイムデプロイが可能になります。

ABSTRACT

Deep neural networks (DNNs) have achieved great success in the area of computer vision. The disparity estimation problem tends to be addressed by DNNs which achieve much better prediction accuracy in stereo matching than traditional hand-crafted feature based methods. On one hand, however, the designed DNNs require significant memory and computation resources to accurately predict the disparity, especially for those 3D convolution based networks, which makes it difficult for deployment in real-time applications. On the other hand, existing computation-efficient networks lack expression capability in large-scale datasets so that they cannot make an accurate prediction in many scenarios. To this end, we propose an efficient and accurate deep network for disparity estimation named FADNet with three main features: 1) It exploits efficient 2D based correlation layers with stacked blocks to preserve fast computation; 2) It combines the residual structures to make the deeper model easier to learn; 3) It contains multi-scale predictions so as to exploit a multi-scale weight scheduling training technique to improve the accuracy. We conduct experiments to demonstrate the effectiveness of FADNet on two popular datasets, Scene Flow and KITTI 2015. Experimental results show that FADNet achieves state-of-the-art prediction accuracy, and runs at a significant order of magnitude faster speed than existing 3D models. The codes of FADNet are available at https://github.com/HKBU-HPML/FADNet.

研究の動機と目的

  • ディープステレオマッチングネットワークにおける精度と推論効率のトレードオフを解決すること。
  • テクスチャが欠落している、または繰り返しのある領域などの困難なシーンでも高い精度を維持しながら、リアルタイムデプロイを可能にすること。
  • 3D畳み込みベースのネットワーク(例:PSMNet、GANet)が示す高いメモリおよび計算要求を犠牲にすることなく克服すること。
  • GPUメモリ使用量と推論時間を最小限に抑えることで、エッジデバイスへの実用的デプロイを可能にすること。

提案手法

  • FADNet は、高速な計算を維持しながら視差間の特徴関係を捉えるためにスタックされた2次元ベースの相関層を採用している。
  • 訓練の安定化とより深いネットワークアーキテクチャによる特徴学習の向上のため、残差ブロックを統合している。
  • マルチスケールの予測とマルチスケール重みスケジューリング訓練手法を用いることで、特徴表現と収束性を向上させている。
  • 3D畳み込みの代わりにポイントワイドな相関演算を活用することで、FLOPsとメモリ消費量を大幅に削減している。
  • 3D演算を避けるために2次元畳み込みを用いたエンコーダデコーダアーキテクチャとして設計されており、高精度を維持している。
  • スケジューリングされたマルチスケール監視により訓練を最適化し、一般化性能を向上させ、微細なディテールの誤差を低減している。

実験結果

リサーチクエスチョン

  • RQ12次元ベースのネットワークは、3Dベースのモデルと比較して推論速度とメモリ効率で顕著に優れていながら、最先端のディスパリティ推定精度を達成できるか?
  • RQ2重みスケジューリングを用いたマルチスケール監視は、2次元ベースのディスパリティ推定ネットワークの精度向上にどの程度効果的か?
  • RQ3残差学習と効率的な相関層が、計算コストを増加させることなく、より深い、より正確なモデルを共同で実現できるか?
  • RQ42次元ベースのネットワークは、PSMNet や GANet などの3D畳み込みベースのモデルと比較して、現実世界の困難なシナリオでどの程度の性能を発揮できるか?
  • RQ52次元畳み込みと効率的な設計のみを用いて、低メモリエッジデバイスに高精度なディスパリティ推定モデルをデプロイすることは可能か?

主な発見

  • FADNet は Scene Flow データセットで最先端の精度を達成し、エンドツーエンド(EPE)誤差が 0.464 であった。これは PSMNet(0.452)や GANet(0.442)と同等の性能であり、NVIDIA Tesla V100 GPU 上で GANet より 46 倍速く、PSMNet より 8 倍速い。
  • KITTI 2015 データセットでは、FADNet は D1-all の外れ率が 2.82% であり、より効率的であるにもかかわらず、DispNetC(4.34%)を 2 倍以上も上回る精度を達成した。
  • FADNet は Tesla V100 GPU 上で 1 セットのステレオペアあたり 18.7 ms で実行され、GPU メモリ使用量はわずか 1.62 GB にとどまる。これは PSMNet(13.99 GB)の 10 分の 1 であり、Titan X(Pascal)GPU 上でも FADNet は 3.87 GB のメモリ使用量にとどまる。
  • 3Dベースのモデル(例:PSMNet や GANet)はメモリ制限のため失敗するが、FADNet は 12 GB メモリ搭載のデスクトップ GPU(例:Titan X)でもデプロイ可能である。
  • 可視化比較では、FADNet は DispNetC よりも細かなテクスチャとディテールをよりよく保持しており、誤差マップも顕著に低く、PSMNet にほぼ匹敵する。
  • FADNet の推論速度は PSMNet より 20 倍速く、GANet より 46 倍速く、ロボット工学や自動運転のリアルタイム応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。