Skip to main content
QUICK REVIEW

[論文レビュー] FADNet++: Real-Time and Accurate Disparity Estimation with Configurable Networks

Qiang Wang, Shaohuai Shi|arXiv (Cornell University)|Oct 6, 2021
Advanced Vision and Imaging参考文献 48被引用数 4
ひとこと要約

FADNet++ は、効率的な 2D 畳み込みとポイントワイド相関レイヤー、リラクゼーション学習を組み合わせた設定可能でリアルタイムなディープニューラルネットワークであり、多様なハードウェア上で 100ms 未満の推論速度を維持しながら最先端の精度を達成する。FADNet-T から FADNet++ までのモデルバリアントを生成可能で、モバイルおよびサーバー GPU でのデプロイに適した、調整可能な精度と速度を提供する。

ABSTRACT

Deep neural networks (DNNs) have achieved great success in the area of computer vision. The disparity estimation problem tends to be addressed by DNNs which achieve much better prediction accuracy than traditional hand-crafted feature-based methods. However, the existing DNNs hardly serve both efficient computation and rich expression capability, which makes them difficult for deployment in real-time and high-quality applications, especially on mobile devices. To this end, we propose an efficient, accurate, and configurable deep network for disparity estimation named FADNet++. Leveraging several liberal network design and training techniques, FADNet++ can boost its accuracy with a fast model inference speed for real-time applications. Besides, it enables users to easily configure different sizes of models for balancing accuracy and inference efficiency. We conduct extensive experiments to demonstrate the effectiveness of FADNet++ on both synthetic and realistic datasets among six GPU devices varying from server to mobile platforms. Experimental results show that FADNet++ and its variants achieve state-of-the-art prediction accuracy, and run at a significant order of magnitude faster speed than existing 3D models. With the constraint of running at above 15 frames per second (FPS) on a mobile GPU, FADNet++ achieves a new state-of-the-art result for the SceneFlow dataset.

研究の動機と目的

  • リアルタイムアプリケーションにおけるディープラーニングベースのステレオマッチングにおける推論速度と精度のトレードオフを解決すること。
  • モバイルデプロイに不適切なほど遅くメモリを多く消費する既存の 3D 畳み込みベースのモデル(CVM-Conv3D)の制限を克服すること。
  • 異なるハードウェアプラットフォーム向けに、モデルサイズ、精度、推論速度のバランスを取れる柔軟で設定可能なネットワークアーキテクチャを設計すること。
  • 合成データセット(SceneFlow)および実世界データセットの両方で最先端のパフォーマンスを達成するとともに、低遅延および低メモリ使用量を維持すること。
  • メモリ集約的な 3D 畳み込みを回避し、設定可能なチャネルスケーリングを活用した最適化された 2D ベースの設計により、モバイルデバイスへの効率的なデプロイを可能にすること。

提案手法

  • 3D 畳み込みをポイントワイド相関レイヤーに置き換えることで計算コストを低減する、新しい 2D 畝み込みベースのネットワークアーキテクチャ(FADNet++)を提案する。
  • リラクゼーションブロックとマルチスケールリラクゼーション学習を統合し、推論遅延を増加させずに特徴表現とモデル精度を向上させる。
  • 設定可能なチャネルスケーリング比を導入し、パrameter数と推論速度が異なる複数のモデルバリアント(FADNet-T, FADNet-S, FADNet-M, FADNet++)を生成可能にする。
  • すべてのバリアントを統一的でスケーラブルなトレーニング戦略で訓練し、すべての構成で精度を向上させる。
  • 効率的な 2D 操作と最適化されたレイヤー実装(例:cuDNN)を活用し、サーバーおよびモバイル GPU での高速推論を保証する。
  • 3D 畳み込みの計算的負担を回避しつつ、ポイントワイド相関を用いたコストボリュームに類似した表現を用いて、画像間の特徴関係を捉える。

実験結果

リサーチクエスチョン

  • RQ12D 畝み込みベースのネットワークは、サーバーおよびモバイル GPU でリアルタイム推論速度を維持しながら、最先端の視差推定精度を達成できるか?
  • RQ2提案された設定可能なチャネルスケーリング戦略は、異なるハードウェアプラットフォームでモデル精度と推論速度のバランスを効果的に取れるか?
  • RQ3FADNet++ フレームワークは、特にメモリ制限のあるモバイルデバイスにおいて、既存の 3D 畝み込みベースのモデル(CVM-Conv3D)を精度と速度の両面で上回れるか?
  • RQ4ポイントワイド相関レイヤーの使用は、3D 畝み込みと比較して計算コストをどの程度低減できるか、かつ特徴学習能力を保持できるか?
  • RQ5Jetson AGX などのモバイル GPU で、100ms 未満の推論時間(すなわち 15 フレーム/秒以上)を達成しながら、既存のリアルタイム手法と比較して低エンドツーエンド誤差(EPE)を維持できるか?

主な発見

  • SceneFlow データセットにおいて、FADNet++ は RTX 2070 で 0.053 秒のランタイムで EPE 0.76 を達成し、速度面で 3D ベースのモデルを上回りながらも、競争力のある精度を維持した。
  • モバイル GPU(Jetson AGX)では、FADNet++ は 15 FPS で動作し、EPE 0.258 を達成した。これは AnyNet よりもほぼ 3 倍の精度であり、推論速度はほぼ同等だった。
  • FADNet-S は、TX2 と AGX GPU でそれぞれ 4 倍および 5.9 倍速く、EPE 1.19(StereoNet の 1.2 と同等)を達成した。これは、優れた効率性を示している。
  • FADNet++ は V100 で GPU メモリをたった 2.3 GB 消費するが、GANet などの 3D モデルは 7.5 GB を必要とする。この低メモリ使用量のおかげで、3D モデルがメモリ制限のためデプロイに失敗するモバイルプラットフォームでも動作可能となった。
  • 設定可能なフレームワークにより、FADNet-T から FADNet++ までのモデルバリアントを選択可能で、EPE が 0.76 から 1.83 の間、さまざまな GPU で 0.013 秒から 0.053 秒の推論速度を維持した。
  • Jetson AGX モバイル GPU では、FADNet-T が 15 FPS で EPE 0.043 を達成し、15 FPS 制約下でのモバイルデバイスにおけるリアルタイム視差推定の新しい最先端を樹立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。