Skip to main content
QUICK REVIEW

[論文レビュー] Anytime Stereo Image Depth Estimation on Mobile Devices

Yan Wang, Zihang Lai|arXiv (Cornell University)|Oct 26, 2018
Advanced Vision and Imaging参考文献 54被引用数 13
ひとこと要約

本論文では、モバイルデバイス上で推論速度と精度の間で動的にトレードオフを可能にする、AnyNetと呼ばれる、いつでもステレオ深度推定モデルを提案する。段階的に不正確さを修正することで、低解像度の予測から始める。この手法により、最先端のモデルと比較して2桁少ないパラメータ数で、NVIDIA Jetson TX2上で10–35 FPSを達成し、KITTIベンチマークで競争力のある精度を維持する。

ABSTRACT

Many applications of stereo depth estimation in robotics require the generation of accurate disparity maps in real time under significant computational constraints. Current state-of-the-art algorithms force a choice between either generating accurate mappings at a slow pace, or quickly generating inaccurate ones, and additionally these methods typically require far too many parameters to be usable on power- or memory-constrained devices. Motivated by these shortcomings, we propose a novel approach for disparity prediction in the anytime setting. In contrast to prior work, our end-to-end learned approach can trade off computation and accuracy at inference time. Depth estimation is performed in stages, during which the model can be queried at any time to output its current best estimate. Our final model can process 1242$ imes $375 resolution images within a range of 10-35 FPS on an NVIDIA Jetson TX2 module with only marginal increases in error -- using two orders of magnitude fewer parameters than the most competitive baseline. The source code is available at https://github.com/mileyan/AnyNet .

研究の動機と目的

  • パワーおよびメモリ制限のあるモバイルデバイス上で、リアルタイムかつ高精度なステレオ深度推定の課題に対処すること。
  • 推論中に計算時間と予測精度の間で動的にトレードオフを可能にすること。
  • 埋め込みプラットフォームでのパフォーマンスを損なわずに、モデルの複雑さとパラメータ数を削減すること。
  • 障害物回避や経路計画などの、応答遅延を適応的に制御できるリアルタイムロボットアプリケーションをサポートすること。
  • いつでも現在の最良の深度推定値を照会できるフレームワークを設計すること。

提案手法

  • モデルは、ステレオ画像を段階的に処理し、最初に全範囲の不正確さを含む低解像度(1/16)の不正確さマップを計算する。
  • その後の段階では、現在の推定値をアップサンプリングし、畳み込みニューラルネットワーク(CNN)を用いて残差誤差を予測する。計算範囲は全範囲の10–20%に制限される。
  • 残差予測により、高解像度でのコストボリューム計算を回避し、局所的な誤差補正にのみ集中することで、高速な修正が可能になる。
  • 低解像度での文脈的情報を捉えるために、U-Netベースの特徴抽出器が使用され、コストボリュームの品質が向上する。
  • 速度と精度のバランスを取るために、距離に基づくコストボリューム構築法が採用され、効率的な一致コストの計算が可能になる。
  • 全ネットワークは、すべての段階にわたる統合損失を用いてエンドツーエンドで訓練され、段階的な改善が可能になる。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、モバイルハードウェア上で、ステレオ深度推定のための計算と精度をリアルタイムに動的にトレードオフできるか?
  • RQ2増加する解像度での残差誤差予測は、精度を損なわず、効率をどのように向上させるか?
  • RQ3特徴抽出やコストボリューム構築といったアーキテクチャ的選択が、速度と精度のトレードオフに与える影響は何か?
  • RQ4軽量モデルは、パラメータ数を桁違いに減らしても、標準ベンチマークで最先端のパフォーマンスを達成できるか?
  • RQ5いつでも推論機能は、非いつでもベースラインと比較して、遅延と精度の点でどのように差がつくか?

主な発見

  • AnyNetは、1242×375のステレオ画像に対して、NVIDIA Jetson TX2上で10–35 FPSを達成しており、同じハードウェアで0.3 FPS未満しか動作しないPSMNetと比べて顕著に優れている。
  • モデルは、最も競争力のあるベースラインと比較して、2桁少ないパラメータ数しか使用していないため、リソース制限のあるデバイスに適している。
  • KITTI-2015では、最終段階で3ピixel誤差率が6.2%に達し、最先端の性能と同等またはそれを上回っている。
  • アブレーションスタディの結果、U-Net特徴抽出器を削除すると、最初の段階で誤差が5.5パーセンテージポイント上昇し、低解像度特徴の質の重要性が明確になった。
  • 残差予測を直接不正確さ予測に置き換えると、後の段階で推論時間が6倍以上に延び、残差修正戦略の効率性が裏付けられた。
  • 距離に基づくコストボリューム構築法は、PSMNet方式と比較して10%高速であり、より優れた速度-精度トレードオフを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。