Skip to main content
QUICK REVIEW

[論文レビュー] Deep Optics for Monocular Depth Estimation and 3D Object Detection

Julie Chang, Gordon Wetzstein|arXiv (Cornell University)|Apr 18, 2019
Advanced Vision and Imaging参考文献 48被引用数 17
ひとこと要約

本稿では、1眼深度推定および3次元物体検出のための、光学設計とニューラルネットワークの共同最適化であるディープオプティクスを提案する。被写界深度のコード化と色収差を深度の手がかりとして用いることで、すべての焦点が合った画像よりも深度の精度が向上し、最適化された非球面レンズや、色収差を有する標準的な単レンズですら顕著な向上を示す。NYU Depth v2、KITTI、およびカスタムデータセットを用いた検証により、3次元物体検出性能の向上も確認された。

ABSTRACT

Depth estimation and 3D object detection are critical for scene understanding but remain challenging to perform with a single image due to the loss of 3D information during image capture. Recent models using deep neural networks have improved monocular depth estimation performance, but there is still difficulty in predicting absolute depth and generalizing outside a standard dataset. Here we introduce the paradigm of deep optics, i.e. end-to-end design of optics and image processing, to the monocular depth estimation problem, using coded defocus blur as an additional depth cue to be decoded by a neural network. We evaluate several optical coding strategies along with an end-to-end optimization scheme for depth estimation on three datasets, including NYU Depth v2 and KITTI. We find an optimized freeform lens design yields the best results, but chromatic aberration from a singlet lens offers significantly improved performance as well. We build a physical prototype and validate that chromatic aberrations improve depth estimation on real-world results. In addition, we train object detection networks on the KITTI dataset and show that the lens optimized for depth estimation also results in improved 3D object detection performance.

研究の動機と目的

  • 深度推定の不適切な定式化を、深度の手がかりを光学的に符号化することで解消すること。
  • 光学とディープラーニングを共同で設計することで、深度推定および上位レベルの3次元ビジョンタスクが向上するかを調査すること。
  • エンドツーエンド微分可能なフレームワーク内での、被写界深度、乱視、色収差、非球面レンズといった異なる光学符号化戦略の相対的性能を評価すること。
  • 最適化された光学によって向上した深度推定が、単なる深度回帰を超えて3次元物体検出という上位レベルのタスクにも寄与することを検証すること。
  • 単純なレンズが固有の色収差を有していても、ニューラルネットワークと共同最適化することで、標準的なすべての焦点が合った光学よりも優れた性能を示すことを実証すること。

提案手法

  • 固定または最適化可能なレンズパラメータ(被写界深度、乱視、色収差、非球面位相マスクを含む)を組み込んだ微分可能な光学的像形成モデルを開発する。
  • このモデルを畳み込みニューラルネットワーク(CNN)と統合し、光学的および電子的コンponentsを含むエンドツーエンドのバックプロパゲーションを可能にする。
  • 再構成損失を微分可能にすることで、レンズ幾何学的形状とネットワーク重みの勾配ベース最適化を可能にする。
  • シミュレーションを用いて、NYU Depth v2、KITTI、およびカスタムデータセット上で光学符号化戦略を評価し、勾配降下法を用いてレンズパラメータを最適化する。
  • 色収差を有する単レンズを有する物理的プロトタイプを製作し、実環境のシーンでテストすることで、シミュレーション結果の妥当性を検証する。
  • 3次元物体検出のために、最適化されたレンズから生成された深度マップを用いたFrustrum PointNet(FPointNet)を訓練する。地上測定LIDARの代わりに予測された深度を用いる。

実験結果

リサーチクエスチョン

  • RQ1被写界深度のぼやけや色収差といった光学符号化戦略が、ディープニューラルネットワークと共同最適化された場合、1眼深度推定を向上させ得るか?
  • RQ2固定(例:色収差)と最適化可能(例:非球面レンズ)の異なる光学設計は、深度推定においてどのように性能を比較するか?
  • RQ3最適化された光学によって向上した深度推定は、3次元物体検出のような上位レベルの3次元ビジョンタスクにおいても、より良い性能をもたらすか?
  • RQ4固有の光学的非収差を有する単純で低コストなレンズが、ニューラルネットワークと共同最適化された場合、複雑なすべての焦点が合ったレンズを上回る性能を示せるか?
  • RQ5微分可能な光学的像形成モデルは、光学・電子系のエンドツーエンド学習をどの程度効果的に可能にするか?

主な発見

  • 最適化された非球面レンズ設計は、すべてのデータセットで最も優れた深度推定性能を達成し、ベースラインのすべての焦点が合ったネットワークよりも低い平均二乗誤差(RMSE)を達成した。
  • 驚くべきことに、固有の色収差を有する標準的な単レンズは非球面レンズとほぼ同等の性能を示し、色収差が非常に効果的な深度の手がかりである可能性を示唆した。
  • 物理的プロトタイプの検証により、色収差を有する画像が実環境条件下ですべての焦点が合った画像よりも顕著に優れた深度推定を達成した。
  • 最適化されたレンズから生成された深度マップを用いることで、3次元物体検出性能が向上した。これは、より良い深度推定の恩恵が上位レベルのタスクにも及ぶことを示した。
  • U-Netのような単純なネットワークでも、すべての焦点が合った画像を用いたより複雑なネットワークよりも低いRMSEを達成した。これは、光学的符号化がネットワークの負担を軽減することを示唆した。
  • 最適化済み画像とすべての焦点が合った画像の間で、2次元物体検出性能に差はなく、光学的劣化がセマンティック特徴抽出に悪影響を及えないことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。