Skip to main content
QUICK REVIEW

[論文レビュー] DELTAR: Depth Estimation from a Light-weight ToF Sensor and RGB Image

Yijin Li, Xinyang Liu|arXiv (Cornell University)|Sep 27, 2022
Advanced Optical Sensing Technologies被引用数 4
ひとこと要約

DELTARは、軽量なToFセンサ(8×8ゾーン)から得られる低解像度の深度分布とRGB画像を融合することで、高精細で高精度な密度の高い深度マップを生成する新しいニューラルネットワークを提案する。分布に配慮した特徴抽出器とクロスアテンション融合を用いることで、Intel RealSense D435iなどの一般的なRGB-Dセンサと同等の深度品質を達成し、従来の深度補完およびスーパーレゾリューション手法に比べ、低解像度で分布ベースの入力において顕著に優れた性能を発揮する。

ABSTRACT

Light-weight time-of-flight (ToF) depth sensors are small, cheap, low-energy and have been massively deployed on mobile devices for the purposes like autofocus, obstacle detection, etc. However, due to their specific measurements (depth distribution in a region instead of the depth value at a certain pixel) and extremely low resolution, they are insufficient for applications requiring high-fidelity depth such as 3D reconstruction. In this paper, we propose DELTAR, a novel method to empower light-weight ToF sensors with the capability of measuring high resolution and accurate depth by cooperating with a color image. As the core of DELTAR, a feature extractor customized for depth distribution and an attention-based neural architecture is proposed to fuse the information from the color and ToF domain efficiently. To evaluate our system in real-world scenarios, we design a data collection device and propose a new approach to calibrate the RGB camera and ToF sensor. Experiments show that our method produces more accurate depth than existing frameworks designed for depth completion and depth super-resolution and achieves on par performance with a commodity-level RGB-D sensor. Code and data are available at https://zju3dv.github.io/deltar/.

研究の動機と目的

  • 軽量なToFセンサが提供する極めて低解像度(8×8)の深度分布から高解像度で正確な深度マップを生成する課題に対処すること。
  • 従来の深度補完およびスーパーレゾリューション手法が、より高い解像度または点群ベースの深度入力を仮定しているという制限を克服すること。
  • 疎で確率的な深度分布と高解像度のRGB画像を効果的に統合する共同学習フレームワークを設計すること。
  • 直接的なモodal間対応関係が明確でない場合に、RGBとToFセンサの間の補正を実現する新しいキャリブレーション手法を開発すること。
  • 学習および評価のためのペアドでピクセルアラインされたRGBとToF信号を備えた新しい実世界データセット(ZJU-L5)を構築すること。

提案手法

  • 分布特徴抽出器は、各8×8ゾーンごとにToFセンサの深度分布から深度仮説をサンプリングし、確率的情報を保持する。
  • クロスアテンション機構は、RGB画像の特徴とサンプリングされた深度仮説の特徴を統合し、ピクセルごとの対応関係を明示的にモデル化する。
  • 画像自己アテンションモジュールは、全視野にわたる文脈を伝搬させ、RGB画像に一致する密度の高い出力を可能にする。
  • 精練モジュールは、深度再構成のためのビン幅と線形係数を予測し、微分可能な回帰により精度を向上させる。
  • 新規のキャリブレーション手法は、EMに類似したアルゴリズムを用いてToF信号から平面幾何を推定し、その後、点対平面最適化によりRGBとToFセンサ間の外部パラメータを推定する。
  • NYU-Depth V2から合成ToF信号を生成し、実世界データを補強することで、トレーニング中の汎化性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、軽量なToFセンサのスパarsな分布ベースの深度入力から、密度の高い高精度な深度マップを効果的に再構成できるか?
  • RQ2RGB画像特徴と統合する際、深度分布の物理的意味を保持しつつ、クロスモーダルアテンションをどのように設計できるか?
  • RQ3クロスアテンションにおけるピクセル対分布の対応関係をモデル化することで、深度推定にどのような影響を与えるか?
  • RQ4提案手法は、Intel RealSense D435iのような商業用レベルのRGB-Dセンサと同等の深度品質を達成できるか?
  • RQ5確率的サンプリングとアテンション機構を組み込むことで、平均/分散の直接入力や単純な連結処理と比較して、性能にどのような差が生じるか?

主な発見

  • DELTARは、同じタスクにおいて従来の深度補完およびスーパーレゾリューションフレームワークを上回り、特に分布に配慮した特徴抽出とアテンションベースの統合によりその優位性を百を示す。
  • ST VL53L5CX(L5)センサの原始的な深度を、特にL5センサの動作範囲(3メートルまで)内では、Intel RealSense D435iと同等の品質に向上させる。
  • アブレーションスタディでは、画像自己アテンションまたは画像から分布へのアテンションを除去すると性能が著しく低下し、特徴伝搬と統合におけるその重要性が確認された。
  • 一様サンプリングではなく確率的サンプリングを用いることで、RMSEが0.3 cm改善され、分布の不確実性をモデル化することの利点が示された。
  • 精練モジュールを単純な2層のデコーダに置き換えても性能低下はわずかに抑えられ、主な利点は特徴抽出器とアテンション統合コンponentに起因していることが示された。
  • 平らな壁における定量的評価では、3000 mm未満の距離でRealSense D435iと同等またはより優れたバイアスとジッタを達成しており、精度と耐障害性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。