Skip to main content
QUICK REVIEW

[論文レビュー] Depth Reconstruction of Translucent Objects from a Single Time-of-Flight Camera using Deep Residual Networks

Seongjong Song, Hyunjung Shim|arXiv (Cornell University)|Sep 28, 2018
Advanced Optical Sensing Technologies参考文献 23被引用数 6
ひとこと要約

本論文では、1台の時間飛行(ToF)カメラからの単一の入力から、透過性を持つ物体の3次元深度を再構築するための深層残差ネットワーク(ResNet)アプローチを提案する。入力として、前景および背景の深度マップからのマルチスケールパッチを用いる。本手法は、物理的モデルや制御された環境を必要とせず、局所的特徴と意味的特徴を活用することで、センサーのノイズ下でも最先端の精度と耐性を達成する。

ABSTRACT

We propose a novel approach to recovering the translucent objects from a single time-of-flight (ToF) depth camera using deep residual networks. When recording the translucent objects using the ToF depth camera, their depth values are severely contaminated due to complex light interactions with the surrounding environment. While existing methods suggested new capture systems or developed the depth distortion models, their solutions were less practical because of strict assumptions or heavy computational complexity. In this paper, we adopt the deep residual networks for modeling the ToF depth distortion caused by translucency. To fully utilize both the local and semantic information of objects, multi-scale patches are used to predict the depth value. Based on the quantitative and qualitative evaluation on our benchmark database, we show the effectiveness and robustness of the proposed algorithm.

研究の動機と目的

  • 商業用ToFカメラで撮影された透過物体における深刻な深度歪みの問題に取り組むこと。
  • 制御された環境や物理的制約に依存しない実用的でデータ駆動型のソリューションを開発すること。
  • マルチスケールパッチ処理を通じて局所的および意味的特徴を活用することで、深度再構築の精度を向上させること。
  • 低照度や短い露出時間によって生じるToFカメラの一般的なノイズに対して耐性を確保すること。
  • 将来の透過物体再構築に関する研究のための学習ベースのベースラインを確立すること。

提案手法

  • 本手法は、生のToF深度マップからの深度補正を学習するため、深層残差ネットワーク(ResNet)アーキテクチャを用いる。
  • 局所的詳細とグローバルな文脈を捉えるために、前景および背景の深度マップからのマルチスケールパッチを処理する。
  • 正規化エラーを回避し、ノイズの多い入力でのパフォーマンスを向上させるために、バッチ正規化を排除する。
  • 入力は2つの深度マップで構成される:物体の表面からのものと背景からのもので、より良い深度推定を可能にする。
  • 本モデルは、さまざまな条件下での透過物体の大規模ベンチマークデータセットを用いて、エンドツーエンドで訓練される。
  • 本アプローチは完全にデータ駆動型であり、物理的制約や材料特性に関する事前知識を一切必要としない。

実験結果

リサーチクエスチョン

  • RQ1物理的モデルや制御された環境を必要とせず、1台のToFカメラからの入力で、透過物体の正確な3次元深度を深層学習モデルが効果的に回復できるか?
  • RQ2マルチスケールパッチ処理は、単一スケールまたはグローバル処理と比較して、深度再構築の精度をどのように向上させるか?
  • RQ3本手法は、ToFカメラで一般的に見られるノイズに対してどの程度耐性を示すか?
  • RQ4本モデルは、非平面的で丸みを帯びた形状の物体に対しても一般化可能か、すなわち、形状の変動に対して耐性を示すか?
  • RQ5バッチ正規化を排除することで、ノイズの多い実世界のToFデータにおけるパフォーマンスにどのような影響が生じるか?

主な発見

  • 提案手法はベンチマークデータセットで最小のRMSE(70.4 mm)を達成し、定量的指標においてすべてのベースラインを上回る。
  • 標準偏差が16 mmまでの全ノイズレベルで安定したパフォーマンスを維持し、誤差のわずかな上昇にとどまる。
  • 32 mmのノイズではRMSEが72.8 mmに上昇し、128 mmでは143.8 mmに上昇するが、これは極端なノイズ下での劣化を示している。
  • 定性的な結果では、単一スケールパッチネットワークが曲面にリップルを生じさせるのに対し、本手法は滑らかでアーチファクトの少ない深度マップを生成している。
  • 訓練データに含まれない丸い物体に対しても、本モデルは良好な一般化性能を示しており、形状の変化に対して耐性があることが確認された。
  • アブレーションスタディにより、マルチスケールパッチ処理とバッチ正規化の排除がパフォーマンスの向上に顕著に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。