Skip to main content
QUICK REVIEW

[논문 리뷰] DELTAR: Depth Estimation from a Light-weight ToF Sensor and RGB Image

Yijin Li, Xinyang Liu|arXiv (Cornell University)|2022. 09. 27.
Advanced Optical Sensing Technologies인용 수 4
한 줄 요약

DELTAR는 경량 ToF 센서(8×8 영역)로부터의 저해상도 깊이 분포와 RGB 이미지를 융합하여 고해상도, 고정밀도 깊이 맵을 생성하는 새로운 신경망을 제안한다. 분포 인식 특징 추출기와 교차 주의 메커니즘을 활용함으로써, Intel RealSense D435i와 같은 일반적인 RGB-D 센서 수준의 깊이 품질을 달성하며, 기존의 깊이 보완 및 초해상도 방법들보다 저해상도 및 분포 기반 입력에서 뚜렷한 성능 향상을 보인다.

ABSTRACT

Light-weight time-of-flight (ToF) depth sensors are small, cheap, low-energy and have been massively deployed on mobile devices for the purposes like autofocus, obstacle detection, etc. However, due to their specific measurements (depth distribution in a region instead of the depth value at a certain pixel) and extremely low resolution, they are insufficient for applications requiring high-fidelity depth such as 3D reconstruction. In this paper, we propose DELTAR, a novel method to empower light-weight ToF sensors with the capability of measuring high resolution and accurate depth by cooperating with a color image. As the core of DELTAR, a feature extractor customized for depth distribution and an attention-based neural architecture is proposed to fuse the information from the color and ToF domain efficiently. To evaluate our system in real-world scenarios, we design a data collection device and propose a new approach to calibrate the RGB camera and ToF sensor. Experiments show that our method produces more accurate depth than existing frameworks designed for depth completion and depth super-resolution and achieves on par performance with a commodity-level RGB-D sensor. Code and data are available at https://zju3dv.github.io/deltar/.

연구 동기 및 목표

  • 경량 ToF 센서가 제공하는 극도로 저해상도(8×8)의 깊이 분포로부터 고해상도, 정확한 깊이 맵을 생성하는 데 도전하는 것.
  • 기존의 깊이 보완 및 초해상도 방법들이 더 높은 해상도 또는 점 기반 깊이 입력을 전제로 하고 있음을 고려할 때, 이러한 제약을 극복하는 것.
  • 희박하고 확률적인 깊이 분포를 고해상도 RGB 이미지와 효과적으로 융합할 수 있는 공동 학습 프레임워크를 설계하는 것.
  • 직접적인 모odal 간 대응 관계가 명확하지 않은 상황에서 RGB 및 ToF 센서를 캘리브레이션하는 새로운 방법을 개발하는 것.
  • 학습 및 평가를 위해 쌍방향으로 정렬된 RGB 및 ToF 신호를 포함한 새로운 실세계 데이터셋(ZJU-L5)을 구축하는 것.

제안 방법

  • 분포 특징 추출기에서는 8×8 영역별로 ToF 센서의 깊이 분포에서 깊이 가설을 샘플링하여 확률 정보를 유지한다.
  • 교차 주의 메커니즘은 RGB 이미지의 특징과 샘플된 깊이 가설의 특징을 융합하며, 패치-분포 대응 관계를 명시적으로 모델링한다.
  • 이미지 자체 주의 모듈은 전체 시야에 걸쳐 맥락을 전파하여 RGB 이미지에 정렬된 고밀도 출력을 가능하게 한다.
  • 정밀도 향상을 위해 가중치를 미분 가능한 회귀를 통해 재구성하는 데 사용되는 보정 모듈은 분할 너비와 선형 계수를 예측한다.
  • 새로운 캘리브레이션 방법은 ToF 신호로부터 평면 기하 구조를 추정하는 EM 유사 알고리즘을 사용한 후, RGB 및 ToF 센서 간 외부 매개변수를 추정하기 위해 점-평면 최적화를 수행한다.
  • 실세계 데이터를 보완하기 위해 NYU-Depth V2에서 합성된 ToF 신호를 생성하여 훈련 중 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1경량 ToF 센서의 희박하고 분포 기반의 깊이 입력으로부터 신경망이 고밀도, 고정밀도 깊이 맵을 효과적으로 재구성할 수 있는가?
  • RQ2교차 모odal 주의 메커니즘은 깊이 분포의 물리적 의미를 유지하면서 RGB 이미지 특징과 융합할 수 있도록 어떻게 설계할 수 있는가?
  • RQ3교차 주의에서 패치-분포 대응 관계를 모델링하는 것이 깊이 추정에 미치는 영향은 무엇인가?
  • RQ4제안된 방법은 Intel RealSense D435i와 같은 상용 수준의 RGB-D 센서 수준의 깊이 품질을 달성할 수 있는가?
  • RQ5확률 기반 샘플링과 주의 메커니즘의 통합이 평균/분산 입력 또는 단순 연결 방식에 비해 성능에 미치는 영향은 무엇인가?

주요 결과

  • DELTAR는 동일한 작업에서 기존의 깊이 보완 및 초해상도 프레임워크를 능가하며, 특히 분포 인식 특징 추출기와 주의 기반 융합 덕분에 성능 향상을 이룬다.
  • ST VL53L5CX(L5) 센서의 원시 깊이를 개선하여, 특히 L5 센서의 작동 범위(최대 3미터) 내에서 Intel RealSense D435i 수준의 품질을 달성한다.
  • 제거 실험 결과, 이미지 자체 주의 또는 이미지-분포 주의를 제거할 경우 성능 저하가 심각하게 발생함을 확인하여, 이들이 특징 전파 및 융합에서 중요한 역할을 한다는 것을 입증한다.
  • 균일한 샘플링 대비 확률 기반 샘플링을 사용할 경우 RMSE가 0.3cm 향상되어, 분포 불확실성을 모델링하는 데서 유의미한 이점이 있음을 보여준다.
  • 보정 모듈을 단순한 이중층 디코더로 대체해도 성능 저하가 미미하여, 주요 성능 향상 요소는 특징 추출기 및 주의 융합 구성 요소임을 시사한다.
  • 평면 벽에 대한 정량적 평가 결과, 3000mm 이하의 거리에서 DELTAR는 RealSense D435i와 유사하거나 더 낮은 편향과 진동 수준을 확보하여 정확성과 강인성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.