[논문 리뷰] RGB-D Local Implicit Function for Depth Completion of Transparent Objects
이 논문은 레이-보크셀 쌍 기반의 국소 은닉 깊이 함수(LIDF)를 사용하여 투명 물체의 깊이 보완을 위한 빠르고 일반화 능력이 뛰어난 방법을 제안한다. 이는 실시간 추론과 뛰어난 정확도를 가능하게 하며, 학습 가능한 국소 은닉 표현과 반복적 정밀 조정을 결합하여 합성 및 실세계 벤치마크에서 최신 기술(SOTA)을 초월한다. 또한 ClearGrasp보다 20배 빠른 추론 속도를 달성한다.
Majority of the perception methods in robotics require depth information provided by RGB-D cameras. However, standard 3D sensors fail to capture depth of transparent objects due to refraction and absorption of light. In this paper, we introduce a new approach for depth completion of transparent objects from a single RGB-D image. Key to our approach is a local implicit neural representation built on ray-voxel pairs that allows our method to generalize to unseen objects and achieve fast inference speed. Based on this representation, we present a novel framework that can complete missing depth given noisy RGB-D input. We further improve the depth estimation iteratively using a self-correcting refinement model. To train the whole pipeline, we build a large scale synthetic dataset with transparent objects. Experiments demonstrate that our method performs significantly better than the current state-of-the-art methods on both synthetic and real world data. In addition, our approach improves the inference speed by a factor of 20 compared to the previous best method, ClearGrasp. Code and dataset will be released at https://research.nvidia.com/publication/2021-03_RGB-D-Local-Implicit.
연구 동기 및 목표
- 빛 굴절과 흡수로 인해 표준 RGB-D 센서에서 투명 물체가 보이지 않는 점을 감안해, 투명 물체의 깊이 보완 과제를 해결한다.
- 접촉 가장자리나 물리적 사전 지식이 필요하거나 추론 속도가 느린 기존 방법의 한계를 극복한다.
- 학습 가능한 국소 은닉 표현을 통해 새로운 투명 물체로의 일반화 및 실세계 구현을 가능하게 한다.
- 투명 물체 인식의 시뮬레이션-실세계 갭을 줄이기 위해 확장 가능한 합성 데이터셋을 개발한다.
- 실시간 로봇 응용에 적합한 고정확도 깊이 보완을 실현한다.
제안 방법
- 카메라 레이와 그가 교차하는 보크셀을 기반으로 깊이를 함수로 모델링하는 국소 은닉 깊이 함수(LIDF)를 도입하여 국소적이고 효율적인 추론을 가능하게 한다.
- 위치 인코딩을 사용해 특징 표현을 향상시키고 은닉 함수 내에서 미세한 기하학적 세부 정보를 포착한다.
- 가장 확률 높은 종료 보크셀을 선택하기 위해 레이-보크셀 쌍에 대해 argmax 풀링을 적용하여 먼 보크셀에서 오는 노이즈를 감소시킨다.
- 각 보크셀 내에서 오프셋을 학습하여 레이의 정확한 종료 지점을 예측함으로써, NeRF에서 사용하는 히우리스틱 3D 점 샘플링 방식을 대체한다.
- RGB, 입력 깊이, LIDF 출력을 활용해 깊이 예측을 반복적으로 개선하는 자기보정 정밀 조정 모델을 통합한다.
- 모든 파이프라인을 다양한 물체 유형, 조명 조건, 시점이 포함된 NVIDIA Omniverse를 활용해 생성한 대규모 합성 데이터셋인 Omnivers Object에서 훈련한다.

실험 결과
연구 질문
- RQ1레이-보크셀 쌍 기반의 국소 은닉 신경 표현이 투명 물체의 깊이 보완에서 새로운 투명 물체로 일반화될 수 있는가?
- RQ2보크셀 내 오프셋 예측을 통한 깊이 학습이 히우리스틱 3D 점 샘플링 대비 정확도와 효율성 면에서 뛰어나지 않는가?
- RQ3자기보정 정밀 조정 모듈은 추론 시 진짜 기하학적 지오메트리가 없더라도 깊이 보완 정확도를 향상시킬 수 있는가?
- RQ4대규모 합성 데이터셋이 실세계 투명 물체로의 제로샷 일반화 능력을 어느 정도 향상시키는가?
- RQ5제안된 방법은 최신 기술 수준의 정확도를 유지하면서도 실시간 추론을 달성할 수 있는가?
주요 결과
- ClearGrasp와 Omnivers Object 데이터셋 모두에서 훈련한 결과, 새로운 실세계 물체에서 테스트 RMSE가 0.028로 나타나, 각각 별도로 훈련한 경우보다 뛰어난 성능을 보였다.
- ClearGrasp 대비 추론 속도를 20배 향상시켜 실시간 배포가 가능해졌다.
- 보크셀 특징에 대해 argmax 레이 풀링을 사용할 경우 δ₁.₀₅ 정확도가 65.17%에 도달하여 가중 평균 연산자(59.31%)보다 뚜렷이 뛰어났다.
- 위치 인코딩을 사용할 경우 세부 정보 포착 능력이 향상되어, 인코딩 없이 사용한 경우 대비 δ₁.₀₅ 정확도가 12.3% 포인트 향상되었다.
- 보크셀 내 오프셋을 학습하는 방식이 히우리스틱 점 샘플링 방식보다 깊이 예측 정확도에서 뛰어나 RMSE가 0.028로 나타났다.
- Omnivers Object 데이터셋에서만 훈련한 경우 실세계의 새로운 투명 물체로의 일반화 능력이 향상되어 δ₁.₂₅가 99.43%에 도달했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.