Skip to main content
QUICK REVIEW

[논문 리뷰] RGBD Based Dimensional Decomposition Residual Network for 3D Semantic Scene Completion

Jie Li, Yu Liu|arXiv (Cornell University)|2019. 03. 02.
Advanced Vision and Imaging참고 문헌 43인용 수 12
한 줄 요약

이 논문은 3D 세분화 장면 완성 네트워크를 위한 경량 RGBD 기반 접근법을 제안한다. 차원 분해 잔차(DDR) 블록과 다중 척도의 RGB 및 깊이 특징 융합을 사용한다. 3D 컨볼루션을 인수분해하고 다양한 척도에서 모odal 특징을 융합함으로써, SSCNet 대비 21% 적은 파라미터와 16.6% 적은 FLOPs를 사용하면서도 NYU 및 NYUCAD 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다. SC-IoU는 5.9% 향상되고 SSC-IoU는 5.7% 향상되었다.

ABSTRACT

RGB images differentiate from depth images as they carry more details about the color and texture information, which can be utilized as a vital complementary to depth for boosting the performance of 3D semantic scene completion (SSC). SSC is composed of 3D shape completion (SC) and semantic scene labeling while most of the existing methods use depth as the sole input which causes the performance bottleneck. Moreover, the state-of-the-art methods employ 3D CNNs which have cumbersome networks and tremendous parameters. We introduce a light-weight Dimensional Decomposition Residual network (DDR) for 3D dense prediction tasks. The novel factorized convolution layer is effective for reducing the network parameters, and the proposed multi-scale fusion mechanism for depth and color image can improve the completion and segmentation accuracy simultaneously. Our method demonstrates excellent performance on two public datasets. Compared with the latest method SSCNet, we achieve 5.9% gains in SC-IoU and 5.7% gains in SSC-IOU, albeit with only 21% network parameters and 16.6% FLOPs employed compared with that of SSCNet.

연구 동기 및 목표

  • 깊이 입력에만 의존함으로써 발생하는 3D 세분화 장면 완성(SSC)의 성능 저하 문제를 해결하기 위해.
  • 일般적으로 크고 파라미터가 많은 3D CNN의 계산 비용을 줄이기 위해.
  • 다중 척도 특징 융합를 통해 RGB와 깊이 모달 간 효과적인 융합을 통해 SSC 정확도를 향상시키기 위해.
  • 더 적은 파라미터와 FLOPs로도 높은 성능을 유지하는 경량 아키텍처를 개발하기 위해.

제안 방법

  • 3D 컨볼루션을 인수분해함으로써 성능 손실 없이 모델 파라미터를 극적으로 감소시키는 차원 분해 잔차(DDR) 블록을 도입한다.
  • 네트워크의 여러 수준에서 RGB 및 깊이 입력의 특징을 다중 척도에서 원활하게 융합하는 다중 척도 융합 기법을 적용한다.
  • 파라미터 증가를 최소화하면서 다중 척도의 맥락을 캡처하는 DDR 블록 기반의 경량 ASPP(LW-ASPP) 모듈을 사용한다.
  • 3D 형태 완성과 의미 분류를 동시에 최적화하는 엔드 투 엔드 학습 프레임워크를 설계한다.
  • 정확한 기하학적 표현을 가능하게 하기 위해 3D 장면 볼륨을 인코딩하기 위해 절삭된 부호 거리 함수(TSDF)를 적용한다.
  • 깊은 네트워크에서 학습 안정성과 특징 표현 향상을 위해 잔차 학습 프레임워크를 활용한다.

실험 결과

연구 질문

  • RQ1인수분해된 3D 컨볼루션 블록은 3D 밀도 예측 작업에서 성능을 유지하거나 향상시키면서도 네트워크 파라미터를 줄일 수 있는가?
  • RQ2여러 척도에서 RGB와 깊이 특징을 얼마나 효과적으로 융합할 수 있는가? 이는 3D 장면 완성과 의미 분류 성능 향상에 기여하는가?
  • RQ3DDR 블록과 LW-ASPP를 사용하는 경량 네트워크가 SSCNet과 같은 무거운 최신 기술 수준 모델보다 정확도와 효율성 면에서 뛰어나게 성능을 내는가?
  • RQ4RGB와 깊이 모달은 3D 세분화 장면 완성에서 얼마나 잘 상호보완하는가?
  • RQ5더 작은 네트워크가 상당히 감소된 FLOPs와 파라미터로 더 큰 모델과 비교해 유사하거나 더 높은 성능을 달성할 수 있는가?

주요 결과

  • 제안된 DDR 네트워크는 NYU 및 NYUCAD 데이터셋에서 SSCNet 대비 SC-IoU가 5.9% 높고 SSC-IoU도 5.7% 높다.
  • SSCNet의 파라미터의 21%와 FLOPs의 16.6%만을 사용하면서도, 완성 및 분류 정확도에서 모두 SSCNet을 능가한다.
  • RGB와 깊이 특징의 다중 척도 융합은 성능 향상에 크게 기여하며, RGB는 의미 정확도 향상에 더 기여하고 깊이는 기하학적 일관성에 더 기여한다.
  • 제거 실험 결과, 깊이 또는 RGB 입력만 사용할 경우 성능이 낮아지며(각각 SSC-IoU 28.9% 및 27.2%) 모달 융합의 유용성을 입증한다.
  • LW-ASPP 모듈은 ASPP 없이 대비해 SC-IoU는 3.2% 향상되고 SSC-IoU는 3.6% 향상되며, 파라미터는 낮게 유지된다.
  • DDRNet은 GTX 1080ti에서 44 FPS의 추론 속도를 기록하여 SSCNet(0.7 FPS)보다 훨씬 빠르며, 메모리 사용량도 낮고 정확도 손실는 미미하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.