Skip to main content
QUICK REVIEW

[논문 리뷰] CSPN++: Learning Context and Resource Aware Convolutional Spatial Propagation Networks for Depth Completion

Xinjing Cheng, Peng Wang|arXiv (Cornell University)|2019. 11. 13.
Advanced Vision and Imaging참고 문헌 41인용 수 15
한 줄 요약

CSPN++는 각 픽셀당 적응형 컨volution 커널 크기와 반복 횟수를 학습하여 맥락 인식형 및 자원 인식형 추론을 가능하게 하여 깊이 보완 성능을 향상시킨다. KITTI에서 743.69 RMSE(2.07 iRMSE)로 최신 기준 성능(SoTA)을 달성하며, CSPN 및 기타 SoTA 방법들을 능가한다. 또한 동적 계산 예산 적응 기능을 지원한다.

ABSTRACT

Depth Completion deals with the problem of converting a sparse depth map to a dense one, given the corresponding color image. Convolutional spatial propagation network (CSPN) is one of the state-of-the-art (SoTA) methods of depth completion, which recovers structural details of the scene. In this paper, we propose CSPN++, which further improves its effectiveness and efficiency by learning adaptive convolutional kernel sizes and the number of iterations for the propagation, thus the context and computational resources needed at each pixel could be dynamically assigned upon requests. Specifically, we formulate the learning of the two hyper-parameters as an architecture selection problem where various configurations of kernel sizes and numbers of iterations are first defined, and then a set of soft weighting parameters are trained to either properly assemble or select from the pre-defined configurations at each pixel. In our experiments, we find weighted assembling can lead to significant accuracy improvements, which we referred to as "context-aware CSPN", while weighted selection, "resource-aware CSPN" can reduce the computational resource significantly with similar or better accuracy. Besides, the resource needed for CSPN++ can be adjusted w.r.t. the computational budget automatically. Finally, to avoid the side effects of noise or inaccurate sparse depths, we embed a gated network inside CSPN++, which further improves the performance. We demonstrate the effectiveness of CSPN++on the KITTI depth completion benchmark, where it significantly improves over CSPN and other SoTA methods.

연구 동기 및 목표

  • 이미지 콘텐츠에 따라 각 픽셀당 전파 맥락을 동적으로 적응시킴으로써 깊이 보완 정확도를 향상시키는 것.
  • 각 픽셀당 최적의 커널 크기와 반복 횟수를 학습시켜 정확도를 유지하면서 계산 비용을 감소시키는 것.
  • 학습된 게이트 메커니즘을 통해 노이즈가 많거나 정확도가 떨어지는 희소 깊이 입력에 대한 강건성을 향상시키는 것.
  • 학습 및 추론 중에 모델 복잡도를 계산 예산에 자동으로 적응시킬 수 있도록 하는 것.
  • 외부 환경(KITTI)과 실내 환경(NYUv2) 깊이 보완 벤치마크에서의 일반화 능력을 입증하는 것.

제안 방법

  • CSPN++는 각 픽셀당 커널 크기와 반복 횟수를 픽셀 기반으로 학습 가능한 초기화 변수로 설정하며, 사전 정의된 구성에서 선택하거나 조합하기 위해 소프트 웨이팅 변수 αx와 λx를 사용한다.
  • 맥락 인지형 변형(CA-CSPN)을 도입하여 학습된 어텐션을 통해 다양한 커널 크기와 반복 단계의 출력을 결합함으로써 특징 표현을 향상시킨다.
  • 자원 인지형 변형(RA-CSPN)을 제안하여 각 픽셀당 최적의 커널 크기와 반복 횟수를 학습된 소프트 게이팅을 통해 선택함으로써 계산 비용을 최소화한다.
  • 노이즈가 많은 입력에 대한 강건성을 향상시키기 위해, 신뢰도에 따라 희소 깊이 값을 조건부로 유지하는 게이트 네트워크를 통합한다.
  • 효율적 추론을 위해 학습 중에 지연 시간 정규화 항목을 사용하여 가능한 한 작은 커널 크기와 적은 반복 횟수를 유도한다.
  • 학습 및 추론 중에 예산 반올림 연산을 통해 사용자 정의 계산 예산에 자동으로 적응할 수 있도록 프레임워크를 설계한다.

실험 결과

연구 질문

  • RQ1고정된 구성 대비 각 픽셀당 적응형 커널 크기와 반복 횟수 선택이 깊이 보완 정확도 향상에 기여하는가?
  • RQ2학습된 자원 인지형 추론을 통해 정확도를 유지하거나 향상시키면서 계산 비용을 동적으로 줄일 수 있는가?
  • RQ3게이트 네트워크 통합이 노이즈가 많거나 정확도가 떨어지는 희소 깊이 입력에 대한 강건성에 어떤 영향을 미치는가?
  • RQ4모델이 KITTI(외부 환경)와 NYUv2(실내 환경)와 같은 다양한 환경과 데이터셋 간에 얼마나 잘 일반화되는가?
  • RQ5성능 저하 없이 특정 계산 예산 제약 조건에 자동으로 캘리브레이션할 수 있는가?

주요 결과

  • CA-CSPN은 KITTI 테스트 세트에서 743.69 RMSE와 2.07 iRMSE를 기록하여 CSPN(1019.64 RMSE) 및 기타 모든 SoTA 방법들을 능가한다.
  • RA-CSPN은 기존 CSPN 대비 추론 지연 시간을 최대 5배까지 감소시켰으며, RMSE를 756.27에서 732.32로 향상시켰다.
  • 경직된 계산 예산 제약 조건(기존 CSPN의 35%) 하에서 RA-CSPN은 평균 반복 횟수를 0.439에서 0.303으로 감소시키고, 평균 커널 크기를 0.268에서 0.333으로 증가시켜 자원 제약 조건 내에서 더 높은 정확도를 달성했다.
  • 모델은 복잡한 영역(예: 물체 경계, 먼 거리 표면)에는 더 큰 커널과 더 많은 반복 횟수를 할당하는 반면, 단순한 영역은 더 작은 커널과 적은 반복 횟수를 사용함으로써 지능적인 자원 배분을 학습한다.
  • 게이트 네트워크가 노이즈가 많은 희소 깊이 입력에 대한 강건성을 크게 향상시켜 성능 향상에 기여한다.
  • 모델은 실내 환경에서의 NYUv2에도 잘 일반화되어 기준 방법들보다 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.