Skip to main content
QUICK REVIEW

[논문 리뷰] Depth Estimation on Underwater Omni-directional Images Using a Deep Neural Network

Haofei Kuang, Qingwen Xu|arXiv (Cornell University)|2019. 05. 22.
Advanced Vision and Imaging참고 문헌 26인용 수 4
한 줄 요약

이 논문은 수중 옴니디렉셔널 영상에서 깊이를 추정하기 위해 구면 완전 컨volution 레이어 잔차 신경망(spherical FCRN)을 제안한다. 이는 수중 환경의 특성에 맞게 사전 훈련된 공기 중 FCRN을 경도-위도 매핑을 통해 적응시킨다. 합성 수중 데이터셋을 사용하여, 합성 데이터에 대해 만족스러운 깊이 추정 성능를 달성하지만, 영상 스타일과 깊이 범위의 도메인 차이로 인해 실제 수중 영상으로의 일반화 능력은 제한되어 있다.

ABSTRACT

In this work, we exploit a depth estimation Fully Convolutional Residual Neural Network (FCRN) for in-air perspective images to estimate the depth of underwater perspective and omni-directional images. We train one conventional and one spherical FCRN for underwater perspective and omni-directional images, respectively. The spherical FCRN is derived from the perspective FCRN via a spherical longitude-latitude mapping. For that, the omni-directional camera is modeled as a sphere, while images captured by it are displayed in the longitude-latitude form. Due to the lack of underwater datasets, we synthesize images in both data-driven and theoretical ways, which are used in training and testing. Finally, experiments are conducted on these synthetic images and results are displayed in both qualitative and quantitative way. The comparison between ground truth and the estimated depth map indicates the effectiveness of our method.

연구 동기 및 목표

  • 흐림, 색상 이동, 산산이 흩어지는 효과로 인해 영상 품질이 떨어지는 수중 환경에서 깊이 추정의 과제를 해결하기 위해.
  • 실제 수중 옴니디렉셔널 영상 데이터셋의 부족을 보완하기 위해 데이터 기반 및 이론적 방법을 사용하여 훈련 데이터를 합성하기 위해.
  • 옴니디렉셔널 카메라를 구면으로 모델링하고 영상들을 경도-위도 좌표계로 투영하여 기존의 공기 중 깊이 추정 네트워크(FCRN)를 옴니디렉셔널 수중 영상에 적용하기 위해.
  • 합성 및 실제 수중 데이터셋에서의 성능 평가를 통해 일반화 능력을 평가하기 위해.

제안 방법

  • 수중 색상 이동과 뿌연 현상을 시뮬레이션하는 스타일 전이 네트워크(WaterGAN)를 통해 합성된 수중 투시도 영상에 대해 기존의 FCRN을 훈련한다.
  • 옴니디렉셔널 카메라를 구면으로 모델링하고 영상을 경도-위도 좌표계로 투영하여 투시도 FCRN을 구면 FCRN로 변환한다.
  • 구면 좌표 매핑을 적용하여 표준 컨볼루션 레이어가 왜곡 없이 옴니디렉셔널 영상 특징을 처리할 수 있도록 한다.
  • 큰 옴니디렉셔널 영상 입력 크기로 인한 계산 자원 제약로 인해, ResNet-50 대신 ResNet-18을 사용한 수정된 FCRN 버전을 사용한다.
  • 공기 중 옴니디렉셔널 영상에 깊이에 따라 변하는 뿌연 현상과 빨간색 채널 감쇠를 적용하여 옴니디렉셔널 수중 영상을 합성한다.
  • 해당하는 진짜 깊이 맵과 함께 합성된 옴니디렉셔널 수중 영상에서 구면 FCRN을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 공기 중 깊이 추정 네트워크(FCRN)가 수중 옴니디렉셔널 영상에 효과적으로 적응될 수 있는가?
  • RQ2합성 수중 옴니디렉셔널 영상에서의 구면 FCRN 성능이 투시도 영상에서의 성능에 비해 얼마나 우수한가?
  • RQ3합성 데이터로 훈련된 네트워크가 실제 수중 옴니디렉셔널 영상으로 전이될 때의 한계는 무엇인가?
  • RQ4깊이 추정 정확도와 추론 속도 측면에서 구면 FCRN이 원본 FCRN에 비해 얼마나 우수한가?
  • RQ5이미지 색상, 뿌연 현상, 깊이 범위 등의 도메인 차이가 모델의 실제 데이터 일반화에 얼마나 영향을 미치는가?

주요 결과

  • 기존의 FCRN은 합성 수중 투시도 영상에서 뛰어난 성능를 보였으며, RMSE는 0.162, MAE는 0.117, REL은 0.098, δ₁는 0.914를 기록하였다.
  • 구면 FCRN은 합성 수중 옴니디렉셔널 영상에서 만족스러운 결과를 도출하였으며, RMSE는 0.604, MAE는 0.362, REL은 0.172, δ₁는 0.711을 기록하였다.
  • 옴니디렉셔널 영상에서 성능가 낮기는 하지만, 대부분의 픽셀에 대해 깊이를 성공적으로 추정함으로써, 구면 적응 방법의 타당성을 입증하였다.
  • Berman 등이 제시한 실제 수중 영상에서의 테스트 결과 성능 저하가 발생하였으며, 일부 영역에서 정확하지 못한 예측이 있었는데, 이는 색조와 깊이 범위의 도메인 차이로 인한 것으로 보인다.
  • GPU에서 이미지당 평균 추론 시간은 0.0145초로, 모델의 복잡성에도 불구하고 효율적인 추론을 가능하게 하였다.
  • 합성 데이터와 실제 데이터 간의 성능 격차는 더 다양한 합성 데이터와 실제 데이터에 대한 피니팅을 통해 모델의 강인성을 향상시킬 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.