Skip to main content
QUICK REVIEW

[논문 리뷰] WaveSNet: Wavelet Integrated Deep Networks for Image Segmentation

Qiufu Li, Linlin Shen|arXiv (Cornell University)|2020. 05. 29.
Advanced Neural Network Applications참고 문헌 16인용 수 8
한 줄 요약

WaveSNet는 심층 네트워크에서 다운샘플링 및 업샘플링 중 이미지 세부 정보를 유지하고 복원하기 위해 미분 가능한 이산 웨이블릿 변환(DWT) 및 역 DWT(IDWT) 레이어를 도입한다. U-Net, SegNet, DeepLabv3+와 같은 아키텍처에서 표준 풀링 및 언풀링을 DWT/IDWT로 대체함으로써, CamVid, Pascal VOC, Cityscapes에서 최신 기술 수준의 성능을 달성하며, 특히 미세한 객체와 유사한 객체의 세분화에 뛰어난 성능을 발휘한다.

ABSTRACT

In deep networks, the lost data details significantly degrade the performances of image segmentation. In this paper, we propose to apply Discrete Wavelet Transform (DWT) to extract the data details during feature map down-sampling, and adopt Inverse DWT (IDWT) with the extracted details during the up-sampling to recover the details. We firstly transform DWT/IDWT as general network layers, which are applicable to 1D/2D/3D data and various wavelets like Haar, Cohen, and Daubechies, etc. Then, we design wavelet integrated deep networks for image segmentation (WaveSNets) based on various architectures, including U-Net, SegNet, and DeepLabv3+. Due to the effectiveness of the DWT/IDWT in processing data details, experimental results on CamVid, Pascal VOC, and Cityscapes show that our WaveSNets achieve better segmentation performances than their vanilla versions.

연구 동기 및 목표

  • 심층 네트워크에서 다운샘플링 과정에서 발생하는 데이터 세부 정보 손실로 인한 이미지 세분화 성능 저하 문제를 해결하기 위해.
  • 1D, 2D, 3D 데이터 및 다양한 웨이블릿(예: 하르, 도브체스, 코헨)에 적용 가능한 일반적이고 미분 가능한 DWT/IDWT 레이어를 개발하기 위해.
  • 추론 과정에서 데이터 세부 정보를 명시적으로 처리하는 엔드 투 엔드 웨이블릿 통합 네트워크(WaveSNets)를 설계하기 위해.
  • 세부 정보 인식 특징 학습을 통해 미세한 구조와 유사한 물체의 세분화 정확도를 향상시키기 위해.

제안 방법

  • 표준 딥 러닝 프레임워크와 호환되는 학습 가능한, 미분 가능한 레이어로 DWT 및 IDWT를 재구성하기 위해.
  • 다운샘플링 경로에서 최대 풀링의 대체로 DWT를 통합하여 고주파 세부 정보를 유지하기 위해.
  • 업샘플링 연산의 대체로 IDWT를 통합하여 원래 공간 해상도를 세부 정보를 유지한 채로 복원하기 위해.
  • U-Net, SegNet, DeepLabv3+ 등 다양한 아키텍처에 DWT/IDWT 레이어를 통합하기 위해.
  • 웨이블릿의 다양성(하르, 코헨, 도브체스 등)을 적용하여 다양한 신호 표현에서의 강건성과 성능을 평가하기 위해.
  • 표준 최적화 기법을 사용하여 심층 네트워크의 엔드 투 엔드 학습을 수행하며, 표준 트레이닝 프rotocols를 따르기 위해.

실험 결과

연구 질문

  • RQ1DWT 및 IDWT가 심층 네트워크 내에서 학습 가능한 레이어로 효과적으로 통합되어 다운샘플링 및 업샘플링 과정에서 이미지 세부 정보를 유지할 수 있는가?
  • RQ2표준 풀링 및 언풀링을 DWT/IDWT로 대체함으로써 표준 벤치마크에서 심층 세분화 성능이 향상되는가?
  • RQ3웨이블릿의 선택(예: 하르, 도브체스, 코헨)이 세분화 정확도 및 세부 정보 복원에 어떤 영향을 미치는가?
  • RQ4기본 아키텍처에 비해 WaveSNet이 미세한 구조 및 유사한 물체에서 더 뛰어난 성능을 내는가?

주요 결과

  • WaveSNet은 'ch5.5' 웨이블릿을 사용하여 Pascal VOC 검증 세트에서 79.90% mIoU를 기록하며, 베이스라인인 DeepLabv3+보다 1.22% 높은 성능을 보였다.
  • Cityscapes에서는 70.63% mIoU를 기록하여 베이스라인인 Vanilla DeepLabv3+를 뛰어넘으며 강력한 일반화 능력을 입증했다.
  • 의자, 테이블, 식물과 같은 미세한 객체의 경우, WaveSNet이 베이스라인 모델보다 뚜렷한 향상을 보였으며, mIoU 향상 폭이 최대 5.5%에 이르렀다.
  • 소, 말, 양과 같은 유사한 객체의 경우, WaveSNet이 구조적 세부 정보를 더 잘 유지함으로써 오분류를 줄였다.
  • 시각적 비교 결과, WDeepLabv3+는 뿔, 다리와 같은 미세한 영역을 정확히 세분화하며, 유사한 동물을 서로 오분류하는 것을 방지했다.
  • 모델 크기 증가 폭이 작아(0.88M 파라미터) 다양한 데이터셋에서 일관된 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.