Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Smoothing of Dilated Convolutions for Image Segmentation

Thomas Ziegler, Manuel Fritsche|arXiv (Cornell University)|2019. 03. 19.
Advanced Neural Network Applications참고 문헌 17인용 수 6
한 줄 요약

이 논문은 확대 컨볼루션을 위한 경량이며 파rameter-free인 스무딩 방법을 제안한다. 입력 특징에 간단한 보간 필터(평균 또는 가우시안)를 적용하여 확대 컨볼루션 이전에 처리함으로써 세그멘테이션 정확도를 향상시키며, 기존 방법보다 훨씬 낮은 학습 비용을 요구한다. 이 방법은 DeepLabv2에 비해 단지 2.89–4.34%의 추가 학습 시간만을 요구하며, PASCAL VOC 2012 및 Cityscapes에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Dilated Convolutions have been shown to be highly useful for the task of image segmentation. By introducing gaps into convolutional filters, they enable the use of larger receptive fields without increasing the original kernel size. Even though this allows for the inexpensive capturing of features at different scales, the structure of the dilated convolutional filter leads to a loss of information. We hypothesise that inexpensive modifications to Dilated Convolutional Neural Networks, such as additional averaging layers, could overcome this limitation. In this project we test this hypothesis by evaluating the effect of these modifications for a state-of-the art image segmentation system and compare them to existing approaches with the same objective. Our experiments show that our proposed methods improve the performance of dilated convolutions for image segmentation. Crucially, our modifications achieve these results at a much lower computational cost than previous smoothing approaches.

연구 동기 및 목표

  • 모델 복잡도를 증가시키지 않고 확대 컨볼루션에서의 정보 손실과 격자 무늬 아티팩트를 해결하기 위해.
  • 학습 가능한 파rameter를 추가하는 기존 스무딩 방법의 계산 비용을 줄이기 위해.
  • 간단한, 학습 불가능한 필터가 복잡하고 파arameter가 많은 베이스라인 성능을 따라하거나 초월할 수 있는지 평가하기 위해.
  • 낮은 학습 오버헤드로도 향상된 세그멘테이션 품질을 달성할 수 있는지 보여주기 위해.

제안 방법

  • 각 입력 채널에 사전 필터(평균 또는 가우시안)를 적용하여 확대 컨볼루션 이전에 국소적 공간 정보를 향상시킨다.
  • 추가적인 학습 가능한 파arameter를 도입하지 않기 위해 고정된, 학습 불가능한 필터를 사용한다.
  • 필터링 단계를 네트워크 아키텍처 내부에 통합하여 각 확대 컨볼루션 레이어 이전에 직접 적용한다.
  • 학습 가능한 추가 레이어를 사용하는 G Interact 및 SS Conv와 같은 최신 기술 수준의 베이스라인과 성능을 비교한다.
  • 모델을 PASCAL VOC 2012 및 Cityscapes에서 동일한 초모수 설정으로 학습시킨다.
  • 정확도와 효율성 모두 평가를 위해 mIoU와 학습 시간을 측정한다.

실험 결과

연구 질문

  • RQ1간단하고 학습 불가능한 필터가 세그멘테이션에서 확대 컨볼루션의 강건성을 향상시킬 수 있는가?
  • RQ2사전 필터를 적용함으로써 확대 컨볼루션에서 격자 무늬 아티팩트와 정보 손실이 감소하는가?
  • RQ3이 방법이 훨씬 낮은 학습 비용으로 기존 스무딩 방법과 비교해 유사하거나 더 높은 세그멘테이션 성능을 달성할 수 있는가?
  • RQ4이러한 성능 향상이 다양한 데이터셋과 네트워크 구성에서 안정적인가?

주요 결과

  • 평균 필터는 Cityscapes 데이터셋에서 베이스라인인 DeepLabv2보다 더 큰 mIoU 향상을 달성했으며, SS Conv 베이스라인을 초월했다.
  • 가우시안 필터는 Cityscapes에서 DeepLabv2보다 약간의 mIoU 향상을 기록했으며, 학습 시간은 단지 2.89%만 추가로 소요되었다.
  • 평균 필터는 DeepLabv2보다 단지 4.34% 더 많은 학습 시간만 소요되었고, 더 복잡한 SS Conv 방법보다 더 높은 성능를 달성했다. SS Conv는 22.04% 더 많은 학습 시간을 요구했다.
  • 제안된 방법은 PASCAL VOC 2012 및 Cityscapes 양쪽에서 최신 기술 수준의 성능를 달성했으며, 최소한의 계산 오버헤드를 가졌다.
  • 추가 학습 가능한 파arameter 없이도 SS Conv 베이스라인을 초월하는 성능를 기록했으며, 이는 성능 향상이 복잡성에 의존하지 않음을 보여준다.
  • 결과적으로 단순하고 고정된 필터가 확대 컨볼루션에서의 정보 손실과 격자 무늬 아티팩트를 효과적으로 완화시킬 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.