Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Dilated Convolution for Real-time Semantic Segmentation

Roland Gao|arXiv (Cornell University)|2021. 11. 18.
Advanced Neural Network Applications참고 문헌 47인용 수 9
한 줄 요약

이 논문은 실시간 세분화 모델인 RegSeg를 제안하며, 백본 전반에 걸쳐 큰 조절 가능한 확장률을 가진 확장 컨볼루션을 전통적인 다운샘플링 방식 대신 사용하여 넓고 제어 가능한 수신장(field-of-view)을 달성한다. 병렬 확장 컨볼루션을 사용하는 새로운 D 블록과 확장률 최적화를 위한 미분 가능 아키텍처 탐색을 도입함으로써, RegSeg는 ImageNet 사전학습 없이도 Cityscapes 및 CamVid에서 최신 기술 수준의 정확도-효율성 트레이드오프를 달성한다. 테스트 세트에서 각각 37 FPS에서 78.3 mIOU, 112 FPS에서 80.9 mIOU를 기록한다.

ABSTRACT

The field-of-view is an important metric when designing a model for semantic segmentation. To obtain a large field-of-view, previous approaches generally choose to rapidly downsample the resolution, usually with average poolings or stride 2 convolutions. We take a different approach by using dilated convolutions with large dilation rates throughout the backbone, allowing the backbone to easily tune its field-of-view by adjusting its dilation rates, and show that it's competitive with existing approaches. To effectively use the dilated convolution, we show a simple upper bound on the dilation rate in order to not leave gaps in between the convolutional weights, and design an SE-ResNeXt inspired block structure that uses two parallel $3 imes 3$ convolutions with different dilation rates to preserve the local details. Manually tuning the dilation rates for every block can be difficult, so we also introduce a differentiable neural architecture search method that uses gradient descent to optimize the dilation rates. In addition, we propose a lightweight decoder that restores local information better than common alternatives. To demonstrate the effectiveness of our approach, our model RegSeg achieves competitive results on real-time Cityscapes and CamVid datasets. Using a T4 GPU with mixed precision, RegSeg achieves 78.3 mIOU on Cityscapes test set at $37$ FPS, and 80.9 mIOU on CamVid test set at $112$ FPS, both without ImageNet pretraining.

연구 동기 및 목표

  • 실시간 세분화 모델에서 수신장이 작다는 한계를 해결하기 위해 표준 다운샘플링 방식을 백본 전반에 걸쳐 확장 컨볼루션으로 대체함으로써 더 넓고 제어 가능한 수신장을 달성하고자 한다.
  • 확장률을 조절하여 시야(field-of-view)를 정밀하게 제어할 수 있도록 하되, 특징 커버리지에 격차가 생기지 않도록 하기 위해 설계한다.
  • 다른 확장률을 가진 이중 경로 확장 컨볼루션 블록(D 블록)을 사용하여 고해상도 특징에서 국소적 세부 정보를 유지하고자 한다.
  • 확장 컨볼루션의 확장률 선택을 자동화하기 위해 미분 가능 디지털 변형 컨볼루션을 활용한 미분 가능 신경망 아키텍처 탐색을 적용한다.
  • 특징 추상화 과정에서 손실된 공간적 세부 정보를 효과적으로 복원할 수 있는 경량 디코더를 설계하여 실시간 추론에서의 성능을 향상시키고자 한다.

제안 방법

  • 확장률에 상한선을 설정하여 컨볼루션 커널 가중치 간 격차가 생기지 않도록 하여 수신장의 완전한 커버리지가 보장되도록 한다.
  • SE-ResNeXt를 영감으로 삼아 두 개의 병렬 3×3 컨볼루션을 사용하며 서로 다른 확장률을 적용하는 D 블록을 설계하여 넓은 수신장과 국소적 세부 정보 유지 간의 균형을 확보한다.
  • 확장 컨볼루션을 오프셋 매개변수를 학습시켜 미분 가능한 변형 컨볼루션으로 표현함으로써 확장률에 대한 기울기 기반 최적화를 가능하게 한다.
  • 기울기 하강법을 사용하는 미분 가능한 NAS 방법을 적용하여 백본 내 모든 블록에서 동시에 확장률을 최적화한다.
  • 특징 추상화 과정에서 손실된 공간적 세부 정보를 효과적으로 복원할 수 있는 경량 디코더를 도입하여 국소화 정확도를 향상시킨다.
  • ImageNet 사전학습 없이 종단 간(end-to-end) 학습을 수행하여 데이터 효율성과 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1큰 조절 가능한 확장률을 가진 확장 컨볼루션을 실시간 세분화 백본에서 전통적인 다운샘플링 방식 대신 사용하여 더 넓고 제어 가능한 수신장을 달성할 수 있는가?
  • RQ2고해상도 특징에서 국소적 이미지 세부 정보를 유지하면서도 시야를 최대화할 수 있는가?
  • RQ3미분 가능한 신경망 아키텍처 탐색이 세분화 모델의 확장률 최적화에 효과적으로 적용될 수 있는가?
  • RQ4기존 디코더와 비교해 복잡도를 낮춘 경량 디코더는 추론 속도를 저하시키지 않고 공간적 세부 정보 복원 성능에서 뛰어나게 되는가?
  • RQ5ImageNet 사전학습 없이도 확장 컨볼루션 기반 백본이 기존 실시간 모델보다 더 나은 정확도-효율성 트레이드오프를 달성할 수 있는가?

주요 결과

  • RegSeg는 ImageNet 사전학습 없이 T4 GPU에서 혼합 정밀도를 사용하여 Cityscapes 테스트 세트에서 37 FPS에서 78.3 mIOU를 달성한다.
  • CamVid 데이터셋에서 RegSeg는 112 FPS에서 80.9 mIOU를 기록하여 이전 최신 기술인 DDRNet-23보다 0.8% 향상되고 BiSeNetV2-L보다 2.4% 향상된다.
  • 비교 플롯과 표를 통해 RegSeg는 Cityscapes에서 파라미터-정확도 및 FLOPS-정확도 트레이드오프에서 최고의 성능을 기록한다.
  • 유사한 학습 설정에서 DDRNet-23과 비교했을 때 RegSeg는 더 높은 FPS(38 대 33)와 더 낮은 파라미터 수(3.34M 대 20.1M)를 확보하면서도 경쟁적인 성능을 유지한다.
  • 이중 경로 확장 컨볼루션을 가진 D 블록은 효과적 수신장을 2399로 증가시켜 DeepLabv3+의 1055보다 크게 향상시키며, 국소적 세부 정보를 유지한다.
  • 확장률 최적화를 위한 미분 가능한 NAS 방법은 수동 조정과 유사한 성능을 기록하여 수신장 구성의 종단 간 학습 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.