Skip to main content
QUICK REVIEW

[논문 리뷰] Residual Conv-Deconv Grid Network for Semantic Segmentation

Damien Fourure, Rémi Emonet|HAL (Le Centre pour la Communication Scientifique Directe)|2017. 07. 25.
Advanced Neural Network Applications인용 수 12
한 줄 요약

이 논문은 도메인 특화된 이미지넷 사전 훈련 없이도 경쟁적인 성능을 달성할 수 있도록 공간적 세부 정보를 유지하면서도 맥락 정보를 포착할 수 있도록 다중 해상도의 상호 연결된 스트림을 사용하는 새로운 잔차 컨볼루션-디컨볼루션 격자 네트워크인 GridNet을 제안한다. 격자형 아키텍처를 통해 다양한 스케일에서 특징 맵을 융합함으로써, GridNet은 도시 스케일스(69.45% mIoU)에서 사전 훈련 없이도 훈련을 시작했을 때 몇몇 기준 모델들을 능가하는 성능을 기록한다.

ABSTRACT

This paper presents GridNet, a new Convolutional Neural Network (CNN) architecture for semantic image segmentation (full scene labelling). Classical neural networks are implemented as one stream from the input to the output with subsampling operators applied in the stream in order to reduce the feature maps size and to increase the receptive field for the final prediction. However, for semantic image segmentation, where the task consists in providing a semantic class to each pixel of an image, feature maps reduction is harmful because it leads to a resolution loss in the output prediction. To tackle this problem, our GridNet follows a grid pattern allowing multiple interconnected streams to work at different resolutions. We show that our network generalizes many well known networks such as conv-deconv, residual or U-Net networks. GridNet is trained from scratch and achieves competitive results on the Cityscapes dataset.

연구 동기 및 목표

  • 표준 컨volutional 신경망(CNN)에서의 서브샘플링으로 인한 해상도 손실 문제를 해결하기 위해.
  • 낮은 해상도 스트림으로부터의 맥락 정보를 통합하면서도 고해상도 특징을 유지하는 다중 스트림 아키텍처를 설계하기 위해.
  • U-Net, 풀 컨volution 네트워크, 잔차 네트워크와 같은 기존 아키텍처를 통합된 격자 구조 안에서 일반화하기 위해.
  • 이미지넷 사전 훈련에 의존하지 않고도 의미 분할 벤치마크에서 뛰어난 성능을 달성하기 위해.

제안 방법

  • GridNet는 다양한 해상도에서 작동하는 다수의 수평 스트림을 포함하는 2차원 격자 구조를 사용하며, 컨볼루션 및 디컨볼루션 유닛을 통해 상호 연결된다.
  • 각 스트림은 특정 스케일의 특징 맵을 처리하며, 다운샘플링 및 업샘플링 레이어가 격자 내 수직 컬럼을 형성한다.
  • 기울기 흐름을 촉진하고 훈련 안정성을 향상시키기 위해 스트림 내부 및 스트림 간에 잔차 스케일 연결을 사용한다.
  • 표준 역전파 알고리즘을 사용하여 이미지넷 사전 훈련 없이 종단 간(end-to-end)으로 훈련된다.
  • 다른 스트림의 특징 맵은 스케일 연결을 통해 융합되어 세밀한 세부 정보와 맥락적 이해를 결합한다.
  • 스케일 간의 탄력적인 상호 연결을 允허함으로써, U-Net, 풀 컨볼루션 네트워크, 잔차 네트워크를 통합하는 아키텍처를 일반화한다.

실험 결과

연구 질문

  • RQ1사전 훈련 없이도 다중 해상도 격자형 컨volutional 신경망 아키텍처가 표준 풀 컨볼루션 네트워크보다 의미 분할에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ2잔차 연결을 통한 고해상도 및 저해상도 스트림의 통합이 분할 정확도에 어떤 영향을 미치는가?
  • RQ3격자 기반 아키텍처가 U-Net 및 ResNet과 같은 기존 아키텍처를 의미 분할에 대해 얼마나 잘 일반화할 수 있는가?
  • RQ4스트림 수와 컬럼 수를 변화시켰을 때 성능 및 훈련 복잡도에 어떤 영향을 미치는가?

주요 결과

  • GridNet는 사전 훈련 없이 훈련을 시작했을 때 도시 스케일스 검증 세트에서 평균 교차율(mIoU) 69.45%를 달성하여, 몇몇 풀 컨볼루션 기반 기준 모델들을 능가한다.
  • 스트림 수를 늘릴수록 성능 향상이 이루어지며, 최고의 결과(69.45% mIoU)는 12개의 컬럼과 7개의 스트림(8, 16, 32, 64, 128, 256, 512개의 특징 맵)을 사용했을 때 달성되었다.
  • 스트림 수를 늘리지 않고 컬럼 수만 늘리면 성능 향상이 없으며, 훈련 복잡도만 증가하므로 스트림 수가 컬럼 수보다 더 중요하다는 점을 시사한다.
  • 네트워크는 잘 일반화되어 있으며, 이미지넷 사전 훈련 없이도 FRRN 및 RefineNet과 같은 최신 기술 수준의 모델들과 비교할 만한 성능을 기록한다.
  • 교대로 배치된 업샘플링/다운샘플링 컬럼을 가진 대안 아키텍처는 다소 낮은 성능(66.8% mIoU)을 기록하여, 더 체계적인 컬럼 레이아웃이 더 효과적임을 시사한다.
  • GridNet은 사전 훈련 없이도 강력한 성능을 낼 수 있음을 보여주며, ADE20K에서의 사전 훈련과 같은 더 나은 초기화 전략을 통해 향후 성능 향상 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.