Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Neural Representational Decoders for High-Resolution Semantic Segmentation

Bowen Zhang, Yifan Liu|arXiv (Cornell University)|2021. 07. 30.
Advanced Neural Network Applications참고 문헌 22인용 수 6
한 줄 요약

이 논문은 고해상도 세분화를 위한 새로운 효율적 디코더인 동적 신경 표현 디코더(NRD)를 제안한다. NRD는 국소적 세분화 레이블 패치를 압축된 신경망으로 표현한다. 인코더 특징에 기반해 이러한 신경 표현을 동적으로 생성하고 레이블의 연속성 특성을 활용함으로써, DeeplabV3+ 대비 최대 30% 적은 계산 비용으로 최신 기술 수준의 정확도를 달성한다. 또한 확장된 인코더 방법 대비 15%의 계산 비용 절감을 이룬다.

ABSTRACT

Semantic segmentation requires per-pixel prediction for a given image. Typically, the output resolution of a segmentation network is severely reduced due to the downsampling operations in the CNN backbone. Most previous methods employ upsampling decoders to recover the spatial resolution. Various decoders were designed in the literature. Here, we propose a novel decoder, termed dynamic neural representational decoder (NRD), which is simple yet significantly more efficient. As each location on the encoder's output corresponds to a local patch of the semantic labels, in this work, we represent these local patches of labels with compact neural networks. This neural representation enables our decoder to leverage the smoothness prior in the semantic label space, and thus makes our decoder more efficient. Furthermore, these neural representations are dynamically generated and conditioned on the outputs of the encoder networks. The desired semantic labels can be efficiently decoded from the neural representations, resulting in high-resolution semantic segmentation predictions. We empirically show that our proposed decoder can outperform the decoder in DeeplabV3+ with only 30% computational complexity, and achieve competitive performance with the methods using dilated encoders with only 15% computation. Experiments on the Cityscapes, ADE20K, and PASCAL Context datasets demonstrate the effectiveness and efficiency of our proposed method.

연구 동기 및 목표

  • 저해상도 인코더 특징에서 고해상도 세분화 예측을 복구하는 데 있어 기존 디코더의 비효율성을 해결하기 위해.
  • 세분화 레이블 공간 내 구조적 사전 지식, 예를 들어 局소적 연속성과 같은 특성을 활용하여 디코딩의 효율성과 정확도를 향상시키기 위해.
  • PCA와 같은 선형 차원 축소 기법에 의존하지 않고도 레이블 간 의존성을 암묵적으로 모델링할 수 있는 압축형, 학습 가능한 디코더를 설계하기 위해.
  • 인코더 특징에 조건부로 신경 표현을 동적으로 생성함으로써 엔드 투 엔드 훈련을 가능하게 하기 위해.
  • 확장된 컨볼루션 또는 고해상도 백본을 사용하는 최신 기술 대비 상당히 감소된 계산 복잡도로 경쟁 가능한 성능을 달성하기 위해.

제안 방법

  • 각 국소 패치의 세분화 레이블은 압축된 신경망 $ g_{\boldsymbol{\theta}}(\cdot) $ 로 표현되며, 이는 $ \boldsymbol{\theta} $ 에 의해 매개변수화되며 좌표 및 가이던스 맵을 입력으로 받아 예측 레이블을 출력한다.
  • 신경 표현의 매개변수 $ \boldsymbol{\theta} $ 는 각 공간 위치에서 인코더의 특징 맵에 조건부로 작용하는 경량 네트워크에 의해 동적으로 생성된다.
  • 디코더는 좌표 맵 $ (x,y) $ 와 가이던스 맵 $ m $ 을 신경 표현 네트워크의 입력으로 사용하여 픽셀 단위의 세분화 레이블을 예측한다.
  • 신경 표현의 동적 생성은 레이블 공간 내 연속성 사전 지식을 암묵적으로 활용할 수 있게 하여 일반화 능력과 효율성을 향상시킨다.
  • 전체 아키텍처는 엔드 투 엔드 훈련을 지원하며, 신경 표현 디코더를 표준 인코더-디코더 세분화 프레임워크에 통합한다.
  • 무거운 확장 컨볼루션과 복잡한 다중 스케일 융합을 피하고, 대신 압축형, 조건부로 생성된 신경 표현을 활용하여 효율적인 업샘플링을 구현한다.

실험 결과

연구 질문

  • RQ1국소적 세분화 레이블 패치의 신경 표현은 고해상도 세분화에서 디코딩 효율성과 정확도를 향상시킬 수 있는가?
  • RQ2동적으로 생성된 신경 표현은 세분화 레이블 공간 내 연속성 사전 지식을 효과적으로 활용할 수 있는가?
  • RQ3압축형, 학습 가능한 디코더는 상당히 감소된 계산 비용으로 기존 디코더(예: DeeplabV3+의 것)를 능가할 수 있는가?
  • RQ4제안된 방법은 최신 기술 모델보다 절반 이하의 FLOPs로 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5동적 신경 표현 디코더는 표준 인코더-디코더 아키텍처에 효과적으로 통합되어 엔드 투 엔드 훈련이 가능한가?

주요 결과

  • Cityscapes에서 ResNet-50 기반 NRD는 다중 스케일 기준 80.0% mIoU를 기록했으며, 계산량은 234.6 GFlops 뿐이었고, SFNet(79.5% mIoU, 243.9 GFlops)을 뛰어넘었다.
  • ResNet-101 기반 NRD는 Cityscapes에서 80.5% mIoU를 기록했으며, 계산량은 390.0 GFlops였다. 이는 RGNet(81.5% mIoU)의 성능을 따라가지만, 계산 비용의 30% 미만으로 달성했다.
  • ADE20K에서 NRD는 59개 클래스 기준 54.1% mIoU, 60개 클래스 기준 49.0% mIoU를 기록했으며, 82.7 GFlops를 소비하는 HRNet-W48에 비해 계산량은 42.9 GFlops 뿐이었다.
  • NRD는 DeeplabV3+ 대비 약 30%의 계산 복잡도 감소를 이룩했고, 모든 벤치마크에서 뛰어난 또는 동등한 성능을 달성했다.
  • 확장된 인코더 방법 대비 계산량의 15%로도 경쟁 가능한 성능을 달성하여 뛰어난 속도-정확도 트레이드오프를 입증했다.
  • 제거 분석 결과, 동적 신경 표현은 이중선형 업샘플링 및 PCA 기반 기준 모델에 비해 성능 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.