Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-level Contextual RNNs with Attention Model for Scene Labeling

Heng Fan, Xue Mei|arXiv (Cornell University)|2016. 07. 08.
Advanced Image and Video Retrieval Techniques참고 문헌 34인용 수 13
한 줄 요약

이 논문은 장면 레이블링을 위해 주의 메커니즘을 갖춘 다수준 맥락적 순환 신경망(Multi-level Contextual Recurrent Neural Networks, ML-CRNNs)을 제안한다. 이는 국소적, 전반적, 이미지 주제 맥락을 계층적 CNN에 통합하여 장거리 공간적 및 의미적 의존성을 모델링한다. 이 방법은 CamVid, SiftFlow, Stanford-background 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 주의 기반 융합 전략이 평균 풀링 및 최대 풀링 전략보다 뛰어난 성능을 보였다.

ABSTRACT

Context in image is crucial for scene labeling while existing methods only exploit local context generated from a small surrounding area of an image patch or a pixel, by contrast long-range and global contextual information is ignored. To handle this issue, we in this work propose a novel approach for scene labeling by exploring multi-level contextual recurrent neural networks (ML-CRNNs). Specifically, we encode three kinds of contextual cues, i.e., local context, global context and image topic context in structural recurrent neural networks (RNNs) to model long-range local and global dependencies in image. In this way, our method is able to `see' the image in terms of both long-range local and holistic views, and make a more reliable inference for image labeling. Besides, we integrate the proposed contextual RNNs into hierarchical convolutional neural networks (CNNs), and exploit dependence relationships in multiple levels to provide rich spatial and semantic information. Moreover, we novelly adopt an attention model to effectively merge multiple levels and show that it outperforms average- or max-pooling fusion strategies. Extensive experiments demonstrate that the proposed approach achieves new state-of-the-art results on the CamVid, SiftFlow and Stanford-background datasets.

연구 동기 및 목표

  • 기존 장면 레이블링 방법이 국소적 맥락에만 의존하여 외관상 유사한 픽셀을 잘못 분류하는 데에 기인한 한계를 해결하기 위해.
  • 장기적 국소적, 전반적, 이미지 주제 맥락을 통합된 RNN 프레임워크에서 모델링하여 의미적 이해를 향상시키기 위해.
  • 다양 수준의 공간적 및 의미적 의존성을 활용하기 위해 맥락 기반 RNN을 계층적 CNN에 통합하기 위해.
  • 다양 수준의 특징을 융합하기 위해 평균 및 최대 풀링 전략보다 뛰어난 성능을 보이는 주의 기반 융합 메커니즘 개발하기 위해.
  • CRF와 같은 후처리 기법 없이도 최신 기술 수준 성능를 달성함으로써 제안된 아키텍처의 강건성을 입증하기 위해.

제안 방법

  • 이 방법은 국소(8개 이웃), 전반적(전체 이미지), 이미지 주제(이미지 수준의 의미)의 세 가지 유형의 맥락적 신호를 구조적 RNN 내에 인코딩하여 장거리 의존성을 모델링한다.
  • 국소 맥락은 레이블 유사도 기반으로 학습된 가중치를 갖는 이웃에 대한 가중치 RNN을 통해 모델링되며, 일관된 이웃의 영향력을 향상시킨다.
  • RNN은 3번째, 4번째, 5번째 풀링 레이어에서 유도된 특징 맵에 적용되어 계층적 공간적 및 의미적 표현을 캡처한다.
  • 모델은 주의 메커니즘을 사용하여 다양한 수준의 기여도를 동적으로 가중치를 설정하며, 개선된 특징 융합을 위한 최적의 융합 가중치를 학습한다.
  • 업샘플링 레이어를 사용하여 밀도 있는 픽셀 단위 예측을 생성하는 엔드 투 엔드 학습 파이프라인을 구성함으로써 완전한 감독 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1RNN 내에서 국소적, 전반적, 주제 맥락을 모두 모델링하는 것이 국소적 맥락에만 의존하는 기존 방법보다 장면 레이블링 정확도를 향상시키는가?
  • RQ2계층적 CNN 특징과 맥락 기반 RNN을 융합함으로써 장면 레이블링을 위한 공간적 및 의미적 특징 표현이 어떻게 향상되는가?
  • RQ3다양 수준의 특징을 융합하는 데 있어 주의 기반 융합 메커니즘이 전통적인 풀링 전략(평균 또는 최대 풀링)보다 뛰어나게 성능을 높이는가?
  • RQ4전반적 맥락과 주제 맥락은 드물거나 외관상 모호한 클래스의 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 ML-CRNNs는 CRF와 같은 후처리 기법 없이도 최신 기술 수준 성능를 달성할 수 있는가?

주요 결과

  • CamVid 데이터셋에서 주의 기반 융합을 적용한 제안된 ML-CRNNs는 픽셀 정확도 86.9%와 클래스 정확도 57.7%를 달성하여 이전 최신 기술 수준 성능를 초월하였다.
  • SiftFlow 데이터셋에서 이 방법은 픽셀 정확도 86.9%와 클래스 정확도 57.7%를 기록하였으며, 이는 이전 최고 성능인 85.3%와 55.7%를 뛰어넘었다.
  • Stanford-background 데이터셋에서 이 방법은 픽셀 정확도 87.2%와 클래스 정확도 78.4%를 달성하였으며, 이는 이전 최신 기술 수준 성능인 84.6%와 77.3%를 향상시켰다.
  • 주의 기반 융합 전략은 평균 및 최대 풀링 융합 전략보다 뚜렷하게 뛰어난 성능을 보였으며, 최적의 특징 융합을 학습하는 데의 효과성을 입증하였다.
  • CRF 후처리 없이도 최신 기술 수준 성능를 달성하였으며, 이는 다수준 맥락 기반 RNN 설계의 강건성을 증명하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.