Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Instance Segmentation with Recurrent Attention

Mengye Ren, Richard S. Zemel|arXiv (Cornell University)|2016. 05. 30.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 시각적 주의를 갖춘 종단간 순환 신경망을 제안하여 인스턴스 세분화를 수행하며, 한 번에 하나의 객체를 순차적으로 검출하고 분할하는 인간과 유사한 세는 과정을 모델링한다. 동적 비최대 억제 및 주의 기반 정밀화를 사용하여 겹침을 다루고 파rameter 수를 줄이며, CVPPP, KITTI, Cityscapes 데이터셋에서 인스턴스 카운팅과 세분화를 공동으로 학습함으로써 경쟁력 있는 성능을 달성한다.

ABSTRACT

While convolutional neural networks have gained impressive success recently in solving structured prediction problems such as semantic segmentation, it remains a challenge to differentiate individual object instances in the scene. Instance segmentation is very important in a variety of applications, such as autonomous driving, image captioning, and visual question answering. Techniques that combine large graphical models with low-level vision have been proposed to address this problem; however, we propose an end-to-end recurrent neural network (RNN) architecture with an attention mechanism to model a human-like counting process, and produce detailed instance segmentations. The network is jointly trained to sequentially produce regions of interest as well as a dominant object segmentation within each region. The proposed model achieves competitive results on the CVPPP, KITTI, and Cityscapes datasets.

연구 동기 및 목표

  • 정적 세분화가 개별 객체 인스턴스 간의 구분이 부족하여 실패하는 혼잡하고 겹쳐진 환경에서 개별 객체 인스턴스를 구분하는 데 어려움을 해결하기 위해.
  • 후처리 없이도 분류 및 픽셀 수준의 세분화를 동시에 수행할 수 있는 미분 가능하고 종단간 학습이 가능한 아키텍처를 개발하기 위해.
  • 상향식으로 반복되는 주의 기반 메커니즘을 통해 겹침에 대한 강건성을 모델링하고, 겹치는 검출을 동적으로 억제하기 위해.
  • 전역적인 픽셀별 예측 대신 순차적이고 반복적인 출력 메커니즘을 사용하여 모델 복잡성과 파rameter 수를 줄이기 위해.
  • 세분화와 신뢰도 점수 학습을 공동으로 수행함으로써 자동 정지 기준을 가능하게 하고, 고정된 NMS 임계값에 의존하지 않기 위해.

제안 방법

  • 모델은 이미지 특징 위에서 소프트 주의 기반 메커니즘을 사용해 관심 영역을 반복적으로 주시하는 순환 LSTM 기반 컨트롤러를 사용한다.
  • 각 타임스텝에서, 상위 봉우리와 은닉 상태를 기반으로 상자 제안 네트워크가 다음 관심 객체의 위치를 국소화한다.
  • 세분화 네트워크는 디컨볼루션 레이어를 사용해 제안된 바운딩 박스 내에서 조밀한 픽셀 수준 마스크를 생성한다.
  • 신뢰도 평가 네트워크는 검출된 인스턴스의 신뢰도를 평가하고 시퀀스를 계속할지 여부를 결정한다.
  • 외부 메모리는 이전에 분할된 인스턴스를 저장하여 주의를 안내하고, 타임스텝 간 동적 비최대 억제를 가능하게 한다.
  • 학습 중에 스케줄링 샘플링을 적용하여 지속적으로 진짜 레이블 지도에서 모델이 생성한 입력으로 점진적으로 전환함으로써 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1순환적이고 주의 기반 아키텍처는 후처리 없이도 분류 가능하고 종단간 방식으로 인스턴스 세분화를 효과적으로 수행할 수 있는가?
  • RQ2주의 기반의 순차적 세는 메커니즘이 겹침이나 조밀하게 포장된 객체를 다룰 때 전역적이고 한 번에 예측하는 방법과 비교해 어떻게 성능을 내는가?
  • RQ3인스턴스 카운팅과 세분화의 공동 학습이 성능 향상에 얼마나 기여하고 자동 정지 기준을 가능하게 하는가?
  • RQ4외부 메모리와 동적 NMS를 사용할 경우 표준 NMS 또는 하향식 방법에 비해 겹침에 대한 강건성이 얼마나 향상되는가?
  • RQ5상자 네트워크, 주의 기반 메커니즘, 스케줄링 샘플링과 같은 아키텍처 구성 요소가 세분화 정확도와 일반화에 미치는 영향은 무엇인가?

주요 결과

  • 모델은 CVPPP, KITTI, Cityscapes 벤치마크에서 경쟁력 있는 인스턴스 세분화 성능를 달성하였으며, 이전의 RNN 기반 방법을 능가하고 일부 복잡한 그래픽 모델과도 유사하거나 뛰어난 성능을 보였다.
  • KITTI 데이터셋에서 모델은 다양한 자세와 겹침 조건에서도 자동차를 성공적으로 세분화하였으며, 자동차의 일부만 노출된 경우에도 성능를 유지를 하였다.
  • 후처리 없이도 고해상도의 세밀한 인스턴스 마스크를 생성하였으며, [26, 41]와 같은 방법과 달리 추가적인 정밀화 단계가 필요로 하지 않았다.
  • 제거 실험 결과, 초기 전경 세분화 및 상자 제안 네트워크가 성능에 결정적인 영향을 미치며, 이를 제거할 경우 커버리지 측정치가 크게 감소함을 확인하였다.
  • 스케줄링 샘플링은 학습 안정성과 일반화 성능를 향상시키며, LSTM 내의 봉우리 수를 늘릴수록 성능 향상이 눈에 띄게 나타났다.
  • 학습이 진행됨에 따라 모델은 주의를 통해 주목할 만한 객체를 우선순위로 삼으며, 공간 순서(예: 왼쪽에서 오른쪽)에서 신뢰도 기반의 주의 점프로 전환한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.