Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Segmentation with Reverse Attention

Qin Huang, Chunyang Xia|arXiv (Cornell University)|2017. 07. 20.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

이 논문은 역주의사전 네트워크(RAN)를 제안하며, 세 가지 분기로 구성된 완전 컨volution 신경망으로, 역학습을 통해 긍정(대상 클래스) 및 부정(비대상 클래스) 특징을 명시적으로 학습함으로써 의미 분할 성능을 향상시킨다. 모호한 영역에서의 반응을 강화하는 역주의사전 메커니즘을 도입함으로써 RAN은 PASCAL-Context 데이터셋에서 48.1%의 평균 IoU를 달성하며 최신 기준 성능을 기록했으며, PASCAL VOC, NYUDv2, Person-Part 및 ADE20K 데이터셋에서도 일관된 향상 효과를 보였다.

ABSTRACT

Recent development in fully convolutional neural network enables efficient end-to-end learning of semantic segmentation. Traditionally, the convolutional classifiers are taught to learn the representative semantic features of labeled semantic objects. In this work, we propose a reverse attention network (RAN) architecture that trains the network to capture the opposite concept (i.e., what are not associated with a target class) as well. The RAN is a three-branch network that performs the direct, reverse and reverse-attention learning processes simultaneously. Extensive experiments are conducted to show the effectiveness of the RAN in semantic segmentation. Being built upon the DeepLabv2-LargeFOV, the RAN achieves the state-of-the-art mIoU score (48.1%) for the challenging PASCAL-Context dataset. Significant performance improvements are also observed for the PASCAL-VOC, Person-Part, NYUDv2 and ADE20K datasets.

연구 동기 및 목표

  • 기존 의미 분할 네트워크가 대상 클래스와 연관된 특징만 학습하는 데에 국한되어 있어 경계 영역에서 혼동이 발생하는 문제를 해결하기 위해.
  • 겹침 또는 유사한 시각 패턴으로 인해 반응이 약한 복잡한 영역에서의 분할 정확도를 향상시키기 위해.
  • 대상 클래스와 비대상 클래스를 명시적으로 구분할 수 있도록 '반대' 개념을 학습함으로써 네트워크에 교육하기 위해.
  • 새로운 역주의사전 메커니즘을 통해 모호한 공간 영역에서의 특징 구별 능력을 향상시키기 위해.
  • 수정된 DeepLabv2-LargeFOV 백본을 사용하여 여러 벤치마크 데이터셋에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • RAN 아키텍처는 세 개의 병렬 분기로 구성되며, 대상 클래스의 표준 분할을 위한 직접 분기, 대상 클래스와 관련이 없는 특징을 학습하기 위한 역분기, 그리고 모호한 영역에서 약한 반응을 강화하기 위해 학습 가능한 주의 마스크를 적용하는 역주의사전 분기로 이루어진다.
  • 역주의사전 분기는 시그모이드 활성화를 통해 저신뢰도 또는 고모호성 영역에 집중하는 주의 마스크를 사용하여 반응의 차별화를 향상시킨다.
  • 모든 세 분기에서 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 학습되며, 모든 분기의 특징맵을 융합하여 최종 예측을 도출한다.
  • 이 방법은 ResNet-101 기반의 DeepLabv2-LargeFOV를 기반으로 하며, 확장 컨볼루션과 다중 척도의 맥락 집약을 활용한다.
  • 각 클래스별로 역주의사전 마스크를 생성하여, 대상 객체가 배경 또는 다른 객체와 시각적으로 유사한 영역에서 반응을 선택적으로 강화한다.
  • 최종 분할 출력은 모든 세 분기의 예측을 융합하여 도출되며, 정상 및 비정상 지식을 모두 통합하여 국소화 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1대상 클래스의 '반대'를 학습하는 것이 모호하거나 경계 영역에서 의미 분할 성능을 향상시키는가?
  • RQ2혼란스러운 공간 패턴에서 약한 반응을 강화하는 전용 역주의사전 메커니즘이 더 높은 분할 정확도를 이끌어내는가?
  • RQ3비대상 특징을 명시적으로 모델링하면 유사한 클래스 간 또는 객체와 배경 간의 혼동을 줄일 수 있는가?
  • RQ4표준 의미 학습과 역학습을 통합하면 다양한 데이터셋에서 일관된 성능 향상이 이루어지는가?
  • RQ5RAN 아키텍처는 PASCAL-Context, PASCAL VOC, NYUDv2 및 ADE20K와 같은 도전적인 벤치마크에서 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • RAN은 PASCAL-Context 데이터셋에서 최신 기준 성능인 48.1%의 평균 IoU를 달성하였으며, 기준 모델인 DeepLabv2-LargeFOV를 크게 앞서갔다.
  • PASCAL VOC2012 데이터셋에서 RAN은 기준 모델 대비 1.4% 향상된 평균 IoU를 기록하였으며, RAN-s는 80.5%, RAN-n는 80.4%를 기록하였다.
  • NYUDv2 데이터셋에서 RAN은 기준 모델인 DeepLabv2-LargeFOV 대비 약 3.9%포인트 향상되어 RAN-s는 41.2%, RAN-n는 40.7%의 평균 IoU를 기록하였다.
  • ADE20K 데이터셋에서 RAN은 RAN-s가 35.2%, RAN-n가 35.3%의 평균 IoU를 기록하였으며, 기준 모델인 DeepLabv2-LargeFOV 대비 약 2% 향상되었다.
  • NYUDv2에서의 정성적 결과는 RAN이 특히 겹치는 객체가 많은 복잡한 실내 환경에서 더 선명하고 정확한 예측을 생성함을 보여주었다.
  • 제거 실험 결과는 특히 저신뢰도 반응 영역에서 역주의사전 메커니즘이 성능 향상에 크게 기여함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.