Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Object Detection with Inverted Attention

Zeyi Huang, Wei Ke|arXiv (Cornell University)|2019. 03. 28.
Advanced Neural Network Applications참고 문헌 17인용 수 6
한 줄 요약

이 논문은 경량의 훈련 모듈인 Inverted Attention (IA)를 제안한다. IA는 기울기 기반 피드백을 사용해 특징 맵의 공간적 및 채널 차원을 반복적으로 주의를 뒤집음으로써 객체 검출기의 성능을 향상시킨다. 추가 파라미터나 추론 오버헤드 없이도, IA는 가림, 흐림, 노이즈에 대한 강건성을 향상시키며, 이중 및 단일 단계 검출기에서 PASCAL VOC2012에서 최대 5.4%의 mAP 향상을, COCO2017에서는 2.1%의 mAP 향상을 일관되게 달성한다.

ABSTRACT

Improving object detectors against occlusion, blur and noise is a critical step to deploy detectors in real applications. Since it is not possible to exhaust all image defects through data collection, many researchers seek to generate hard samples in training. The generated hard samples are either images or feature maps with coarse patches dropped out in the spatial dimensions. Significant overheads are required in training the extra hard samples and/or estimating drop-out patches using extra network branches. In this paper, we improve object detectors using a highly efficient and fine-grain mechanism called Inverted Attention (IA). Different from the original detector network that only focuses on the dominant part of objects, the detector network with IA iteratively inverts attention on feature maps and puts more attention on complementary object parts, feature channels and even context. Our approach (1) operates along both the spatial and channels dimensions of the feature maps; (2) requires no extra training on hard samples, no extra network parameters for attention estimation, and no testing overheads. Experiments show that our approach consistently improved both two-stage and single-stage detectors on benchmark databases.

연구 동기 및 목표

  • 훈련 데이터에서 철저히 포괄하기 어려운 실제 이미지 결함, 예를 들어 가림, 흐림, 노이즈 등에 대한 객체 검출기의 강건성을 향상시키기 위해.
  • 하드 샘플 생성 및 주의 추정과 같은 기존 방법의 한계를 해결하기 위해, 추가 훈련 데이터, 파라미터, 또는 추론 오버헤드가 필요로 하지 않는 방법을 개발하기 위해.
  • 훈련 중에 주의를 보완되는 객체 부분, 채널 및 맥락에 유도함으로써 특징 다양성을 향상시키는 메커니즘 개발을 위해.
  • 아키텍처 수정 없이도 추론 비용을 추가하지 않고 이중 및 단일 단계 검출기 모두에서 일관된 성능 향상을 달성하기 위해.

제안 방법

  • IA는 백프로파게이션 중에 백본 네트워크의 분류 점수에 대해 특징 맵의 기울기를 계산함으로써 작동한다.
  • 기울기 기반 주의 맵을 특징 맵의 공간적 및 채널 차원을 반복적으로 뒤집음으로써 주의를 뒤집는다.
  • 주의 뒤집기는 훈련 중에만 적용되며, 추론 효율성을 유지하고 추가 네트워크 파라미터가 필요로 하지 않는다.
  • 표준 검출기인 Faster R-CNN과 SSD에 이 방법을 통합하기 위해 훈련 루프를 수정하여 기울기 기반 주의 뒤집기를 포함시킨다.
  • 이 모듈은 이중 단계 검출기의 경우 ROI 특징 맵 수준에서, 단일 단계 검출기의 경우 전체 특징 맵에 걸쳐 적용된다.
  • 이 과정은 네트워크가 이전에 간과된 객체 부분, 채널 및 맥락적 특징에 주의를 기울이도록 유도하여 특징 다양성을 향상시킨다.

실험 결과

연구 질문

  • RQ1가벼우면서도 파라미터가 없는 훈련 모듈이 가림 및 흐림과 같은 이미지 결함에 대한 객체 검출기의 강건성을 향상시킬 수 있는가?
  • RQ2공간적 및 채널 차원을 가로질러 백프로파게이션 중 주의를 뒤집는 것이 더 포괄적인 특징 학습을 이끌 수 있는가?
  • RQ3이러한 메커니즘이 추론 비용을 추가하지 않고도 이중 및 단일 단계 검출기 모두에서 성능 향상을 이룰 수 있는가?
  • RQ4하드 샘플 생성 및 주의 추정과 비교했을 때, IA의 성능 및 훈련 오버헤드는 어떻게 되는가?
  • RQ5IA는 다양한 데이터셋에서 소형, 중형, 대형 객체의 검출 성능을 향상시키는가?

주요 결과

  • ResNet101을 사용한 PASCAL VOC2012에서, IA는 Faster R-CNN의 mAP를 73.8%에서 79.2%로 향상시켜 5.4%의 절대 향상을 달성했다.
  • COCO2017에서, IA는 ResNet101을 사용한 Faster R-CNN의 mAP를 35.5%에서 35.5%로 유지했고, VGG16를 사용한 SSD512의 mAP는 28.8%에서 29.6%로 향상시켰다.
  • VOC2007에서 VGG16를 사용한 Faster R-CNN의 경우, IA는 mAP를 69.1%에서 71.6%로 향상시켜 2.5%의 상대적 향상을 달성했다.
  • IA는 VOC2012의 19개 객체 카테고리와 COCO2017의 14개 카테고리에서 일관되게 검출 성능을 향상시켜 광범위한 적용 가능성을 입증했다.
  • Faster R-CNN에서는 중형 및 대형 객체에서, SSD512에서는 소형 및 중형 객체에서 성능 향상을 보였으며, 이는 맥락 인식 특징 학습을 의미한다.
  • 시각화 결과, IA로 훈련된 네트워크는 더 포괄적인 객체 영역과 특징에 주의를 기울이며 주로 우세한 부분에 과도하게 의존하는 것을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.