Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Coarse-to-Fine Non-Local Module for the Detection of Small Objects

Hila Levi, Shimon Ullman|arXiv (Cornell University)|2018. 11. 29.
Advanced Neural Network Applications참고 문헌 61인용 수 8
한 줄 요약

이 논문은 객체 검출 네트워크의 상향식 스트림에 통합된 효율적인 코arse-to-fine 비국소 모듈을 제안하여 소형 객체 검출을 향상시킨다. 증가하는 해상도에서 메모리 최적화된 비국소 블록을 적용함으로써, 더 큰 객체에서 더 작은 객체로의 장거리 맥락적 추론이 가능해지고, 클래스 반복을 활용하여 표준 비국소 모듈을 사용한 Faster R-CNN 및 Mask R-CNN에 비해 COCO에서 소형 객체 검출에 1–2 AP 포인트 향상된다.

ABSTRACT

An image is not just a collection of objects, but rather a graph where each object is related to other objects through spatial and semantic relations. Using relational reasoning modules, such as the non-local module \cite{wang2017non}, can therefore improve object detection. Current schemes apply such dedicated modules either to a specific layer of the bottom-up stream, or between already-detected objects. We show that the relational process can be better modeled in a coarse-to-fine manner and present a novel framework, applying a non-local module sequentially to increasing resolution feature maps along the top-down stream. In this way, information can naturally passed from larger objects to smaller related ones. Applying the module to fine feature maps further allows the information to pass between the small objects themselves, exploiting repetitions of instances of the same class. In practice, due to the expensive memory utilization of the non-local module, it is infeasible to apply the module as currently used to high-resolution feature maps. We redesigned the non local module, improved it in terms of memory and number of operations, allowing it to be placed anywhere along the network. We further incorporated relative spatial information into the module, in a manner that can be incorporated into our efficient implementation. We show the effectiveness of our scheme by improving the results of detecting small objects on COCO by 1-2 AP points over Faster and Mask RCNN and by 1 AP over using non-local module on the bottom-up stream.

연구 동기 및 목표

  • 특징 맵 내에서 장거리 공간적 및 의미적 관계를 모델링하여 소형 객체 검출을 향상시키기.
  • 검출 네트워크의 고해상도 특징 맵에 표준 비국소 모듈을 적용할 경우 발생하는 높은 메모리 및 계산 비용 문제를 해결하기.
  • 코어스-투-파인 처리 전략을 통해 소형 객체 간 및 소형 객체와 관련된 더 큰 객체 간의 효과적인 관계 추론을 가능하게 하기.
  • 메모리 효율적인 비국소 모듈에 상대적 공간 인코딩을 통합하여 계산 오버헤드 없이 특징 표현을 향상시키기.
  • 비국소 모듈을 상향식 스트림에 적용하는 것이 하향식 스트림에 적용하는 것보다 소형 객체 검출 성능에서 더 우수한 결과를 낳는다는 것을 입증하기.

제안 방법

  • 주의 계산을 분해하고 군집화 연산을 사용하여 메모리와 FLOPs를 감소시킨 효율적인 비국소(ENL) 모듈을 제안한다.
  • 특징 피라미드 네트워크(FPN)의 상향식 경로에 따라 ENL 모듈을 순차적으로 통합하며, 각 상향식 업샘플링 레이어 이전에 배치한다.
  • 학습 가능한 위치 임베딩을 사용하여 상대적 공간 인코딩을 주의 메커니즘에 통합하여 정위치 정확도를 향상시킨다.
  • 다중 해상도(Res3, Res4, Res5)에서 ENL 모듈을 적용하여 고수준 맥락에서 세부 특징으로의 코어스-투-파인 추론를 가능하게 한다.
  • Batch normalization을 ENL 블록 내부에 포함시키지 않고, ResNet-50 및 FPN를 사용한 표준 Faster R-CNN 및 Mask R-CNN 백본을 사용해 엔드 투 엔드로 훈련한다.
  • 모든 ENL 모듈 간에 공유된 가벼운 주의 헤드를 사용하여 효율성을 유지하면서도 다중 해상도 특징 간 상호작용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1상향식 스트림을 따라 코어스-투-파인 방식으로 비국소 모듈을 적용하면 장거리 맥락을 활용하여 소형 객체 검출을 향상시킬 수 있는가?
  • RQ2표준 비국소 모듈의 높은 메모리 비용을 어떻게 줄여야 고해상도 특징 맵에 적용 가능한가?
  • RQ3비국소 주의 메커니즘에 상대적 공간 정보를 통합하면 소형 및 겹치는 객체의 검출 성능이 향상되는가?
  • RQ4동일한 클래스의 반복적인 인스턴스가 특징 공간 내의 관계 추론를 통해 소형 객체 검출에 효과적으로 활용될 수 있는가?
  • RQ5비국소 추론을 통한 상향식 조절이 객체 검출 벤치마크에서 하향식 통합보다 성능이 뛰어나게 되는가?

주요 결과

  • 제안된 ENL 모듈은 표준 Faster R-CNN 및 Mask R-CNN에 비국소 모듈을 하향식 스트림에 적용한 경우에 비해 COCO에서 소형 객체의 AP를 1–2 포인트 향상시킨다.
  • ENL 모듈의 코어스-투-파인 적용은 더 큰 관련 객체가 존재할 경우 소형 객체 검출을 가능하게 한다(예: 바다에서 수영하는 사람을 찾는 데 해안에 있는 사람들의 존재가 도움이 된다).
  • 비국소 주의 메커니즘을 통해 반복 패턴을 활용하여 동일한 클래스의 다중 겹침 인스턴스(예: 무리의 새들)를 성공적으로 검출한다.
  • ENL 모듈에 상대적 공간 인코딩을 통합함으로써, 특히 소형이고 서로 가까이 있는 객체가 많은 조밀한 장면에서 정위치 정확도가 향상된다.
  • ENL 모듈의 효율적인 설계 덕분에 높은 해상도의 저수준 특징 맵에 적용해도 금기할 만한 메모리 비용 없이 효과적인 장거리 특징 집약이 가능해졌다.
  • 정성적 결과는 저조도 조건이나 높은 객체 밀도를 가진 어려운 장면에서도 더 정확하고 완전한 영역 제안 및 검출 결과를 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.