Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Gaussian Maps for Dense Object Detection

Sonaal Kant|arXiv (Cornell University)|2020. 04. 24.
Advanced Neural Network Applications참고 문헌 28인용 수 5
한 줄 요약

이 논문은 레티나넷에서 가우시안 맵을 보조 작업으로 도입하여 다중 작업 학습 접근법을 제안함으로써 고밀도 객체 검출 성능을 향상시킨다. 픽셀 단위의 객체 존재 가능성 맵을 예측하기 위해 가우시안 디코더 또는 가우시안 레이어를 학습시킴으로써, 혼잡한 장면에서의 국소화 정확도가 향상되며, 이는 SKU110K 데이터셋에서 기준 레티나넷 대비 각각 6% 및 5%의 mAP 향상을 이룬다.

ABSTRACT

Object detection is a famous branch of research in computer vision, many state of the art object detection algorithms have been introduced in the recent past, but how good are those object detectors when it comes to dense object detection? In this paper we review common and highly accurate object detection methods on the scenes where numerous similar looking objects are placed in close proximity with each other. We also show that, multi-task learning of gaussian maps along with classification and bounding box regression gives us a significant boost in accuracy over the baseline. We introduce Gaussian Layer and Gaussian Decoder in the existing RetinaNet network for better accuracy in dense scenes, with the same computational cost as the RetinaNet. We show the gain of 6\% and 5\% in mAP with respect to baseline RetinaNet. Our method also achieves the state of the art accuracy on the SKU110K \cite{sku110k} dataset.

연구 동기 및 목표

  • 유사한 객체들이 서로 가까이 밀집되어 있는 고밀도 객체 검출 문제를 해결함으로써, 겹치는 바운딩 박스와 열악한 국소화 성능을 개선한다.
  • 소매 및 슈퍼마켓 환경에서 높은 객체 밀도로 인한 일반화 및 강인성 향상을 위해 객체 검출기 성능을 향상시킨다.
  • 다중 작업 학습을 통해 고밀도 장면에서의 전경-배경 클래스 불균형 및 척도 변동성 문제를 해결한다.
  • 앵커 학습을 안내하고 경계 예측 성능을 향상시키기 위해 새로운 보조 작업인 가우시안 맵 학습을 제안한다.
  • 추론 비용을 증가시키지 않고도 SKU110K 및 기타 식료품 제품 데이터셋에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 레티나넷의 백본과 공유하는 가우시안 디코더 네트워크를 도입하며, 저해상도 가우시안 히트맵을 예측하기 위한 별도의 디코더 헤드를 추가한다.
  • 표준 디코더를 대체하는 경량 가우시안 레이어를 공유 디코더 위에 배치한 가우시안 레이어 네트워크를 설계하여 파라미터를 감소시키면서도 성능를 유지한다.
  • 분류, 바운딩 박스 회귀, 그리고 새로운 가우시안 맵 손실을 조합한 다중 작업 손실을 통해 네트워크를 종합적으로 학습시킨다.
  • 분류에는 포칼 손실을, 회귀에는 스무스 L1 손실을 사용하며, 동시에 히트맵 예측을 위한 픽셀 단위의 가우시안 교차 엔트로피 손실을 도입한다.
  • 객체 중심 부근 이외의 영역에 낮은 존재 가능성 확률을 할당하도록 네트워크를 강제하여, 앵커가 진짜 객체 중심에 집중하고 오분류를 줄이는 데 기여한다.
  • 공유 특징과 경량 추가 요소를 사용함으로써 기준 레티나넷과 동일한 계산 비용을 유지한다.

실험 결과

연구 질문

  • RQ1가우시안 맵 예측을 포함한 다중 작업 학습이 고밀도 장면에서 객체 검출 정확도를 향상시키는가?
  • RQ2픽셀 단위의 객체 존재 가능성 맵 학습이 겹치는 바운딩 박자를 줄이고 혼잡한 장면에서의 국소화 성능을 향상시키는가?
  • RQ3경량 가우시안 레이어가 전체 디코더 헤드를 대체할 수 있으며 성능을 유지하거나 향상시킬 수 있는가?
  • RQ4SKU110K 및 웹마켓과 같은 벤치마크 데이터셋에서 제안된 방법이 최신 기술 수준의 검출기와 비교해 어떻게 성능을 내는가?
  • RQ5홀로세렉타와 같은 데이터셋에서 성능 저하가 발생하는 이유는 무엇이며, 척도 인식 훈련을 통해 이를 완화할 수 있는가?

주요 결과

  • 가우시안 레이어 네트워크는 SKU110K 데이터셋에서 기준 레티나넷 대비 6%의 mAP 향상을 달성했으며, mAP는 0.506에 도달했다.
  • 가우시안 디코더 네트워크는 레티나넷 대비 5%의 mAP 향상을 기록했으며, SKU110K에서 mAP는 0.506에 도달했으며, 이는 이전 최신 기술 수준 대비 3% 향상된 성능이다.
  • 웹마켓 데이터셋에서 가우시안 레이어 모델은 mAP 0.403을 기록했으며, 이는 이전 최신 기술 수준(0.383) 대비 2% 향상된 성능이다.
  • CAPG-GP 데이터셋에서 가우시안 레이어 모델은 mAP 0.510을 기록했으며, 이는 이전 최신 기술 수준(0.431) 대비 7.4% 상대적 향상이다.
  • 가지각 및 CAPG-GP와 같은 덜 밀도 있는 데이터셋에서는 성능 향상이 두드러지지만, 척도 변동성과 이미지 해상도 다양성으로 인해 홀로세렉타에서는 성능 저하가 발생한다.
  • 가우시안 레이어가 배경 혼동을 줄이고 앵커 품질을 향상시켜, 겹치는 객체를 더 잘 구분하는 것으로 질적 결과에서 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.