Skip to main content
QUICK REVIEW

[논문 리뷰] AdaZoom: Adaptive Zoom Network for Multi-Scale Object Detection in Large Scenes

Jingtao Xu, Yali Li|arXiv (Cornell University)|2021. 06. 19.
Advanced Neural Network Applications참고 문헌 46인용 수 14
한 줄 요약

AdaZoom는 대규모 환경에서 다중 척도 객체 검출을 위해 유연한 크기와 종횡비를 가진 동적 집중 영역을 강화 학습 기반으로 생성하는 적응형 줌 네트워크를 제안한다. 정 politie 그라디언트 최적화와 공동 학습을 통해 기존 방법 대비 VisDrone2019에서 AP를 4.64% 향상시켜 최신 기술 수준을 확립한다. 추가 애너테이션 없이도 성능 향상을 달성한다.

ABSTRACT

Detection in large-scale scenes is a challenging problem due to small objects and extreme scale variation. It is essential to focus on the image regions of small objects. In this paper, we propose a novel Adaptive Zoom (AdaZoom) network as a selective magnifier with flexible shape and focal length to adaptively zoom the focus regions for object detection. Based on policy gradient, we construct a reinforcement learning framework for focus region generation, with the reward formulated by object distributions. The scales and aspect ratios of the generated regions are adaptive to the scales and distribution of objects inside. We apply variable magnification according to the scale of the region for adaptive multi-scale detection. We further propose collaborative training to complementarily promote the performance of AdaZoom and the detection network. To validate the effectiveness, we conduct extensive experiments on VisDrone2019, UAVDT, and DOTA datasets. The experiments show AdaZoom brings a consistent and significant improvement over different detection networks, achieving state-of-the-art performance on these datasets, especially outperforming the existing methods by AP of 4.64% on Vis-Drone2019.

연구 동기 및 목표

  • 대규모 항공 영상에서 작은 객체, 밀집 객체 및 극도로 다양한 척도의 객체를 탐지하는 과제를 해결한다.
  • 고정 척도 또는 다중 척도 이미지 피라미드의 한계를 극복하여 학습과 추론 간 적응성과 일관성이 부족한 문제를 해결한다.
  • 집중 영역에 대한 추가 애너테이션 없이도 관련 영역을 선택적으로 확대할 수 있는 방법을 개발한다.
  • 공동 학습을 통한 줌 네트워크와 검출기의 공동 최적화를 통해 검출 성능을 향상시킨다.

제안 방법

  • AdaZoom는 시각적 특징 기반으로 적응형 집중 영역을 생성하기 위해 정책 그래디언트 기반 강화 학습 프레임워크를 사용하며, 보상은 객체 분포 품질에서 유도된다.
  • 네트워크는 집중 영역 내 객체의 공간 분포와 크기에 맞게 스케일과 종횡비를 동적으로 조정한다.
  • 콘텐츠에 따라 각 집중 영역에 대해 가변적인 확대를 적용함으로써 줌 영역 내에서 다중 척도 검출이 가능해진다.
  • 공동 학습은 AdaZoom가 생성한 영역에서 검출기를 개선하고, 검출 피드백을 활용해 AdaZoom이 검출이 어려운 영역을 우선순위로 삼도록 유도하는 방식으로 번갈아가며 수행된다.
  • 학습과 추론 모두 통합된 파이프라인을 통해 엔드 투 엔드로 작동하여 단계 간 일관성 문제를 방지한다.
  • 집중 영역에 대한 추가 애너테이션이 필요 없으며, 시스템은 검출 성능 기반 보상 신호만으로 학습된다.

실험 결과

연구 질문

  • RQ1강화 학습 기반 시스템이 대규모 환경에서 작은 객체와 밀집 객체의 검출을 향상시키기 위해 적응형 집중 영역을 생성할 수 있는가?
  • RQ2집중 영역의 적응형 스케일 및 종횡비 조정이 다중 척도 검출 성능에 어떤 영향을 미치는가?
  • RQ3줌 네트워크와 검출기 간의 공동 학습이 전체 검출 정확도 향상에 얼마나 기여하는가?
  • RQ4제안된 방법이 추가 기능 없이도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • AdaZoom는 기존 방법 대비 VisDrone2019 데이터셋에서 AP를 4.64%p 절대적으로 향상시켜 최신 기술 수준의 성능을 확립했다.
  • 적응형 스케일과 종횡비 메커니즘은 고정 영역 기반 베이스라인 대비 AP를 0.77%p 향상시키며, 공동 학습과 조합 시 추가로 1.23%p 성능 향상을 기록했다.
  • 적응형 영역 생성과 함께 공동 학습을 적용할 경우 AP는 0.71%p, AP75는 1.00%p 향상되어 상호보완적 성과를 보였다.
  • 7개의 집중 영역을 사용할 경우, 소형 객체에 대해 95.1%의 리콜을 달성하여 가장 도전적인 인스턴스에 효과적으로 집중함을 시사한다.
  • 정확도와 추론 효율성 간 균형을 유지하며, 추론 시간은 집중 영역 수에 따라 선형적으로 증가한다.
  • 정성적 결과에서는 AdaZoom이 작은 객체와 밀집 객체를 효과적으로 타겟팅하며, 전체 이미지 추론 대비 줌 영역에서의 검출 성능 향상이 뚜렷하게 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.