Skip to main content
QUICK REVIEW

[논문 리뷰] Scale-aware Automatic Augmentation for Object Detection

Yukang Chen, Yanwei Li|arXiv (Cornell University)|2021. 03. 31.
Advanced Neural Network Applications참고 문헌 49인용 수 8
한 줄 요약

이 논문은 새로운 스케일 인식 검색 공간 내에서 이미지 수준(확대/축소)과 박스 수준(스케일 적응형 영역 비율) 증강을 동시에 최적화하는 자동 데이터 증강 방법인 Scale-aware AutoAug를 제안한다. 효율적인 검색을 위해 파레토 스케일 밸런스 지표를 도입함으로써 기존 방법 대비 40배 낮은 검색 비용으로도 최신 기준 성능을 달성하며, COCO에서 최대 1.0% 향상된 AP를 기록하고 인스턴스 세그멘테이션 및 키포인트 검출로의 전이도 효과적으로 이루어진다.

ABSTRACT

We propose Scale-aware AutoAug to learn data augmentation policies for object detection. We define a new scale-aware search space, where both image- and box-level augmentations are designed for maintaining scale invariance. Upon this search space, we propose a new search metric, termed Pareto Scale Balance, to facilitate search with high efficiency. In experiments, Scale-aware AutoAug yields significant and consistent improvement on various object detectors (e.g., RetinaNet, Faster R-CNN, Mask R-CNN, and FCOS), even compared with strong multi-scale training baselines. Our searched augmentation policies are transferable to other datasets and box-level tasks beyond object detection (e.g., instance segmentation and keypoint estimation) to improve performance. The search cost is much less than previous automated augmentation approaches for object detection. It is notable that our searched policies have meaningful patterns, which intuitively provide valuable insight for human data augmentation design. Code and models will be available at https://github.com/Jia-Research-Lab/SA-AutoAug.

연구 동기 및 목표

  • 객체 검출에서의 스케일 변동성 문제를 해결하기 위해 이미지 수준과 박스 수준의 스케일 변동을 명시적으로 고려하는 데이터 증강 전략을 개발한다.
  • 수작업으로 설계된 또는 이전에 학습된 증강 정책의 한계를 극복하여 이미지 공간과 객체 박스 공간 양쪽에서의 스케일 인식 능력을 충분히 활용하지 못하는 문제를 해결한다.
  • 객체 검출에서 자동 증강 검색의 높은 계산 비용을 줄이면서도 성능을 유지하거나 향상시킨다.
  • 효율적이고 확장 가능하며 다양한 검출기와 작업으로의 전이가 가능한 증강 정책을 가능하게 하는 검색 공간과 평가 지표를 설계한다.
  • 해석 가능하고 의미 있는 증강 패턴을 제공하여 인간이 설계한 데이터 증강 전략에 통찰을 제공한다.

제안 방법

  • 이미지 수준의 확대/축소 작업과 학습 가능한 확률 및 크기, 박스 수준의 증강을 스케일 적응형 영역 비율로 파arameter화한 스케일 인식 검색 공간을 도입한다.
  • 검증 정확도와 다중 스케일에서의 누적 손실을 기반으로 정책을 평가하는 새로운 검색 지표인 파레토 스케일 밸런스를 제안하며, 이는 실제 성능과의 상관관계를 기존의 프록시 정확도보다 향상시킨다.
  • 스케일 인식 검색 공간 내에서 강화 학습 또는 NAS 유사 최적화 기법을 사용해 고성능 증강 정책을 탐색한다.
  • 증강 과정에서 공간적 맥락을 유지하기 위해 가우시안 맵을 활용해 증강된 이미지를 일반화한다.
  • RetinaNet, Faster R-CNN, FCOS, Mask R-CNN 등의 앵커 기반 및 앵커리스 검출기를 사용하여 MS COCO, Pascal VOC 등의 객체 검출 벤치마크에서 정책을 훈련 및 검증한다.
  • 설계된 정책을 앵커 기반 및 앵커리스 검출기로의 전이 없이도 인스턴스 세그멘테이션 및 키포인트 추론과 같은 관련 박스 수준 작업에 적용한다.

실험 결과

연구 질문

  • RQ1이미지 수준과 박스 수준의 증강을 스케일 인식 파rameter와 함께 통합한 단일 검색 공간이 객체 검출 성능 향상에 기여하는가?
  • RQ2다중 스케일에서의 스케일 밸런스 성능에 기반한 새로운 검색 지표가 기존의 프록시 정확도보다 효율적인 증강 검색을 이끄는가?
  • RQ3검색된 증강 정책이 다양한 객체 검출기와 데이터셋, 심지어 객체 검출을 초월한 작업으로도 일반화 가능한가?
  • RQ4학습된 증강 정책에서 어떤 의미 있는 패턴이 드러나며, 이를 인간이 설계한 데이터 증강 전략에 통찰을 제공할 수 있는가?
  • RQ5Scale-aware AutoAug는 스케일 불변성을 확보하기 위해 피처 피라미드(FPN)와 같은 아키텍처 구성 요소를 얼마나 대체하거나 대체할 수 있는가?

주요 결과

  • ResNet-50를 사용할 때 Scale-aware AutoAug는 RetinaNet에서 41.3% AP, Faster R-CNN에서 41.8% AP, FCOS에서 42.6% AP를 기록하며 강력한 베이스라인을 크게 초월한다.
  • ResNeXt-32x8d-101-DCN을 사용한 강력한 FCOS 베이스라인에서 Scale-aware AutoAug는 단일 스케일 테스트 시 AP를 47.5%에서 48.5%로 1.0% 향상시켰으며, 더 큰 훈련 이미지를 사용하면 49.6%까지 상승한다.
  • 다중 스케일 테스트를 적용할 경우, 개선된 FCOS 모델은 51.4% AP를 기록하여 동일한 백본에서 SNIPER의 46.1% AP와 SNIP의 47.0% AP를 뛰어넘는다.
  • 이 방법은 검색 비용을 20 GPU일로 줄여 기존의 AutoAug-det와 같은 이전 작업의 400 TPU일 대비 40배 감소시켰다.
  • 학습된 정책은 해석 가능한 패턴을 보이며, 확대 축소가 선호되며(더 높은 확률과 크기), 객체의 스케일이 증가할수록 영역 비율이 감소하고, 기하학적 변환 작업이 색상 변환 작업보다 지배적이다.
  • Scale-aware AutoAug는 Faster R-CNN에서 FPN을 대체할 수 있으며, 네트워크 수정 없이도 순수한 ResNet-50-C4 베이스라인에서 AP를 34.7%에서 36.8%로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.