Skip to main content
QUICK REVIEW

[논문 리뷰] Complementary datasets to COCO for object detection

Ali Borji|arXiv (Cornell University)|2022. 06. 23.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 COCO 객체 검출 벤치마크에서 성능 포화 문제를 해결하기 위해 상호보완적인 두 데이터셋인 COCO_OI와 ObjectNet_D를 소개한다. COCO_OI는 COCO와 OpenImages(80개의 공통 클래스)를 조합하여 훈련 데이터를 80% 증가시킨다. ObjectNet_D는 일반적인 시각적 조건과 다양한 시점에서의 실제 세계 이미지를 제공하여 일반화 성능을 테스트한다. 모델들은 이 두 데이터셋에서 뚜렷한 성능 저하를 보이며, COCO를 넘어서는 내성적 안정성과 일반화 능력의 한계를 드러낸다.

ABSTRACT

For nearly a decade, the COCO dataset has been the central test bed of research in object detection. According to the recent benchmarks, however, it seems that performance on this dataset has started to saturate. One possible reason can be that perhaps it is not large enough for training deep models. To address this limitation, here we introduce two complementary datasets to COCO: i) COCO_OI, composed of images from COCO and OpenImages (from their 80 classes in common) with 1,418,978 training bounding boxes over 380,111 images, and 41,893 validation bounding boxes over 18,299 images, and ii) ObjectNet_D containing objects in daily life situations (originally created for object recognition known as ObjectNet; 29 categories in common with COCO). The latter can be used to test the generalization ability of object detectors. We evaluate some models on these datasets and pinpoint the source of errors. We encourage the community to utilize these datasets for training and testing object detection models. Code and data is available at https://github.com/aliborji/COCO_OI.

연구 동기 및 목표

  • COCO에서의 성능 포화 문제를 해결하기 위해 더 크고 다양한 데이터셋을 훈련 및 평가에 활용하기 위해 도입한다.
  • 다양한 시점과 배경을 가진 일상적인 물체 시나리오를 포함시켜 모델의 일반화 능력을 향상시킨다.
  • 기존 COCO 벤치마크를 넘어서서 객체 검출기의 실패 모드를 진단할 수 있는 검증 세트를 구축한다.
  • 학계가 이 데이터셋을 활용하여 객체 검출 모델의 내성적 안정성 향상을 위한 훈련 및 평가를 장려한다.

제안 방법

  • COCO_OI는 COCO와 OpenImages를 80개의 공통 클래스를 기반으로 융합하여 제작되며, 빈도가 높은 클래스(사람, 자동차, 의자 등)를 제외하여 데이터 불균형을 방지한다.
  • OpenImages의 이미지는 가로세로 비율을 유지하면서 최대 640픽셀의 크기로 조정되어 COCO의 이미지 크기 분포와 호환되도록 한다.
  • ObjectNet_D는 ObjectNet 데이터셋의 5,875개 이미지를 수작업으로 레이블링하여 제작되었으며, COCO와 공통된 29개의 카테고리와 하나의 객체만 포함된 이미지로 구성된다.
  • TIDE라는 성능 진단 도구를 활용하여 체계적인 오류 분석이 가능한 새로운 검증 세트를 각 데이터셋에 마련한다.
  • OpenImages와 ObjectNet의 카테고리가 COCO의 80개 클래스와 일치하도록 클래스 매핑을 정의하여 다중 데이터셋 평가를 가능하게 한다.
  • ObjectNet_D에 대한 모델 미세조정 제한 조건을 포함한 완전한 라이선싱 정보를 함께 공개한다.

실험 결과

연구 질문

  • RQ1COCO와 OpenImages를 융합하면 더 크고 다양한 훈련 데이터셋을 확보할 수 있으며, 이로 인해 객체 검출 성능이 향상될 수 있는가?
  • RQ2최신 기술의 객체 검출기는 다양한 시점과 배경을 가진 실제 세계의 일상적인 물체 시나리오에 얼마나 잘 일반화되는가?
  • RQ3COCO_OI와 ObjectNet_D에서 평가했을 때 현재의 검출기들이 보이는 주요 실패 모드는 무엇인가?
  • RQ4ObjectNet_D에서 전용 검증 세트를 통해 모델의 내성적 안정성과 일반화 능력의 한계를 효과적으로 진단할 수 있는가?

주요 결과

  • EfficientDet는 COCO에서 51.2 AP를 기록했지만, COCO_OI에서는 44.0 AP로 뚜렷한 성능 저하를 보였다.
  • ObjectNet_D에서는 EfficientDet의 AP가 23.9로 떨어졌으며, AP_S는 0.0으로 떨어져 소형 객체에 대한 심각한 실패 원인을 드러냈다. 이는 큰 객체 크기와 복잡한 배경이 영향을 미쳤다.
  • DetectoRS도 유사한 경향을 보였으며, COCO_OI에서는 51.5 AP, ObjectNet_D에서는 20.3 AP를 기록하여 내성적 문제의 모델 독립성(모델에 관계없이 발생)을 확인했다.
  • TIDE를 활용한 오류 분석 결과, 모델은 소형 객체와 복잡한 장면에서 더 많이 실패하며, 특히 ObjectNet_D에서는 큰 객체가 이상적인 각도에서 촬영된 경우에 더 심각한 실패를 보였다.
  • ObjectNet_D에서의 성능 저하—특히 근처의 0에 가까운 AP_S—는 현재의 검출기가 혼잡한 실제 세계 장면에서 소형 객체를 처리하는 데 어려움을 겪고 있음을 시사한다.
  • 본 연구는 데이터 다양성과 실제 세계의 변동성이 일반화 능력 향상에 핵심적임을 확인하였으며, 현재의 벤치마크(예: COCO)는 객체 검출 과제의 전반적인 과제를 충분히 반영하지 못하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.