Skip to main content
QUICK REVIEW

[논문 리뷰] Open Vocabulary Object Detection with Pseudo Bounding-Box Labels

Mingfei Gao, Xing Chen|arXiv (Cornell University)|2021. 11. 18.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 사전 훈련된 시각-언어 모델과 대규모 이미지-캡션 쌍을 사용하여 개방 범주 객체 검출을 위한 가짜 바운딩 박스 레이블을 생성하는 방법을 제안한다. 이러한 모델의 국소화 능력을 활용해 다양하고 확장 가능한 훈련 주석을 자동으로 생성함으로써, 기존의 인간 레이블링에 의존하지 않고도 새로운 카테고리에서 검출 성능을 향상시킨다. COCO의 새로운 카테고리에서 상태최저 기준(SOTA) 방법보다 8% mAP 향상되었으며, 기본 클래스에 대한 인간 레이블링된 박스가 필요하지 않다.

ABSTRACT

Despite great progress in object detection, most existing methods work only on a limited set of object categories, due to the tremendous human effort needed for bounding-box annotations of training data. To alleviate the problem, recent open vocabulary and zero-shot detection methods attempt to detect novel object categories beyond those seen during training. They achieve this goal by training on a pre-defined base categories to induce generalization to novel objects. However, their potential is still constrained by the small set of base categories available for training. To enlarge the set of base classes, we propose a method to automatically generate pseudo bounding-box annotations of diverse objects from large-scale image-caption pairs. Our method leverages the localization ability of pre-trained vision-language models to generate pseudo bounding-box labels and then directly uses them for training object detectors. Experimental results show that our method outperforms the state-of-the-art open vocabulary detector by 8% AP on COCO novel categories, by 6.3% AP on PASCAL VOC, by 2.3% AP on Objects365 and by 2.8% AP on LVIS. Code is available at https://github.com/salesforce/PB-OVD.

연구 동기 및 목표

  • 기존의 개방 범주 검출 방법이 기초 카테고리로 제한된 인간 레이블링된 소량의 데이터에 의존하는 데서 비롯되는 한계를 해결하기 위해.
  • 대규모 이미지-캡션 데이터셋에서 자동으로 가짜 레이블을 생성함으로써 고비용의 인간 레이블링된 바운딩 박스에 대한 의존도를 줄이기 위해.
  • 훈련 중에 사용하는 기초 카테고리의 다양성과 스케일을 확장함으로써 새로운 객체 카테고리로의 일반화 능력을 향상시키기 위해.
  • 가짜 바운딩 박스 레이블이 다양한 벤치마크 데이터셋에서 검출 성능 향상에 기여하는지 평가하기 위해.
  • 다양한 텍스트 인코더와 데이터 규모가 가짜 레이블의 품질과 일반화 능력에 미치는 영향을 조사하기 위해.

제안 방법

  • 이미지 캡션에 언급된 객체에 대응하는 활성화 맵(Grad-CAM를 통해)을 사전 훈련된 시각-언어 모델을 활용해 생성한다.
  • 이 활성화 맵을 이미지-캡션 쌍에 해당하는 객체 카테고리에 대응하는 가짜 바운딩 박스 레이블로 변환한다.
  • 자동으로 생성된 가짜 레이블을 사용해 개방 범주 객체 검출기를 훈련시켜, 새로운 카테고리로의 일반화 능력을 향상시킨다.
  • 사용 가능한 경우 인간 레이블링된 박스로 검출기를 미세조정하지만, 이러한 미세조정이 없어도 본 방법은 여전히 효과가 있다.
  • 가짜 레이블 생성 과정을 대규모 이미지-캡션 데이터셋(예: COCO Captions)으로 확장하여 기초 카테고리의 다양성과 수를 늘린다.
  • 최종 검출기 성능에 영향을 주는 다양한 텍스트 인코더(예: CLIP 대비 BERT)와 데이터 볼륨의 영향을 평가한다.

실험 결과

연구 질문

  • RQ1이미지-캡션 쌍에서 유도된 가짜 바운딩 박스 레이블이 개방 범주 객체 검출 성능을 향상시키는가?
  • RQ2가짜 레이블링된 기초 카테고리의 규모와 다양성이 새로운 카테고리로의 검출 일반화에 어떤 영향을 미치는가?
  • RQ3사전 훈련된 시각-언어 모델의 국소화 능력을 활용하면 인간 레이블링 기반 기준보다 더 정확하고 일반화 능력이 뛰어난 가짜 레이블을 얻을 수 있는가?
  • RQ4텍스트 인코더 선택(예: CLIP 대비 BERT)이 생성된 가짜 레이블의 품질과 최종 검출 성능에 어떤 영향을 미치는가?
  • RQ5인간 레이블링된 기초 카테고리에 대한 미세조정 없이도 이 방법이 상태최저 기준(SOTA) 개방 범주 검출기보다 우수한 성능을 낼 수 있는가?

주요 결과

  • 두 모델 모두 COCO 기초 카테고리로 미세조정된 경우, 제안된 방법은 COCO의 새로운 카테고리에서 상태최저 기준(SOTA) 방법보다 mAP가 8% 높게 기록한다.
  • COCO 기초 카테고리로의 미세조정 없이도, 제안된 방법은 COCO의 새로운 카테고리에서 미세조정된 SOTA 기준보다 mAP가 3% 높게 기록한다.
  • 사전 훈련 단계에서 COCO를 초월한 더 큰 객체 카테고리 어휘를 사용할 경우, Objects365에서 2.3% 향상되고 LVIS에서 2.7% 향상된다.
  • 가짜 레이블 생성에 사용된 이미지-캡션 데이터의 양을 늘일수록 목표 데이터셋에서 검출 성능이 약 2% 향상된다.
  • CLIP를 텍스트 인코더로 사용한 방법이 BERT를 사용한 방법보다 약간 우수한 성능을 보이며, 성능 향상의 주요 원인이 인코더 선택이 아니라 가짜 레이블의 규모와 다양성임을 시사한다.
  • 정성적 결과는 가짜 레이블 생성기가 COCO 원래 카테고리 목록에 포함되지 않은 객체들(예: 슬리퍼, 냄비, 피자)까지도 성공적으로 국소화하고 있음을 보여주며, 이는 어휘 외 객체로의 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.