Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Open Vocabulary Object Detection without Human-provided Bounding Boxes

Mingfei Gao, Xing Chen|arXiv (Cornell University)|2021. 11. 18.
Multimodal Machine Learning Applications참고 문헌 34인용 수 7
한 줄 요약

이 논문은 인간이 제공한 바운딩 박스가 없는 환경에서 사전 훈련된 시각-언어 모델을 활용해 고품질의 가짜 바운딩 박스 레이블을 생성함으로써 인간의 레이블이 없는 상태에서 훈련되는 새로운 오픈 뷰어 객체 검출 프레임워크를 제안한다. 이 방법은 최신 기술 수준(SOTA)의 성능을 달성하며, COCO의 신규 카테고리에서 인간 레이블이 있는 모델보다 3% AP 높고, 동일한 인간 레이블 기반 모델을 사용할 경우 8% AP 높은 성능을 기록한다.

ABSTRACT

Despite great progress in object detection, most existing methods are limited to a small set of object categories, due to the tremendous human effort needed for instance-level bounding-box annotation. To alleviate the problem, recent open vocabulary and zero-shot detection methods attempt to detect object categories not seen during training. However, these approaches still rely on manually provided bounding-box annotations on a set of base classes. We propose an open vocabulary detection framework that can be trained without manually provided bounding-box annotations. Our method achieves this by leveraging the localization ability of pre-trained vision-language models and generating pseudo bounding-box labels that can be used directly for training object detectors. Experimental results on COCO, PASCAL VOC, Objects365 and LVIS demonstrate the effectiveness of our method. Specifically, our method outperforms the state-of-the-arts (SOTA) that are trained using human annotated bounding-boxes by 3% AP on COCO novel categories even though our training source is not equipped with manual bounding-box labels. When utilizing the manual bounding-box labels as our baselines do, our method surpasses the SOTA largely by 8% AP.

연구 동기 및 목표

  • 높은 레이블링 비용으로 인해 기존 객체 검출 방법이 정의된 소수의 객체 카테고리에 국한되어 있다는 한계를 해결하기 위해.
  • 사람이 제공한 인스턴스 수준의 바운딩 박스 레이블에 의존하지 않고 오픈 뷰어 검출을 가능하게 하기 위해.
  • 사전 훈련된 시각-언어 모델을 활용해 약한 지도 학습 기반의 가짜 박스 생성을 위한 훈련 프레임워크를 개발하기 위해.
  • 수동 바운딩 박스 레이블이 없음에도 불구하고 오픈 뷰어 검출 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
  • 가짜 레이블 기반 훈련이 인간 레이블 기반 훈련과 동등하거나 이를 초월할 수 있음을 입증하기 위해.

제안 방법

  • 객체 쿼리에 대해 시각-언어 모델을 활용해 국소화 인식 임베딩을 예측함으로써, 약한 지도 학습 기반 국소화를 가능하게 한다.
  • 다양한 이미지-텍스트 쌍에 걸쳐 시각-언어 모델의 어텐션 맵을 통합함으로써 가짜 바운딩 박스 레이블을 생성한다.
  • 인간 레이블이 전혀 없는 상태에서 생성된 가짜 박스를 감독 신호로 사용하여 표준 객체 검출기 모델을 훈련시킨다.
  • 기반 시각적 특징과 일치시키는 방식으로 가짜 박스의 품질을 향상시키기 위해 대비 학습 목표를 적용한다.
  • 필요에 따라 소수의 기본 카테고리에 대해 인간 레이블이 있는 바운딩 박스를 사용해 검출기를 미세 조정함으로써 일반화 성능을 향상시킨다.
  • 가짜 박스 품질과 검출기 성능을 점진적으로 개선하기 위해 다단계 훈련 파이프라인을 구현한다.

실험 결과

연구 질문

  • RQ1인간 레이블이 전혀 없는 상태에서 오픈 뷰어 객체 검출을 달성할 수 있는가?
  • RQ2시각-언어 모델에서 유도된 가짜 바운딩 박스는 객체 검출기 훈련에 얼마나 효과적인가?
  • RQ3가짜 레이블 기반 훈련된 검출기가 인간 레이블 기반 훈련된 SOTA 모델을 능가할 수 있는가?
  • RQ4여러 벤치마크에서 제안된 방법의 성능가지 기본 카테고리와 새로운 카테고리 모두에서 SOTA와 비교해 볼 때 어떤가?
  • RQ5오픈 뷰어 검출에서 시각-언어 모델을 활용한 약한 지도 학습 기반 국소화에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 인간 레이블이 없는 상태에서도 COCO의 새로운 카테고리에서 SOTA 모델보다 3% 높은 AP 성능을 달성한다.
  • SOTA와 동일한 설정(즉, 인간 레이블 기반 기반 모델 사용)에서 평가했을 때, 8% 높은 AP를 기록하여 훨씬 뛰어난 학습 효율성을 입증한다.
  • 이 방법은 다양한 벤치마크에서 잘 일반화되며, COCO, PASCAL VOC, Objects365, LVIS에서 뛰어난 성능을 보인다.
  • 시각-언어 모델에서 유도된 가짜 바운딩 박스 생성은 효과적인 감독 신호를 제공하여 검출기 훈련에 유용하다.
  • 비용이 많이 드는 인간 레이블 의존도를 크게 줄이면서도, 완전히 지도 학습 기반의 기반 모델과 동등하거나 이를 초월하는 성능을 유지한다.
  • 결과적으로 약한 지도 학습 기반의 가짜 레이블링이 오픈 뷰어 검출에서 인간 레이블 기반 바운딩 박스의 실질적이고 강력한 대안임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.