Skip to main content
QUICK REVIEW

[논문 리뷰] Open-Vocabulary Object Detection using Pseudo Caption Labels

Han-Cheol Cho, Won Young Jhoo|arXiv (Cornell University)|2023. 03. 23.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 이미지 캡션 모델을 사용하여 객체 인스턴스에 대한 풍부하고 기술적인 캡션을 생성함으로써 개방형 어휘 객체 검출을 향상시키는 간단한 사전 처리 기법인 가짜 캡션 레이블링(Pseudo Caption Labeling, PCL)을 제안한다. 크롭된 이미지에 20% 마진을 적용하고 객체 이름 접두사를 붙임으로써 표준 객체 레이블을 다양하고 맥락 인식이 가능한 가짜 캡션으로 변환함으로써, 시각-언어 모델로부터 보다 효과적인 지식 전이가 가능해지며, 정제된 VisualGenome 데이터를 기반으로 훈련했을 때 LVIS 벤치마크에서 최고 성능인 AP 34.5와 APr 30.6을 달성한다.

ABSTRACT

Recent open-vocabulary detection methods aim to detect novel objects by distilling knowledge from vision-language models (VLMs) trained on a vast amount of image-text pairs. To improve the effectiveness of these methods, researchers have utilized datasets with a large vocabulary that contains a large number of object classes, under the assumption that such data will enable models to extract comprehensive knowledge on the relationships between various objects and better generalize to unseen object classes. In this study, we argue that more fine-grained labels are necessary to extract richer knowledge about novel objects, including object attributes and relationships, in addition to their names. To address this challenge, we propose a simple and effective method named Pseudo Caption Labeling (PCL), which utilizes an image captioning model to generate captions that describe object instances from diverse perspectives. The resulting pseudo caption labels offer dense samples for knowledge distillation. On the LVIS benchmark, our best model trained on the de-duplicated VisualGenome dataset achieves an AP of 34.5 and an APr of 30.6, comparable to the state-of-the-art performance. PCL's simplicity and flexibility are other notable features, as it is a straightforward pre-processing technique that can be used with any image captioning model without imposing any restrictions on model architecture or training process.

연구 동기 및 목표

  • 단순한 클래스 이름을 넘어서 새로운 객체에 대한 더 풍부하고 다양한 지식을 추출하여 개방형 어휘 객체 검출을 향상시키기 위해.
  • 粗안한 수동 프롬프트 레이블의 한계를 보완하기 위해 세밀한 맥락 기반의 가짜 캡션 레이블을 도입하기 위해.
  • 모델 훈련 또는 아키텍처를 수정하지 않고도 지식 전이를 향상시킬 수 있는 유연하고 아키텍처 독립적인 사전 처리 방법을 개발하기 위해.
  • 가짜 캡션을 통해 관계, 특성, 환경적 맥락을 활용하여 미리 보지 않은 객체 클래스로의 일반화 능력을 향상시키기 위해.
  • 캡션 모델을 사용한 단순한 사전 처리가 복잡한 다중 데이터셋 훈련 접근 방식과 경쟁할 수 있음을 보여주기 위해.

제안 방법

  • PCL는 사전 훈련된 이미지 캡션 모델에 크롭된 객체 이미지(20% 마진 포함)와 객체 이름을 접두사로 제공하여 가짜 캡션 레이블을 생성한다.
  • 이 방법은 표준 객체 검출 데이터셋을 영역-캡션 데이터셋으로 변환함으로써, 시각-언어 모델로부터 지식 전이를 가능하게 한다.
  • 객체 이름 접두사 도입으로 생성된 모든 캡션은 대상 객체를 명시적으로 언급함으로써 레이블 일관성을 유지한다.
  • 이 방법은 모듈러하고 어떤 이미지 캡션 모델과도 호환되며, 모델 아키텍처나 훈련 과정에 대한 수정이 필요 없다.
  • 가짜 캡션은 객체의 특성, 관계, 주변 맥락을 포괄하여 검출기에 전달되는 지식을 풍부하게 한다.
  • 이 방법은 데이터 사전 처리 단계에서 적용되므로 기존의 OVD 훈련 파ip라인과 모델 아키텍처와도 호환된다.

실험 결과

연구 질문

  • RQ1세밀하고 맥락 기반의 가짜 캡션 레이블은 표준 수동 프롬프트 레이블보다 개방형 어휘 객체 검출 성능을 향상시키는가?
  • RQ2가짜 레이블에 객체의 특성, 관계, 환경적 맥락을 통합할 경우, 새로운 객체 클래스로의 일반화 능력이 향상되는가?
  • RQ3캡션 모델을 사용한 레이블 생성 방식은 기존의 약한 감독 또는 다중 데이터셋 접근 방식과 비교해 어떻게 성능을 내는가?
  • RQ4크롭 마진, 접두사 도입, 캡션 다양성과 같은 설계 선택 사항 중 성능에 가장 큰 영향을 미치는 것은 무엇인가?
  • RQ5캡션 모델을 활용한 단순한 사전 처리 기법인 PCL가 아키텍처 수정 없이도 복잡한 훈련 레시피 없이 최고 성능을 달성할 수 있는가?

주요 결과

  • PCL는 정제된 VisualGenome 데이터를 기반으로 훈련했을 때 LVIS 벤치마크에서 AP 34.5와 APr 30.6의 성능을 기록하여 최고 성능을 달성했다.
  • 훈련 중 수동 프롬프트 레이블을 제거하면 성능이 크게 떨어졌으며(AP -2.2, APr -2.0), 이는 레이블 일관성의 중요성을 입증한다.
  • 20% 크롭 마진을 적용함으로써 맥락 이해가 향상되었으며, 원래 바운딩 박스를 그대로 사용한 경우 대비 APr 하락 폭이 1.6 감소했다.
  • PCL 모델은 '은은한 펜던트가 달린 목걸이를 쓴 고양이'와 같은 복잡한 자유형 질의에서 뛰어난 성능을 보였으며, 기준 모델이 실패한 경우에도 주요 객체를 정확히 검출했다.
  • 제거 실험 결과, 객체당 다수의 캡션을 사용하고 객체 이름 접두사를 도입하는 것이 성능 향상에 핵심적인 역할을 한다는 것이 확인되었다.
  • 일부 캡션 생성 오류가 존재하더라도(예: 한 예시에서 16개 레이블 중 7개 오류), 방법은 여전히 강건하고 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.