Skip to main content
QUICK REVIEW

[논문 리뷰] Region-centric Image-Language Pretraining for Open-Vocabulary Detection

Dahun Kim, Anelia Angelova|arXiv (Cornell University)|2023. 09. 29.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 표준 분류 기반 사전학습을 탐지기 아키텍처로 대체하여 노이즈가 있는 이미지-텍스트 쌍에서 대비 손실만을 사용하여 영역 수준의 오픈 버킷 객체 표현을 학습하는 DITO를 제안한다. 대규모 이미지-텍스트 데이터에 직접 탐지기 헤드를 훈련시키고, 특징의 강건성을 향상시키기 위해 이동 윈도우 학습(Shifted-Window Learning)을 도입함으로써 DITO는 LVIS에서 40.4 mask APr, COCO에서 40.8 노바르 AP를 달성하여 가짜 레이블링 없이도 최신 기술을 초월한다.

ABSTRACT

We present a new open-vocabulary detection approach based on region-centric image-language pretraining to bridge the gap between image-level pretraining and open-vocabulary object detection. At the pretraining phase, we incorporate the detector architecture on top of the classification backbone, which better serves the region-level recognition needs of detection by enabling the detector heads to learn from large-scale image-text pairs. Using only standard contrastive loss and no pseudo-labeling, our approach is a simple yet effective extension of the contrastive learning method to learn emergent object-semantic cues. In addition, we propose a shifted-window learning approach upon window attention to make the backbone representation more robust, translation-invariant, and less biased by the window pattern. On the popular LVIS open-vocabulary detection benchmark, our approach sets a new state of the art of 37.6 mask APr using the common ViT-L backbone and public LAION dataset, and 40.5 mask APr using the DataComp-1B dataset, significantly outperforming the best existing approach by +3.7 mask APr at system level. On the COCO benchmark, we achieve very competitive 39.6 novel AP without pseudo labeling or weak supervision. In addition, we evaluate our approach on the transfer detection setup, where it demonstrates notable improvement over the baseline. Visualization reveals emerging object locality from the pretraining recipes compared to the baseline.

연구 동기 및 목표

  • 사전학습 중 영역 수준의 표현을 학습하여 이미지 수준의 사전학습과 오픈 버킷 객체 탐지 간 격차를 해소한다.
  • 가짜 레이블링이나 추가 지도 학습 없이도 대규모 노이즈가 있는 이미지-텍스트 쌍으로부터 탐지기 헤드가 학습할 수 있도록 한다.
  • 새로운 이동 윈도우 학습 전략을 통해 비전 트랜스포머의 강건성 향상과 윈도우 주의의 편향 감소를 도모한다.
  • 약한 지도 학습이나 공동 훈련에 의존하지 않고 오픈 버킷 탐지 벤치마크에서 최고 성능을 달성한다.
  • 사전학습 중 탐지기 아키텍처를 사용하면 잠재적인 국소성과 새로운 카테고리로의 일반화 능력 향상이 가능하다는 것을 입증한다.

제안 방법

  • 이미지-텍스트 사전학습 중 표준 이미지 분류 헤드를 탐지기 헤드로 대체하여 이미지-텍스트 쌍으로부터 영역 수준의 감독을 가능하게 한다.
  • 랜덤 영역 샘플링과 다중 피라미드 수준에서의 RoI 풀링을 통해 다중 해상도 이미지-텍스트 감독을 제공한다.
  • RoI 임베딩에 대해 최대 풀링을 적용하여 영역 수준 특징을 집계함으로써 텍스트 쿼리와의 정렬을 향상시킨다.
  • 창문 크기보다 작은 스트라이드를 가진 겹치지 않는 윈도우 주의를 적용하여 패턴 편향을 감소시키고 번역 불변성을 향상시키는 이동 윈도우 학습(SWL)을 도입한다.
  • 추가 목표나 가짜 레이블링 없이 이미지-텍스트 쌍에 대한 대비 손실만을 사용하여 훈련한다.
  • 표준 탐지기 헤드 훈련을 통해 다운스트림 탐지 데이터셋에서 전체 탐지기의 미세조정을 수행한다.
Figure 1: DITO method. Detection-Oriented Pretraining (left): DITO trains the detector heads (e.g. FPN (Li et al., 2022b ; Lin et al., 2017a ) , Faster RCNN head (Ren et al., 2015 ) ) upon a ViT encoder backbone with multi-level image-text contrastive loss to bridge the gap between image-text pretra
Figure 1: DITO method. Detection-Oriented Pretraining (left): DITO trains the detector heads (e.g. FPN (Li et al., 2022b ; Lin et al., 2017a ) , Faster RCNN head (Ren et al., 2015 ) ) upon a ViT encoder backbone with multi-level image-text contrastive loss to bridge the gap between image-text pretra

실험 결과

연구 질문

  • RQ1이미지-텍스트 사전학습 중에 탐지기 헤드를 직접 훈련시켜 추가 지도 학습 없이도 오픈 버킷 탐지 성능을 향상시킬 수 있는가?
  • RQ2분류 기반 사전학습을 탐지 기반 사전학습으로 대체하면 국소화 성능 향상과 새로운 카테고리로의 일반화 능력 향상에 기여하는가?
  • RQ3이동 윈도우 학습은 비전 트랜스포머의 탐지에 사용되는 표준 윈도우 주의에서 유도되는 편향을 완화할 수 있는가?
  • RQ4LVIS와 COCO에서 제로샷 및 패스트 샷 일반화 성능 측면에서 탐지기 중심 사전학습은 기존 방법보다 어떻게 비교되는가?
  • RQ5명시적인 바운딩 박스 감독 없이 사전학습 특징이 국소화된, 객체 인식 특징을 얼마나 잘 학습하는가?

주요 결과

  • DITO는 ViT-L 백본을 사용하여 LVIS 오픈 버킷 탐지 벤치마크에서 40.4 mask APr를 달성하였으며, 이는 이전 최고 성능 기준 +6.5 APr 향상이다.
  • 외부 바운딩 박스 레이블이 있는 설정에서 DITO는 45.8 box APr를 기록하여 이전 최고 기록보다 +12.5 포인트 향상되었다.
  • COCO 벤치마크에서 DITO는 가짜 레이블링이나 약한 지도 학습 없이도 40.8 novel AP를 달성하여 새로운 카테고리로의 강력한 일반화 능력을 입증했다.
  • 제거 분석 결과, 동결된 백본과 미세조정된 탐지기 양쪽에서 이동 윈도우 학습을 사용할 경우 +4.1 APr의 가장 큰 성과 향상이 나타났다.
  • SWL의 최적 윈도우 크기는 4×4이며, 전체 글로벌 주의(1×1 격자)보다 +4.6 APr 향상되었다.
  • 시각화 결과 DITO 특징가 기존 기준 대비 더 국소화된 의미 표현을 학습하고 있음을 확인하였으며, 특히 알려지지 않은 또는 새로운 객체에서 두드러진 특징을 보였다.
Figure 2: Visual-text similarity map . For each example, we show the paired image (left) and text (bottom) input, and the visual-text similarity map using the backbone features (middle) or our detection-oriented pretraining features (right). We use Flickr30K (top row) and COCO Captions (bottom row)
Figure 2: Visual-text similarity map . For each example, we show the paired image (left) and text (bottom) input, and the visual-text similarity map using the backbone features (middle) or our detection-oriented pretraining features (right). We use Flickr30K (top row) and COCO Captions (bottom row)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.