Skip to main content
QUICK REVIEW

[논문 리뷰] What is Where by Looking: Weakly-Supervised Open-World Phrase-Grounding without Text Inputs

Tal Shaharabany, Yoad Tewel|arXiv (Cornell University)|2022. 06. 19.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

이 논문은 훈련 중에 텍스트나 바운딩 박스 애너테이션을 사용하지 않고 이미지 하나만을 입력으로 사용하여 객체를 검출하고 국소화하는 순수 시각적 어휘 기반 설정—'보는 것만으로 어디에 무엇이 있는지 파악하기' (WWbL)—라는 약한 지도 학습, 오픈월드 방법을 제안한다. CLIP를 이용한 이미지-텍스트 매칭과 BLIP를 이용한 이미지 캡션 생성을 조합함으로써, 약한 지도 학습 국소화 및 어휘 기반 설정에서 최신 기술 수준의 성능을 달성하였으며, 인간이 작성한 캡션을 사용한 완전 지도 학습 기반 모델과 유사한 성능을 보였다.

ABSTRACT

Given an input image, and nothing else, our method returns the bounding boxes of objects in the image and phrases that describe the objects. This is achieved within an open world paradigm, in which the objects in the input image may not have been encountered during the training of the localization mechanism. Moreover, training takes place in a weakly supervised setting, where no bounding boxes are provided. To achieve this, our method combines two pre-trained networks: the CLIP image-to-text matching score and the BLIP image captioning tool. Training takes place on COCO images and their captions and is based on CLIP. Then, during inference, BLIP is used to generate a hypothesis regarding various regions of the current image. Our work generalizes weakly supervised segmentation and phrase grounding and is shown empirically to outperform the state of the art in both domains. It also shows very convincing results in the novel task of weakly-supervised open-world purely visual phrase-grounding presented in our work. For example, on the datasets used for benchmarking phrase-grounding, our method results in a very modest degradation in comparison to methods that employ human captions as an additional input. Our code is available at https://github.com/talshaharabany/what-is-where-by-looking and a live demo can be found at https://replicate.com/talshaharabany/what-is-where-by-looking.

연구 동기 및 목표

  • 훈련 중에 텍스트나 바운딩 박스 애너테이션을 사용하지 않는 새로운 과제인 약한 지도 학습, 오픈월드, 순수 시각적 어휘 기반 설정을 해결하기 위해.
  • 학습 어휘에 포함되지 않은 객체가 존재할 수 있는 오픈월드 환경에서 객체 탐지 및 기술을 가능하게 하기 위해.
  • 사용자 애너테이션된 캡션을 입력으로 요구하지 않고도 경쟁 가능한 어휘 기반 설정 성능을 달성하기 위해.
  • 사전 학습된 시각-언어 모델을 활용해 약한 지도 학습 국소화가 오픈월드 시각적 어휘 기반 설정으로 효과적으로 일반화될 수 있음을 보여주기 위해.

제안 방법

  • 바운딩 박스나 세그멘테이션 마스크 없이 COCO의 이미지 캡션만을 사용하여 세그멘테이션 네트워크 $g$ 를 훈련함으로써, 이는 약한 지도 학습이 된다.
  • 전경 영역이 해당 캡션과 일치하도록 정렬하기 위해 CLIP의 이미지-텍스트 매칭 점수를 지도 신호로 사용한다.
  • 네 가지 손실 항목을 사용한다: 전경 매칭 ($L_{\text{fore}}$), 배경 거부 ($L_{\text{back}}$), CLIP의 관련성 맵 가이던스 ($L_{\text{rmap}}$), 마스크 정규화 ($L_{\text{reg}}$).
  • 추론 단계에서는 선택적 검색을 적용하여 객체 제안 영역을 생성한 후, BLIP를 사용해 각 영역에 대해 후보 어휘를 생성한다.
  • CLIP의 임베딩 공간에서 생성된 어휘를 군집화하여 중복을 방지하고 가장 대표적인 어휘를 선택한다.
  • 학습된 네트워크 $g$ 를 사용하여 전체 이미지와 어휘를 입력으로 받아 각 어휘에 대한 전경 마스크를 예측한다.

실험 결과

연구 질문

  • RQ1추론 중에 텍스트 입력 없이도 약한 지도 학습 방법이 어휘 기반 설정에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2이미지 수준의 지도만으로도 새로운 객체 카테고리에 일반화할 수 있는 오픈월드 객체 탐지 시스템은 가능한가?
  • RQ3CLIP의 매칭 점수와 BLIP의 캡션 생성 능력의 통합이 순수 시각적 어휘 기반 설정에 얼마나 효과적인가?
  • RQ4CLIP의 해석 가능성 맵 사용이 국소화 성능 향상에 얼마나 기여하는가?
  • RQ5COCO 캡션에서 훈련된 약한 지도 학습 국소화 모델이 새로운 이미지에서 제로샷 어휘 기반 설정에 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 MS-COCO에서 어휘 기반 설정에 대해 평균 mAP 61.03%와 Visual Genome에서 65.95%를 기록하여 인간 캡션을 사용한 완전 지도 학습 기반 모델과 유사한 성능을 달성하였다.
  • 제거 실험 결과, $L_{\text{rmap}}$ 손실 항목을 제거할 경우 성능이 9% 이상 감소함을 확인하여, 국소화 정확도 향상에 있어 이 항목의 중요성을 입증하였다.
  • 최적의 정규화 계수 $\lambda_3 = 4$ 는 CUB에서 약한 지도 학습 국소화에 대해 96.50%의 정확도를 기록하였으며, 다양한 값 범위에서도 안정적인 성능을 보였다.
  • MS-COCO와 Visual Genome 벤치마크에서 모두 최신 기술 수준의 약한 지도 학습 국소화 및 어휘 기반 설정 모델을 초월하는 성능을 보였다.
  • BLIP를 이용한 어휘 생성과 CLIP를 이용한 매칭을 통합함으로써 중복이 없는 강력한 어휘 군집화가 가능해져 어휘 기반 설정 품질이 향상되었다.
  • 웹 이미지 및 BBC의 'Week in Pictures'와 같은 실세계 데이터셋에서도 잘 일반화됨을 보여주어 강력한 제로샷 일반화 성능을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.