Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Object Detection from Captions via Textual Scene Attributes

Achiya Jerbi, Roei Herzig|arXiv (Cornell University)|2020. 09. 30.
Multimodal Machine Learning Applications참고 문헌 51인용 수 6
한 줄 요약

이 논문은 이미지 캡션에서 추출한 텍스트적 시나리오 그래프를 활용하여 검출 정확도를 향상시키는 새로운 약한 감독 객체 검출 방법을 제안한다. '빨간 랩탑'과 같은 텍스트적 속성과 시각적 객체 검출기를 정렬하는 엔트레인먼트 손실을 도입함으로써, 경계 상자 애너테이션을 필요로 하지 않고도 MS COCO 및 Pascal VOC 2007에서 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

Object detection is a fundamental task in computer vision, requiring large annotated datasets that are difficult to collect, as annotators need to label objects and their bounding boxes. Thus, it is a significant challenge to use cheaper forms of supervision effectively. Recent work has begun to explore image captions as a source for weak supervision, but to date, in the context of object detection, captions have only been used to infer the categories of the objects in the image. In this work, we argue that captions contain much richer information about the image, including attributes of objects and their relations. Namely, the text represents a scene of the image, as described recently in the literature. We present a method that uses the attributes in this "textual scene graph" to train object detectors. We empirically demonstrate that the resulting model achieves state-of-the-art results on several challenging object detection datasets, outperforming recent approaches.

연구 동기 및 목표

  • 경계 상자 애너테이션 없이도 약한 감독 객체 검출(WSOD) 문제를 해결하기 위해, 단순한 객체 레이블을 넘어서 더 풍부한 정보를 포함한 이미지 캡션의 정보를 활용하고자 한다.
  • 캡션에 기재된 색상, 형태, 공간 관계와 같은 텍스트적 시나리오 속성을 활용하여 객체 정위치를 안내함으로써 검출 성능을 향상시키고자 한다.
  • 예측된 시각적 속성과 캡션에 기재된 속성 간 일관성을 강제하는 새로운 학습 목표를 개발하여 시나리오 수준의 이해를 향상시키고자 한다.
  • 캡션에서의 속성 수준의 감독이 레이블 추출에만 의존하는 방법보다 현저히 뛰어난 성능을 낼 수 있음을 입증하고자 한다. 이는 추가 학습 데이터 없이도 가능하다.

제안 방법

  • 사전 훈련된 텍스트-시나리오 그래프(SG) 모델을 사용하여 이미지 캡션에서 텍스트적 시나리오 그래프를 추출함으로써 객체, 그들의 속성, 관계를 포괄한다.
  • 예측된 시각적 객체 특징가 캡션에 기재된 속성과 일치하도록 하는 새로운 엔트레인먼트 손실을 도입한다. 예를 들어, 빨간 물체는 '빨간' 속성과 연관되어야 한다.
  • 이중 브랜치 아키텍처를 사용한다. 하나는 이미지 특징 추출 및 객체 제안 생성을 담당하고, 다른 하나는 동일한 특징에서 시각적 속성을 예측한다.
  • 객체 검출은 Faster R-CNN 스타일의 백본을 사용하며, 엔트레인먼트 손실이 학습 중에 적용되어 시각적 예측을 텍스트적 속성과 일치시킨다.
  • 이 방법은 Ye 등(2019)과 동일하게 정확한 문자열 매칭을 통한 객체 레이블 추출을 사용하지만, 지역화 및 분류를 향상시키기 위해 SG 기반의 엔트레인먼트 손실을 추가한다.
  • 경계 상자 애너테이션 없이도, 이미지 수준의 레이블과 텍스트 기반 설명만을 사용하여 이미지-캡션 쌍으로 끝에서 끝까지(end-to-end) 훈련된다.

실험 결과

연구 질문

  • RQ1이미지 캡션의 텍스트적 시나리오 속성을 단순한 객체 레이블 감독을 넘어서 약한 감독 객체 검출 성능 향상에 효과적으로 활용할 수 있는가?
  • RQ2새로운 손실 함수를 통해 시각적 객체 특징과 텍스트적 속성 간 일관성을 강제하면 검출 정확도가 향상되는가?
  • RQ3이미지 캡션만을 감독으로 사용할 때, 캡션 기반 검출 모델의 성능이 완전 감독 기반 베이스라인과 비교해 어떻게 되는가?
  • RQ4캡션에서의 속성 수준 감독이 레이블 품질 향상에만 집중하는 방법보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • 제안된 EM + SG Loss 모델은 COCO Captions로 훈련했을 때 VOC 2007 테스트 세트에서 mAP 45.9를 달성하며, 실제 COCO 레이블로 훈련된 완전 감독 WSOD 모델의 46.3 mAP에 근접한다.
  • COCO 테스트-dev 세트에서 이 모델은 최신 기준 mAP@0.5:0.95를 달성하여 다양한 데이터셋에 대한 강력한 일반화 능력을 보여준다.
  • Flickr30K 캡션으로 훈련하고 VOC 2007에서 평가했을 때, 추가 학습 데이터 없이도 EM + TextClsf 베이스라인 대비 성능 격차를 네 배로 개선한다.
  • 학습 과정에서 부산물로 얻은 속성 분류기의 성능이 의미 있는 수준을 보이며, 이는 속성 이해가 효과적으로 학습 중에 포착되었음을 시사한다.
  • 제거 실험 결과, 엔트레인먼트 손실이 성능 향상의 핵심 요인임을 확인할 수 있었으며, 이를 제거하면 성능이 베이스라인 ExactMatch 수준으로 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.