Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to discover and localize visual objects with open vocabulary

Keren Ye, Mingda Zhang|arXiv (Cornell University)|2018. 11. 25.
Multimodal Machine Learning Applications참고 문헌 37인용 수 4
한 줄 요약

이 논문은 사전에 정의된 객체 카테고리나 바운딩 박스 애너테이션 없이 이미지-캡션 쌍에서 시각적 객체를 발견하고 국소화하는 약한 지도 학습 객체 검출 프레임워크를 제안한다. 공간 활성화 맵을 통해 이미지-단어 주의를 모델링하고, 가장자리 기반 기울기 기반의 새로운 객체도출 기준을 도입함으로써, 오직 노이즈가 있는 캡션만을 사용하여 COCO에서 6.91%의 mAP@0.50 IoU를 달성하며 웹 스케일 데이터로부터 효과적인 오픈 뷰포트리 객체 검출을 실현한다.

ABSTRACT

To alleviate the cost of obtaining accurate bounding boxes for training today's state-of-the-art object detection models, recent weakly supervised detection work has proposed techniques to learn from image-level labels. However, requiring discrete image-level labels is both restrictive and suboptimal. Real-world "supervision" usually consists of more unstructured text, such as captions. In this work we learn association maps between images and captions. We then use a novel objectness criterion to rank the resulting candidate boxes, such that high-ranking boxes have strong gradients along all edges. Thus, we can detect objects beyond a fixed object category vocabulary, if those objects are frequent and distinctive enough. We show that our objectness criterion improves the proposed bounding boxes in relation to prior weakly supervised detection methods. Further, we show encouraging results on object detection from image-level captions only.

연구 동기 및 목표

  • 고정된 어휘를 가진 객체 검출기의 한계를 해결하기 위해 사전에 정의된 카테고리 외의 객체도 검출할 수 있도록 하는 것.
  • 웹에서 다량의 약한 지도 학습 이미지-캡션 쌍을 활용하여 고비용의 바운딩 박스 애너테이션에 대한 의존도를 줄이는 것.
  • 이미지 수준의 레이블이나 진짜 바운딩 박스가 없이도 비정형적이고 노이즈가 있는 캡션으로부터 의미 있는 시각적 객체 연관성을 학습하는 것.
  • 모서리 주변 기울기 일관성에 기반해 고품질 후보 바운딩 박스를 식별하는 강력한 객체도출 메트릭을 개발하는 것.
  • 오직 이미지-캡션 쌍만을 사용해 일반화 가능한 객체 검출기를 훈련시켜 새로운, 흔한, 특징적인 객체를 탐지할 수 있도록 하는 것.

제안 방법

  • 공유 임bed딩 공간 내에서 이미지 영역과 캡션 내 단어 간의 쌍별 유사도를 계산하여 공간 활성화 맵을 학습한다.
  • 일치하는 이미지-캡션 쌍 간의 유사도를 최대화하고, 부정적 쌍 간의 유사도를 최소화하기 위해 트리플릿 손실을 사용해 모델을 훈련시킨다.
  • 모든 바운딩 박스 가장자리에 강한 기울기가 존재하는 지역을 선호하는 새로운 객체도출 기준을 도입하여 후보 박스를 기울기 일관성 기반으로 순위 매긴다.
  • 고성능 활성화 영역에서 유도된 가짜 진짜 바운딩 박스를 사용해, 다중 예외 학습(MIL) 손실을 적용한 Faster-RCNN 스타일 검출기를 훈련시킨다.
  • 식별 가능한 객체 개념의 고품질 오픈 어휘를 캡션에서 추출하기 위해 단어 빈도와 임베딩 기반 순위 매기기(Eq. 7)를 활용한다.
  • 가장자리 기반 후보 박스와 클래스 활성화 맵의 융합을 탐색하여 국소화 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1어떤 바운딩 박스 애너테이션 없이도 이미지-캡션 쌍만으로 객체 검출을 효과적으로 훈련시킬 수 있는가?
  • RQ2자연어 캡션의 약한 지도 학습만으로도 고정된 어휘 외의 객체를 탐지할 수 있는가?
  • RQ3가장자리 기반 기울기 기반 객체도출 기준이 기존의 약한 지도 학습 방법보다 고품질 바운딩 박스 후보를 더 잘 생성하는가?
  • RQ4노이즈가 있는 캡션으로 훈련된 검출기가 COCO 수준의 객체를 mAP가 높게 일반화하여 탐지할 수 있는가?
  • RQ5표준 데이터셋에 포함되지 않은 새로운, 흔하고 특징적인 객체들인 'tree stump'(나무 둔덕)이나 'table'(테이블)을 모델이 성공적으로 식별하고 국소화할 수 있는가?

주요 결과

  • 제안된 객체도출 기준은 기존의 두 가지 약한 지도 학습 검출 방법보다 고품질 바운딩 박스 후보를 훨씬 효과적으로 생성한다.
  • 모델은 오직 노이즈가 있는 이미지 캡션만으로 COCO 데이터셋에서 6.91%의 mAP@0.50 IoU를 달성하여 도전적인 오픈 뷰포트리 환경에서 효과적인 검출을 실현함을 보여준다.
  • Eq. 7과 단어 빈도를 통한 순위 매기기로 학습된 어휘는 COCO의 80개 카테고리에 대해 높은 리콜(그림 7 참조)을 달성하여 관련 객체 개념의 효과적인 탐지가 가능함을 시사한다.
  • 표준 COCO 카테고리 집합에 포함되지 않은 새로운 객체들인 'tree stump'과 'table'을 성공적으로 탐지함으로써 오픈 뷰포트리 기능을 확인한다.
  • 다중 예외 학습(MIL) 손실을 사용함으로써 노이즈가 많은 레이블에 대한 강건성이 향상되어 일반화 능력이 향상됨을 확인하였다.
  • COCO에서 훈련된 모델은 PASCAL VOC로도 일반화 가능하여 약한 지도 학습에도 불구하고 데이터셋 간 전이 가능성은 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.