Skip to main content
QUICK REVIEW

[논문 리뷰] TextTopicNet - Self-Supervised Learning of Visual Features Through Embedding Images on Semantic Text Spaces

Yash Patel, Lluís Gómez|arXiv (Cornell University)|2018. 07. 04.
Image Retrieval and Classification Techniques참고 문헌 55인용 수 4
한 줄 요약

TextTopicNet는 LDA로 임bed된 위키백과 기사에서 유도된 의미적 주제 맥락을 예측하도록 CNN을 훈련시켜 자기지도 학습 방식으로 시각적 특징을 학습하는 방법을 제안한다. 다국어 위키백과에서 무료로 이용 가능한 텍스트-이미지 쌍을 활용함으로써, 인간이 레이블링한 데이터 없이도 이미지 분류, 객체 검출, 다중모odal 검색에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The immense success of deep learning based methods in computer vision heavily relies on large scale training datasets. These richly annotated datasets help the network learn discriminative visual features. Collecting and annotating such datasets requires a tremendous amount of human effort and annotations are limited to popular set of classes. As an alternative, learning visual features by designing auxiliary tasks which make use of freely available self-supervision has become increasingly popular in the computer vision community. In this paper, we put forward an idea to take advantage of multi-modal context to provide self-supervision for the training of computer vision algorithms. We show that adequate visual features can be learned efficiently by training a CNN to predict the semantic textual context in which a particular image is more probable to appear as an illustration. More specifically we use popular text embedding techniques to provide the self-supervision for the training of deep CNN. Our experiments demonstrate state-of-the-art performance in image classification, object detection, and multi-modal retrieval compared to recent self-supervised or naturally-supervised approaches.

연구 동기 및 목표

  • 딥 러닝을 위한 컴퓨터 비전 분야에서 인간 레이블링 데이터셋의 높은 비용과 제한된 확장성 문제를 해결하기 위해.
  • 구조화되지 않은, 자연스럽게 함께 나타나는 일러스트레이티드 기사의 텍스트가 시각적 표현 학습을 위한 무료이고 확장 가능한 지도 신호로 기능할 수 있는지 탐색하기 위해.
  • 자기지도 학습을 통한 시각적 특징 학습에서 LDA를 통해 유도된 주제 수준의 의미적 표현이 단어 수준 또는 문서 수준의 임베딩보다 더 효과적인지 조사하기 위해.
  • 자기지도 학습을 통해 학습된 시각적 특징이 인간 레이블링 데이터를 전혀 사용하지 않고도 ImageNet에서의 지도 학습 전처리 성능과 동등하거나 이를 초월할 수 있는지 보여주기 위해.

제안 방법

  • 이 방법은 주어진 이미지가 일러스트레이션으로 사용되는 위키백과 기사의 의미적 주제 벡터를 예측하기 위해 CNN을 사용한다.
  • 텍스트 임베딩은 전체 기사의 주제 수준 의미 맥락을 모델링하기 위해 잠재적 디리클레 분할(Latent Dirichlet Allocation, LDA)을 사용하여 생성된다.
  • CNN은 이미지 특징과 해당 LDA로 인코딩된 텍스트 주제 벡터를 정렬하기 위해 대비 손실(contrastive loss)을 사용하여 엔드 투 엔드로 훈련된다.
  • 모델은 다양한 도메인에서 100만 개 이상의 이미지-텍스트 쌍을 포함한 대규모 다국어 위키백과 코퍼스에서 사전 훈련된다.
  • 이미지 분류, 객체 검출, 다중모달 검색과 같은 후속 작업에 사용하기 위해 최종 레이어(prob layer)의 특징이 사용된다.
  • 사전 훈련 과정에서 인간 레이블링된 레이블을 전혀 사용하지 않으며, 지도 신호는 위키백과 기사 내에서 이미지와 그 텍스트 맥락의 공존에 전적으로 기반한다.

실험 결과

연구 질문

  • RQ1구조화되지 않은, 자연스럽게 발생하는 위키백과 기사의 의미적 텍스트 임베딩이 시각적 표현 학습을 위한 효과적인 자기지도 신호로 기능할 수 있는가?
  • RQ2LDA를 통한 주제 수준의 의미적 표현이 자동으로 학습된 단어 수준 또는 문서 수준의 텍스트 임베딩보다 자기지도 학습을 통한 시각적 특징 학습에서 더 효과적인가?
  • RQ3위키백과 기사에서 학습된 자기지도 시각적 특징은 파인튜닝 없이도 이미지 분류 및 객체 검출과 같은 후속 작업으로 일반화될 수 있는가?
  • RQ4TextTopicNet의 성능은 표준 벤치마크에서 지도 학습 및 비지도 자기지도 학습 기반 모델과 비교해 볼 때 어떻게 되는가?

주요 결과

  • TextTopicNet는 위키백과 데이터셋에서 mAP 38.94를 기록하여 모든 비지도 학습 방법보다 뛰어나며, 지도 학습 방법의 성능에 가까워지고 있다.
  • ImageCLEF 데이터셋에서는 mAP 38.87을 기록하여 다양한 다국어 및 다도메인 환경에서도 강력한 일반화 성능을 보였다.
  • PASCAL VOC 2007에서 이미지 분류 및 객체 검출 분야에서 파인튜닝 없이도 최신 기술 수준의 성능을 달성했다.
  • 정성적 결과 분석을 통해 주제 공간 레이어(prob layer)의 특징은 의미적으로 관련성이 있는 이미지 검색을 가능하게 하였으며, 'airplane'이나 'fighter'와 같이 다의어인 쿼리에 대해서도 효과적으로 작동하였다.
  • 의도적인 의미 유사도 레이블 없이도 'airplane'이나 'flight'와 같은 쿼리에 대해 의미적으로 관련된 이미지를 성공적으로 검색하였다.
  • 클래스 특화 지도 신호 없이도 PASCAL VOC 2007에서 정확한 클래스 검색이 이루어지는 것으로 나타나, 모델은 여전히 세분화된 인식을 지원하는 일반적인 주제 기반 시각적 특징을 학습하고 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.