Skip to main content
QUICK REVIEW

[논문 리뷰] Image search using multilingual texts: a cross-modal learning approach between image and text

Maxime Portaz, Hicham Randrianarivo|arXiv (Cornell University)|2019. 03. 27.
Multimodal Machine Learning Applications참고 문헌 32인용 수 10
한 줄 요약

이 논문은 이미지에 대해 CNN을 사용하고 다국어 텍스트에 대해 RNN과 다국어 단어 임베딩(BIVEC 또는 MUSE)을 사용하여 이미지와 다국어 텍스트를 공유 벡터 공간에 함께 임bedding하는 교차모달 학습 프레임워크를 제안한다. 이는 다국어 이미지 검색에서 최신 기준 성능을 달성하며, BIVEC를 사용할 경우 Multi30K에서 recall@10이 15.15% 향상되었고, MUSE를 사용할 경우 4개의 언어로 구성된 다국어 검색 작업에서 49.38%의 recall@10을 기록한다.

ABSTRACT

Multilingual (or cross-lingual) embeddings represent several languages in a unique vector space. Using a common embedding space enables for a shared semantic between words from different languages. In this paper, we propose to embed images and texts into a unique distributional vector space, enabling to search images by using text queries expressing information needs related to the (visual) content of images, as well as using image similarity. Our framework forces the representation of an image to be similar to the representation of the text that describes it. Moreover, by using multilingual embeddings we ensure that words from two different languages have close descriptors and thus are attached to similar images. We provide experimental evidence of the efficiency of our approach by experimenting it on two datasets: Common Objects in COntext (COCO) [19] and Multi30K [7].

연구 동기 및 목표

  • 공유 벡터 공간에 이미지와 텍스트 표현을 정렬함으로써 다국어 텍스트 쿼리를 사용한 이미지 검색을 가능하게 하기 위해.
  • 목표 언어가 훈련 중에 등장하지 않더라도 다국어 훈련 데이터를 활용하여 이미지 검색 성능을 향상시키기 위해.
  • 교차모달 검색 작업에서 두 가지 다국어 임베딩 방법—BIVEC와 MUSE—의 성능 및 제로샷 일반화 능력을 평가하기 위해.
  • 추가 언어 훈련을 통해 영어를 포함한 모든 언어의 검색 성능 향상을 보여주기 위해.
  • 정렬된 다국어 임베딩을 활용하여 제로샷 다국어 이미지 검색을 가능하게 하기 위해.

제안 방법

  • 프레임워크는 이미지에서 시각적 특징을 추출하고 이를 공유 임베딩 공간에 투영하기 위해 합성곱 신경망(CNN)을 사용한다.
  • 텍스트 표현은 다국어 단어 임베딩으로 인코딩된 문장을 처리하는 순환 신경망(RNN)을 통해 생성된다.
  • 다국어 임베딩은 BIVEC를 통해 이중 언어 문장 쌍을 사용해 공동으로 훈련함으로써 학습되거나, MUSE를 통해 독립적으로 훈련된 단언어 임베딩 간의 매핑을 학습함으로써 이루어진다.
  • 모델은 동일한 샘플의 이미지 및 텍스트 임베딩 간의 대비 손실을 최소화하도록 훈련되어, 이들이 공유 공간에서 가까이 있도록 유도한다.
  • 이 방법은 제로샷 검색을 지원한다: 훈련 중에 등장하지 않은 언어의 쿼리를 사용하여 이미지를 검색할 수 있다. 이는 공유 다국어 공간 덕분이다.
  • 프레임워크는 双방향 검색을 가능하게 한다: 다국어에서 이미지 쿼리로부터 텍스트를 검색하거나 텍스트 쿼리로부터 이미지를 검색할 수 있다.

실험 결과

연구 질문

  • RQ1단일 모델이 이미지와 다국어 텍스트를 공유 벡터 공간에 함께 임베딩하여 다국어 간 이미지 검색을 가능하게 할 수 있는가?
  • RQ2추가 언어 훈련을 통해 본 적이 있거나 본 적이 없는 언어의 이미지 검색 성능이 향상되는가?
  • RQ3BIVEC와 MUSE 임베딩은 다국어 이미지 검색에서 성능 및 제로샷 일반화 능력 측면에서 어떻게 비교되는가?
  • RQ4다국어 데이터를 사용하여 영어에서의 이미지 검색 성능을 향상시킬 수 있는가, 동시에 성능 저하 없이 유지되는가?
  • RQ5훈련 중에 새로운 언어를 추가할 경우, 여러 언어에서의 재현율 성능에 어떤 영향을 미치는가?

주요 결과

  • BIVEC 임베딩을 사용할 경우, 단언어 기반 모델 대비 COCO 데이터셋에서 recall@10이 3.35%p 절대적으로 향상되었다.
  • Multi30K 데이터셋에서 BIVEC 기반 모델은 기준 모델 대비 recall@10에서 15.15%p의 절대적 향상을 달성하여 강력한 다국어 일반화 능력을 입증하였다.
  • 영어와 프랑스어로 훈련된 BIVEC 모델은 프랑스어에서 55.22%의 recall@10을 기록하여 MUSE 기반 모델 대비 26.39%p 향상되었다.
  • MUSE 기반 모델은 네 개 언어(영어, 프랑스어, 독일어, 체코어)를 포함한 다국어 검색 작업에서 49.38%의 recall@10을 달성하여 강력한 제로샷 성능을 보였다.
  • 훈련 중에 새로운 언어를 추가할 경우 영어의 성능은 감소(최대 recall@1에서 2.62%p 감소)하지만, 다국어 재현율에서는 뚜렷한 향상이 있으며, 네 개 언어를 모두 포함했을 때 6.42%p 향상되었다.
  • 모델는 새로운 언어 훈련이 해당 언어 뿐만 아니라 영어를 포함한 다른 언어의 성능 향상에도 기여함을 보여주었으며, 언어 간 긍정적 전이 효과가 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.