Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Text with Graph Convolutional Network for Cross-Modal Information Retrieval

Jing Yu, Yuhang Lu|arXiv (Cornell University)|2018. 02. 03.
Multimodal Machine Learning Applications참고 문헌 20인용 수 15
한 줄 요약

이 논문은 텍스트를 단어2벡 기반 유사도를 사용해 의미 관계를 포착하는 그래프로 모델링하고, 이미지에는 사전 훈련된 CNN 특징을 사용하는 이중 경로 신경망인 GIN을 제안한다. 모델은 쌍별 유사도 손실을 통해 공유된 의미 공간을 공동으로 학습하며, 텍스트-질의-이미지 검색 작업에서 최신 기술 대비 17% 향상된 정확도를 달성한다.

ABSTRACT

Cross-modal information retrieval aims to find heterogeneous data of various modalities from a given query of one modality. The main challenge is to map different modalities into a common semantic space, in which distance between concepts in different modalities can be well modeled. For cross-modal information retrieval between images and texts, existing work mostly uses off-the-shelf Convolutional Neural Network (CNN) for image feature extraction. For texts, word-level features such as bag-of-words or word2vec are employed to build deep learning models to represent texts. Besides word-level semantics, the semantic relations between words are also informative but less explored. In this paper, we model texts by graphs using similarity measure based on word2vec. A dual-path neural network model is proposed for couple feature learning in cross-modal information retrieval. One path utilizes Graph Convolutional Network (GCN) for text modeling based on graph representations. The other path uses a neural network with layers of nonlinearities for image modeling based on off-the-shelf features. The model is trained by a pairwise similarity loss function to maximize the similarity of relevant text-image pairs and minimize the similarity of irrelevant pairs. Experimental results show that the proposed model outperforms the state-of-the-art methods significantly, with 17% improvement on accuracy for the best case.

연구 동기 및 목표

  • 교차 모달 검색에서 단어 수준의 의미 관계를 忽시하는 벡터 공간 텍스트 모델의 한계를 해결하기 위해.
  • 텍스트를 그래프로 모델링하여 구조적이고 관계 기반 의미를 유지함으로써 교차 모달 검색을 향상시키기 위해.
  • 이중 경로 신경망을 사용해 이미지와 텍스트 간의 공통 의미 공간과 결합된 특징 표현을 공동으로 학습하기 위해.
  • 그래프 컨볼루션 네트워크를 통해 글로벌 의미 구조를 딥 러닝에 통합하여 특징 표현을 향상시키기 위해.
  • 영어 및 중국어 기준 데이터셋을 사용하여 다양한 언어와 모달 간의 일반화 능력을 입증하기 위해.

제안 방법

  • 노드가 단어를 나타내고, 간선이 단어2벡 유사도로 가중치가 부여된 텍스트 그래프를 구축하여 의미 관계를 인코딩한다.
  • 그래프 컨볼루션 네트워크(GCN)를 적용하여 그래프 구조에서 문맥화된 관계 인식 텍스트 표현을 학습한다.
  • 사전 훈련된 CNN 특징을 처리하기 위해 다중 비선형 층을 가진 별도의 딥 네트워크를 사용하여 이미지 표현을 생성한다.
  • 쌍별 유사도 손실 함수를 사용하여 관련된 텍스트-이미지 쌍 간의 유사도를 최대화하고, 관련이 없는 쌍 간의 유사도를 최소화한다.
  • 전체 모델을 엔드 투 엔드로 훈련하여 특징 학습과 의미 공간 정렬을 공동으로 최적화한다.
  • 이미지에는 오프 더 셰프 ImageNet 사전 훈련된 CNN 특징을 활용하고, 텍스트의 경우 GCN와 완전 연결 층을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1단어2벡 기반 유사도를 사용해 텍스트를 그래프로 모델링하면 교차 모달 검색에서 의미 표현이 향상되는가?
  • RQ2GCN를 통해 글로벌 의미 구조를 통합하면 평면 벡터 모델 대비 새로운 텍스트-이미지 쌍에 대해 더 나은 일반화 성능을 보이는가?
  • RQ3텍스트에 GCN, 이미지에 피드포워드 네트워크를 사용하는 이중 경로 아키텍처가 기존 SOTA 모델보다 교차 모달 검색에서 우월한 성능을 내는가?
  • RQ4모델은 영어 외 비영어 텍스트(예: 중국어) 및 이질적 데이터를 포함한 다양한 데이터셋과 모달 간에서 어떻게 성능을 발휘하는가?
  • RQ5공통 의미 공간과 결합된 특징의 공동 학습이 검색 정확도 향상에 얼마나 기여하는가?

주요 결과

  • Eng-Wiki 데이터셋에서 텍스트-질의-이미지 검색 작업에서 GIN은 두 번째로 우수한 성능을 보인 JFSSL 대비 평균 평균 정밀도(MAP)에서 17.13% 향상된 성과를 기록했다.
  • NUS-WIDE 데이터셋에서는 AUSL과 LGCFL를 제외한 모든 경쟁 모델을 능가하며 대규모 벤치마크에서 강력한 성능을 보였다.
  • 이미지-질의-텍스트 작업에서 GIN은 Eng-Wiki 데이터셋에서 모든 재현율 수준에서 최고의 정밀도를 기록하여 뛰어난 검색 품질을 입증했다.
  • TVGraz 데이터셋에서는 텍스트-질의 및 이미지-질의 작업 모두에서 최고 성능을 기록했으며, 특히 향상된 CNN 특징 덕분에 이미지-질의-텍스트 검색에서 더 큰 향상을 이뤘다.
  • 중국어 Ch-Wiki 데이터셋에서 GIN은 텍스트 질의 시 6.77% 향상되고 이미지 질의 시 2.43% 향상되어 비영어 텍스트에 대한 뛰어난 일반화 능력을 입증했다.
  • 모델은 그래프 기반 텍스트 모델링을 통해 의미 관계를 포착함으로써, 특히 제로샷 또는 희귀어 일반화 시나리오에서 벡터 공간 기반 베이스라인보다 뚜렷하게 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.