Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Text with Graph Convolutional Network for Cross-Modal Information Retrieval

Jing Yu, Yuhang Lu|arXiv (Cornell University)|Feb 3, 2018
Multimodal Machine Learning Applications参考文献 20被引用数 15
ひとこと要約

本稿では、語の類似度をword2vecに基づいて用いたグラフとしてテキストをモデル化し、画像には事前学習済みのCNN特徴量を用いる二重パス型ニューラルネットワーク、GINを提案する。モデルはペairワイズ類似度損失を用いて共有された意味的空間を共同で学習し、テキストクエリ付き画像検索タスクにおいて、最先端手法比で17%の精度向上を達成した。

ABSTRACT

Cross-modal information retrieval aims to find heterogeneous data of various modalities from a given query of one modality. The main challenge is to map different modalities into a common semantic space, in which distance between concepts in different modalities can be well modeled. For cross-modal information retrieval between images and texts, existing work mostly uses off-the-shelf Convolutional Neural Network (CNN) for image feature extraction. For texts, word-level features such as bag-of-words or word2vec are employed to build deep learning models to represent texts. Besides word-level semantics, the semantic relations between words are also informative but less explored. In this paper, we model texts by graphs using similarity measure based on word2vec. A dual-path neural network model is proposed for couple feature learning in cross-modal information retrieval. One path utilizes Graph Convolutional Network (GCN) for text modeling based on graph representations. The other path uses a neural network with layers of nonlinearities for image modeling based on off-the-shelf features. The model is trained by a pairwise similarity loss function to maximize the similarity of relevant text-image pairs and minimize the similarity of irrelevant pairs. Experimental results show that the proposed model outperforms the state-of-the-art methods significantly, with 17% improvement on accuracy for the best case.

研究の動機と目的

  • クロスモodal検索におけるベクトル空間テキストモデルが語のレベルの意味的関係を無視するという限界を解決すること。
  • 構造的および関係的意味的特徴を保持するようにテキストをグラフとしてモデル化することで、クロスモダリティ検索を向上させること。
  • 二重パス型ニューラルネットワークを用いて、画像とテキスト間で共通の意味的空間と結合された特徴表現を共同で学習すること。
  • グラフ畳み込みネットワークを用いて深層学習にグローバルな意味的構造を統合することで、特徴表現を向上させること。
  • 英語および中国語のベンチマークデータセットを用いて、言語およびモダリティの多様性にわたる一般化を実証すること。

提案手法

  • ノードを語として、word2vec類似度で重み付けされたエッジを用いて意味的関係を符号化するテキストグラフを構築する。
  • グラフ畳み込みネットワーク(GCN)を適用し、グラフ構造から文脈を反映した関係に敏感なテキスト表現を学習する。
  • 事前学習済みのCNN特徴量を処理するための、複数の非線形層を有する別個の深層ニューラルネットワークを用いて画像表現を生成する。
  • ペアワイズ類似度損失関数を用い、関連するテキスト-画像ペアの類似度を最大化し、関係のないペアの類似度を最小化する。
  • エンドツーエンドで全モデルを訓練し、特徴学習と意味的空間の整合性最適化を同時に最適化する。
  • 画像にはオフザシェルのImageNet事前学習済みCNN特徴量を活用し、テキストのGCNおよび全結合層はエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1word2vecに基づく類似度を用いたテキストのグラフモデル化は、クロスモダリティ検索における意味的表現を向上させるか?
  • RQ2GCNを用いてグローバルな意味的構造を統合することで、フラットなベクトルモデルと比較して、未学習のテキスト-画像ペアに対する一般化性能が向上するか?
  • RQ3GCNをテキストに、フィードフォワードネットワークを画像に用いる二重パスアーキテクチャは、既存の最先端手法を上回るクロスモダリティ検索性能を達成できるか?
  • RQ4本モデルは、非英語テキスト(例:中国語)や異種データを含む多様なデータセットおよびモダリティにおいて、どのように性能を発揮するか?
  • RQ5共通の意味的空間と結合された特徴の共同学習が、検索精度をどの程度向上させるか?

主な発見

  • Eng-Wikiデータセットにおけるテキストクエリ付き画像検索タスクで、2番目に良い手法JFSSLに比べ、平均平均精度(MAP)が17.13%向上した。
  • NUS-WIDEデータセットでは、AUSLおよびLGCFLを除き、すべての競合手法を上回り、大規模ベンチマークでも強力な性能を示した。
  • 画像クエリ付きテキストタスクでは、Eng-WikiデータセットであらゆるリCALLレートにおいて最高の精度を達成し、堅牢な検索品質を示した。
  • TVGrazデータセットでは、テキストクエリおよび画像クエリの両タスクで最高の結果を出した。特に画像クエリ付きテキスト検索では、優れたCNN特徴量のおかげでより顕著な向上を示した。
  • 中国語のCh-Wikiデータセットでは、テキストクエリで6.77%、画像クエリで2.43%の性能向上を達成し、非英語テキストへの一般化能力が優れていることを示した。
  • グラフベースのテキストモデリングにより意味的関係を捉えることで、ベクトル空間ベースラインを著しく上回り、特にゼロショットまたはレアワード一般化のシナリオで顕著な効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。