Skip to main content
QUICK REVIEW

[論文レビュー] Webly Supervised Joint Embedding for Cross-Modal Image-Text Retrieval

Niluthpol Chowdhury Mithun, Rameswar Panda|arXiv (Cornell University)|Aug 23, 2018
Multimodal Machine Learning Applications被引用数 9
ひとこと要約

本稿では、完全にアノテートされた画像・テキストペアの少量セットと、ノイズの多いタグが付与された大規模なウェブ画像の両方を共同で学習することで、クロスモーダルな画像・テキスト検索を向上させる2段階のウェブリー監視手法を提案する。VSE や VSEPP などの監視付きペairワイズランキング損失に弱いアノテーションを持つウェブデータを統合することで、より頑健な視覚的・意味的埋め込みを学習し、最先端の手法と比較して顕著な性能向上を達成する—MSCOCO や Flickr30K において R@10 で最大 9% の向上を達成している。

ABSTRACT

Cross-modal retrieval between visual data and natural language description remains a long-standing challenge in multimedia. While recent image-text retrieval methods offer great promise by learning deep representations aligned across modalities, most of these methods are plagued by the issue of training with small-scale datasets covering a limited number of images with ground-truth sentences. Moreover, it is extremely expensive to create a larger dataset by annotating millions of images with sentences and may lead to a biased model. Inspired by the recent success of webly supervised learning in deep neural networks, we capitalize on readily-available web images with noisy annotations to learn robust image-text joint representation. Specifically, our main idea is to leverage web images and corresponding tags, along with fully annotated datasets, in training for learning the visual-semantic joint embedding. We propose a two-stage approach for the task that can augment a typical supervised pair-wise ranking loss based formulation with weakly-annotated web images to learn a more robust visual-semantic embedding. Experiments on two standard benchmark datasets demonstrate that our method achieves a significant performance gain in image-text retrieval compared to state-of-the-art approaches.

研究の動機と目的

  • 監視付き画像・テキスト検索で用いられる小規模で完全にアノテートされたデータセットのスケーラビリティとバイアスの制限を解消すること。
  • ノイズの多いタグが付与された大規模なウェブ画像が、視覚的・意味的埋め込みの頑健性を向上させることを検証すること。
  • 弱い監視付きウェブデータと監視付き画像・テキストペアを組み合わせた、実用的でスケーラブルなフレームワークを構築し、検索性能を向上させること。
  • 高価な人手によるアノテーションデータに依存することを減らし、画像・テキスト検索におけるクロスデータセット一般化性能を向上させること。

提案手法

  • 標準的なペアワイズランキング損失(例:VSE や VSEPP)を用いて、完全にアノテートされた画像・テキストペアの少量セットでジョイント埋め込みモデルを事前学習する2段階のトレーニングフレームワークを提案する。
  • 2段階目では、ウェブ画像にノイズの多いタグが付与された状態で、監視付き損失と弱い監視付き損失を同時に最適化することでモデルをファインチューニングする。
  • タグを対照的損失ペアの弱い監視として扱い、画像特徴とタグ埋め込みの間で対照的損失ペアを構築する。ここでタグは TF-IDF 重み付き BOW ベクトルとして表現される。
  • 画像とテキスト特徴が共通の潜在空間に投影される共有埋め込み空間を用い、クロスモーダル類似度計算を可能にする。
  • ランキング損失の重み付き組み合わせにより、監視付きおよび弱い監視付き信号を統合し、ノイズの多いウェブデータから学習するが、性能の低下を防ぐ。
  • 画像特徴抽出には深層ニューラルネットワーク(例:ResNet152, VGG19)を、文の符号化には Word2Vec を用いた RNN ベースのエンコーダーを用いる。

実験結果

リサーチクエスチョン

  • RQ1ノイズの多いタグが付与された大規模なウェブ画像が、画像・テキスト検索における視覚的・意味的埋め込みの頑健性を向上させることができるか?
  • RQ2限られた人手によるアノテート済みペアとウェブデータを統合した場合、MSCOCO や Flickr30K といった標準ベンチマークで性能にどのように影響を与えるか?
  • RQ3本手法は、完全に監視付きのベースラインと比較して、データセット間でより一般化性能が優れているか?
  • RQ4異なる損失関数(VSE 対 VSEPP)および画像特徴抽出器(VGG19 対 ResNet152)が、ウェブリー監視トレーニング方式とどのように相互作用するか?

主な発見

  • MSCOCO データセットでは、VSEPP-VGG19 変種において、標準的な監視付きベースラインと比較して R@1 で 6% の向上、R@10 で最大 9% の向上を達成した。
  • Flickr30K データセットでは、画像からテキストへの検索において R@1 が 3–6%、R@10 が 3–9% 向上し、特に VSEPP-VGG19 の設定で最大の向上が観察された。
  • テキストから画像への検索では、平均して R@1 が 2.25%、R@10 が 3.25% 向上し、両方向の検索で一貫した向上を示した。
  • ResNet152 特徴を用いた場合、より顕著な向上が見られた:テキストから画像への検索で R@1 が 11.18% 向上したのに対し、VGG19 を用いた場合は 3.5% にとどまった。
  • VSE および VSEPP の両方の損失形式において、本手法は一貫して性能を向上させ、異なるランキング損失設計とも互換性があることを示した。
  • 本手法は特徴選択や損失関数に対して頑健であり、基盤となるアーキテクチャや損失関数にかかわらず、ウェブデータの統合が一般化性能を向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。