Skip to main content
QUICK REVIEW

[論文レビュー] Category-Based Deep CCA for Fine-Grained Venue Discovery from Multimodal Data

Yi Yu, Suhua Tang|arXiv (Cornell University)|May 8, 2018
Advanced Image and Video Retrieval Techniques参考文献 23被引用数 5
ひとこと要約

本論文では、同じ会場からの画像・テキストペア間の対比較相関と、同じタイプの会場間のカテゴリベース相関を同時に最適化する新しい深層学習モデル、Category-based Deep CCA (C-DCCA) を提案する。これにより、マルチモーダルデータから同時に正確な会場検索とグループ会場検索が可能になる。C-DCCA は、VGG16+Doc2Vec 特徴を用いた UCSD データセットで MAP 0.496 を達成し、最先端手法を上回る性能を発揮した。

ABSTRACT

In this work, travel destination and business location are taken as venues. Discovering a venue by a photo is very important for context-aware applications. Unfortunately, few efforts paid attention to complicated real images such as venue photos generated by users. Our goal is fine-grained venue discovery from heterogeneous social multimodal data. To this end, we propose a novel deep learning model, Category-based Deep Canonical Correlation Analysis (C-DCCA). Given a photo as input, this model performs (i) exact venue search (find the venue where the photo was taken), and (ii) group venue search (find relevant venues with the same category as that of the photo), by the cross-modal correlation between the input photo and textual description of venues. In this model, data in different modalities are projected to a same space via deep networks. Pairwise correlation (between different modal data from the same venue) for exact venue search and category-based correlation (between different modal data from different venues with the same category) for group venue search are jointly optimized. Because a photo cannot fully reflect rich text description of a venue, the number of photos per venue in the training phase is increased to capture more aspects of a venue. We build a new venue-aware multimodal dataset by integrating Wikipedia featured articles and Foursquare venue photos. Experimental results on this dataset confirm the feasibility of the proposed method. Moreover, the evaluation over another publicly available dataset confirms that the proposed method outperforms state-of-the-arts for cross-modal retrieval between image and text.

研究の動機と目的

  • 実世界のユーザー生成写真と豊富なテキスト記述から、細分化された会場発見の課題に取り組むこと。
  • 特定の会場を特定する「正確な会場検索」と、同じカテゴリの類似会場を検索する「グループ会場検索」を同時に最適化すること。
  • Wikipedia と Foursquare からの異種マルチモーダルデータを活用して、画像とテキスト間のクロスモーダル相関学習を向上させること。
  • トレーニング中の1会場あたりの写真数を増やすことで、多様な視覚的側面を捉える表現学習を強化すること。
  • 新しく構築したマルチモーダル会場データセットと公開の UCSD データセットを用いて、クロスモーダル検索の検証を実施すること。

提案手法

  • C-DCCA は Deep CCA を拡張し、同じ会場からの画像とテキスト間の対比較相関と、同じカテゴリの異なる会場間のカテゴリベース相関の2種類の相関を導入する。
  • 深層ニューラルネットワークが画像およびテキスト特徴を共通の潜在空間にマップし、クロスモーダル相関を最大化する。
  • 正確な会場検索とグループ会場検索の両方のパフォーマンスをバランスさせるため、両相関目的を統合した損失関数を用いて、同時に最適化する。
  • 視覚的特徴抽出には VGG16 を、テキスト的特徴学習には Doc2Vec を使用し、ドメイン特化表現を向上させるために微調整を適用する。
  • Wikipedia の特集記事(テキスト)と Foursquare の会場写真(画像)を統合することで、会場ごとの視覚的多様性を高めた新しいマルチモーダルデータセットを構築する。
  • 検索空間を縮小し、正確な会場検索性能を向上させるために、粗い地理的位置情報を用いる。

実験結果

リサーチクエスチョン

  • RQ1対比較相関とカテゴリベース相関の共同最適化は、正確な会場検索とグループ会場検索の両方のパフォーマンスを向上させるか?
  • RQ2Wikipedia のテキストと1会場1枚の画像に依存するのではなく、Foursquare からの追加の会場写真を統合することで、表現学習はどの程度向上するか?
  • RQ3深層特徴(例:VGG16)と文脈的テキスト埋め込み(例:Doc2Vec)を用いることで、手作業特徴(例:SIFThist, LDA)に比べて、クロスモーダル検索性能はどの程度向上するか?
  • RQ4事前学習モデルを会場特化データセットで微調整することで、クロスモーダル検索性能が向上するか?
  • RQ5粗い位置情報の使用が、C-DCCA と標準 DCCA の間の正確な会場検索性能差にどの程度影響を与えるか?

主な発見

  • C-DCCA は、VGG16+Doc2Vec 特徴を用いた UCSD データセットで MAP 0.496 を達成し、最先端手法 SCM(MAP 0.277)を著しく上回った。
  • DCCA やその他の最先端手法と比較して、グループ会場検索性能が15–20%向上した。特に深層特徴を用いた場合に顕著であった。
  • SIFThist ではなく VGG16 を使用することで、MAP が15ポイント以上向上し、複雑な視覚的意味を捉える深層特徴の優位性を示した。
  • VGG16 の微調整と Doc2Vec モデルの再学習により、MAP が 4.1%(0.455 → 0.496)の絶対的向上を達成し、ドメイン特化適応が性能向上に寄与することを示した。
  • 粗い位置情報の使用により、ロサンゼルスでは正確な会場検索で MRR1 が 0.8、ロンドンでは 0.7 を達成し、位置情報の事前知識が DCCA との性能差を縮小することを示した。
  • 正確な会場検索性能がわずかに低下しても、グループ会場検索性能は強く維持されたことから、カテゴリベース相関学習の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。