Skip to main content
QUICK REVIEW

[論文レビュー] ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval

Mengjun Cheng, Y. J. Sun|arXiv (Cornell University)|Mar 31, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

ViSTAは、新しい融合トークン機構と二重対照学習を用いて視覚的特徴とシーンテキスト特徴を統合することで、シーンテキストあり・なしの両方の状況におけるクロスモーダルリtrievalを統合する完全なトランスフォーマー基盤フレームワークを提案する。最先端の性能を達成し、シーンテキストありリtrievalにおいてRecall@1を8.4%向上させるとともに、従来手法より少なくとも3倍高速に動作する。

ABSTRACT

Visual appearance is considered to be the most important cue to understand images for cross-modal retrieval, while sometimes the scene text appearing in images can provide valuable information to understand the visual semantics. Most of existing cross-modal retrieval approaches ignore the usage of scene text information and directly adding this information may lead to performance degradation in scene text free scenarios. To address this issue, we propose a full transformer architecture to unify these cross-modal retrieval scenarios in a single $ extbf{Vi}$sion and $ extbf{S}$cene $ extbf{T}$ext $ extbf{A}$ggregation framework (ViSTA). Specifically, ViSTA utilizes transformer blocks to directly encode image patches and fuse scene text embedding to learn an aggregated visual representation for cross-modal retrieval. To tackle the modality missing problem of scene text, we propose a novel fusion token based transformer aggregation approach to exchange the necessary scene text information only through the fusion token and concentrate on the most important features in each modality. To further strengthen the visual modality, we develop dual contrastive learning losses to embed both image-text pairs and fusion-text pairs into a common cross-modal space. Compared to existing methods, ViSTA enables to aggregate relevant scene text semantics with visual appearance, and hence improve results under both scene text free and scene text aware scenarios. Experimental results show that ViSTA outperforms other methods by at least $\bf{8.4}\%$ at Recall@1 for scene text aware retrieval task. Compared with state-of-the-art scene text free retrieval methods, ViSTA can achieve better accuracy on Flicker30K and MSCOCO while running at least three times faster during the inference stage, which validates the effectiveness of the proposed framework.

研究の動機と目的

  • シーンテキストが存在しない、もしくはノイズが混入している状況で性能が低下する既存のクロスモーダルリtrievalモデルの限界を是正すること。
  • シーンテキストありおよびシーンテキストなしのクロスモーダルリtrievalを、どちらの状況でも性能を落とさずに統合する、単一でスケーラブルなフレームワークに統合すること。
  • 軽量な統合機構を用いて、シーンテキストが存在する場合にのみ関連するシーンテキストの意味的特徴を効果的に集約することで、視覚的表現を向上させること。
  • 二重対照学習により、視覚モダリティの耐性を強化し、シーンテキストが欠落している場合でもアライメントを維持すること。
  • 最小限の計算コストで済む二重エンコーダー型トランスフォーマー・アーキテクチャを活用することで、大規模リtrievalに適した高速な推論を可能にすること。

提案手法

  • ViSTAは、画像パッチとシーンテキスト埋め込みを別々にエンコードする完全なトランスフォーマー・アーキテクチャを採用し、モダリティ固有の情報を交換する専用の融合トークンを介してそれらを統合する。
  • 融合トークン機構により、視覚的特徴とシーンテキスト特徴の間で選択的かつ注意に基づいた相互作用が可能となり、各モダリティにおける最も顕著な特徴に集中する。
  • 二重対照学習が導入され、一方の損失は画像-テキストペアを、もう一方は画像-統合ペアをそれぞれアライメントさせることで、モダリティ欠落下でも視覚的特徴の耐性を向上させる。
  • 効率的な推論を実現するため、二重エンコーダー構成を採用し、事前に画像およびテキスト特徴をオフラインで計算することで、大規模な類似度計算を高速化する。
  • 統合機構は最大4層まで複数層にわたって適用可能であり、アブレーションスタディにより4層が最適な性能を示すことが判明した。
  • アブレーション実験では、グローバルアテンション、クロスアテンション、およびラテント統合と比較され、融合トークン手法が優れていることが実証された。

実験結果

リサーチクエスチョン

  • RQ1統一されたクロスモーダルリtrievalフレームワークは、性能の低下を伴わずに、シーンテキストありおよびシーンテキストなしの両状況を効果的に処理できるか?
  • RQ2シーンテキストが存在しない場合に干渉を避けるために、どのようにして視覚的特徴とシーンテキスト情報を選択的に統合できるか?
  • RQ3トランスフォーマー基盤アーキテクチャにおいて、視覚的特徴とシーンテキスト特徴を統合する最適な統合機構は何か?
  • RQ4二重対照学習は、シーンテキストが欠落している、もしくはノイズが混入している状況でも、視覚的特徴表現の耐性を向上させるか?
  • RQ5提案手法は、大規模リtrievalにおいて高い精度を達成するとともに、高速な推論速度を維持できるか?

主な発見

  • ViSTAは、シーンテキストありの画像-テキストリtrievalにおいてCTC-1Kベンチマークで52.5%のRecall@1を達成し、従来の最先端手法を最低8.4%以上上回った。
  • シーンテキストなしの状況でも強力な性能を維持し、CTC-1Kで47.0%のRecall@1を達成し、最先端手法と同等またはそれ以上の性能を示した。
  • ViSTAは、二重エンコーダー設計と効率的な統合機構のおかげで、従来手法より少なくとも3倍高速に推論が可能である。
  • アブレーションスタディにより、融合トークン戦略がグローバルアテンション、クロスアテンション、およびラテント統合を上回り、画像-テキストリtrievalで52.5%のR@1を達成することが確認された。
  • 二重対照学習は性能を顕著に向上させ、完全な損失設定では52.5%のR@1を達成したが、一方の対照損失のみを用いた場合では46.6%にとどまった。
  • 融合層の数を増やすことで性能が向上し、4層がピークに達し52.5%のR@1を記録した。これは、より深い統合が特徴学習を強化することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。