Skip to main content
QUICK REVIEW

[論文レビュー] Improved Probabilistic Image-Text Representations

Sanghyuk Chun|arXiv (Cornell University)|May 29, 2023
Image Retrieval and Classification Techniques被引用数 6
ひとこと要約

本論文は、モンテカルロ近似を閉形式の確率的距離に置き換えることで、効率的で正確な推論を実現する、PCME++と呼ばれる改善された確率的画像・テキストマッチングフレームワークを提案する。偽陽性の導入とミックスサンプルデータ拡張を用いることで、豊富な偽陰性が存在する状況下での損失飽和を軽減し、MS-COCO、CxC、ECCV Captionベンチマークで最先端の性能を達成。ノイズの多いアノテーションにも強く、ゼロショットプロンプトチューニングへの応用性も有する。

ABSTRACT

Image-Text Matching (ITM) task, a fundamental vision-language (VL) task, suffers from the inherent ambiguity arising from multiplicity and imperfect annotations. Deterministic functions are not sufficiently powerful to capture ambiguity, prompting the exploration of probabilistic embeddings to tackle the challenge. However, the existing probabilistic ITM approach encounters two key shortcomings; the burden of heavy computations due to the Monte Carlo approximation, and the loss saturation issue in the face of abundant false negatives. To overcome the issues, this paper presents an improved Probabilistic Cross-Modal Embeddings (named PCME++) by introducing a new probabilistic distance with a closed-form solution. In addition, two optimization techniques are proposed to enhance PCME++ further: first, the incorporation of pseudo-positives to prevent the negative effect under massive false negatives; second, mixed sample data augmentation for probabilistic matching. Experimental results on MS-COCO Caption and two extended benchmarks, CxC and ECCV Caption, demonstrate the effectiveness of PCME++ compared to state-of-the-art ITM methods. The robustness of PCME++ is also evaluated under noisy image-text correspondences. In addition, the potential applicability of PCME++ in automatic prompt-filtering for zero-shot classification is shown. The code is available at https://github.com/naver-ai/pcmepp

研究の動機と目的

  • MS-COCOのようなデータセットにおける多数対多数の対応関係と疎なアノテーションに起因する、画像・テキストマッチングの本質的曖昧性に対処すること。
  • モンテカルロサンプリングに依存する従来の確率的ITM手法(例:PCME)が抱える計算効率の低さと損失飽和の問題を克服すること。
  • 効率的な推論と近似最近傍探索との統合を可能にする、閉形式解を有するスケーラブルで微分可能な確率的距離を設計すること。
  • 偽陽性とミックスサンプルデータ拡張を導入することで、ノイズや不完全な監視下でもモデルの一般化性能を向上させること。
  • 不確実性を意識した表現が、ゼロショット分類の自動プロンプトチューニングといった下流タスクにどのように有効に応用できるかを示すこと。

提案手法

  • 2つの正規分布間の期待L2距離を解析的に計算する閉形式サンプリング距離(CSD)を導入し、モンテカルロサンプリングの必要性を排除する。
  • CSDに基づく新しい目的関数を提案し、正確な勾配と低コストな計算を実現するエンドツーエンド学習を可能にする。
  • 現実のデータセットに多く存在する偽陰性による勾配飽和を是正するため、偽陽性を導入する。
  • 確率的マッチングに適した多様で現実的な訓練サンプルを生成するため、ミックスサンプルデータ拡張(MSDA)を適用する。
  • 閉形式距離を活用することで、FAISSを用いた効率的な近似最近傍(ANN)検索との統合を可能にする、確率的埋め込み空間の適合を実現する。
  • 学習済み分布からの不確実性推定値を活用し、ゼロショット分類におけるプロンプト選択をガイドすることで、制御可能なリtrievalを実現する。

実験結果

リサーチクエスチョン

  • RQ1モンテカルロ近似と比較して、確率的距離の閉形式解が、画像・テキストマッチングの効率性と正確性をどのように向上させるか?
  • RQ2多数の偽陰性が存在する確率的ITMにおいて、偽陽性の導入が損失飽和をどの程度軽減するか?
  • RQ3ミックスサンプルデータ拡張が、確率的画像・テキスト表現の一般化性能をどの程度向上させるか?
  • RQ4PCME++が得る不確実性を意識した表現は、ゼロショット分類における自動プロンプトチューニングに効果的に応用できるか?
  • RQ5ノイズや不完全な画像・テキストアノテーションに対して、PCME++は決定的および従来の確率的ベースラインと比較してどの程度頑健か?

主な発見

  • PCME++はMS-COCO Captionで最先端の性能を達成し、特にバックボーンサイズが増加する際(例:ViT-L/14)にSOTA手法を一貫して上回る改善を示す。
  • 拡張されたベンチマークCxCおよびECCV Captionでも、PCME++は既存手法を上回り、多様なデータ分布にわたる強力な一般化性能を示す。
  • ノイズの多い画像・テキスト対応関係に対しても頑健で、正例ラベルが汚損または不完全であっても高い性能を維持する。
  • 閉形式距離により効率的な推論が可能であり、FAISSとの統合を可能にし、大規模リtrievalに向けたスケーラビリティを実現する。
  • PCME++が得る不確実性推定値は高い解釈可能性を示し、低信頼度の予測のユーザー主導による除外を可能にする制御可能なリtrievalを実現する。
  • PCME++はゼロショット画像分類のための効果的な自動プロンプトチューニングを可能にし、ImageNetでInfoNCE や VSE++といった強力なベースラインを上回る性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。