Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Embeddings for Cross-Modal Retrieval

Sanghyuk Chun, Seong Joon Oh|arXiv (Cornell University)|Jan 13, 2021
Multimodal Machine Learning Applications参考文献 58被引用数 5
ひとこと要約

本稿では、画像とキャプションを共有埋め込み空間内での確率分布として表現するProbabilistic Cross-Modal Embedding (PCME) を提案する。この方法により、画像-テキストペアに内在する1対多の対応関係をモデル化できる。不確実性を考慮した埋め込みを学習することで、決定的ベースラインを上回るリtrieval性能を達成し、解釈可能な不確実性推定と埋め込み上の集合演算を可能にする。

ABSTRACT

Cross-modal retrieval methods build a common representation space for samples from multiple modalities, typically from the vision and the language domains. For images and their captions, the multiplicity of the correspondences makes the task particularly challenging. Given an image (respectively a caption), there are multiple captions (respectively images) that equally make sense. In this paper, we argue that deterministic functions are not sufficiently powerful to capture such one-to-many correspondences. Instead, we propose to use Probabilistic Cross-Modal Embedding (PCME), where samples from the different modalities are represented as probabilistic distributions in the common embedding space. Since common benchmarks such as COCO suffer from non-exhaustive annotations for cross-modal matches, we propose to additionally evaluate retrieval on the CUB dataset, a smaller yet clean database where all possible image-caption pairs are annotated. We extensively ablate PCME and demonstrate that it not only improves the retrieval performance over its deterministic counterpart but also provides uncertainty estimates that render the embeddings more interpretable. Code is available at https://github.com/naver-ai/pcme

研究の動機と目的

  • 1対多の対応関係に起因する画像-テキストリtrievalの課題に対処すること。これは、1つの画像に対して複数の妥当なキャプションが存在する、あるいは逆に1つのキャプションが複数の画像を指す場合を含む。
  • 決定的埋め込み関数が、クロスモーダルマッチの多重性をモデル化できないという限界を克服すること。
  • COCOにおける非包括的ラベル付けの問題を解消するため、CUBデータセットを用いて包括的なアノテーションを備えた洗練された評価ベンチマークを提案すること。
  • 不確実性推定による解釈可能な埋め込みを実現し、曖昧さや失敗の可能性の分析を可能にすること。
  • 確率的埋め込みが集合代数的演算(例:混合、削除)をサポートでき、それが意味的関係と整合することを示すこと。

提案手法

  • 画像とキャプションを、平均ベクトルと分散ベクトルによってパラメータ化された共有埋め込み空間内での多変量ガウス分布として表現する。
  • ハードネガティブマイニングを用いた対照的損失でモデルを学習し、埋め込み損失は平均ベクトル上で計算され、不確実性はKLダイバージェンスによる正則化が施される。
  • 標準偏差成分の幾何平均をインスタンスごとの不確実性スコアとして用い、クエリにおける曖昧さを定量化する。
  • 画像やキャプションの領域を消去するデータオーグメンテーションを実施し、不確実性が視覚的または言語的情報の欠落とどのように相関するかを調査する。
  • t-SNEを用いて2次元に可視化することで、意味的クラスごとの空間的クラスタリングや分布行動を分析する。
  • 入力データに対して集合代数演算(例:混合、削除)を適用し、それに対応する埋め込み分布の変化を観察することで、確率的空間内での意味的整合性を検証する。

実験結果

リサーチクエスチョン

  • RQ1確率的埋め込みは、画像キャプションペアに一般的に見られる1対多の関係を効果的にモデル化できるか?
  • RQ2確率的埋め込みから得られる不確実性推定は、入力データの実際の曖昧さと相関しているか?
  • RQ3PCMEの性能は、標準的かつ洗練されたベンチマークにおいて、決定的およびマルチリプレゼンテーションベースラインと比較してどうなるか?
  • RQ4埋め込み上の集合演算は、交差や包含関係といった意味的関係を反映できるか?
  • RQ5不確実性スコアは、リtrievalの難易度や失敗の可能性を予測できるか?

主な発見

  • PCMEはCOCO 1kで45.0 R@1および68.8 R@5を達成し、決定的ベースラインを上回り、PVSEおよびVSRNベースラインと同等または上回る性能を示した。
  • モデルの性能は不確実性の増加に伴い低下し、高い不確実性がリtrievalの難易度と相関していることが確認された。
  • 標準偏差成分からの不確実性推定値は、画像における消去されたピクセルの割合やキャプションにおける消去された語の割合と正の相関を示し、入力の曖昧さに敏感であることが妥当性を確認した。
  • 2次元可視化では、'この鳥は <unk> ...' のような一般的なキャプションが複数のサブクラスをカバーする中心部に位置し、意味的一般性の分布モデル化が行われていることが示された。
  • 集合代数的演算(例:混合や削除)により得られる埋め込みは、交差や包含関係を反映しており、確率的空間内での意味的整合性が裏付けられた。
  • PCMEにおいて平均ベクトルのみ(mu-only)を用いても、決定的モデルを上回る性能を達成するが、完全な確率的モデリングにより、さらなるロバストネスと解釈可能性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。