Skip to main content
QUICK REVIEW

[論文レビュー] Crisscrossed Captions: Extended Intramodal and Intermodal Semantic Similarity Judgments for MS-COCO

Zarana Parekh, Jason Baldridge|arXiv (Cornell University)|Apr 30, 2020
Multimodal Machine Learning Applications参考文献 31被引用数 14
ひとこと要約

Crisscrossed Captions (CxC) は、画像-キャプション、キャプション-キャプション、画像-画像のペア間で人間がアノテートした267,095件の意味的類似度判断を含む MS-COCO を拡張し、マルチモーダルおよびユニモーダル表現学習の包括的評価を可能にする。画像-テキストペアとキャプション-キャプションペアの両方で学習したマルチタスク二重エンコーダーは、4つの検索タスクで最先端の性能を達成し、モダリティ間学習が画像エンコーディングの代償をもってテキストエンコーディングを向上させることを示している。このトレードオフは CxC の高密度アノテーションがなければ測定不可能である。

ABSTRACT

By supporting multi-modal retrieval training and evaluation, image captioning datasets have spurred remarkable progress on representation learning. Unfortunately, datasets have limited cross-modal associations: images are not paired with other images, captions are only paired with other captions of the same image, there are no negative associations and there are missing positive cross-modal associations. This undermines research into how inter-modality learning impacts intra-modality tasks. We address this gap with Crisscrossed Captions (CxC), an extension of the MS-COCO dataset with human semantic similarity judgments for 267,095 intra- and inter-modality pairs. We report baseline results on CxC for strong existing unimodal and multimodal models. We also evaluate a multitask dual encoder trained on both image-caption and caption-caption pairs that crucially demonstrates CxC's value for measuring the influence of intra- and inter-modality learning.

研究の動機と目的

  • 既存の画像キャプションデータセット(例:MS-COCO)に、包括的なクロスモダリティおよびイントラモダリティ関係が欠如している問題に対処すること。
  • 異なるモダリティ間のポジティブおよびネガティブな関連性を含めることで、マルチモーダル表現学習の包括的評価を可能にすること。
  • モダリティ間(画像-テキスト)およびモダリティ内(テキスト-テキスト、画像-画像)関係から学習するモデルの開発と評価を支援すること。
  • 画像-テキスト、テキスト-画像、テキスト-テキスト、画像-画像検索タスクの全範囲でモデル性能を評価する統一ベンチマークを提供すること。
  • マルチタスク学習が多様な検索および類似度タスクのパフォーマンスをバランスよく向上させることの有効性を検証すること。

提案手法

  • 意味的類似度スコア(0–5)を、Semantic Textual Similarity (STS) にインspiredされた段階的類似度スケールを用いて、267,095組の画像-キャプション、キャプション-キャプション、画像-画像ペアに対してアノテートする。
  • 意味的関連性の分布を幅広くカバーするよう、多様性に偏った間接的サンプリング戦略を採用する。
  • 画像-テキスト検索のための双方向損失と、テキスト-テキスト検索のための別個損失を用いたマルチタスク二重エンコーダーを訓練する。
  • BERTベースのテキストエンコーダーと EfficientNet-B4 を画像エンコーダーとして使用し、画像-テキストおよびキャプション-キャプション類似度の両方を同時に最適化する。
  • 公開されたコードリリースを用いて CxC アノテーションを既存の MS-COCO データと統合し、既存のベンチマークとのシームレスな統合を可能にする。
  • 検索タスクの4つの異なる設定において、Recall@k、Spearmanの順位相関係数(Spearman R)、および検索パフォーマンスを用いてモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1画像-キャプションペアとキャプション-キャプションペアの両方で同時に学習することで、画像-テキスト、テキスト-画像、テキスト-テキスト、画像-画像検索タスクのパフォーマンスにどのような影響を与えるか?
  • RQ2標準的な MS-COCO 評価に含まれないイントラモダリティ類似度判断に対して、既存のユニモーダルおよびマルチモーダルモデルはどの程度一般化できるか?
  • RQ3統一的かつ高密度なクロスモダリティおよびイントラモダリティペアのセットで学習された場合、1つのモデルアーキテクチャが多様な検索および類似度タスクでバランスの取れたパフォーマンスを達成できるか?
  • RQ4モデルがモダリティ間およびモダリティ内類似度の両方を最適化するように訓練された場合、表現能力にどのようなトレードオフが生じるか?
  • RQ5人間によるアノテート類似度スコアと、モデルの予測値との相関関係は、異なるモダリティおよびタスクでどの程度の強さを示すか?

主な発見

  • マルチタスク二重エンコーダー(DE T2T+I2T)は、4つの検索タスクすべてで最も高い全体的パフォーマンスを達成し、画像-テキストペアのみで学習したモデルを上回った。
  • DE T2T+I2T モデルは、複数のモデルで Recall@k に1–3%の絶対的向上を示し、CxC が追加のポジティブペアを提供することで検索再現率が向上することを実証した。
  • 画像-キャプションペアのみで学習されたにもかかわらず、DE T2T+I2T モデルはテキスト-テキスト類似度(Spearman R = 0.82)で最高のスコアを記録し、STS、SIS、SITSの3つの類似度タスクでバランスの取れた性能を示した。
  • 画像-テキストペアのみで学習したモデル(DE I2T)は、SISスコア(81.3)が最高であったが、STSスコア(50.9)が最低であり、画像表現に強く集中している一方でテキスト表現が弱体化していることを示唆した。
  • CxC アノテーションは、同じ画像に複数のキャプションが付与される「コ・キャプション(co-captions)」の平均類似度が低く(3.0)、これはパラフレーズ生成に使用する際の課題を示しており、人間の評価において画像の文脈を考慮する必要性を強調している。
  • CxC データセットは、MS-COCO の元々の 50,000 個のバイナリペアに比べ、アノテーション密度を 5 倍以上に向上させ、267,095 の類似度スコアを裏付ける 1,335,475 件の独立した人間の判断を含んでいる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。