Skip to main content
QUICK REVIEW

[論文レビュー] Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder

Zheyuan Liu, Weixuan Sun|arXiv (Cornell University)|May 25, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、最初に高速なベクトル類似度を用いて候補をフィルタリングし、その後で参照画像、テキストクエリ、候補画像の間の相互作用を明示的にモデル化するデュアルマルチモodalエンコーダーを用いてトップ候補を再ランク付けする二段階のコンposed画像検索手法を提案する。このアプローチは、効率性と微細なクロスマodal推論を組み合わせることで、Fashion-IQおよびCIRRベンチマークで最先端の性能を達成する。

ABSTRACT

Composed image retrieval aims to find an image that best matches a given multi-modal user query consisting of a reference image and text pair. Existing methods commonly pre-compute image embeddings over the entire corpus and compare these to a reference image embedding modified by the query text at test time. Such a pipeline is very efficient at test time since fast vector distances can be used to evaluate candidates, but modifying the reference image embedding guided only by a short textual description can be difficult, especially independent of potential candidates. An alternative approach is to allow interactions between the query and every possible candidate, i.e., reference-text-candidate triplets, and pick the best from the entire set. Though this approach is more discriminative, for large-scale datasets the computational cost is prohibitive since pre-computation of candidate embeddings is no longer possible. We propose to combine the merits of both schemes using a two-stage model. Our first stage adopts the conventional vector distancing metric and performs a fast pruning among candidates. Meanwhile, our second stage employs a dual-encoder architecture, which effectively attends to the input triplet of reference-text-candidate and re-ranks the candidates. Both stages utilize a vision-and-language pre-trained network, which has proven beneficial for various downstream tasks. Our method consistently outperforms state-of-the-art approaches on standard benchmarks for the task. Our implementation is available at https://github.com/Cuberick-Orion/Candidate-Reranking-CIR.

研究の動機と目的

  • コンポジット画像検索(CIR)における推論効率と識別力のトレードオフを解消すること。
  • 三つ組みモデル化を通じてクエリと候補の明示的相互作用を可能にすることで、検索精度を向上させること。
  • 高速な事前フィルタリングと計算コストの高い再ランク付け段階を組み合わせることで、許容可能な推論時間を維持すること。
  • CIRにおいてビジョンアンドランゲージプリトレーニングモデルをデュアルエンコーダー構造で効果的に活用すること。

提案手法

  • 本手法は二段階パイプラインを用いる:まず、候補集合のサイズを削減するための高速なベクトル距離ベースのフィルタリング。
  • フィルタリング段階では、クエリ変更済みの参照埋め込みと事前に計算された候補埋め込みの間のコサイン類似度を計算する。
  • 再ランク付け段階では、参照画像、テキストクエリ、候補画像の三つ組みを同時に注目するデュアルエンコーダー構造を採用する。
  • デュアルエンコーダーは、三つの入力をマルチモーダルトランスフォーマーエンコーダーで処理し、洗練された関連スコアを計算する。
  • 両段階ともビジョンアンドランゲージプリトレーニングバックボーンに基づいて構築されており、強力な特徴表現を保証する。
  • 最終的な予測は、最高の関連スコアを持つ再ランク付け済みトップ-K候補から選択される。

実験結果

リサーチクエスチョン

  • RQ1二段階アプローチは、コンポジット画像検索における推論効率と識別力のバランスを取れるか?
  • RQ2クエリ-候補間の直接的な特徴修正と比較して、三つ組みレベルの相互作用(参照-テキスト-候補)は、検索精度の向上にどの程度効果的か?
  • RQ3最小限の性能低下で、デュアルエンコーダー構造がコンポジット画像検索におけるクロスマodal相互作用を効果的にモデル化できるか?
  • RQ4再ランク付け段階における候補集合サイズ(K)と推論コストの最適なトレードオフは何か?
  • RQ5再ランク付け段階は、初期フィルタリング段階に比べて、リCALLとプレシジョンの観点でどの程度向上するか?

主な発見

  • 提案手法は、Fashion-IQおよびCIRRベンチマークの両方で最先端の性能を達成し、既存のSOTA手法を上回る。
  • 再ランク付け段階は、単独のフィルタリング結果と比較して平均リCALLを約5パーセンテージポイント向上させる。
  • Fashion-IQでは、再ランク付けステップの推論時間がフィルタリングステップの約8倍遅く、CIRRでは約35倍遅い。
  • フィルタリングモジュールは、簡単なネガティブ例を効果的に除去しており、上位6候補がすでに参照画像に類似しているという定性的な結果から明らかである。
  • CIRRの定性的な例の4つ中3つにおいて、再ランク付けモデルは真のターゲットを上位に引き上げており、特にネコのような追加されたオブジェクトや図書館のような新しいシーン要因の検出において優れた性能を示す。
  • 「with」を正しく解釈して同時に二つのエンティティを検出する必要がある組み合わせ的推論を要するケースでは失敗する。これは図4の失敗例(d)で確認できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。