Skip to main content
QUICK REVIEW

[論文レビュー] Cross-modal Active Complementary Learning with Self-refining Correspondence

Qin Yang, Sun Yuan|arXiv (Cornell University)|Oct 26, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、画像・テキストマッチングにおけるノイジーコルレスポンダ(NC)に対して耐性を高めるための一般化されたフレームワークであるクロスモーダルロバスト補完学習(CRCL)を提案する。本手法は、新たなアクティブ補完損失(ACL)と自己精練対応補正(SCC)を用いる。ACLはアクティブ学習と補完学習を統合し、誤った教師信号の影響を低減する。一方、SCCはモーメンタムに基づく自己精錬を用いて、対応補正を安定化・向上させる。本手法は、合成ノイズおよび実世界のノイズ下において、Flickr30K、MS-COCO、CC152Kで最先端のロバスト性を達成した。

ABSTRACT

Recently, image-text matching has attracted more and more attention from academia and industry, which is fundamental to understanding the latent correspondence across visual and textual modalities. However, most existing methods implicitly assume the training pairs are well-aligned while ignoring the ubiquitous annotation noise, a.k.a noisy correspondence (NC), thereby inevitably leading to a performance drop. Although some methods attempt to address such noise, they still face two challenging problems: excessive memorizing/overfitting and unreliable correction for NC, especially under high noise. To address the two problems, we propose a generalized Cross-modal Robust Complementary Learning framework (CRCL), which benefits from a novel Active Complementary Loss (ACL) and an efficient Self-refining Correspondence Correction (SCC) to improve the robustness of existing methods. Specifically, ACL exploits active and complementary learning losses to reduce the risk of providing erroneous supervision, leading to theoretically and experimentally demonstrated robustness against NC. SCC utilizes multiple self-refining processes with momentum correction to enlarge the receptive field for correcting correspondences, thereby alleviating error accumulation and achieving accurate and stable corrections. We carry out extensive experiments on three image-text benchmarks, i.e., Flickr30K, MS-COCO, and CC152K, to verify the superior robustness of our CRCL against synthetic and real-world noisy correspondences.

研究の動機と目的

  • 実世界のデータにしばしば存在する不整合な画像・テキストペアに起因するノイジーコルレスポンダ(NC)の深刻な課題に対処すること。
  • 高いノイズレベル下で過学習や信頼性の低い補正が生じる既存手法の限界を克服すること。
  • 既存の画像・テキストマッチングモデルのアーキテクチャを変更することなく、ロバスト性を向上させる一般化されたフレームワークの開発。
  • アクティブ学習と補完学習のバランスを取ることで、誤った教師信号のリスクを低減しつつ、モデル性能を維持すること。
  • 繰り返し適用されるモーメンタム補正付き自己精錬プロセスを用いて、対応補正の正確性と安定性を向上させること。

提案手法

  • 信頼性の高い正例ペアに注目するアクティブ学習と、関係のないペアを間接的教師信号として用いる補完学習を統合したアクティブ補完損失(ACL)を提案する。
  • 補完学習部に指数正規化を導入し、損失更新の安定性を高め、ノイズの多い教師信号に対する耐性を向上させる。
  • 履歴予測を統合するために、モーメンタム補正を用いた複数の自己精錬プロセスを適用する自己精錬対応補正(SCC)機構を設計する。
  • 訓練エポックにわたる予測の安定化と精錬を図るため、モーメンタム補正(MC)を用いることで誤差蓄積を低減する。
  • ACLとSCCを既存の画像・テキストマッチングモデルにプラグインモジュールとして統合し、ノイズデータ下でのロバストな学習を可能にする。
  • ソフトマージン補正とアクティブサンプル選択を組み合わせることで、深層ネットワークの記憶効果を制御的に活用する。

実験結果

リサーチクエスチョン

  • RQ1ノイジーコルレスポンダ下での画像・テキストマッチングにおいて、誤った教師信号のリスクを低減する損失関数をどのように設計できるか?
  • RQ2アクティブ学習と補完学習をどのように共同最適化することで、ノイジーピアの影響に対するロバスト性を向上させられるか?
  • RQ3モーメンタム補正付きの反復的自己精錬は、ノイズ環境下での対応補正の正確性と安定性を向上させられるか?
  • RQ4本手法であるCRCLは、合成および実世界のノイジーコルレスポンダが高水準に存在する状況下で、既存手法と比較してどの程度の性能を示すか?
  • RQ5本フレームワークは、アーキテクチャの変更なしに、さまざまな既存の画像・テキストマッチングアーキテクチャに一般化して適用可能か?

主な発見

  • 提案されたCRCLフレームワークは、合成および実世界のノイジーコルレスポンダ設定下で、Flickr30K、MS-COCO、CC152Kで最先端の性能を達成した。
  • ACLはアクティブ学習と補完学習のバランスを取ることで、ノイジーペアへの過学習を顕著に低減し、より安定した学習ダイナミクスを実現した。
  • モーメンタム補正付きのSCCは誤差蓄積を低減し、特に高ノイズレベル下で対応補正の正確性を向上させた。
  • 広範なアブレーションスタディにより、ACLとSCCが相乗的にロバスト性に寄与していることが確認され、ACLが信頼性の高い教師信号を提供し、SCCが正確な補正を保証していることが示された。
  • 本フレームワークは優れた一般化性能を示し、既存の画像・テキストマッチングモデルを最小限のアーキテクチャ的変更で強化できた。
  • MS-COCO(50%ノイズ)において、CRCLは先行手法を大きく上回り、極端なノイズ条件下での有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。