Skip to main content
QUICK REVIEW

[論文レビュー] CWCL: Cross-Modal Transfer with Continuously Weighted Contrastive Loss

Rakshith Sharma Srinivasa, Jaejin Cho|arXiv (Cornell University)|Sep 26, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、対照的学習の新しい目的関数として、連続的で二値的でない測度としてクロスモodalデータ間の類似度をモデル化する、継続的重み付き対照的損失(CWCL)を提案する。バッチ内のすべての類似例(正例・負例のペアに限らない)を活用することで、CWCLはゼロショット転移性能を向上させ、画像分類タスクで6–8%、音声から意図への分類およびキーワード分類タスクで20–30%の絶対的向上を達成した。

ABSTRACT

This paper considers contrastive training for cross-modal 0-shot transfer wherein a pre-trained model in one modality is used for representation learning in another domain using pairwise data. The learnt models in the latter domain can then be used for a diverse set of tasks in a zero-shot way, similar to ``Contrastive Language-Image Pre-training (CLIP)'' and ``Locked-image Tuning (LiT)'' that have recently gained considerable attention. Most existing works for cross-modal representation alignment (including CLIP and LiT) use the standard contrastive training objective, which employs sets of positive and negative examples to align similar and repel dissimilar training data samples. However, similarity amongst training examples has a more continuous nature, thus calling for a more `non-binary' treatment. To address this, we propose a novel loss function called Continuously Weighted Contrastive Loss (CWCL) that employs a continuous measure of similarity. With CWCL, we seek to align the embedding space of one modality with another. Owing to the continuous nature of similarity in the proposed loss function, these models outperform existing methods for 0-shot transfer across multiple models, datasets and modalities. Particularly, we consider the modality pairs of image-text and speech-text and our models achieve 5-8% (absolute) improvement over previous state-of-the-art methods in 0-shot image classification and 20-30% (absolute) improvement in 0-shot speech-to-intent classification and keyword classification.

研究の動機と目的

  • 事前学習モデルからの完全な教師信号をクロスモーダルアライメントの過程で抽出する際の、標準的対照的学習の非効率性を解消すること。
  • 事前学習済みテキストモデルを活用することで、音声や医療画像のような低リソースモーダルティに特化したゼロショット転移性能を向上させること。
  • 類似度を二値的(正例/負例)に扱うのではなく、類似度の連続的性質を捉える損失関数を開発すること。
  • 画像テキストおよび音声テキストを含む、多様なモダリティペアにおいて提案手法の有効性を実証すること。
  • 既存のペairedデータから最大限の教師信号を得ることで、データおよび計算効率の良いトレーニングを可能にすること。

提案手法

  • アーキテクチャのアノテーションとバッチ内すべての他のサンプルとの類似度に基づいて、動的重みを負例に割り当てる継続的重み付き対照的損失(CWCL)を導入する。
  • アノテーションとバッチ内すべての他のサンプルとの間の連続的類似度スコアを計算する類似度関数を用い、二値的正例/負例の区別を置き換える。
  • 温度スケーリングと学習可能なパラメータを用いて重み関数をキャリブレーションし、モデルが最も情報の多い類似サンプルに適応的に注目できるようにする。
  • 事前学習済み画像または音声エンコーダーを凍結させつつ、テキストエンコーダーをエンドツーエンドでトレーニングすることで、元のモダリティからの知識を保持する。
  • テンプレートベースのクラス埋め込み生成を用いてゼロショット意図分類およびキーワード分類を改善し、事前学習済みテキスト表現との整合性を高める。
  • ミニバッチレベルの対照的目的関数を用いて確率的勾配降下法で損失を最適化し、バッチ内のすべてのサンプルを考慮する。

実験結果

リサーチクエスチョン

  • RQ1連続的類似度測定は、標準的対照的学習を上回るゼロショットクロスモーダル転移を実現できるか?
  • RQ2画像テキストおよび音声テキストアライメントタスクにおいて、CWCLは標準的対照的損失と比較してどのように性能を発揮するか?
  • RQ3CWCLは、性能を維持または向上させつつ、データおよび計算要件をどれほど削減できるか?
  • RQ4CWCLは、ラベル付きデータが限られたモダリティペアに対しても一般化可能か?
  • RQ5CWCLは、低リソース音声タスクにおいて、完全に教師ありモデルと同等の性能を達成できるか?

主な発見

  • RoBERTa+Sを用いた場合、CWCLは最良のベースライン比でゼロショット画像分類精度を6–8%絶対的に向上させ、SLURPで63.80%の精度を達成した。
  • STOPデータセットでは、CWCLがゼロショット音声から意図への分類を20–30%絶対的に向上させ、RoBERTa+Sで87.87%の精度を達成した。
  • GSCV2におけるキーワードスプライティングでは、テンプレートなしで81.02%、テンプレートベースのクラス埋め込みを用いることで82.77%の精度を達成し、ベースラインを上回った。
  • テンプレートを用いたBARTベースのモデルは、GSCV2で89.43%の精度を達成し、タスク固有のトレーニングデータを用いた教師ありベースラインに近い性能を示した。
  • CWCLは、より少ないデータサンプルでトレーニングされたモデルが、標準的対照的学習よりも高い性能を示しており、データ効率性を実証した。
  • タスク固有の微調整なしに、テンプレートありでGSCV2で98.2%の精度を達成するなど、ほぼ教師あり性能を達成しており、ゼロショット一般化能力の高さが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。