Skip to main content
QUICK REVIEW

[論文レビュー] Data Efficient Language-supervised Zero-shot Recognition with Optimal Transport Distillation

BoRui Wu, Ruizhe Cheng|arXiv (Cornell University)|Dec 17, 2021
Multimodal Machine Learning Applications被引用数 14
ひとこと要約

OTTERは、ノイズの多いハードラベルに依存せず、ソフトで一対多の画像・テキストマッチングをモデル化することで対照学習を改善する最適輸送蒸留を用いたデータ効率の良いゼロショット認識手法を提案する。300万枚の画像・テキストペアでの学習のみで、42件の評価においてInfoNCE、ラベルスムージング、知識蒸留を上回り、Google Open ImagesおよびImageNet 10KでSOTAを達成し、FH@10で最大6.6ポイントの向上を達成した。

ABSTRACT

Traditional computer vision models are trained to predict a fixed set of predefined categories. Recently, natural language has been shown to be a broader and richer source of supervision that provides finer descriptions to visual concepts than supervised "gold" labels. Previous works, such as CLIP, use InfoNCE loss to train a model to predict the pairing between images and text captions. CLIP, however, is data hungry and requires more than 400M image-text pairs for training. The inefficiency can be partially attributed to the fact that the image-text pairs are noisy. To address this, we propose OTTER (Optimal TransporT distillation for Efficient zero-shot Recognition), which uses online entropic optimal transport to find a soft image-text match as labels for contrastive learning. Based on pretrained image and text encoders, models trained with OTTER achieve strong performance with only 3M image text pairs. Compared with InfoNCE loss, label smoothing, and knowledge distillation, OTTER consistently outperforms these baselines in zero shot evaluation on Google Open Images (19,958 classes) and multi-labeled ImageNet 10K (10032 classes) from Tencent ML-Images. Over 42 evaluations on 7 different dataset/architecture settings x 6 metrics, OTTER outperforms (32) or ties (2) all baselines in 34 of them.

研究の動機と目的

  • 大規模でノイズの多い画像・テキストデータセットで学習する際の対照学習のデータ非効率性を解消すること。
  • ハードラベルに依存せず、ソフトで一対多の画像・テキストマッチング関係をモデル化することで性能を向上させること。
  • CLIPが使用する4億ペアのような巨大データセットに依存するのを減らし、より小さなノイズの多いデータから最適輸送を活用して訓練信号を精錬すること。
  • エントロピー正則化された最適輸送を用いて、未ペアの画像とキャプション間の確率的マッチングを割り当てることで、ゼロショット一般化を強化すること。
  • 最小限のデータでSOTAのパフォーマンスを達成しつつ、多様なベンチマークで強力な一般化性能を維持すること。

提案手法

  • OTTERは、画像、テキスト、クロスモodalな類似度から成る類似度行列を用いて、画像とキャプション間のペアワイズマッチングスコアをモデル化する。
  • エントロピー正則化された最適輸送を適用し、バッチ内のすべての画像・テキストペアに対してソフトで微分可能なマッチング確率を計算することで、一対多の関係を捉える。
  • 温度調整された対照損失を導入し、ハードな真値ペアの代わりに最適輸送の解を擬似ラベルとして使用する。
  • 画像およびテキストエンコーダーの指数的移動平均(EMA)を採用し、訓練の安定性を向上させ、一般化性能を向上させる。
  • 最適輸送によるマッチング確率と対照的損失を組み合わせることで、画像およびテキスト表現を同時に最適化する。
  • このフレームワークは、CLIPと比較して顕著にデータ要件を削減した、わずか300万枚の画像・テキストペアのみを用いてエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1最適輸送を用いてバッチ内でソフトで一対多の画像・テキストマッチングをモデル化することで、対照学習の性能向上が図れるか?
  • RQ2最適輸送による確率的マッチングにハードラベルを置き換えることで、ゼロショット認識におけるデータ効率が向上するか?
  • RQ3InfoNCE、ラベルスムージング、知識蒸留と比較して、OTTERは多様なベンチマークにおけるゼロショット一般化性能で優れているか?
  • RQ4類似度行列の構成とEMAの貢献は、モデルの安定性およびパフォーマンスにどのように寄与しているか?
  • RQ5300万枚の画像・テキストペアでの学習のみで、4億ペアを用いたCLIPと同等またはそれ以上のパフォーマンスを達成できるか?

主な発見

  • OTTERは、Google Open ImagesおよびImageNet 10Kの42件の評価のうち32件でInfoNCE、ラベルスムージング、知識蒸留を上回った。
  • Google Open Imagesのテストセットでは、OTTERで学習したResNet50は、CLIP-RN50をFH@1で2.6ポイント、FH@10で6.6ポイント上回った。
  • OTTERで学習したResNet50(2560万パラメータ)は、同じ設定でInfoNCEで学習した幅広いWide ResNet50x2(6840万パラメータ)を上回った。
  • ImageNet 21K+1Kでは、OTTERはFH@10で14.3%を達成し、前回SOTAのHZSLを相対的に68%も上回った。
  • アブレーションスタディの結果、画像またはテキストの類似度コンponentを削除する、またはEMAを無効化すると、FH@K=1で最大4.9ポイントのパフォーマンス低下が生じた。
  • 可視化結果から、OTTERはInfoNCEがネガティブとみなす意味のある未ペアの画像・テキストマッチングを特定していることが確認され、微細な意味的整合性を捉える能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。