Skip to main content
QUICK REVIEW

[論文レビュー] A Simple Long-Tailed Recognition Baseline via Vision-Language Model

Teli Ma, Shijie Geng|arXiv (Cornell University)|Nov 29, 2021
Multimodal Machine Learning Applications参考文献 40被引用数 10
ひとこと要約

この論文では、長尾分布データに対して最初に継続的微調整を行い、次にバランスの取れたサンプルで線形アダプタによる微調整を行うことで、対照的視覚言語モデルを活用するシンプルで効果的な長尾認識ベースライン、BALLADを提案する。SOTA性能を達成し、ResNet-50 ×16を用いたImageNet-LTでトップ1正答率76.5%を記録し、先行手法を最大7.2%上回る。

ABSTRACT

The visual world naturally exhibits a long-tailed distribution of open classes, which poses great challenges to modern visual systems. Existing approaches either perform class re-balancing strategies or directly improve network modules to address the problem. However, they still train models with a finite set of predefined labels, limiting their supervision information and restricting their transferability to novel instances. Recent advances in large-scale contrastive visual-language pretraining shed light on a new pathway for visual recognition. With open-vocabulary supervisions, pretrained contrastive vision-language models learn powerful multimodal representations that are promising to handle data deficiency and unseen concepts. By calculating the semantic similarity between visual and text inputs, visual recognition is converted to a vision-language matching problem. Inspired by this, we propose BALLAD to leverage contrastive vision-language models for long-tailed recognition. We first continue pretraining the vision-language backbone through contrastive learning on a specific long-tailed target dataset. Afterward, we freeze the backbone and further employ an additional adapter layer to enhance the representations of tail classes on balanced training samples built with re-sampling strategies. Extensive experiments have been conducted on three popular long-tailed recognition benchmarks. As a result, our simple and effective approach sets the new state-of-the-art performances and outperforms competitive baselines with a large margin. Code is released at https://github.com/gaopengcuhk/BALLAD.

研究の動機と目的

  • ヘッドクラスが支配的でテールクラスにデータ不足が生じる長尾データ分布の課題に対処すること。
  • 言語モダリティが、代表的表現学習を未代表的クラスで向上させるために補完的監視を提供できるかを検討すること。
  • 視覚モダリティに依存するかつ固定ラベルセットに依存する先行手法の制限を克服し、新規または希少なカテゴリへの一般化を向上させること。
  • 視覚言語モデルのオープンボキャブラリ機能を活用して、少サンプルやゼロショット一般化を向上させるシンプルで効果的なベースラインを構築すること。
  • 複雑なアーキテクチャや膨大なハイパーパramータチューニングを必要とせず、長尾ベンチマークでの性能を向上させること。

提案手法

  • 長尾ターゲットデータセット上で視覚言語バックボーン(例:CLIP)を対照的学習を用いて継続的微調整することで、マルチモodal表現を新しいドメインに適応する。
  • 事前学習後に視覚言語バックボーンを凍結し、学習可能な線形アダプタを導入して微調整を行う。
  • アダプタ学習中にクラスバランスサンプリングを適用し、すべてのクラスが等しく表現されるようにバランスの取れた訓練データを構築する。
  • オリジナルのCLIP特徴とアダプタで学習された特徴の間のトレードオフを制御するための残留要因λを用いる。
  • バランスの取れたサンプル上でクロスエントロピー損失を用いてアダプタを訓練し、低リソースクラスに特化した視覚特徴の最適化を可能にする。
  • 訓練を二段階に分ける:段階Aは対照的事前学習によるドメイン適応、段階Bはアダプタ微調整によるクラス固有の最適化。

実験結果

リサーチクエスチョン

  • RQ1視覚言語モデルは、長尾データセットにおける認識性能を向上させるために、効果的なオープンボキャブラリ監視を提供できるか?
  • RQ2標準的な微調整と比較して、長尾データ上で継続的微調整を行うことで表現学習が向上するか?
  • RQ3学習可能なアダプタレイヤーの統合は、ヘッドクラスの正答率を低下させることなく、テールクラスの性能にどのように影響するか?
  • RQ4訓練データのバランスをとる最適な戦略は何か?訓練パイプラインの中で、いつ、どこで再サンプリングを適用すべきか?
  • RQ5長尾認識の文脈において、一般化性能と収束性のバランスを最良にしたのは、どのサンプリング戦略(クラスバランス、ルート平方、ミックスバランス)か?

主な発見

  • BALLADは、ResNet-50 ×16バックボーンを用いてImageNet-LTベンチマークで76.5%という新たなSOTAトップ1正答率を達成し、先行手法を最大7.2%上回った。
  • 少サンプル性能が顕著に向上し、ImageNet-LTの少サンプルサブセットで59.5%の正答率を達成し、低リソースクラスへの一般化能力が優れていることが示された。
  • 残留要因λ ≈ 0.2を用いた線形アダプタが最適な性能を示し、事前学習後にわずかなバランスの取れた適応が十分であることを示している。
  • バランス戦略を段階B(アダプタ学習)でのみ適用すると、段階Aでも適用する場合よりも優れた結果が得られ、ヘッドクラスの表現が強く保持された。
  • 段階Bでのクラスバランスサンプリングが、ImageNet-LTにおいてルート平方およびミックスバランスサンプリング戦略を上回り、最も優れた全体的な性能を達成した。
  • ゼロショット一般化性能も強く、CLIPのImageNet-LTにおけるゼロショット性能(58.2%)はもともとSOTAと競合可能であり、BALLADはさらに顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。