[論文レビュー] Masked Unsupervised Self-training for Label-free Image Classification
本論文は、CLIPのようなゼロショットビジョンモデルの性能を、ラベルなしデータ上で同時に疑似ラベル付けとマスク画像モデリングを最適化することで、教師付き微調整によって向上させるMasked Unsupervised Self-Training (MUST) を提案する。ViT-Bを用いたImageNetではトップ1正解率77.7%を達成し、CLIPのゼロショット性能より+9.4%、16-shotの教師付き微調整より+6.2%の向上を達成した。
State-of-the-art computer vision models are mostly trained with supervised learning using human-labeled images, which limits their scalability due to the expensive annotation cost. While self-supervised representation learning has achieved impressive progress, it still requires a second stage of finetuning on labeled data. On the other hand, models pre-trained with large-scale text-image supervision (e.g., CLIP) have enabled zero-shot transfer to downstream image classification tasks. However, the zero-shot performance of CLIP-like models are often insufficient for real-world adoption. In this paper, we aim to leverage the abundant unlabeled data from a target domain to improve the performance of a pre-trained zero-shot classifier, by unsupervised finetuning of the pre-trained model. We propose Masked Unsupervised Self-Training (MUST), a new unsupervised adaptation method which leverages two different and complementary sources of training signals: pseudo-labels and raw images. MUST jointly optimizes three objectives to learn both class-level global feature and pixel-level local feature and enforces a regularization between the two. We demonstrate the efficacy of MUST on a variety of downstream tasks, where it improves upon CLIP by a large margin. MUST also outperforms supervised few-shot adaptation methods. It achieves a top-1 accuracy of 77.7% on ImageNet using ViT-B, +9.4% higher than CLIP, and +6.2% higher than 16-shot CLIP adaptation. Our code is available at https://github.com/salesforce/MUST.
研究の動機と目的
- スケーラブルである一方で、教師付きモデルに比べて性能が劣りがちなCLIP風モデルのゼロショット性能のギャップを解消すること。
- ラベルなしデータの豊富なドメインからのデータを活用し、人為的ラベルの必要なしに事前学習済みゼロショット分類器を向上させること。
- 自己学習(ノイズの多い疑似ラベルに依存する)と自己教師あり学習(微調整が必要)の限界を克服するため、両方の教師信号を統合すること。
- グローバルなクラスレベル特徴とローカルなピクセルレベル表現との間の整合性を、正則化目的関数によって統一フレームワークで強化すること。
- ラベル付きデータが限られる環境での実用的導入を可能にするために、完全に教師なしの適応によって高い性能を達成すること。
提案手法
- MUSTは、ターゲットドメインのラベルなし画像のみを用いて、事前学習済みゼロショット分類器(例:CLIP)を教師なし微調整する。
- 3つの目的関数を同時に最適化する:(1) 教師モデルから生成された疑似ラベルを用いた自己学習、(2) マスクされたパッチを再構築するMAE風のマスク画像モデリング、(3) プレゼンテーション学習を正則化するグローバル-ローカル特徴の整合性。
- 自己学習の目的関数は、一貫性正則化とエントロピー最小化を用い、摂動を加えた入力に対して信頼性の高い鋭い予測を生成する。
- マスク画像モデリングの目的関数は、欠落した画像パッチの再構築を学習させ、ローカル特徴の学習を強化する。
- グローバル-ローカル整合性の目的関数は、グローバル分類ヘッドとローカル表現との間の構造的関係を強制し、特徴品質を向上させる。
- 学習の安定化のため、学生モデルのオンラインネットワークに対してEMA(指数移動平均)更新戦略を適用する。
実験結果
リサーチクエスチョン
- RQ1疑似ラベル付けとマスク画像モデリングを統合することで、ラベルなしデータなしにゼロショット分類性能を向上させられるか?
- RQ2提案されたグローバル-ローカル特徴整合性目的関数は、単独で用いるいずれの教師信号よりもモデルの一般化性能をどのように向上させるか?
- RQ3MUSTによる教師なし適応によって、ゼロショットモデルと完全教師ありモデルの性能ギャップはどの程度縮まるか?
- RQ4標準的な微調整やCLIPのゼロショット性能と比較して、MUSTは分布シフトに対してどのように耐性を向上させるか?
- RQ5ImageNetのウォームアップを用いたトランスductive学習により、ImageNet-R や ImageNet-A のような分布外データセットでさらに性能が向上するか?
主な発見
- ViT-Bを用いたImageNetでは、MUSTがトップ1正解率77.7%を達成し、CLIPのゼロショット性能より+9.4%の向上を達成した。
- 同じベンチマークで、MUSTはCLIPの16-shot教師付き微調整より6.2ポイント高い性能を達成した。
- ImageNet-V2では、CLIPより7.0%の正解率向上を達成し、自然な分布シフトへの一般化性能の向上を示した。
- ImageNetのウォームアップを用いたトランスductive MUSTは、ImageNet-Rで87.6%の正解率を達成し、CLIPより+9.9%の向上を示し、分布シフトに対する強い耐性を示した。
- 広範なアブレーションスタディにより、疑似ラベル付けとマスク画像モデリングの両方が性能向上に顕著に寄与しており、整合性目的関数が追加の利得をもたらすことが確認された。
- MUSTは、適応段階でラベル付きデータを一切使用しなかったにもかかわらず、特定のベンチマークでは完全教師あり手法と同等の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。