[論文レビュー] ClusterFit: Improving Generalization of Visual Representations
ClusterFit は、事前学習モデルからの特徴をクラスタリングし、それらのクラスタ割り当てを仮ラベルとして新たなネットワークを微調整する、シンプルで後処理的な手法である。この手法は、追加のデータや教師信号なしに、11種類の多様な画像および動画ベンチマークで顕著な性能向上を達成し、最先端のモデル比で最大9%の相対的精度向上を実現した。
Pre-training convolutional neural networks with weakly-supervised and self-supervised strategies is becoming increasingly popular for several computer vision tasks. However, due to the lack of strong discriminative signals, these learned representations may overfit to the pre-training objective (e.g., hashtag prediction) and not generalize well to downstream tasks. In this work, we present a simple strategy - ClusterFit (CF) to improve the robustness of the visual representations learned during pre-training. Given a dataset, we (a) cluster its features extracted from a pre-trained network using k-means and (b) re-train a new network from scratch on this dataset using cluster assignments as pseudo-labels. We empirically show that clustering helps reduce the pre-training task-specific information from the extracted features thereby minimizing overfitting to the same. Our approach is extensible to different pre-training frameworks -- weak- and self-supervised, modalities -- images and videos, and pre-training tasks -- object and action classification. Through extensive transfer learning experiments on 11 different target datasets of varied vocabularies and granularities, we show that ClusterFit significantly improves the representation quality compared to the state-of-the-art large-scale (millions / billions) weakly-supervised image and video models and self-supervised image models.
研究の動機と目的
- 弱い教師ありおよび自己教師ありの事前学習における過学習を是正すること。具体的には、代理の目的関数に起因するアーティファクトを学習してしまうのを防ぎ、一般化可能な視覚的不変性を学習すること。
- 教師なしクラスタリングによる特徴空間の平滑化を通じて、視覚的表現の転移性を向上させること。
- 画像・動画・さまざまな事前学習フレームワーク(弱い教師ありおよび自己教師あり)に適用可能なスケーラブルでアーキテクチャに依存しない手法を開発すること。
- 大規模モデルを用いても、複雑な事前学習目的関数を用いるよりも、後処理的なクラスタリングと再訓練が優れた性能を発揮することを示すこと。
- 手作業で設計されたラベル空間に代わって、最小限の教師なしクラスタリングステップが、事前学習における高コストなラベル設計を代替可能であることを示すこと。
提案手法
- 事前学習済みモデルを用いて、新しいデータセット上の事前学習ネットワークから特徴を抽出する。
- 抽出された特徴に対して k-means クラスタリングを適用し、類似したサンプルをクラスタにグループ化する。
- 得られたクラスタ割り当てを仮ラベルとして用い、新規のネットワークを再訓練する。
- クラスタ仮ラベルに基づく標準的な交差エントロピー損失を用いて、新しいネットワークを訓練することで、滑らかでより一般化可能な特徴空間を学習する。
- クラスタリングステップは、代理目的関数に依存するアーティファクトを除去しながらも、視覚的整合性を保持する損失を伴う圧縮処理として機能する。
- この手法は、モデルアーキテクチャ、モダリティ(画像/動画)、事前学習目的関数に依存しないため、広範な適用が可能である。
実験結果
リサーチクエスチョン
- RQ1事前学習モデルからの特徴に対して後処理的なクラスタリングを適用することで、視覚的表現の一般化が向上するか?
- RQ2クラスタリングによる代理目的関数特有のアーティファクトの除去が、下流タスクにおける転移性能の向上に寄与するか?
- RQ3さまざまなデータセットおよびモダリティにおいて、ClusterFit は最先端の大規模弱教師ありおよび自己教師ありモデルと比較してどのように性能を発揮するか?
- RQ4ラベル空間の多様性と粒度が、クラスタリングベースの事前学習の有効性に与える影響は何か?
- RQ5シンプルで教師なしのクラスタリングステップが、事前学習における高コストな手作業によるラベル空間設計を代替可能か?
主な発見
- 自己教師ありモデルに適用した場合、ImageNet-1K でトップ1精度が最大9%向上し、ImageNet-1K でも7〜9%向上した。
- 10億枚の画像に1,500のハッシュタグを用いた弱教師あり事前学習において、ImageNet-9K で4.6%、iNaturalist で5.8%の精度向上を達成した。
- 1,900万本の動画と438種類のハッシュタグを用いた動画事前学習において、Kinetics で3.2%、Sports1M で4.3%の精度向上を達成した。
- 事前学習に使用する語彙として、最も頻出する100語の動詞のみを用いた場合、438語のフルモデルと比較して2%以内の性能で、元の弱教師ありモデルを上回った。
- 画像および動画データセットを含む11の多様なベンチマークにおいて、一貫して性能向上が見られた。これらのデータセットは、多様な語彙と粒度を有していた。
- 追加のデータ、教師信号、アーキテクチャの変更なしに、特徴空間の平滑化がクラスタリングによって達成されることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。