[論文レビュー] SemPPL: Predicting pseudo-labels for better contrastive representations
SemPPLは、ラベル付き埋め込みのk-NN分類器を用いて未ラベル付きデータの疑似ラベルを予測し、それらの疑似ラベルを用いて意味的ポジティブ例を定義することで、表現学習を向上させる画期的な半教師あり対照学習手法を提案する。これにより自己強化型のループが形成され、性能が向上し、ResNet-50と選択的カーネルを用いた場合、1%および10%のラベルでそれぞれ72.3%および78.3%のトップ1精度という最先端の性能を達成した。
Learning from large amounts of unsupervised data and a small amount of supervision is an important open problem in computer vision. We propose a new semi-supervised learning method, Semantic Positives via Pseudo-Labels (SemPPL), that combines labelled and unlabelled data to learn informative representations. Our method extends self-supervised contrastive learning -- where representations are shaped by distinguishing whether two samples represent the same underlying datum (positives) or not (negatives) -- with a novel approach to selecting positives. To enrich the set of positives, we leverage the few existing ground-truth labels to predict the missing ones through a $k$-nearest neighbours classifier by using the learned embeddings of the labelled data. We thus extend the set of positives with datapoints having the same pseudo-label and call these semantic positives. We jointly learn the representation and predict bootstrapped pseudo-labels. This creates a reinforcing cycle. Strong initial representations enable better pseudo-label predictions which then improve the selection of semantic positives and lead to even better representations. SemPPL outperforms competing semi-supervised methods setting new state-of-the-art performance of $68.5\%$ and $76\%$ top-$1$ accuracy when using a ResNet-$50$ and training on $1\%$ and $10\%$ of labels on ImageNet, respectively. Furthermore, when using selective kernels, SemPPL significantly outperforms previous state-of-the-art achieving $72.3\%$ and $78.3\%$ top-$1$ accuracy on ImageNet with $1\%$ and $10\%$ labels, respectively, which improves absolute $+7.8\%$ and $+6.2\%$ over previous work. SemPPL also exhibits state-of-the-art performance over larger ResNet models as well as strong robustness, out-of-distribution and transfer performance. We release the checkpoints and the evaluation code at https://github.com/deepmind/semppl .
研究の動機と目的
- ImageNetのわずかなデータにしかラベルが付与されていないような低監視状態において、半教師あり表現学習を向上させること。
- 従来の対照学習手法が負例サンプリングに過剰に注力している一方で、最適なポジティブサンプリングを軽視しているという不均衡を是正すること。
- 限られた真のラベルを活用して未ラベル付きデータの疑似ラベルをブートストラップし、学習された表現における意味的整合性を向上させること。
- より良い表現が疑似ラベル予測を改善し、その逆に疑似ラベルの改善がポジティブサンプリングを精緻化し、さらに表現を向上させるという自己強化型のサイクルを構築すること。
提案手法
- SemPPLは、ラベル付きデータの埋め込みに対してk-NN分類器を適用し、未ラベル付きデータの疑似ラベルを予測することで、意味的ポジティブ例の特定を可能にする。
- 意味的ポジティブ例は、あるアーキテクチャサンプルと同じ予測疑似ラベルを持つ未ラベル付きサンプルとして定義される。
- 本手法は、アーキテクチャと意味的ポジティブサンプル間の類似度を最大化し、負例との類似度を最小化する対照損失を用いて表現学習を共同最適化する。
- フレームワークは任意の対照損失と互換性があり、非対照的目的へも拡張可能である。
- 大(224×224)および小(96×96)の2つのクロップを用いたマルチクロップデータ拡張戦略を採用し、大クロップには10%の確率でサリエンシー遮蔽を適用する。
- トレーニングパイプラインにはメモリバンクの更新のためのキューが含まれており、意味的ポジティブに基づく追加の損失項が統合されており、計算コストはわずか8.5%増加にとどまる。
実験結果
リサーチクエスチョン
- RQ1限られたラベル付きデータから得られる疑似ラベル予測が、対照的表現学習における意味的ポジティブの選択を改善できるか?
- RQ2共有された疑似ラベルを持つ意味的ポジティブを組み込むことで、低ショット半教師あり学習における表現品質はどの程度向上するか?
- RQ3表現学習と疑似ラベル予測の間の自己強化型ループが、最小限の監視下でImageNetにおける性能をどの程度向上させるか?
- RQ4精度、頑健性、分布外一般化性能の観点から、SemPPLは最先端手法と比較してどのように差をつけるか?
- RQ5SemPPLは、選択的カーネルのようなアーキテクチャ的改善と効果的に組み合わせられ、性能をさらに向上させられるか?
主な発見
- SemPPLは、1%のラベルとResNet-50バックボーンを用いた場合、ImageNetで68.5%のトップ1精度を達成し、新たなSOTAを樹立した。
- 10%のラベルを用いた場合、SemPPLはResNet-50で76.0%のトップ1精度に達し、半教師あり設定で新たなSOTAを記録した。
- 選択的カーネルと組み合わせた場合、SemPPLは1%および10%のラベルでそれぞれ72.3%および78.3%のトップ1精度を達成し、先行研究より+7.8%および+6.2%の絶対的精度向上を達成した。
- SemPPLは強力な頑健性と分布外一般化性能を示し、これらのベンチマークで先行SOTA手法を上回った。
- ReLIC v2よりわずか8.5%の追加計算コストで実現されており、k-NNと損失計算が主な要因である。また、幅広い対照的および非対照的目的と互換性がある。
- コードとチェックポイントは、再現性およびさらなる研究のため、https://github.com/deepmind/semppl で公開されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。