[論文レビュー] Simple Distillation Baselines for Improving Small Self-supervised Models
本稿では、オフラインまたはオンラインの知識蒸留を用いて、小規模な自己教師ありモデルの性能を向上させるシンプルな知識蒸留フレームワーク、SimDisを提案する。大規模な事前学習済み教師モデルからの表現を小規模な学生モデルに蒸留することで、SimDisはResNet-18において、メモリバンクや複雑な構成要素を必要としない状態で、線形評価精度において最先端の性能を達成した。
While large self-supervised models have rivalled the performance of their supervised counterparts, small models still struggle. In this report, we explore simple baselines for improving small self-supervised models via distillation, called SimDis. Specifically, we present an offline-distillation baseline, which establishes a new state-of-the-art, and an online-distillation baseline, which achieves similar performance with minimal computational overhead. We hope these baselines will provide useful experience for relevant future research. Code is available at: https://github.com/JindongGu/SimDis/
研究の動機と目的
- モデルサイズが小さくなるにつれて顕著に拡大する、小規模な自己教師ありモデルとその教師あり対応モデルとの間の性能格差を是正すること。
- メモリバンクや対照的ネガティブ例といった複雑な構成要素に依存しない、実用的で効率的な蒸留ベースラインを構築すること。
- 大規模な教師モデルからの蒸留が、自己教師あり学習における小規模な学生モデルの性能を顕著に向上させられることを示すこと。
- LARS最適化子やSyncBNを含まない最小限の学習設定下での蒸留の有効性を検証し、実用性を高め、計算コストを低減すること。
提案手法
- 大規模な教師モデルをBYOLを用いて事前学習した後、それを小規模な学生モデルの教師として用いるオフライン蒸留ベースライン(SimDis-Off)を提案する。
- 学生モデルと教師モデルを同時に学習するオンライン蒸留ベースライン(SimDis-On)を導入し、学生モデルが教師モデルの複数の視点からの表現から学習する。
- 教師モデルおよび学生モデルの両方でシアンズ型ネットワークアーキテクチャを採用し、学生モデルが自ネットワークおよび教師ネットワークからの正規化済み出力を予測するように訓練する。
- BYOLプロトコルに従い、学生モデルの正規化予測と教師モデルの正規化出力との間で平均二乗誤差損失を用いる。
- 教師および学生ネットワークからの複数のターゲット視点を組み合わせることで、最適化の安定性と性能を向上させるマルチビュー蒸留を可能にする。
- LARS最適化子やSyncBNに依存しないように、1台のマシンで8GPUを用いて学習することで、よりシンプルで実用的な設定下でも安定性を示した。
実験結果
リサーチクエスチョン
- RQ1大規模な事前学習済み教師モデルからのシンプルな知識蒸留が、小規模な自己教師あり学生モデルの性能を顕著に向上させられるか?
- RQ2小規模モデルを学習する際、オンライン蒸留とオフライン蒸留の性能および計算コストはどのように比較されるか?
- RQ3LARSやSyncBNといった重要な構成要素を排除した状況下で、蒸留が小規模な自己教師ありモデルにどれほど向上効果をもたらすか?
- RQ4学生および教師ネットワークからのマルチビュー蒸留は、学習効率および最終的な精度を向上させるか?
- RQ5SEEDのような先行研究が使用するメモリバンクやネガティブサンプルを一切用いずに、蒸留ベースラインが最先端の性能を達成できるか?
主な発見
- SimDis-Offは、1000エポックの学習後、ImageNetの線形評価で67.18%のトップ-1精度を達成し、SEEDなどの先行SOTA手法を上回った。
- SimDis-Onも同様の設定で66.78%のトップ-1精度を達成し、オンライン蒸留が最小限の計算コスト増でオフライン蒸留と同等の性能を示した。
- 長時間の学習が進むにつれて、オフラインとオンライン蒸留の性能差は著しく縮まり、100エポックでは3.65%の差が、1000エポックでは1%未満にまで縮小した。
- マルチビュー蒸留(SimDis-On-7v)により、単一ビューのオンライン蒸留に比べ2.57%の性能向上が得られ、オフライン蒸留との差も縮小したが、FLOPsの増加は無視できるほどであった。
- LARSやSyncBNを含まない設定下でも、SimDis-Offは62.66%のトップ-1精度、SimDis-Onは全7ビューで63.52%のトップ-1精度を達成し、最小限で実用的な学習条件下でも強力な性能を示した。
- 蒸留なしでは学生モデルが55.96%のトップ-1精度を達成したが、全ビューのマルチビュー蒸留を適用すると63.52%まで向上し、提案された蒸留戦略の有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。