Skip to main content
QUICK REVIEW

[論文レビュー] Bag of Instances Aggregation Boosts Self-supervised Distillation

Haohang Xu, Jiemin Fang|arXiv (Cornell University)|Jul 4, 2021
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

この論文では、教師モデルからの類似度に基づいて関連するインスタンスを「バッグ」に集約することで、小規模モデルの性能を向上させる自己教師付き蒸留手法BINGOを提案する。二重の蒸留損失(インスタンス間およびインスタンス内)を適用することで、教師モデルから関係性の知識を転送し、ResNet-18およびResNet-34を用いたImageNetにおけるトップ1精度65.5%および68.9%というSOTAの結果を達成した。これは、先行手法を顕著に上回る結果である。

ABSTRACT

Recent advances in self-supervised learning have experienced remarkable progress, especially for contrastive learning based methods, which regard each image as well as its augmentations as an individual class and try to distinguish them from all other images. However, due to the large quantity of exemplars, this kind of pretext task intrinsically suffers from slow convergence and is hard for optimization. This is especially true for small-scale models, in which we find the performance drops dramatically comparing with its supervised counterpart. In this paper, we propose a simple but effective distillation strategy for unsupervised learning. The highlight is that the relationship among similar samples counts and can be seamlessly transferred to the student to boost the performance. Our method, termed as BINGO, which is short for Bag of InstaNces aGgregatiOn, targets at transferring the relationship learned by the teacher to the student. Here bag of instances indicates a set of similar samples constructed by the teacher and are grouped within a bag, and the goal of distillation is to aggregate compact representations over the student with respect to instances in a bag. Notably, BINGO achieves new state-of-the-art performance on small-scale models, i.e., 65.5% and 68.9% top-1 accuracies with linear evaluation on ImageNet, using ResNet-18 and ResNet-34 as the backbones respectively, surpassing baselines (52.5% and 57.4% top-1 accuracies) by a significant margin. The code is available at https://github.com/haohang96/bingo.

研究の動機と目的

  • 大規模な例示集合による小規模モデルにおける対照的自己教師付き学習の収束が遅く、最適化が不十分であるという問題に対処すること。
  • ランダムなインスタンスペアではなく、極めて類似したサンプル間の関係的構造を活用することで、非教師付き学習における知識蒸留を改善すること。
  • 大規模な教師モデルから小規模な学生モデルへ、コンパクトなバッグベースの表現を関係性に従って転送する戦略を開発すること。
  • ラベル付きデータを必要とせずに、小規模モデルにおける自己教師付き表現学習でSOTAの性能を達成すること。

提案手法

  • 事前学習済みの教師モデルからの埋め込みを照合することで、類似度が高いインスタンスを「バッグ」として構築する。特定のアンカーインスタンスと類似度が高いものをグループ化する。
  • バッグ単位のデータセットが標準のインスタンス単位のデータセットに置き換えられ、関連するサンプルの構造的グループに基づく蒸留が可能になる。
  • 二重の蒸留損失を導入する:インスタンス内損失は、同じ画像の増強画像同士の教師・学生ネットワーク間の整合性を保つものであり、インスタンス間損失は、バッグ内のすべてのインスタンスをアンカーに近づけるものである。
  • バッグ構築には、教師の埋め込み空間からの類似度スコアを用い、類似度が非常に高いサンプルのみをグループ化することを保証する。
  • 学生モデルは、インスタンスレベルおよびバッグレベルの監視を統合した修正された対照的目的関数を用いて学習される。
  • 本手法は既存の自己教師付きフレームワークと互換性があり、アーキテクチャの変更を最小限に抑えて適用可能である。

実験結果

リサーチクエスチョン

  • RQ1極めて類似したサンプルを「バッグ」に集約することで、小規模モデルにおける自己教師付き学習の知識蒸留が向上するか?
  • RQ2類似したインスタンス間の関係性の知識を転送することで、関係性に依存しない蒸留手法に比べて、より優れた表現学習が達成できるか?
  • RQ3教師モデルの重みではなく、教師のデータ関係性のみを用いた場合、学生モデルの性能はどのように変化するか?
  • RQ4BINGOは、ResNet-18やResNet-34といった小規模バックボーンを用いたImageNetで、線形評価下でSOTAの性能を達成できるか?
  • RQ5同等の訓練エポック数下で、BINGOの計算コストはSEED や DisCo といった既存手法と比較してどの程度か?

主な発見

  • BINGOは、学生モデルとしてResNet-18を用いることで、ImageNetで65.5%という新たなSOTAのトップ1精度を達成し、以前のSOTA(52.5%)を上回った。
  • 学生モデルにResNet-34を用いた場合、68.9%のトップ1精度に到達し、以前のSOTA(57.4%)を顕著に上回った。
  • 教師の重みを用いずに、教師のデータ関係性のみを用いた場合でも、BINGOは62.2%の精度を達成し、関係性知識そのものの価値を示した。
  • 同じ訓練コスト(100エポック)下でも、BINGOはSEED(62.7%トップ1)を上回り、200エポックでDisCo(68.1%トップ1)と同等の性能を示した。これは、優れたサンプル効率性を示している。
  • アブレーションスタディの結果、教師の事前学習済み重みと関係性情報の両方を用いることで最良の性能(ResNet-18を用いた場合で64.0%)が得られ、両者の補完的効果が確認された。
  • BINGOの計算コストはDisCoと同等であり、訓練時間が制限されても強力な性能を維持しており、長時間の訓練スケジュールを必要とする手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。