Skip to main content
QUICK REVIEW

[論文レビュー] How Well Does Self-Supervised Pre-Training Perform with Streaming Data?

Dapeng Hu, Shipeng Yan|arXiv (Cornell University)|Apr 25, 2021
Domain Adaptation and Few-Shot Learning被引用数 10
ひとこと要約

本研究は、一括でではなく逐次的に到着するデータの設定下における自己教師あり事前学習を調査する。データリプレイやパラメータ正則化といった単純な手法を用いることで、逐次的自己教師あり学習が、共同事前学習と同等の性能を達成することを明らかにした。これは、深刻な分布シフト下でも最小限の消去的忘却と、共同学習モデルと類似した強固な特徴表現を示しており、顕著である。

ABSTRACT

Prior works on self-supervised pre-training focus on the joint training scenario, where massive unlabeled data are assumed to be given as input all at once, and only then is a learner trained. Unfortunately, such a problem setting is often impractical if not infeasible since many real-world tasks rely on sequential learning, e.g., data are decentralized or collected in a streaming fashion. In this paper, we conduct the first thorough and dedicated investigation on self-supervised pre-training with streaming data, aiming to shed light on the model behavior under this overlooked setup. Specifically, we pre-train over 500 models on four categories of pre-training streaming data from ImageNet and DomainNet and evaluate them on three types of downstream tasks and 12 different downstream datasets. Our studies show that, somehow beyond our expectation, with simple data replay or parameter regularization, sequential self-supervised pre-training turns out to be an efficient alternative for joint pre-training, as the performances of the former are mostly on par with those of the latter. Moreover, catastrophic forgetting, a common issue in sequential supervised learning, is much alleviated in sequential self-supervised learning (SSL), which is well justified through our comprehensive empirical analysis on representations and the sharpness of minima in the loss landscape. Our findings, therefore, suggest that, in practice, for SSL, the cumbersome joint training can be replaced mainly by sequential learning, which in turn enables a much broader spectrum of potential application scenarios.

研究の動機と目的

  • データが一括ではなく逐次的に到着するストリーミングデータ設定下における自己教師あり事前学習の実現可能性と有効性を調査すること。
  • 高コストなストレージと計算資源を要する共同事前学習の実用的制限を克服するため、スケーラブルな代替手法として逐次学習を検討すること。
  • 逐次的自己教師あり学習における消去的忘却を分析し、教師あり継続的学習と比較すること。
  • さまざまなストリーミングデータ分布下で、多様な下流タスクとデータセットにおける転移性能を評価すること。
  • 逐次的および共同学習モデル間の表現類似性と損失関数の鋭さの包括的実証的分析を提供すること。

提案手法

  • ImageNetおよびDomainNetのストリーミングデータから得られる4種類のストリーミングデータタイプ(インスタンスインクリメンタル、ランダムクラスインクリメンタル、遠方クラスインクリメンタル、ドメインインクリメンタル)を用いて、合計500以上のモデルを事前学習する。
  • 逐次的なデータ処理下で、標準的な自己教師あり学習手法(例:SimCLR、MoCo)を用いて事前学習を行う。
  • 忘却を緩和するために、継続的学習手法(例:経験リプレイ、パラメータ正則化(例:MAS))を適用する。
  • 12のデータセットを対象に、3つの下流タスク(線形評価、少数ショット分類、Pascal VOCオブジェクト検出)でモデルを評価する。
  • 逐次的に学習されたモデルと共同で学習されたモデルの特徴量間の線形CKA類似度を計算し、表現の整合性を測定する。
  • 各データチャンク処理後のモデル状態間を補間する重みパスに沿ったkNNベースの精度を用いて、損失関数の鋭さを分析する。

実験結果

リサーチクエスチョン

  • RQ1異なるストリーミングデータ分布下で、逐次的自己教師あり事前学習は、共同事前学習と比較して下流タスクの転移性能にどの程度差があるか?
  • RQ2教師あり継続的学習と比較して、逐次的自己教師あり学習における消去的忘却はどの程度顕著か?
  • RQ3ストリーミング条件下で、逐次的に学習されたモデルと共同で学習されたモデルの間で、学習された表現はどの程度類似しているか?
  • RQ4継続的学習手法(例:データリプレイ、パラメータ正則化)は、逐次的SSLの性能向上にどのような役割を果たすか?
  • RQ5逐次的自己教師あり学習モデルと教師ありモデルの間で、損失関数の鋭さにどのような差が生じるか?また、これは一般化性能にどのような示唆をもたらすか?

主な発見

  • データリプレイやパラメータ正則化を用いた逐次的自己教師あり事前学習は、分布シフトが軽微またはないストリーミングデータにおいて、共同事前学習と同等の転移学習性能を達成する。
  • 遠方クラスインクリメンタルなど深刻な分布シフトが生じるストリーミングデータでは、性能の差が顕著になるが、MASやリプレイを用いることで、逐次的および共同学習モデル間のCKA類似度が最大0.9に達し、強固な特徴整合性が示された。
  • 教師あり学習と比較して、逐次的SSLでは消去的忘却が顕著に軽減されており、平坦な損失関数の形状と高い表現安定性によって裏付けられた。
  • 鋭さの分析から、SSLモデルは特にインスタンスインクリメンタル設定下で、学習ステップ間の補間パスに沿って平坦な最小値を示し、一般化可能性が優れていることが判明した。
  • 線形CKA類似度スコアは、深刻な分布シフト下のデータでも、逐次的に学習されたSSLモデルが共同学習モデルと0.7の類似度を維持しており、MASやリプレイを適用すると0.9に上昇する。これは、強固な特徴学習が行われていることを確認する。
  • 1000クラス分類を伴うインスタンスインクリメンタル設定では鋭さの値が高くなるが、SSLモデルは依然として良好な一般化性能を示しており、鋭さそのものが自己教師あり設定下での性能劣化を予測する要因ではないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。