Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning via Sequential Function-Space Variational Inference

Tim G. J. Rudner, Freddie Bickford Smith|arXiv (Cornell University)|Dec 28, 2023
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文は、ネットワークパラメータではなく予測関数のベイジアン推論を行うことで、柔軟で適応的な学習が可能となり、一般化性能が向上する、継続的学習のための逐次的関数空間変分推論(s-fsvi)を提案する。s-fsviは、Split MNIST や Multi-Head CIFAR、Omniglot といったベンチマーク継続的学習タスクで最先端の精度を達成しており、最小限のコアセットまたはランダムに選択されたコアセットに依存するだけであり、EWC や VCL や FROMP よりも優れた性能を発揮する。

ABSTRACT

Sequential Bayesian inference over predictive functions is a natural framework for continual learning from streams of data. However, applying it to neural networks has proved challenging in practice. Addressing the drawbacks of existing techniques, we propose an optimization objective derived by formulating continual learning as sequential function-space variational inference. In contrast to existing methods that regularize neural network parameters directly, this objective allows parameters to vary widely during training, enabling better adaptation to new tasks. Compared to objectives that directly regularize neural network predictions, the proposed objective allows for more flexible variational distributions and more effective regularization. We demonstrate that, across a range of task sequences, neural networks trained via sequential function-space variational inference achieve better predictive accuracy than networks trained with related methods while depending less on maintaining a set of representative points from previous tasks.

研究の動機と目的

  • パラメータ空間における正則化の限界、特に小さなパラメータの変更が予測の大きな変化を引き起こす問題を解消すること。
  • 従来の関数空間手法が近似(例:ラプラス近似)に依存するか、線形モデルに限定されるという柔軟性の欠如を克服すること。
  • 深層ニューラルネットワークに直接適用可能なスケーラブルで柔軟な変分推論フレームワークを、関数空間で構築すること。
  • 過去のタスクからの注意深く選択されたコアセットへの依存度を低くしつつ、高い性能を維持すること。
  • 予測精度を損なわず、効果的な前向きおよび後向きの転移を実現すること。

提案手法

  • 継続的学習を逐次的関数空間変分推論として定式化し、予測関数の事後分布をタスクごとに段階的に更新する。
  • 関数の変分族を用い、平均および分散パラメータを直接最適化可能にすることで、柔軟性と正則化の向上を図る。
  • 過去のタスクのコンテキストポイントにおける関数の事前分布と一致するよう、関数空間正則化項を導入する。
  • パラメータの更新と関数空間の制約を分離し、パラメータが自由に適応可能である一方で、関数的知識を保持できるようにする。
  • 現在の関数事後分布とコンテキストポイントにおける関数の事前分布とのKLダイバージェンスを最小化する変分目的関数を採用し、同時に新規データに適合させる。
  • 確率的最適化を用いて深層ベイジアンニューラルネットワークに適用することで、複雑で高次元のタスクへのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1関数空間における変分推論が、予測関数の不確実性を直接モデル化することで、パラメータ空間正則化を上回る性能を発揮できるか?
  • RQ2関数空間で変分分散パラメータを直接最適化することで、一般化性能が向上し、忘却が軽減されるか?
  • RQ3従来の関数空間ベースラインと比較して、この手法はコアセット選択およびサイズにどれほど感度を示すか?
  • RQ4s-fsvi は、大規模または注意深く選択されたコアセットに依存せず、強力な前向きおよび後向きの転移をどの程度達成できるか?
  • RQ5s-fsvi は、マルチヘッドおよび逐次的タスク設定を含む多様な継続的学習ベンチマークに一般化可能か?

主な発見

  • Multi-Head Split CIFAR では、77.6% のテスト精度を達成し、EWC(71.6%)、VCL(67.4%)、FROMP(76.2%)を上回り、分散も小さい。
  • Split MNIST では、最小限のコアセットサイズであっても、ジョイントトレーニングと同等の性能を示し、VCL や EWC より顕著に優れている。
  • s-fsvi は強力な前向き転移(FT = 7.3)と後向き転移(BT = -2.5)を示し、FT ではすべてのベースラインを上回り、BT では EWC や FROMP と同等の性能を発揮する。
  • 1クラスあたり1点のコアセットのみを用いても、s-fsvi は1タスクあたり40点のコアセットを使用する VCL や FROMP を上回る性能を示す。
  • ランダムに選択されたコアセットやノイズを含むコアセットに対しても、s-fsvi は高い性能を維持し、コアセットの品質にほとんど感度を示さない。
  • VCL や EWC よりも関数空間推論において一貫して優れた性能を発揮しており、知識転送の観点から関数空間正則化がパラメータ空間正則化よりも効果的であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。