Skip to main content
QUICK REVIEW

[論文レビュー] Single-Net Continual Learning with Progressive Segmented Training (PST)

Xiaocong Du, Gouranga Charan|arXiv (Cornell University)|May 28, 2019
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 4
ひとこと要約

本稿では、一貫した記憶の消失を防ぐために、モデルパラメータを重要(凍結)および二次的(保持)なグループに分割し、固定サイズのメモリバッファを用いたリハーサルを実施する、1ネットワークに特化した継続的学習手法であるプログレッシブセグメンテッドトレーニング(PST)を提案する。PSTは、CIFAR-10およびCIFAR-100において、重み更新パスにおけるFLOPsが24倍以上も低減するなど、エッジデプロイに非常に効率的である一方で、SOTA(最先端)の単一ヘッド精度を達成している。

ABSTRACT

There is an increasing need of continual learning in dynamic systems, such as the self-driving vehicle, the surveillance drone, and the robotic system. Such a system requires learning from the data stream, training the model to preserve previous information and adapt to a new task, and generating a single-headed vector for future inference. Different from previous approaches with dynamic structures, this work focuses on a single network and model segmentation to prevent catastrophic forgetting. Leveraging the redundant capacity of a single network, model parameters for each task are separated into two groups: one important group which is frozen to preserve current knowledge, and secondary group to be saved (not pruned) for a future learning. A fixed-size memory containing a small amount of previously seen data is further adopted to assist the training. Without additional regularization, the simple yet effective approach of PST successfully incorporates multiple tasks and achieves the state-of-the-art accuracy in the single-head evaluation on CIFAR-10 and CIFAR-100 datasets. Moreover, the segmented training significantly improves computation efficiency in continual learning.

研究の動機と目的

  • 自己走行車両やドローンのような動的エッジシステムにおける継続的学習における記憶の消失問題を解決すること。
  • 事前にタスクを特定しない状況下でも高い単一ヘッド評価精度を維持すること。これは、実世界のデプロイにおいて重要な課題である。
  • 限られたリソースを有する端末での効率的で適応可能な学習を可能にするために、継続的学習における計算コストを低減すること。
  • 動的な構造拡張を避けるために、1つの静的ネットワークアーキテクチャを用いて過去の知識を保持すること。
  • 追加の正則化を用いずに、パラメータのセグメンテーションとメモリ支援型トレーニングによって、高い効率性とパフォーマンスを達成すること。

提案手法

  • モデルパラメータを2つのグループに分割する:過去のタスクの知識を保持するための重要なグループ(凍結)と、将来の学習に用いる二次的グループ(保持)。
  • 重要度サンプリングを用いて、過去のタスクに不可欠なパラメータを特定し、それらを凍結する。
  • 継続的なリハーサルのため、以前に学習済みのデータの小さなサブセットを格納する固定サイズのメモリバッファを維持する。
  • メモリ支援型バランス調整を適用し、メモリサンプルの寄与度を動的に調整することで、安定した学習を実現する。
  • セグメンテーションされたネットワークとメモリバッファを用いて、新たなタスクに対して段階的に学習を進める。これにより、パラメータの干渉を回避する。
  • 1つのネットワークの余剰な容量を活用することで、構造の変更を避けつつ、パフォーマンスを維持する。

実験結果

リサーチクエスチョン

  • RQ1動的な構造拡張なしに、1つの静的ニューラルネットワークアーキテクチャが継続的学習において最先端のパフォーマンスを達成できるか?
  • RQ2パラメータセグメンテーションとメモリリハーサルの組み合わせが、単一ヘッド評価における記憶の消失をどれほど効果的に軽減できるか?
  • RQ3プログレッシブセグメンテーションは、エッジデバイスにおける継続的学習で、計算コストをどの程度低減できるか?
  • RQ4重要度サンプリング、モデルセグメンテーション、メモリバランス調整の各要因が、全体のパフォーマンスに果たす相対的寄与度は何か?
  • RQ5資源制限のある環境において、PSTは最小限のメモリ使用量と低FLOPオーバーヘッドで高い精度を維持できるか?

主な発見

  • PSTは、CIFAR-10およびCIFAR-100において、5、10、20の段階的タスクの全範囲で、SOTAの単一ヘッド精度を達成している。
  • 重要度サンプリングやモデルセグメンテーションを除去すると、精度が0.32–0.45パーセンテージポイント著しく低下し、それらの要素が極めて重要な役割を果たしていることが示された。
  • メモリ支援型バランス調整は寄与度は小さいが、依然としてパフォーマンスを向上させ、メモリ予算が変化する条件下でも0.06–0.11%の精度向上をもたらした。
  • PSTは、iCaRLなどの正則化手法と比較して、重み更新パスにおけるFLOPsを24倍以上も低減しており、エッジデプロイに特に有益である。
  • 限られたメモリでも高い精度を維持できるが、あるメモリサイズを超えると性能向上の伸びが飽和する傾向にある。
  • セグメンテーションされたトレーニングアプローチにより、重み更新パスにおける演算量の削減のおかげで、特に低遅延を実現する高速なトレーニングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。