[論文レビュー] One Big Net For Everything
本論文は、強化学習と勾配ベースの教師あり・教師なし学習を統合することで、段階的に多様な制御および予測スキルを学習する、1つの再帰的ニューラルネットワーク(ONE)を提案する。過去の経験を圧縮し、共有されるサブルーチンを再利用することで、ONEは崩壊的忘却を回避し、一般化能力を高め、効率的な重み更新とPowerPlayスタイルのタスク順序付けにより、アルゴリズム的に関連する新しいタスクを迅速に学習可能になる。
I apply recent work on "learning to think" (2015) and on PowerPlay (2011) to the incremental training of an increasingly general problem solver, continually learning to solve new tasks without forgetting previous skills. The problem solver is a single recurrent neural network (or similar general purpose computer) called ONE. ONE is unusual in the sense that it is trained in various ways, e.g., by black box optimization / reinforcement learning / artificial evolution as well as supervised / unsupervised learning. For example, ONE may learn through neuroevolution to control a robot through environment-changing actions, and learn through unsupervised gradient descent to predict future inputs and vector-valued reward signals as suggested in 1990. User-given tasks can be defined through extra goal-defining input patterns, also proposed in 1990. Suppose ONE has already learned many skills. Now a copy of ONE can be re-trained to learn a new skill, e.g., through neuroevolution without a teacher. Here it may profit from re-using previously learned subroutines, but it may also forget previous skills. Then ONE is retrained in PowerPlay style (2011) on stored input/output traces of (a) ONE's copy executing the new skill and (b) previous instances of ONE whose skills are still considered worth memorizing. Simultaneously, ONE is retrained on old traces (even those of unsuccessful trials) to become a better predictor, without additional expensive interaction with the enviroment. More and more control and prediction skills are thus collapsed into ONE, like in the chunker-automatizer system of the neural history compressor (1991). This forces ONE to relate partially analogous skills (with shared algorithmic information) to each other, creating common subroutines in form of shared subnetworks of ONE, to greatly speed up subsequent learning of additional, novel but algorithmically related skills.
研究の動機と目的
- 災害的忘却を伴わずに、多様なタスクにわたる継続的学習が可能な、1つの汎用的ニューラルネットワーク(ONE)の開発。
- 強化学習と勾配ベースの教師あり・教師なし学習を統合し、ONEに新しいスキルを効率的に訓練する。
- タスク間の共通するアルゴリズム的構造を同定することで、事前に学習したサブルーチンを再利用可能にする。
- 計算コストを最小限に抑えながら学習速度を最適化するため、PowerPlayフレームワークを用いてタスクを自動的に順序付ける。
- 歴史的経験データをすべて保持し、データ破棄を避けることで、継続的な圧縮と一般化を実現する。
提案手法
- ONEは、複数の学習パラダイム(例:ニューロエボリューションを含む強化学習、教師あり学習、予測のための非教師あり勾配降下)を用いて訓練される。
- ユーザーが定義したゴールベクトルを用いてタスクを指定し、入力に依存するダイナミクスを通じてネットワークがタスク固有の行動を学習可能になる。
- PowerPlayスタイルの訓練では、過去の試行(成功・失敗を問わず)の入力/出力トレースを再利用し、ONEを再訓練することで、予測精度と一般化能力を向上させる。
- 部分的に類似したスキル同士を関連付けることで、共有サブネットワークが形成され、共通するサブルーチンを介して、新しい関連タスクの学習が著しく高速化される。
- 重要な重みの安定化と忘却の低減を図るため、重みの分散の追跡とタスク固有の重み使用ログの記録をヒューリスティックとして用いる。
- 計算コストの最小化と学習速度の最大化を目的として、タスク・ソルバーのペアに対するグリーディサーチを用いて、タスクを自動的に順序付ける。
実験結果
リサーチクエスチョン
- RQ11つの再帰的ニューラルネットワークが、災害的忘却を伴わずに、多様な制御および予測スキルの蓄積的習得が可能か?
- RQ2強化学習と勾配ベースの学習をどのように統合すれば、汎用的問題解決者を効率的に訓練できるか?
- RQ3関連するスキルを1つのネットワークに同時に圧縮することで、共有サブルーチンが自然に出現するか?
- RQ4過去の経験データを破棄せずに保持することで、どのようなメカニズムが効率的な継続的学習を可能にするか?
- RQ5計算複雑性に基づく自動タスク順序付けは、関連する新しいスキルの学習速度を向上させることができるか?
主な発見
- ONEは、神経的進化からの試行を含め、過去のすべての経験データを破棄せずに、制御および予測スキルを段階的に吸収可能である。
- 勾配降下を用いて過去の行動を圧縮することで、ONEは内部の重み行列を簡素化し、事前に学習したスキルの本質を埋め込む。
- 部分的に類似したスキル同士を関連付けることで、共有サブルーチンが自然に出現し、関連する新しいタスクの学習が著しく高速化される。
- 重みの分散とタスク固有の重み使用状況の追跡により、重要な知識の安定化が図られ、再訓練時の忘却が低減される。
- PowerPlayを用いた自動タスク順序付けにより、計算コストを最小限に抑えつつ学習速度を最大化する順序で新しいスキルが学習される。
- 本システムは、1つのRNNが過去の経験を継続的かつデータ効率的に圧縮することで、一般問題解決者へと進化可能であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。