[論文レビュー] Memory-efficient Reinforcement Learning with Value-based Knowledge Consolidation
本稿では、報酬関数の知識をターゲットQネットワークから現在のQネットワークに統合する統合損失を介して、継続的学習における深刻な忘却を軽減するメモリ効率の良い強化学習アルゴリズムMeDQNを提案する。標準DQNと比較して10倍以上小さいリプレイバッファを用いても、表形式および画像ベースの環境で同等または優れた性能を達成し、メモリ使用量を顕著に削減しながらも、高いサンプル効率を維持する。
Artificial neural networks are promising for general function approximation but challenging to train on non-independent or non-identically distributed data due to catastrophic forgetting. The experience replay buffer, a standard component in deep reinforcement learning, is often used to reduce forgetting and improve sample efficiency by storing experiences in a large buffer and using them for training later. However, a large replay buffer results in a heavy memory burden, especially for onboard and edge devices with limited memory capacities. We propose memory-efficient reinforcement learning algorithms based on the deep Q-network algorithm to alleviate this problem. Our algorithms reduce forgetting and maintain high sample efficiency by consolidating knowledge from the target Q-network to the current Q-network. Compared to baseline methods, our algorithms achieve comparable or better performance in both feature-based and image-based tasks while easing the burden of large experience replay buffers.
研究の動機と目的
- 制限されたメモリ容量のため、非i.i.d.データ上で学習する際の深層強化学習における深刻な忘却を解消すること。
- オンデバイスおよびエッジRLアプリケーションにおける大規模な経験リプレイバッファのメモリ負荷を軽減すること。
- 大規模なデータ保存に依存せずに、高いサンプル効率と学習安定性を維持すること。
- 最小限のメモリオーバーヘッドで継続的RL設定における効果的な知識保持を可能にすること。
提案手法
- ターゲットQネットワークから現在のQネットワークへの価値関数知識の転送を可能にする知識統合損失を導入する。
- 学習した経験と過去の知識の保持のバランスを調整可能なハイパーパrameterを用いる。
- 大規模な経験リプレイバッファを、均一または実状態サンプリングに置き換えることで、メモリ使用量を最大10倍まで削減する。
- 学習更新中に統合損失を適用することで、学習の安定性を高め、忘却を低減する。
- 2つの変種を設計:均一状態サンプリング向けのMeDQN(U)と実状態サンプリング向けのMeDQN(R)を、タスクの種別に適応させる。
- 標準DQNアーキテクチャを維持しつつ、知識統合を学習目的に組み込むことで、既存のフレームワークとの互換性を保つ。
実験結果
リサーチクエスチョン
- RQ1大規模なリプレイバッファに依存せずに、ターゲットネットワークからの知識統合がDQNにおける忘却を軽減できるか?
- RQ2リプレイバッファを10倍小さくした場合、MeDQNの性能は標準DQNと比べてどうなるか?
- RQ3知識統合は、低次元および高次元制御タスクの両方でサンプル効率と学習安定性を向上させるか?
- RQ4MeDQNは、Atari や MinAtar などの画像ベースの環境でも、最小限のメモリ使用量で性能を維持できるか?
- RQ5継続的RL設定において、新しい知識の学習と過去の知識の記憶の最適なバランスは何か?
主な発見
- 100kバッファサイズのMeDQN(R)は、3つのAtariゲーム(Name This Game, Phoenix, Qbert)で100万バッファの標準DQNを上回った。
- Seaquest(MinAtar)では、MeDQN(R)が100kバッファで25.82 ± 1.69の報酬を達成し、100万バッファのDQNの20.48 ± 0.75を上回った。
- MeDQN(R)は、10%のリプレイバッファメモリしか使用しなかったにもかかわらず、他の2つのAtariゲームでDQNと同等の性能を達成した。
- Atariゲームでは、メモリ使用量を7GBから0.7GBに削減し、性能劣化なしに10倍のメモリフットプリント削減を確認した。
- MeDQN(U)およびMeDQN(R)は、忘却の低減と必要な更新回数の減少により、計算効率が向上した。
- 最小限のメモリオーバーヘッドでSOTA性能を達成し、多様な環境にわたり強いロバスト性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。