[論文レビュー] Reinforcement Learning with Structured Hierarchical Grammar Representations of Actions
本稿では、エージェントの行動から階層的なマクロアクションを文法推論を用いて発見する、Action Grammar Reinforcement Learning (AG-RL) というフレームワークを紹介する。このフレームワークは、深層強化学習におけるサンプル効率を向上させる。学習されたマクロアクションをアクション空間に追加することで、20種類のAtariゲームにおいて性能が向上し、SACと比較して中央値で+96%、最大で+3,756%のサンプル効率向上を達成。また、広範なハイパーパrameterチューニングなしで、20ゲーム中17ゲームで最先端の手法を上回った。
From a young age humans learn to use grammatical principles to hierarchically combine words into sentences. Action grammars is the parallel idea, that there is an underlying set of rules (a "grammar") that govern how we hierarchically combine actions to form new, more complex actions. We introduce the Action Grammar Reinforcement Learning (AG-RL) framework which leverages the concept of action grammars to consistently improve the sample efficiency of Reinforcement Learning agents. AG-RL works by using a grammar inference algorithm to infer the "action grammar" of an agent midway through training. The agent's action space is then augmented with macro-actions identified by the grammar. We apply this framework to Double Deep Q-Learning (AG-DDQN) and a discrete action version of Soft Actor-Critic (AG-SAC) and find that it improves performance in 8 out of 8 tested Atari games (median +31%, max +668%) and 19 out of 20 tested Atari games (median +96%, maximum +3,756%) respectively without substantive hyperparameter tuning. We also show that AG-SAC beats the model-free state-of-the-art for sample efficiency in 17 out of the 20 tested Atari games (median +62%, maximum +13,140%), again without substantive hyperparameter tuning.
研究の動機と目的
- 報酬が疎な環境において顕著なサンプル効率の悪さという、深層強化学習における重要な課題に取り組む。
- 言語の文法と行動の階層性の生物学的・認知的類似性を活用し、学習効率と解釈可能性を向上させる。
- 訓練中に自動的に構造的で階層的なマクロアクションを発見し、エージェントのアクション空間に統合する手法を開発する。
- 文法に基づいて推論されたマクロアクションが、広範なAtari環境において、広範なハイパーパrameterチューニングなしで顕著に性能向上をもたらすことを実証する。
- 訓練の安定性とデータ効率を向上させる一般化可能な技術——Hindsight Action ReplayとAbandon Ship——を導入する。
提案手法
- 固定ステップ数ごとに訓練を一時停止し、エージェントのアクション系列を収集。その後、繰り返し発生する構造的アクションパターンを特定するための文法推論アルゴリズムを適用する。
- 識別されたアクション系列を、時間的抽象化としてマクロアクションに変換する。これにより、原始的アクションが複雑で再利用可能な単位として組み合わされる。
- 発見されたマクロアクションをエージェントの元のアクション空間に追加し、継続的な訓練中にそれらを選択可能にする。
- Hindsight Action Replay (HAR) を用いて、元の目標が達成されなかった場合でも、マクロアクションからの経験を再利用することで、データ効率を向上させる。
- Abandon Ship手法を実装し、長時間のマクロアクションが失敗した場合に早期終了を許可することで、マクロアクション訓練中の分散を低減し、学習の安定性を向上させる。
- DDQNおよびSACエージェント(AG-DDQNおよびAG-SAC)にこのフレームワークを適用し、学習を再開する際にネットワークを微調整する(訓練を再開から行うのではなく)。
実験結果
リサーチクエスチョン
- RQ1エージェント行動から発見された階層的アクション文法は、深層強化学習におけるサンプル効率を向上させることができるか?
- RQ2文法から推論されたマクロアクションは、手動で設計されたものや繰り返し実行される原始的アクションと比較して、性能と一般化能力において優れているか?
- RQ3提案手法であるHindsight Action ReplayおよびAbandon Shipは、長時間のマクロアクションを用いた訓練において、学習の安定性とデータ効率をどの程度向上させるか?
- RQ4AG-RLフレームワークは、多様なAtariゲームにおいて、標準的なRLエージェントおよび最先端の手法をサンプル効率の観点から一貫して上回ることができるか?
- RQ5このフレームワークは、広範なハイパーパrameterチューニングなしで、価値ベース(DDQN)および方策ベース(SAC)の強化学習アルゴリズムの両方に対して効果的に適用可能か?
主な発見
- AG-DDQNを用いた8つのAtariゲームすべてで性能向上が見られ、DDQNと比較して中央値で+31%、最大で+668%のサンプル効率向上を達成した。
- AG-SACは、20ゲーム中19ゲームでSACと比較して中央値で+96%、最大で+3,756%のサンプル効率向上を達成。ハイパーパrameterチューニングは最小限に抑えられた。
- AG-SACは、20ゲーム中17ゲームでモデルフリーの最先端手法をサンプル効率の観点で上回り、中央値で+62%、最大で+13,140%の向上を達成した。
- Abandon Ship手法は訓練の分散を顕著に低減し、100ステップを超える長さのマクロアクションに対しても効果的な学習を可能にした。
- Hindsight Action Replayは性能向上に不可欠であり、これを除去するとAG-DDQNは標準的なDDQNと同等の性能にとどまった。これは、経験の再利用を最大化する役割を果たしていることを示している。
- 平均して、エージェントは評価時に長さ6.9のマクロアクションを実行した(原始的アクションのみの場合の1.0と比較)。これは、高レベルのアクションが広く使用されていることを示しており、マクロアクションの長さは2から100以上にわたった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。