[論文レビュー] A Novel Automated Curriculum Strategy to Solve Hard Sokoban Planning Instances
本稿では、深層強化学習(RL)のための画期的な自動カリキュラム戦略を提案する。この戦略は、難易度量子モーメントを用いた多腕バンディット手法を用い、動的に複雑さが増す未ラベル付きのSokoban計画インスタンスを選択する。解法の境界付近にある部分課題に焦点を当てることで、RLエージェントが225個の難易度の高いSokobanインスタンスのうち179個(80%)を解くことに成功し、以前の最先端手法が解けた31個(13%)を著しく上回った。
In recent years, we have witnessed tremendous progress in deep reinforcement learning (RL) for tasks such as Go, Chess, video games, and robot control. Nevertheless, other combinatorial domains, such as AI planning, still pose considerable challenges for RL approaches. The key difficulty in those domains is that a positive reward signal becomes {\em exponentially rare} as the minimal solution length increases. So, an RL approach loses its training signal. There has been promising recent progress by using a curriculum-driven learning approach that is designed to solve a single hard instance. We present a novel {\em automated} curriculum approach that dynamically selects from a pool of unlabeled training instances of varying task complexity guided by our {\em difficulty quantum momentum} strategy. We show how the smoothness of the task hardness impacts the final learning results. In particular, as the size of the instance pool increases, the ``hardness gap'' decreases, which facilitates a smoother automated curriculum based learning process. Our automated curriculum approach dramatically improves upon the previous approaches. We show our results on Sokoban, which is a traditional PSPACE-complete planning problem and presents a great challenge even for specialized solvers. Our RL agent can solve hard instances that are far out of reach for any previous state-of-the-art Sokoban solver. In particular, our approach can uncover plans that require hundreds of steps, while the best previous search methods would take many years of computing time to solve such instances. In addition, we show that we can further boost the RL performance with an intricate coupling of our automated curriculum approach with a curiosity-driven search strategy and a graph neural net representation.
研究の動機と目的
- 成功する計画が指数的にまれである組合せAI計画タスクにおける極端な報酬スパarsityに対処すること。
- 手動によるカリキュラム設計の限界を克服し、完全に自動的かつ動的に訓練インスタンスを選択可能にする。
- ラベル付き解法や広範なドメイン固有のヒューリスティクスが不要な状況でも、深層RLエージェントがSokobanのようなPSPACE完全な計画問題を解けるようにすること。
- 解法の境界に位置する部分課題に注目することで、サンプル効率と学習速度を向上させ、探索と進捗のバランスを取ること。
- 自動カリキュラムと好奇心駆動探索、グラフニューラルネットワーク表現を組み合わせることで、有効性を実証すること。
提案手法
- 多様な複雑さの未ラベル付きSokoban部分課題(解けないインスタンスも含む)を含む大規模なプールを用意する。
- 現在のポリシーの性能と解法可能性の推定値に基づき、難易度量子モーメント多腕バンディット戦略を用いて部分課題のバッチを選択する。
- 選択された部分課題を、状態表現と行動ポリシーを学習できるグラフニューラルネットワーク(GNN)ポリシーを備えた深層RLエージェントに供給する。
- モンテカルロツリー探索(MCTS)を用いて解法可能性を評価し、現在のポリシーがわずかに超えられる範囲の部分課題にバンディットの選択を誘導する。
- ポリシーの向上に応じて、選択されたインスタンスの難易度を段階的に向上させることで、カリキュラムを動的に調整する。
- エージェントが新規または挑戦的な部分課題を探索するよう促すために、好奇心駆動探索を統合する。
実験結果
リサーチクエスチョン
- RQ1動的部課題選択に基づく自動カリキュラム戦略が、難易度の高い組合せ計画問題における深層RLのパフォーマンスを著しく向上させることができるか?
- RQ2タスク難易度の進行のなめらかさが、報酬がスパースな環境における学習効率と最終的パフォーマンスに与える影響は何か?
- RQ3自己教師あり・自己教師ありカリキュラム学習は、手作業で設計されたまたは固定されたカリキュラムスケジュールに比べて、どれほど優れているか?
- RQ4異なる難易度レベルの部分課題の混合が、安定的かつ高速な学習軌道を維持する上で果たす役割は何か?
- RQ5自動カリキュラムと好奇心駆動探索、GNN表現を組み合わせることで、さらにサンプル効率を向上させ、かつて不可能とされたインスタンスを解けるようになるか?
主な発見
- 提案された自動カリキュラム戦略は、225個の難易度の高いSokobanインスタンスのうち179個(80%)を解けたのに対し、以前の最先端ベースラインはたった31個(13%)にとどまった。
- 難易度量子モーメントバンディット戦略は、現在のポリシーの能力をわずかに超える部分課題に訓練を集中させることに成功し、なめらかで効果的な学習進行を実現した。
- 訓練が進むにつれ、より大規模・複雑な部分課題(例:14-および15ボックス)のサンプリング確率が上昇した。これは、エージェントの能力向上に適応した有効な調整であることを示している。
- 訓練プールに解けない部分課題を含めることで、学習がより速く、より強固になった。これは、挑戦的だが解けないインスタンスにさらされることで一般化能力が向上する可能性を示唆している。
- グラフニューラルネットワークと好奇心駆動探索の統合により、パフォーマンスがさらに向上し、エージェントが数百ステップにわたる長大で複雑な計画を発見できるようになった。
- 本手法は、ラベル付き解法や手作業によるヒューリスティクスを一切使用せず、難易度の高い計画ドメインにおける自己教師あり・カリキュラム駆動型深層RLの実現可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。