[論文レビュー] SPOTTER: Extending Symbolic Planning Operators through Targeted Reinforcement Learning
SPOTTER は、記号的計画と標的型強化学習を統合するフレームワークであり、既存の演算子が目標に到達できない場合に、自動的に新しい記号的演算子を発見・合成する。環境を探索して計画が可能になる部分目標(subgoals)を特定し、それらの部分目標に到達するためのポリシーを学習する強化学習エージェントを訓練することで、その演算子を記号的ドメインに追加する。これにより、純粋な強化学習に比べて優れたサンプル効率性と一般化性能を達成するが、事前の知識や成功した計画トレースを必要としない。
Symbolic planning models allow decision-making agents to sequence actions in arbitrary ways to achieve a variety of goals in dynamic domains. However, they are typically handcrafted and tend to require precise formulations that are not robust to human error. Reinforcement learning (RL) approaches do not require such models, and instead learn domain dynamics by exploring the environment and collecting rewards. However, RL approaches tend to require millions of episodes of experience and often learn policies that are not easily transferable to other tasks. In this paper, we address one aspect of the open problem of integrating these approaches: how can decision-making agents resolve discrepancies in their symbolic planning models while attempting to accomplish goals? We propose an integrated framework named SPOTTER that uses RL to augment and support ("spot") a planning agent by discovering new operators needed by the agent to accomplish goals that are initially unreachable for the agent. SPOTTER outperforms pure-RL approaches while also discovering transferable symbolic knowledge and does not require supervision, successful plan traces or any a priori knowledge about the missing planning operator.
研究の動機と目的
- 部分的に指定されたドメインにおける記号的計画エージェントが、欠落または誤った演算子のため目標に到達できないという課題に対処すること。
- 欠落した演算子の知識や成功した計画トレースが事前に与えられない状況でも、新しい記号的演算子とその低レベル制御器を自動で発見できること。
- 計画が可能になる部分目標に焦点を当てた探索によって、記号的計画における強化学習のサンプル効率性と一般化性能を向上させること。
- 実行時における演算子合成を可能にする形で、記号的計画と強化学習を統合すること。
- エージェントが予期しない状況に適応できるように、動的に記号的アクションモデルを拡張できるフレームワークを開発すること。
提案手法
- エージェントはまず、現在のドメインモデルを用いて目標に向けて記号的計画を試行する。
- 計画が得られなかった場合、オンライン探索者がランダムな探索を実行し、目標への記号的計画が可能になる状態(部分目標)に到達する。
- そのような部分目標状態に到達すると、オフライン強化学習学習者が起動され、関連する事前条件からその状態に確実に到達するポリシーを学習する。
- 強化学習学習者は探索者からの軌道データを用いてポリシーを訓練し、定期的にその学習済ポリシーが高得点を達成するような事前条件を推定しようとする。
- 妥当な事前条件が発見された場合、新しい記号的演算子がその事前条件とともに計画ドメインに合成され追加される。
- このプロセスは繰り返される:新しい演算子により新たな計画が可能になり、そのサイクルは目標に到達するか、さらなる進展が得られなくなるまで継続する。
実験結果
リサーチクエスチョン
- RQ1記号的計画エージェントは、現在のモデルが目標に到達できない場合に、どのように新しい演算子を自動で発見できるか?
- RQ2成功した計画トレースや欠落した演算子の事前知識がなければ、強化学習を用いて一般化可能な記号的演算子を学習できるか?
- RQ3計画が可能になる部分目標に焦点を当てた探索により、サンプル効率性をどのように向上させられるか?
- RQ4合成された演算子は、同じドメイン内での異なるタスク間でどの程度再利用可能か?
- RQ5記号的計画と強化学習を統合することで、部分的に指定されたドメインにおいて純粋な強化学習よりも収束が速く、性能が優れているか?
主な発見
- SPOTTER は、ドアの施錠解除や物体操作を含むグリッドワールドパズルにおいて、純粋な強化学習ベースラインに比べて累積報酬と学習速度の両面で顕著に優れている。
- フレームワークは、元のドメインモデルに存在しない新しい記号的演算子(例:「ボールを道から移動させる」)を自動で発見し、以前に到達不可能だった目標を達成可能にする。
- SPOTTER は一般化可能な記号的知識を学習する:合成された演算子はタスク間で一般化され、新しい計画文脈でも再利用可能である。
- 目標達成に構造的に関連する部分目標に焦点を当てた探索により、ランダムな探索を避けることで、高いサンプル効率性を達成している。
- 成功した計画トレースや欠落した演算子の事前知識が不要であるため、部分的にしか把握されていない動的環境における実世界への展開に対しても、SPOTTER は頑健である。
- グリッドワールド環境での評価により、SPOTTER は標準的な記号的プランナーや純粋な強化学習エージェントが処理できない複雑なパズルを解けることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。