[論文レビュー] Planning with Sequence Models through Iterative Energy Minimization
この論文では、強化学習のための軌道計画に、マスクされた言語モデルを用いた反復的エネルギー最小化を適用するプランナーモデルLEAPを提案する。双方向的文脈を用いたエネルギー最小化として軌道計画を定式化することで、LEAPはBabyAIおよびAtariタスクにおいて、自己回帰的ベースラインに比べてより優れた汎化性能、テスト時適応、計画の組み合わせ性能を実現する。
Recent works have shown that sequence modeling can be effectively used to train reinforcement learning (RL) policies. However, the success of applying existing sequence models to planning, in which we wish to obtain a trajectory of actions to reach some goal, is less straightforward. The typical autoregressive generation procedures of sequence models preclude sequential refinement of earlier steps, which limits the effectiveness of a predicted plan. In this paper, we suggest an approach towards integrating planning with sequence models based on the idea of iterative energy minimization, and illustrate how such a procedure leads to improved RL performance across different tasks. We train a masked language model to capture an implicit energy function over trajectories of actions, and formulate planning as finding a trajectory of actions with minimum energy. We illustrate how this procedure enables improved performance over recent approaches across BabyAI and Atari environments. We further demonstrate unique benefits of our iterative optimization procedure, involving new task generalization, test-time constraints adaptation, and the ability to compose plans together. Project website: https://hychen-naza.github.io/projects/LEAP
研究の動機と目的
- 自己回帰的系列モデルの計画における制限、すなわち生成後に過去の行動を再評価できない点を解消すること。
- 双方向的なマスクされた言語モデルを用いた反復的エネルギー最小化として、系列モデルによる軌道計画を可能にすること。
- BabyAIやAtari環境のような長時間スケールの意思決定タスクにおける性能向上を図ること。
- 動的障害物や複雑な迷路を含む、未観測の環境やテスト時の制約への汎化を可能にすること。
- 複数のモデルを組み合わせて複数目的タスクを達成するための組み合わせ的計画を可能にすること。
提案手法
- 負の擬似尤度を用いて、行動軌道上の暗黙のエネルギー関数を推定する双方向的マスク言語モデル(MLM)を学習する。
- MLMの負の対数尤度として軌道のエネルギーを定義し、エネルギーに基づく最適化を可能にする。
- 各時刻の行動を、現在の文脈と将来の行動を考慮したもとで最も確率の高い行動に置き換えることで、反復的改善を実行する。
- 双方向的文脈を用いることで、将来の情報を用いて改善段階で過去の行動選択に影響を与える。
- 反復的最小化により、目的を満たす低エネルギー(高尤度)の軌道に収束させる。
- エネルギー最小化プロセスを、新しい制約に適応可能で、複数のモデルを組み合わせた計画を生成可能なプランナに統合する。
実験結果
リサーチクエスチョン
- RQ1系列モデルに対する反復的エネルギー最小化は、標準的な自己回帰的生成に比べて強化学習における軌道計画性能を向上させるか?
- RQ2系列モデルにおける双方向的文脈は、軌道内の初期行動の改善を可能にするか?
- RQ3エネルギー最小化フレームワークは、新しい障害物や複雑なレイアウトを有する未観測環境に汎化可能か?
- RQ4動的障害物や新たに追加された障害物といったテスト時の制約にプランナは適応可能か?
- RQ5本フレームワークを用いて、複数の学習済みモデルを組み合わせて複数目的計画を達成できるか?
主な発見
- LEAPは、DT や IQL といった自己回帰的ベースラインを上回り、テスト時の障害物にオンラインで適応する性能を示し、中程度の難易度のラバ環境では92.0%の成功を達成したのに対し、DTは68.0%にとどまった。
- 未観測の迷路環境では、LEAPは中程度の難易度で77.5%、難易度の高いケースで61.0%の成功を記録した。一方、DTはそれぞれ36.0%および24.5%に低下した。
- 複合タスクの組み合わせにおいて、LEAPは容易なケースで83.5%、中程度のケースで43.0%の成功を達成した。これは、IQL(42.5%および11.5%)やDT(58.0%および15.5%)を顕著に上回った。
- LEAPは、複雑な迷路や動的障害物の状況においても頑健であることが示され、反復的改善によりラバーグリッドや検出不能な障害物を効果的に回避した。
- 反復的エネルギー最小化プロセスにより、長時間スケールの計画性能が向上し、評価されたすべてのベンチマークで一貫した性能向上が確認された。
- フレームワークは組み合わせ的計画をサポートしており、各モデルが部分的な情報しか観測しない状況でも、複数のモデルが単一の計画に寄与できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。