Skip to main content
QUICK REVIEW

[論文レビュー] PDDLGym: Gym Environments from PDDL Problems

Tom Silver, Rohan Chitnis|arXiv (Cornell University)|Feb 15, 2020
Software Engineering Research参考文献 25被引用数 10
ひとこと要約

PDDLGym は、PDDL ドメインおよび問題ファイルから自動的に OpenAI Gym 環境を生成するオープンソースフレームワークであり、関係的強化学習および順序決定意思決定研究を可能にします。Sokoban から TSP まで多様でカスタマイズ可能なベンチマークをサポートしており、計画とモデル学習の難易度に顕著な差異を示しています。

ABSTRACT

We present PDDLGym, a framework that automatically constructs OpenAI Gym environments from PDDL domains and problems. Observations and actions in PDDLGym are relational, making the framework particularly well-suited for research in relational reinforcement learning and relational sequential decision-making. PDDLGym is also useful as a generic framework for rapidly building numerous, diverse benchmarks from a concise and familiar specification language. We discuss design decisions and implementation details, and also illustrate empirical variations between the 20 built-in environments in terms of planning and model-learning difficulty. We hope that PDDLGym will facilitate bridge-building between the reinforcement learning community (from which Gym emerged) and the AI planning community (which produced PDDL). We look forward to gathering feedback from all those interested and expanding the set of available environments and features accordingly. Code: https://github.com/tomsilver/pddlgym

研究の動機と目的

  • Gym と PDDL を統合することで強化学習(RL)と古典的 AI 計画の間のギャップを埋める。
  • 標準化された記号的記述言語を用いて、研究者が関係的順序意思決定のベンチマークを迅速に作成・比較できるようにする。
  • RL と計画の研究者が同一で明確に定義された環境で手法を評価できるようにすることで、クロスコミュニティ研究を促進する。
  • 統一的かつ拡張可能なフレームワークを通じて、関係的 RL、階層的ポリシー学習、状態抽象化に関する先進的 research を支援する。
  • インタラクションデータから記号的遷移モデルを学習し、関係構造を発見する基盤を提供する。

提案手法

  • Python ライブラリを用いて PDDL ドメインおよび問題ファイルから自動的に Gym 環境を構築する。
  • 観測を、地面に適用された関係的述語の集合(例:on(plate, table))として表現し、行動を、地面に適用されたオペレータテンプレート(例:pick(plate))として表現する。
  • 環境側で PDDL で定義された遷移モデルに基づき、Gym の標準 API(step、reset、action_space、observation_space)を実装する。
  • 11 / 20 の組み込みドメインでカスタムレンダリングをサポートし、可視化と解釈可能性を向上させる。
  • Fast-Forward 計画と FOLDT 学習を用いて、環境間での計画難易度とモデル学習難易度を評価する。
  • URL ベースのローディングにより外部 PDDL リポジトリとの統合を可能にし、拡張性とコミュニティ貢献を支援する。

実験結果

リサーチクエスチョン

  • RQ1PDDL に基づく計画問題を、RL 研究用の標準化された Gym 環境に体系的に変換する方法は何か?
  • RQ2PDDL に基づく環境は、計画難易度とモデル学習複雑性においてどの程度変動するか?
  • RQ3PDDLGym は、関係的 RL と記号的計画の分野における研究を統一・加速する共通のベンチマークプラットフォームとして機能できるか?
  • RQ4関係的環境において、インタラクションデータから正確な遷移モデルを学習する際の課題は何か?
  • RQ5PDDLGym は、階層的・目的条件付き・ラップドポリシー学習手法の開発をどのように支援できるか?

主な発見

  • 20 の組み込み PDDLGym 環境は計画難易度に顕著な差異を示しており、Depot ドメインは TSP ドメインと比べて時間の2桁分の100倍以上かかっている。
  • Fast-Forward 計画時間は TSP で1秒未塔から Depot で1000秒以上まで変動し、問題の複雑さの広いスケールを示している。
  • モデル学習難易度は顕著に変動しており、FOLDT 学習は5つのドメインで成功したが、Baking、Depot、Sokoban などの他のドメインでは合理的な時間内に収束しなかった。
  • 環境全体の平均フレームレート(FPS)は Sokoban で155から TSP で1688まで変動し、ランダムポリシー下でのパフォーマンスのばらつきを示している。
  • 20 のドメインのうち11つでカスタムレンダリングを実装し、研究およびデバッグのための可視化と解釈可能性を向上させた。
  • 実験的結果は、TSP や Blocks のような「単純な」ドメインですら、オペレータ発見や状態抽象化といった非自明な課題を学習に提示していることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。