[論文レビュー] Symbolic Network: Generalized Neural Policies for Relational MDPs
SymNet は、RDDL で表現された関係的マルコフ決定過程(RMDP)の一般化された方策を学習する新しいニューラルネットワークフレームワークである。問題インスタンスをグラフ構造の表現に変換し、グラフニューラルネットワークを用いて状態および行動の埋め込みを計算することで、事前学習済みのパラメータを用いて一括して優れた性能を達成する。これは、エンドツーエンドでドメインに依存しない神経的関係的計画の実現可能性を示している。
A Relational Markov Decision Process (RMDP) is a first-order representation to express all instances of a single probabilistic planning domain with possibly unbounded number of objects. Early work in RMDPs outputs generalized (instance-independent) first-order policies or value functions as a means to solve all instances of a domain at once. Unfortunately, this line of work met with limited success due to inherent limitations of the representation space used in such policies or value functions. Can neural models provide the missing link by easily representing more complex generalized policies, thus making them effective on all instances of a given domain? We present SymNet, the first neural approach for solving RMDPs that are expressed in the probabilistic planning language of RDDL. SymNet trains a set of shared parameters for an RDDL domain using training instances from that domain. For each instance, SymNet first converts it to an instance graph and then uses relational neural models to compute node embeddings. It then scores each ground action as a function over the first-order action symbols and node embeddings related to the action. Given a new test instance from the same domain, SymNet architecture with pre-trained parameters scores each ground action and chooses the best action. This can be accomplished in a single forward pass without any retraining on the test instance, thus implicitly representing a neural generalized policy for the whole domain. Our experiments on nine RDDL domains from IPPC demonstrate that SymNet policies are significantly better than random and sometimes even more effective than training a state-of-the-art deep reactive policy from scratch.
研究の動機と目的
- 無限に広がる問題インスタンスのスケールで、関係的MDP(RMDP)に対して効果的で一般化された方策を学習するという長年の課題に取り組む。
- シンボリックな基底関数アプローチの限界を克服するため、ニューラルネットワークの表現力を利用することで、RMDPに基づく計画分野の関心を再燃させる。
- ドメインに依存せず、問題インスタンスのサイズが異なる場合でも再訓練なしにパラメータを共有する神経アーキテクチャを構築する。
- 新しいテストインスタンス(可能であればより大きなサイズのもの)に対して、事前学習済みパラメータを用いて1回の順伝播で効率的な推論を可能にし、1つのドメイン全体にわたる単一のニューラル方策を学習可能にする。
提案手法
- 各 RDDL 問題インスタンスを、ノードがオブジェクトタプルを表し、エッジが行動によって誘発される述語の相互作用を表すインスタンスグラフに変換する。
- グラフニューラルネットワーク(GNN)を用いて、関係的状態特徴からノードの埋め込みを計算し、状態内の構造的および意味的関係を捉える。
- 関連するオブジェクトタプルの埋め込みと第一階の記号に基づいて、各具体化された行動のスコアを計算し、ニューラルスコアリングによる行動選択を可能にする。
- ドメイン内の複数の訓練インスタンスに対して強化学習を用いて、すべてのパラメータをインスタンス間で共有しながら、モデル全体をエンドツーエンドで学習する。
- 事前学習済みの SymNet モデルを、微調整なしに、任意の新しいテストインスタンスに対して1回の順伝播で適用し、一般化された方策を生成する。
- RDDL に内在する第一階構造を活用することで、サイズ不変性とドメイン不変性を維持し、問題のサイズにかかわらず一般化を実現する。
実験結果
リサーチクエスチョン
- RQ1ニューラルネットワークは、シンボリック基底関数の表現限界を克服できるほど、RMDP の一般化された方策を効果的に表現できるか?
- RQ21つの事前学習済みニューラルモデルが、再訓練なしに同じ RDDL ドメインの多様な問題インスタンスに一般化できるか?
- RQ3事前学習済みでドメインに一般化されたニューラル方策の性能は、ランダム方策やインスタンス固有の深層強化学習方策と比べてどの程度か?
- RQ4グラフベースのニューラルアーキテクチャは、RMDP における関係的構造と行動の依存関係をどの程度正確に捉えることができるか?
主な発見
- SymNet は、テストされた9つのすべての RDDL ドメインでランダム方策を顕著に上回り、強力な一般化能力を示している。
- 28% のテストインスタンスにおいて、同じインスタンスに対してから scratch で学習した方策を上回る報酬を得ており、優れたゼロショット性能を示している。
- 18 個のインスタンス中 15 個で TraPSNet よりも優れた性能を示し、行動記号固有のグラフ構造が方策学習を向上させることを示唆している。
- ナビゲーション、 Wildfire など 4 つのドメインでは、オンラインプランナである PROST をも凌駆したが、これはオフライン方策であるにもかかわらずである。
- 5 つのドメインでは PROST が SymNet を上回ったため、SymNet の方策はまだ最適に近いとは言えず、さらなる改善の余地があることが示された。
- 学習時に見られなかったより大きなテストインスタンスに対しても、モデルは効果的に一般化しており、サイズ不変性とドメイン不変性の本質を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。