[論文レビュー] Learning Generalized Policies Without Supervision Using GNNs
この論文は、最適な価値関数やラベル付きデモを必要とせず、古典的計画領域において一般化された計画方策を学習する自己教師付きグラフニューラルネットワーク(GNN)手法を提案する。状態を推移的閉包やロール合成といった導出原子で拡張することで、Logistics や Spanner* といったドメインにおいて、最小限の GNN 层でさえも、より大きなテストインスタンスに対してほぼ完璧な一般化(最大100%)を達成する。これは、NP困難な計画設定における標準的な価値ベース強化学習の限界を克服するものである。
We consider the problem of learning generalized policies for classical planning domains using graph neural networks from small instances represented in lifted STRIPS. The problem has been considered before but the proposed neural architectures are complex and the results are often mixed. In this work, we use a simple and general GNN architecture and aim at obtaining crisp experimental results and a deeper understanding: either the policy greedy in the learned value function achieves close to 100% generalization over instances larger than those used in training, or the failure must be understood, and possibly fixed, logically. For this, we exploit the relation established between the expressive power of GNNs and the $C_{2}$ fragment of first-order logic (namely, FOL with 2 variables and counting quantifiers). We find for example that domains with general policies that require more expressive features can be solved with GNNs once the states are extended with suitable "derived atoms" encoding role compositions and transitive closures that do not fit into $C_{2}$. The work follows the GNN approach for learning optimal general policies in a supervised fashion (Stahlberg, Bonet, Geffner, 2022); but the learned policies are no longer required to be optimal (which expands the scope, as many planning domains do not have general optimal policies) and are learned without supervision. Interestingly, value-based reinforcement learning methods that aim to produce optimal policies, do not always yield policies that generalize, as the goals of optimality and generality are in conflict in domains where optimal planning is NP-hard.
研究の動機と目的
- 最適な価値関数や教師あり価値関数を必要としない、自己教師付きGNNベースの手法を用いて、古典的計画領域における一般化方策を学習すること。
- 最適計画がNP困難であるドメインにおいて、標準的な価値ベース強化学習の一般化性能の欠落を是正すること。
- C2論理の表現力に制限されるGNNが、どのようにしてより複雑な計画特徴を捉えるかを調査すること。
- 導出原子(例:推移的閉包、ロール合成)の使用が、GNNの表現力と一部の計画ドメインで必要な非C2特徴の間のギャップをどのように埋めるかを検討すること。
- 非最適で自己教師付きのGNN方策が、教師ありや標準的なRLアプローチよりも、より大きなインスタンスに効果的に一般化できるかを実証すること。
提案手法
- 小さな訓練インスタンスにおいて、ラップドSTRIPS形式で、一般化された価値関数 V(s) を学習するためのシンプルで汎用的なGNNアーキテクチャを用いる。
- 標準的な価値ベースRLで用いられるL0損失関数の代わりに、真の最適値がなくても自己教師付き学習が可能になる新しいL1損失関数を採用する。
- C2論理の表現力を超える特徴を符号化するために、推移的閉包やロール合成などの導出原子を状態表現に拡張する。
- 学習された価値関数から導かれるグリーディ方策を、訓練に使ったインスタンスよりも大きなテストインスタンスに適用し、一般化性能を評価する。
- 過学習を軽減し、特に導出原子を使用する場合に一般化性能を向上させるために、GNNの深さ(例:30層から2層に)を低減する。
- 未見でより大きなインスタンスを用いたカバレッジメトリクスを用いて、複数のドメイン(例:Logistics, Spanner*, Gridworld)で性能を検証する。
実験結果
リサーチクエスチョン
- RQ1最適な価値関数や教師付き情報がなくても、自己教師付きGNNベースの手法が、より大きなインスタンスに一般化する一般化方策を学習できるか?
- RQ2最適計画がNP困難であるドメインにおいて、標準的な価値ベース強化学習手法が最適価値関数を学習しても、なぜ一般化に失敗するのか?
- RQ3C2論理に制限されるGNNが、複雑な計画ドメインにおける一般化方策に必要な特徴をどの程度捉えることができるか?
- RQ4導出原子(例:推移的閉包、ロール合成)が、C2表現力を超えるGNNの能力をどの程度拡張し、完全な一般化を可能にするか?
- RQ5GNNの深さを低減することで一般化性能が向上するか、特に導出原子と組み合わせた場合に顕著か?
主な発見
- Logisticsドメインでは、導出原子を追加することで、グリーディ方策のカバレッジが0%から14%に上昇し、サイクル回避を導入した場合に60%から100%にまで上昇した。
- 最大50の場所を有する変更版のSpanner*ドメインにおいて、導出原子なしではGNN層数L=10でカバレッジが33%に達したが、導出原子を追加すると86%に上昇した。
- GNN層数を10から5にさらに減らしたところ、導出原子を有する状況でカバレッジが86%に上昇し、層数をわずか2にまで減らした場合に100%のカバレッジを達成した。
- 層数を減らした効果は、特に導出原子と組み合わせた場合に過学習が軽減されたことに起因する。
- 導出原子と最小限のGNN深さを組み合わせることで、複数のドメイン(例:Logistics, Spanner*)で100%の一般化を達成した。
- L1損失関数により、最適方策が存在しない状況でも効果的な自己教師付き学習が可能となり、NP困難ドメインにおいて標準的な価値ベースRLを上回る一般化性能を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。