[論文レビュー] Learning First-Order Symbolic Representations for Planning from the Structure of the State Space
本稿では、事前的な記号的知識なしに、状態空間グラフの構造的トポロジーから1次記号的計画表現(アクションスキーマ、述語、オブジェクトなど)を学習する手法を提案する。SATに基づく推論を用いた2段階の組合せ的探索により、Gripper や Blocksworld、Hanoi といった古典的領域について、平坦で非記号的な状態空間グラフからも、正しいかつ一般化可能な1次モデルを効果的に回復できた。
One of the main obstacles for developing flexible AI systems is the split between data-based learners and model-based solvers. Solvers such as classical planners are very flexible and can deal with a variety of problem instances and goals but require first-order symbolic models. Data-based learners, on the other hand, are robust but do not produce such representations. In this work we address this split by showing how the first-order symbolic representations that are used by planners can be learned from non-symbolic inputs that encode the structure of the state space. The representation learning problem is formulated as the problem of inferring planning instances over a common but unknown first-order domain that account for the structure of the observed state space. This means to infer a complete first-order representation (i.e. general action schemas, relational symbols, and objects) that explains the observed state space structures. The inference problem is cast as a two-level combinatorial search where the outer level searches for values of a small set of hyperparameters and the inner level, solved via SAT, searches for a first-order symbolic model. The framework is shown to produce general and correct first-order representations for standard problems like Gripper, Blocksworld, and Hanoi from input graphs that encode the flat state-space structure of a single instance.
研究の動機と目的
- データ駆動型のブラックボックス学習と、手作業で記述された記号的モデルを必要とするモデルベース計画の間のギャップを埋める。
- 非記号的で構造的な入力から、1次記号的計画表現(アクションスキーマ、述語、オブジェクト)の自動合成を可能にする。
- 表現学習の問題を、構造的同値性を介して観測された状態空間グラフを説明する共通の1次ドメインを推論する問題として定式化する。
- ラベル付き有向グラフ(状態遷移を符号化)という最小限の入力から、スケーラブルなフレームワークを構築し、一般化可能で再利用可能な計画モデルを推論する。
- 状態空間トポロジーから直接、解釈可能で構成的かつ再利用可能な表現を学習することで、記号的・結合的(connectionist)な分野の溝を埋める。
提案手法
- 各インスタンス P_i がドメイン D に対して生成する状態空間グラフ G(P_i) が、観測された入力グラフ G_i と構造的に一致するような1次ドメイン D(アクションスキーマ、述語、オブジェクトを含む)を求める問題として表現学習を定式化する。
- 推論を2段階の探索に定式化する:外側の段階はハイパーパrameter(例:アクションスキーマ数、述語数、引数数)を探索し、内側の段階は固定されたハイパーパrameterに対して有効な1次モデルを見つけるためにSATソルバを用いる。
- 観測されたグラフ G_i と生成されたグラフ G(P_i) の構造的同値性をSAT式にエンコードし、遷移、事前条件、効果に関する制約を含む。
- 否定を含む上位のSTRIPS言語をターゲットの記号的形式的体系として採用し、静的・動的述語の表現を可能にする。
- すべての入力グラフを説明する最小のドメインサイズ(一般化を優遇)を持つ最も単純なモデルをSATソルバで特定する。
- AND-ORグラフへの拡張により非決定的アクションを扱い、重み付きMax-SAT拡張によりノイズのある入力を処理する。
実験結果
リサーチクエスチョン
- RQ1状態空間グラフの構造的トポロジーから、記号的入力なしに1次記号的計画表現を学習可能か?
- RQ2複数のインスタンスの状態空間構造を説明する共通の1次ドメイン(オブジェクト、関係、アクションスキーマを含む)を推論することは可能か?
- RQ3ハイパーパrameterとSATエンコードされた制約の有界な探索空間内で、最も単純かつ一般化可能な1次モデルをどのように発見できるか?
- RQ4平坦で非記号的なグラフから、微細な記号的構造(例:静的vs.動的述語、オブジェクトの役割)をどの程度回復できるか?
- RQ5不完全またはノイズのある状態空間データに対して、このアプローチはどの程度頑健か?
主な発見
- 本手法は、1つのインスタンスの平坦な状態空間グラフから、Gripper や Blocksworld、Hanoi といった標準的計画領域について、正しいかつ一般化可能な1次モデルを効果的に学習できた。
- 入力に存在しなかったにもかかわらず、適切なアクションスキーマ、関係記号、オブジェクトの役割を含む学習済み表現が得られた。
- 構造的再利用ができないため、命題的エンコードの試みは、意味のない変数集合(例:グレイコード)を生成しやすいが、本手法はそれらを上回る性能を示した。
- 1次表現の使用により、訓練済みインスタンスを超えた一般化が可能となり、同じドメインモデルが異なる目標や問題インスタンスで再利用可能である。
- 非決定的アクションは、入力グラフをAND-OR構造に拡張し、一貫したアクションパラメータ化を強制することで処理された。
- ノイズ(余分な遷移やラベル)は、SAT問題を重み付きMax-SATタスクに再定式化することで耐性を示したが、計算コストが増加した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。