Skip to main content
QUICK REVIEW

[論文レビュー] Learning First-Order Symbolic Planning Representations That Are Grounded

Andrés Occhipinti Liberman, Blai Bonet|arXiv (Cornell University)|Apr 25, 2022
AI-based Problem Solving and Planning被引用数 5
ひとこと要約

本稿では、答え集合プログラミング(ASP)を用いて解析済み2次元画像に根ざした明確で一階述語の計画モデルを学習する新しい手法を提案する。組み合わせ的学習と画像に基づく根拠づけを組み合わせることで、訓練データ以外の画像ペアで定義される新しいインスタンスへの一般化を可能にし、ブロック、ソコバン、ハノイ、グリッド領域において最小限の人為的アノテーション付き述語で正確な計画を達成する。

ABSTRACT

Two main approaches have been developed for learning first-order planning (action) models from unstructured data: combinatorial approaches that yield crisp action schemas from the structure of the state space, and deep learning approaches that produce action schemas from states represented by images. A benefit of the former approach is that the learned action schemas are similar to those that can be written by hand; a benefit of the latter is that the learned representations (predicates) are grounded on the images, and as a result, new instances can be given in terms of images. In this work, we develop a new formulation for learning crisp first-order planning models that are grounded on parsed images, a step to combine the benefits of the two approaches. Parsed images are assumed to be given in a simple O2D language (objects in 2D) that involves a small number of unary and binary predicates like "left", "above", "shape", etc. After learning, new planning instances can be given in terms of pairs of parsed images, one for the initial situation and the other for the goal. Learning and planning experiments are reported for several domains including Blocks, Sokoban, IPC Grid, and Hanoi.

研究の動機と目的

  • 組み合わせ的記号的計画と深層学習の間のギャップを埋めるために、解析済み画像に根ざした一階述語の行動スキーマを根拠づける。
  • 訓練データ以外の画像ペアで定義される新しい計画インスタンスへの一般化を可能にする。
  • 視覚的根拠づけを伴う非構造的状態シーケンスから、ドメインの述語と行動スキーマを同時に学習する。
  • 手作業で書かれたものに類似した解釈可能で人間が読みやすい計画モデルを生成しつつ、視覚的入力に強い耐性を維持する。

提案手法

  • 単一のO2D言語で、一価および二価の視覚的述語を持つ解析済み画像表現の上に答え集合プログラミング(ASP)タスクとして学習問題を定式化する。
  • 状態遷移の構造的表現を用い、各状態は2次元レイアウト内のオブジェクト関係(例:'left'、'above'、'shape')によって記述される。
  • 行動の適用が観察された遷移と整合的になるように、1つの状態から次の状態へ正しくマッピングされるよう制約を適用する。
  • 対称性を破るルールと最適化ルールを課し、前件、効果、非静的述語が最小限のより単純でコンactなモデルを好む。
  • 学習された記号的述語を視覚的特徴にマッピングする根拠づけメカニズムを採用し、新しい画像ベースのインスタンスでの評価を可能にする。
  • ASPソルバを用いて、行動スキーマ、述語、および視覚的入力空間におけるそれらの根拠づけを同時に推論する。

実験結果

リサーチクエスチョン

  • RQ1非構造的状態シーケンスから学習された一階記号的計画モデルが、視覚的入力表現に根ざして学習可能か?
  • RQ2解析済み2次元画像に根ざした学習された述語が、訓練時に見られなかった新しい計画インスタンスへのゼロショット一般化を可能にするか?
  • RQ3学習されたモデルが、手作業で書かれたモデルに類似した解釈可能性と、深層学習モデルに類似した視覚的変動への耐性の両方を達成できるか?
  • RQ4オブジェクト数が異なるブロック、ソコバン、ハノイなどの多様なドメインにおいて、この手法はどのようにスケーリングするか?
  • RQ5インダクティブバイアス(例:単純さ、最小性)が、学習された計画モデルの品質および一般化性能に与える影響は何か?

主な発見

  • 本手法は、解析済み2次元画像に根ざした解釈可能で一階述語の行動スキーマと述語を効果的に学習し、新しい画像ベースのインスタンスでの計画を可能にする。
  • 訓練時に見られなかったオブジェクト数の多いインスタンスに対しても一般化できることを示し、強力なゼロショット一般化を実現する。
  • 本手法は、ブロック、ソコバン、IPCグリッド、ハノイなど複数のドメインで、画像ベースの状態記述のみを用いて、計画問題を高い精度で解ける。
  • 対称性を破るルールと最適化制約を用いたASPの適用により、ベースライン手法よりも前件や効果が少ない、よりコンactで最小限のモデルが得られる。
  • 根拠づけメカニズムにより、学習された述語が視覚的特徴(例:'left'、'above')と意味的に整合するようになり、新しい画像での正しい評価が可能になる。
  • 特に複雑な視覚的ドメインにおいて、解釈可能性と一般化性能のバランスを取る点で、純粋な組み合わせ的または深層学習ベースの手法を上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。