Skip to main content
QUICK REVIEW

[論文レビュー] STRIPS Action Discovery

Alejandro Muchada Suárez, Javier Segovia‐Aguas|arXiv (Cornell University)|Jan 30, 2020
AI-based Problem Solving and Planning参考文献 31被引用数 5
ひとこと要約

本論文は、初期状態と目的状態のみから、古典的プランナを用いたPDDLへの新規コンパイルを通じて、アクションの署名、事前条件、効果を含むStripsアクションモデルを合成する非教師ありアルゴリズムUDAMを提案する。この手法は、事前条件を削除することで静的述語を学習し、プログラミングするのではなく、静的述語を明示的に定義する必要を減らす。また、IPCベンチマークで高い成功率を示し、未観測の計画インスタンスへの一般化を実現する。

ABSTRACT

The problem of specifying high-level knowledge bases for planning becomes a hard task in realistic environments. This knowledge is usually handcrafted and is hard to keep updated, even for system experts. Recent approaches have shown the success of classical planning at synthesizing action models even when all intermediate states are missing. These approaches can synthesize action schemas in Planning Domain Definition Language (PDDL) from a set of execution traces each consisting, at least, of an initial and final state. In this paper, we propose a new algorithm to unsupervisedly synthesize STRIPS action models with a classical planner when action signatures are unknown. In addition, we contribute with a compilation to classical planning that mitigates the problem of learning static predicates in the action model preconditions, exploits the capabilities of SAT planners with parallel encodings to compute action schemas and validate all instances. Our system is flexible in that it supports the inclusion of partial input information that may speed up the search. We show through several experiments how learned action models generalize over unseen planning instances.

研究の動機と目的

  • 複雑な環境において誤りを起こしやすく、保守が難しい高水準の計画知識ベースを手動で構築する課題に対処すること。
  • 初期状態と目的状態のみが観測可能である状況で、完全なStripsアクションスキーマ(アクションの署名、事前条件、効果)を非教師ありで学習すること。
  • 静的述語を事前条件にハードコードするのではなく、それらを削除可能なものとして扱うことで、静的述語の学習の難易度を軽減すること。
  • 部分的な事前知識を用いてアクションモデルを段階的に改善し、新しいインスタンスでの検証を可能にすること。
  • 入力例の数を増やした際の、学習されたアクションモデルの一般化性と収束性を評価すること。

提案手法

  • SATベースのプランナを用いて、入力計画インスタンスからアクションスキーマを推論する古典的計画問題として、アクション学習タスクをPDDLにコンパイルする。
  • 静的述語を固定された構成要素ではなく、削除可能な事前条件として扱う、新規のコンパイル戦略を採用し、手動での指定の必要を低減する。
  • 複数の入力例を同時にテストできるように、並列な検証インスタンスを生成する。
  • 学習タスクのための有界な探索空間を探索するための構成アルゴリズムを用い、効率性と収束性を向上させる。
  • アクションの署名、アクション名、中間状態の情報なしに動作する非教師あり学習アルゴリズム(UDAM)を適用する。
  • アクション構造に構造的制約を課した計画問題として学習タスクをエンコードすることで、市販の古典的プランナを活用する。

実験結果

リサーチクエスチョン

  • RQ1初期状態と目的状態のみから、アクション署名や中間状態の情報なしにStripsアクションモデルを学習できるか?
  • RQ2事前条件にハードコードせず、静的述語を効果的に学習する方法は何か?
  • RQ3学習されたアクションモデルは、新しい未観測の計画インスタンスへどの程度一般化できるか?
  • RQ4部分的な事前知識の導入が、学習の収束性とモデル品質に与える影響は何か?
  • RQ5提案されたコンパイルアプローチは、正しいかつ一般化可能なアクションスキーマを学習する高成功率を達成できるか?

主な発見

  • 提案手法は、中間状態やアクション名の情報なしに、初期状態と目的状態のみを用いて、完全なStripsアクションモデル(アクションの署名、事前条件、効果)を成功裏に学習した。
  • 理論的に解けるすべてのテストケースが、学習されたモデルによって正しく解かれるなど、未観測の計画インスタンスへの一般化が良好に実現された。
  • 入力例の数が増加するにつれて、モデル学習の収束が高く達成され、安定した学習行動を示した。
  • 事前条件からの静的述語の削除戦略は、手動での指定の必要性を低減し、モデルの頑健性を向上させた。
  • 並列インスタンスを用いた検証フレームワークにより、多様な入力に対して学習されたアクションモデルの正しさと一貫性が確認された。
  • 標準的なIPCベンチマークにおいて、一般化性と学習の完全性の面で、先行手法を上回る優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。