Skip to main content
QUICK REVIEW

[論文レビュー] Classical Planning in Deep Latent Space

Masataro Asai, Hiroshi Kajino|arXiv (Cornell University)|Jun 30, 2021
AI-based Problem Solving and Planning被引用数 6
ひとこと要約

Latplanは、ラベルなしの画像ペアによる状態遷移から、深層埋め込み空間表現を用いて古典的計画法を可能にする神経記号的フレームワークを提案する。視覚ドメイン(8パズルやSokobanなど)において、画像を命題論理にマッピングし、最適な計画を生成・可視化することで、人為的ラベルやドメイン知識なしにエンドツーエンドの計画を実現する。

ABSTRACT

Current domain-independent, classical planners require symbolic models of the problem domain and instance as input, resulting in a knowledge acquisition bottleneck. Meanwhile, although deep learning has achieved significant success in many fields, the knowledge is encoded in a subsymbolic representation which is incompatible with symbolic systems such as planners. We propose Latplan, an unsupervised architecture combining deep learning and classical planning. Given only an unlabeled set of image pairs showing a subset of transitions allowed in the environment (training inputs), Latplan learns a complete propositional PDDL action model of the environment. Later, when a pair of images representing the initial and the goal states (planning inputs) is given, Latplan finds a plan to the goal state in a symbolic latent space and returns a visualized plan execution. We evaluate Latplan using image-based versions of 6 planning domains: 8-puzzle, 15-Puzzle, Blocksworld, Sokoban and Two variations of LightsOut.

研究の動機と目的

  • 原始的な視覚入力から自動的に記号的PDDLモデルを生成することで、古典的計画における知識獲得のボトル neck を解消すること。
  • サブ記号的ディープラーニングと記号的計画法の間のギャップを埋めるために、視覚的観測を命題論理に埋め込む神経記号的システムを構築すること。
  • 物体タイプ、構造、アクション意味論に関する事前知識なしに、新しい未確認の環境でもドメインに依存しない計画を可能にすること。
  • 学習された潜在表現が、標準的なドメインに依存しないヒューリスティクスを用いて、効果的で最適な計画をサポートするかを評価すること。
  • 確率的深層ニューラルネットワークを用いた計画のための表現学習における、記号の接地の不安定性の主な要因を特定すること。

提案手法

  • 多項分布バイナリ潜在変数を備えた離散オートエンコーダ(状態オートエンコーダ、SAE)が、原始的な画像を命題的記号的状態表現にマッピングする。
  • カテゴリカル潜在変数とスキップ接続を備えたアクションオートエンコーダ(AAE)が、教師なしで遷移をクラスタリングし、記号的アクションラベルを生成する。
  • バック・トゥ・ロジット(BTL)モジュールが、AAEのデコードを直接記号的形で前向きダイナミクス(STRIPS効果)および逆方向ダイナミクス(STRIPS事前条件)をモデル化する。
  • 本システムは、有効な状態遷移のラベルなし画像ペア上でエンドツーエンドに学習され、教師なしで完全な命題的PDDLモデルを学習する。
  • 初期状態と目的状態の画像が与えられた場合、LatplanはSAEを用いて状態を記号的論理に埋め込み、古典的プランナを起動し、計画を画像のシーケンスとして可視化する。
  • ドメインに依存しないヒューリスティクス(例:FF、IPDB)が、学習された記号的空間内で探索を効率的にガイドする。

実験結果

リサーチクエスチョン

  • RQ1深層学習システムは、ラベルなしの画像遷移のみから完全で利用可能なPDDLアクションモデルを自動的に学習できるか?
  • RQ2人為的ラベルなしで、視覚ドメインにおける最適な計画を学習された記号的表現がどの程度サポートできるか?
  • RQ3回転、平行移動、スタイルの違いなどの視覚的変化に対して、学習された記号はどの程度安定しているか?
  • RQ4確率的深層ニューラルネットワークを用いた現実世界の入力における記号の接地の不安定性の主な要因は何か?
  • RQ5標準的なドメインに依存しないヒューリスティクスは、完全に視覚データから学習された潜在空間内で探索を効果的にガイドできるか?

主な発見

  • Latplanは、8パズル、15パズル、ブロックワールド、Sokoban、およびLightsOutの2つの変種を含む6つの画像ベースの計画ドメインについて、記号的PDDLモデルを成功裏に学習し、最適な計画を可能にした。
  • 8パズルやブロックワールドといった標準ドメインでは高い成功率を達成し、ドメインに依存しないヒューリスティクスを用いた学習済み表現が効果的な計画をサポートしていることを示した。
  • 4ディスクのハノイの塔のような困難なドメインでは、まれな特徴(例:上部領域に小さなディスクがある)のため、成功率が著しく低下し、SAEにおけるデータの不均衡が問題であることを示した。
  • 本研究では、記号の不安定性の原因として2つを同定した:ニューラルネットワーク固有の確率的性質と、観測における外部ノイズであり、これにより「記号の安定性問題(SSP)」を形式化した。
  • 8パズルにおける回転や平行移動された数字の変化に対しても、SAEは部分的な耐性を示したが、ナプキンに描かれたような高価なスタイルやノイズの多い入力では失敗し、一般化の限界を浮き彫りにした。
  • 学習済み記号的空間で標準的なドメインに依存しないヒューリスティクス(例:FF、IPDB)を用いることで、効率的な探索が実現した。これは、自動的に取得された表現に対してもこれらのヒューリスティクスの有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。