Skip to main content
QUICK REVIEW

[論文レビュー] Learning Action Models from Disordered and Noisy Plan Traces

Hankz Hankui Zhuo, Jing Peng|arXiv (Cornell University)|Aug 26, 2019
Robot Manipulation and Learning参考文献 30被引用数 5
ひとこと要約

本稿では、自然言語や監視ログのような現実世界のデータでよく見られる、順序が乱れており、並列な動作が含まれ、状態にノイズが混入している計画トレースから、正確な動作モデルを学習するMAX-SATベースのフレームワークAMDNを提案する。不正確な順序、並列動作、ノイズのない状態を扱うための特別な制約を構築し、それらを尤度に応じて重み付けすることで、AMDNは合成的および現実世界のドメインにおいて、先行手法(ARMS、AMAN)を上回る性能を示し、ノイズや順序の乱れに対して強く、入力サイズに多項式的にスケーリングする。

ABSTRACT

There is increasing awareness in the planning community that the burden of specifying complete domain models is too high, which impedes the applicability of planning technology in many real-world domains. Although there have many learning systems that help automatically learning domain models, most existing work assumes that the input traces are completely correct. A more realistic situation is that the plan traces are disordered and noisy, such as plan traces described by natural language. In this paper we propose and evaluate an approach for doing this. Our approach takes as input a set of plan traces with disordered actions and noise and outputs action models that can best explain the plan traces. We use a MAX-SAT framework for learning, where the constraints are derived from the given plan traces. Unlike traditional action models learners, the states in plan traces can be partially observable and noisy as well as the actions in plan traces can be disordered and parallel. We demonstrate the effectiveness of our approach through a systematic empirical evaluation with both IPC domains and the real-world dataset extracted from natural language documents.

研究の動機と目的

  • 現実世界の計画トレース(不完全なデータ収集のため、順序が乱れていたり、並列動作を含んでいたり、ノイズが混入していたりする)からドメインの動作モデルを学ぶという課題に対処すること。
  • 完全に順序が整っているか、クリーンな計画トレースを仮定しない方法を開発し、実用的応用において一般的な状況に対応すること。
  • MAX-SATフレームワークにおける制約の重み付けを通じて不確実性を明示的にモデル化することで、ノイズや順序の乱れに対する耐障害性を向上させること。
  • 標準的なIPC計画ドメインおよび自然言語文書から抽出した現実世界のデータセットを用いて、手法の評価を行うこと。

提案手法

  • 3種類の制約を構築する:順序の乱れをモデル化するための不正確な順序制約、同時に発生する動作を捉えるための並列制約、部分的に観測可能または誤った状態を扱うためのノイズ制約。
  • 制約は、不正確な順序やノイズの発生確率に比例した重みでエンコードされ、MAX-SATソルバがより信頼性の高い情報を優先できるようにする。
  • 重み付けされたMAX-SATソルバを用いて、最も多くの制約を満たす整合性のある動作モデルの集合を特定し、ノイズや順序の乱れによる矛盾を最小限に抑える。
  • その解をSTRIPS形式の動作モデルに変換し、事前条件と効果を表現する。
  • 制御されたレベルの順序の乱れやノイズを含む合成的計画トレース、および自然言語チュートリアルから抽出した現実世界のトレースを用いてフレームワークを評価する。

実験結果

リサーチクエスチョン

  • RQ1計画トレースに順序の乱れや並列動作が含まれる状況下で、MAX-SATベースのアプローチが動作モデルをどれほどうまく学習できるか?
  • RQ2提案された制約の重み付け方式は、ノイズや順序の乱れを無視する手法と比較して、ノイズのある状態に対する耐障害性を向上させられるか?
  • RQ3AMDNの学習精度は、乱れやノイズのレベルが変化する中でARMSやAMANと比べてどうなるか?
  • RQ4AMDNの性能は、計画トレースの数が増加するにつれて向上するか?また、実行時間はどのようにスケーリングするか?

主な発見

  • AMDNは、現実世界のデータセットであるCookingTutorialにおいて、ARMSやAMANを著しく上回る精度を達成した。400件のトレースで88.2%の精度を記録したのに対し、ARMSとAMANはそれぞれ73.2%および75.6%であった。
  • AMDNは順序の乱れに対して優れた耐障害性を示した。不正確な順序の確率が上昇するにつれて、AMDNの精度低下はARMSやAMANよりも遅く、動作順序の不確実性を明示的にモデル化したためである。
  • ノイズに対してもAMDNはより高い耐性を示した。ノイズレベルが上昇する中で、AMDNはAMAN や ARMS よりも高い精度を維持した。これは、信頼性の低い観測を低減するための重み付けされた制約のおかげである。
  • AMDNの実行時間は、入力の計画トレース数に多項式的に増加し、ブロックスワールドドメインでは $0.3845x^{2}+4.837x-15.32$ の多項式フィットが得られた。これは、スケーラブルな性能を示している。
  • AMDNの精度は、より多くの計画トレースが与えられるにつれて向上した。これは、ノイズや順序の乱れのある状況下でも、データ量の増加がモデル学習を促進することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。