Skip to main content
QUICK REVIEW

[論文レビュー] Single-Agent Policy Tree Search With Guarantees

Laurent Orseau, Levi H. S. Lelis|arXiv (Cornell University)|Nov 27, 2018
Artificial Intelligence in Games参考文献 14被引用数 18
ひとこと要約

本論文は、単一エージェント計画におけるノード展開の理論的保証を提供する2つのポリシー誘導型ツリー探索アルゴリズム—LevinTS および LubyTS—を紹介する。A3Cで学習したニューラルネットワークポリシーを用いて、LevinTS はソコバンにおいて、状態アートのヒューリスティックプランナーよりも少ないノード展開数と短い解法で、1,000レベルすべてを解く優れた性能を達成した。

ABSTRACT

We introduce two novel tree search algorithms that use a policy to guide search. The first algorithm is a best-first enumeration that uses a cost function that allows us to prove an upper bound on the number of nodes to be expanded before reaching a goal state. We show that this best-first algorithm is particularly well suited for `needle-in-a-haystack' problems. The second algorithm is based on sampling and we prove an upper bound on the expected number of nodes it expands before reaching a set of goal states. We show that this algorithm is better suited for problems where many paths lead to a goal. We validate these tree search algorithms on 1,000 computer-generated levels of Sokoban, where the policy used to guide the search comes from a neural network trained using A3C. Our results show that the policy tree search algorithms we introduce are competitive with a state-of-the-art domain-independent planner that uses heuristic search.

研究の動機と目的

  • 報酬がスパースで決定論的な単一エージェント問題において、ヒューリスティックのガイドラインが重要であるが、理論的境界が欠如しているモンテカルロツリー探索(MCTS)の限界を解消すること。
  • ヒューリスティックによる保証を備えた古典的計画法と、ポリシー学習を特徴とする強化学習を統合し、形式的な性能保証を備えたポリシー誘導型探索を導入すること。
  • 学習済みポリシーを活用して探索の負荷を軽減しつつ、解法時間に関する理論的境界を維持するアルゴリズムの開発。
  • A3Cを用いて学習したニューラルポリシーを用い、PSPACE困難な領域—ソコバン—において、本アプローチの有効性を検証すること。

提案手法

  • LevinTS はポリシーで誘導されるベストファーストサーチ戦略を採用し、目的に到達するまでのノード展開数に厳密な上界を保証するコスト関数を用いる。
  • LubyTS はLuby系列に基づくランダムサンプリング戦略を採用し、任意の解法が見つかるまでの期待ノード展開数に上界を提供する。
  • 両アルゴリズムとも、ポリシーを入力として用い、ポリシーが行動列の確率を定義することで、成功路線の確率に依存する境界を可能にする。
  • ポリシーは、1,000レベルのコンピュータ生成ソコバンデータセット上でA3C強化学習を用いて得られた。
  • 探索は行動列の木上で行われ、ノードは行動履歴を表し、ゴール状態は遷移時にのみ特定される。
  • 理論的保証は、ポリシー下での成功行動列の確率質量に基づいて導出され、ヒューリスティックの品質に依存しない性能保証を保証する。

実験結果

リサーチクエスチョン

  • RQ1ポリシー誘導型ツリー探索は、決定論的単一エージェント問題において、探索負荷に証明可能な境界を提供できるか?
  • RQ2解法品質および探索効率の観点から、LAMA などの最先端ヒューリスティックベースプランナーよりもポリシー誘導型探索の性能は優れているか?
  • RQ3深層強化学習(A3C)で学習したポリシーは、最も簡単なレベルでのみ学習されたとしても、ツリー探索における効果的なガイドラインを提供できるか?
  • RQ4ヒューリスティック関数の代わりにポリシーを使用する場合、ノード展開数に理論的境界を導出できるか?
  • RQ5成功路線が少ない問題と多くの解を持つ問題の両方において、LevinTS(ベストファースト)と LubyTS(サンプリングベース)の2つの提案アルゴリズムの有効性にどのような差が生じるか?

主な発見

  • LevinTS は1,000レベルすべてを解き、1レベルあたり平均168のノード展開で完了した。これは LAMA の1レベルあたり200~1,000のノード展開よりも顕著に少ない。
  • LevinTS が得た解法は、移動回数の観点から LAMA が生成する解法よりも顕著に短く、より優れた解法品質を示した。
  • 32ステップの上限を設けた LubyTS (256, 32) は90%以上の成功率を達成し、LubyTS (256, 1) や LubyTS (256, 32) よりも優れた性能を示した。これは解法長の推定値に敏感であることを示している。
  • LubyTS (256, 32) は、解法長の上限を手動で調整した multiTS (200, 100) と同等の性能を示したが、使用しているのは学習済みポリシーのみであった。
  • 1%のノイズを含む LevinTS は、合計999のノード展開で全レベルを解いた。これは、I2A(ハイブリッドなモデルフリー/モデルベースプランナ)が95%のレベルで平均4,000のノード展開を要したのに対し、顕著に優れていた。
  • 学習段階で難易度の高いレベルのカバレッジが不足していたにもかかわらず、LevinTS は体系的な探索によりそれらのレベルを解くことができ、ポリシーの限界に強く対処できるという、耐性の高さを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。