Skip to main content
QUICK REVIEW

[論文レビュー] Constructing Abstraction Hierarchies Using a Skill-Symbol Loop

George Konidaris|PubMed|Sep 25, 2015
Reinforcement Learning in Robotics参考文献 7被引用数 6
ひとこと要約

本論文は、時間的および状態の抽象化を備えた階層的MDPを構築するために、ハイレベルなスキルの習得とシンボリック表現の構築を交互に繰り返すスキル-シンボルループフレームワークを提案する。スキルとその対応するシンボリック抽象化を反復的に精錬することで、複数のタスクにわたる効率的な計画が可能となり、タクシー領域での実験で、状態空間と行動列の抽象化によって計画の複雑さが低減されていることが示された。

ABSTRACT

We describe a framework for building abstraction hierarchies whereby an agent alternates skill- and representation-construction phases to construct a sequence of increasingly abstract Markov decision processes. Our formulation builds on recent results showing that the appropriate abstract representation of a problem is specified by the agent's skills. We describe how such a hierarchy can be used for fast planning, and illustrate the construction of an appropriate hierarchy for the Taxi domain.

研究の動機と目的

  • 連続的かつ高次元のドメインにおけるハイレベルな意思決定とローレベルな行動・認識との連携の課題に対処すること。
  • スキル習得後も元のローレベルな状態空間を維持する既存の階層的RL手法の制限を克服すること。
  • 各レベルで状態空間と利用可能な行動がより抽象的になるように、抽象化階層を自動的に構築すること。
  • エージェントが利用可能なスキルに応じて適切なシンボリック表現が決定されることを示し、動的かつ柔軟な階層形成を可能にすること。
  • スキルから導かれる階層的抽象化を活用することで、マルチタスク強化学習における高速かつスケーラブルな計画を実現すること。

提案手法

  • フレームワークは、新しいオプション(マクロアクション)が発見されるスキル習得フェーズと、シンボリック抽象化が構築される表現習得フェーズを交互に繰り返す。
  • シンボリック表現は、シンボルを状態の集合にマッピングするグランドイング分類器によって定義され、論理演算が意味を保持するように設計される。
  • 階層の各レベルで、そのレベルに利用可能なスキルに基づいて状態空間が抽象化され、次第に抽象度の高いSMDPの系列が形成される。
  • エージェントは、目標と状態抽象化が一致する最高レベルで計画を実行し、必要に応じて下位レベルに降格する。
  • 動的計画法と意思決定木を、それぞれ計画とグランドイング分類器の評価に用いる。
  • 階層は反復的に構築される:まずスキルが習得され(例:タクシー領域における「乗車/降車」)、次にそのスキルに基づいてシンボリック状態が形成される。

実験結果

リサーチクエスチョン

  • RQ1各レベルで状態空間と行動集合がより抽象的になるように、抽象化階層を自動的に構築する方法は何か?
  • RQ2エージェントが利用可能なスキルと、計画に適したシンボリック表現との関係は何か?
  • RQ3スキル習得と表現構築のループが、複数のタスクにわたる高速な計画を可能にする真の階層を生み出せるか?
  • RQ4どのような状況で階層が計画の改善に寄与しなくなり、その理由は何か?
  • RQ5意味的意味を保持しつつ効率的な計画を可能にするために、シンボリック抽象化をどのようにグランドイングすればよいか?

主な発見

  • フレームワークはタクシー領域で3段階の抽象化階層を成功裏に構築した。レベルはM2(例:「乗客を赤に」のようなマクロアクション)、M1(粗い状態抽象化)、M0(原始的アクション)である。
  • 例題1では、M2レベルでの計画に成功した。これは十分なシンボリック抽象化のおかげで、4状態のグラフで自明な計画が達成されたためである。
  • 例題2では、タクシーの位置に関する状態の具体的な情報が不足していたため、M2レベルでの計画に失敗し、M1レベルへの降格が必要となった。
  • 例題3では、M2およびM1レベルのいずれの状態でも、乗客が基地外の位置にいる状態を表現できなかったため、M0レベルでの完全な計画が必要となった。
  • 結果から、階層が性能向上をもたらすのは、シンボリック抽象化が問題の目的構造と整合している場合に限られ、スキル駆動型の表現設計の重要性が浮き彫りになった。
  • フレームワークは、スキル習得とシンボリック表現が相互に依存していることを示している:スキルが適切な抽象化を決定し、新たなスキルの習得には新たな表現の必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。