Skip to main content
QUICK REVIEW

[論文レビュー] Situational Awareness by Risk-Conscious Skills

Daniel J. Mankowitz, Aviv Tamar|arXiv (Cornell University)|Oct 10, 2016
Reinforcement Learning in Robotics参考文献 28被引用数 3
ひとこと要約

本論文は、確率的ゴール半マルコフ決定過程(PG-SMDP)においてリスク感受性の目的関数を最適化することで、リスク感受性のスキルを学習する、新しい階層的強化学習アルゴリズムSARiCoSを提案する。この手法により、サッカーにおける時間の浪費といった人間らしい状況認識が可能となり、報酬ベースのモデル誤設定を効果的に緩和し、勝利時および敗北時の両状況で優れた性能を達成する。

ABSTRACT

Hierarchical Reinforcement Learning has been previously shown to speed up the convergence rate of RL planning algorithms as well as mitigate feature-based model misspecification (Mankowitz et. al. 2016a,b, Bacon 2015). To do so, it utilizes hierarchical abstractions, also known as skills -- a type of temporally extended action (Sutton et. al. 1999) to plan at a higher level, abstracting away from the lower-level details. We incorporate risk sensitivity, also referred to as Situational Awareness (SA), into hierarchical RL for the first time by defining and learning risk aware skills in a Probabilistic Goal Semi-Markov Decision Process (PG-SMDP). This is achieved using our novel Situational Awareness by Risk-Conscious Skills (SARiCoS) algorithm which comes with a theoretical convergence guarantee. We show in a RoboCup soccer domain that the learned risk aware skills exhibit complex human behaviors such as `time-wasting' in a soccer game. In addition, the learned risk aware skills are able to mitigate reward-based model misspecification.

研究の動機と目的

  • 階層的強化学習(H-RL)におけるリスク感受性の欠如、特に報酬ベースのモデル誤設定を緩和すること。
  • 時間または空間に依存するリスク態度としての状況認識(SA)を、リスク感受性の目的関数を通じてH-RLに統合すること。
  • リスク回避的またはリスク求心的行動を含む、異なるリスク態度を持つリスク感受性スキル(RASs)の学習を可能にするフレームワークの開発。
  • PG-SMDPにおいて、スキル間ポリシーとRASsのリスク感受性パラメータ(RAPs)の両方を学習するアルゴリズムの設計。
  • リスク感受性スキルの学習が、ロボカップサッカーのような動的環境における、時間の浪費といった複雑な人間らしい行動を生み出すことの実証。

提案手法

  • 本論文は、時間的およびリスク依存的な目的を持つタスクをモデル化するため、確率的ゴール半マルコフ決定過程(PG-SMDP)を提案する。
  • リスク感受性スキル(RASs)を導入し、リスク態度を制御する追加のリスク感受性パラメータ(RAP)を有するパラメータ化されたオプションを定義する。
  • SARiCoSアルゴリズムは、条件付きリスク価値(CVaR)などのリスク感受性目的関数を最適化し、スキル間ポリシーとRASsのRAPsの両方を学習する。
  • 標準的な方策勾配法の仮定の下で、アルゴリズムは理論的に局所最適解に収束することが保証される。
  • 指数的リスク、CVaR、VaRを含む柔軟なリスク基準をサポートでき、さまざまなリスク好みに適応可能である。
  • 本手法はロボカップサッカー環境で評価され、ゲーム状態とリスク感受性に応じて攻撃的行動と時間の浪費行動の切り替えを学習した。

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習におけるリスク感受性目的関数は、サッカーにおける時間の浪費といった複雑な人間らしい行動を誘発できるか?
  • RQ2リスク感受性スキルの学習は、誤った報酬設計が最適でないポリシーを生む報酬ベースのモデル誤設定を緩和できるか?
  • RQ3期待報酬最大化と比較して、CVaRなどのリスク感受性目的関数を最適化することで、より強固で文脈に適した戦略を学習できるか?
  • RQ4同じフレームワークが、試合残り時間などのタスク状態に応じて、リスク回避的とリスク求心的といった異なるリスク態度をサポートできるか?
  • RQ5PG-SMDPを用いた階層的強化学習におけるリスク感受性スキルの学習に対して、理論的収束保証があるか?

主な発見

  • 勝利状況では、SARiCoSエージェントはゆっくりとドリブルし、ボールの上に立ち続けることで時間の浪費を学習し、平均エピソード長142.3 ± 1.5ステップを達成した。
  • 勝利状況ではSARiCoSエージェントは1エピソードあたり1.3 ± 0.6ゴールしか得られなかったが、相手がボールを奪う頻度は100エピソードあたり7.3 ± 0.6回にとどまり、リスク回避的行動が効果的であることが示された。
  • 敗北状況では、SARiCoSエージェントは1エピソードあたり74.3 ± 6.5ゴールを記録し、平均報酬が6.3 ± 0.2に達した。これは期待報酬(ER)ベースラインが1.7 ± 1.2ゴールを記録し、平均報酬が-0.3 ± 0.1という負の値にとどまったのと比べて顕著に優れていた。
  • SARiCoSエージェントは、リスク感受性目的関数のおかげで、敗北状況において性能基準βを達成した。この目的関数により、ゴールスコアリングのような高インパクト報酬を求めるよう促されたが、ERエージェントは局所最適解に陥っていた。
  • SARiCoSエージェントは、報酬ベースのモデル誤設定に対して頑健であり、ERエージェントが低報酬ループに陥るのを防ぐために、過度な遠距離ドリブルといった非効率な行動を回避した。
  • アルゴリズムは理論的に局所最適解に収束し、リスク感受性の階層的意思決定における安定性と実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。