Skip to main content
QUICK REVIEW

[論文レビュー] Active Learning for Risk-Sensitive Inverse Reinforcement Learning

Rui Chen, Wenshuo Wang|arXiv (Cornell University)|Sep 14, 2019
Reinforcement Learning in Robotics参考文献 22被引用数 4
ひとこと要約

本稿では、人間のリスク志向性を学習する際に収束を加速し、分散を低減するため、情報量の多い摂動を適応的に選択するリスクセンシティブ逆強化学習(RS-IRL)のアクティブラーニングフレームワークを提案する。確率単体上での将来の精錬方向を計算することで、最適化問題を解かずに高影響度のデモを特定し、単一ステップおよび複数ステップの両設定において、顕著に高いサンプル効率を実現する。

ABSTRACT

One typical assumption in inverse reinforcement learning (IRL) is that human experts act to optimize the expected utility of a stochastic cost with a fixed distribution. This assumption deviates from actual human behaviors under ambiguity. Risk-sensitive inverse reinforcement learning (RS-IRL) bridges such gap by assuming that humans act according to a random cost with respect to a set of subjectively distorted distributions instead of a fixed one. Such assumption provides the additional flexibility to model human's risk preferences, represented by a risk envelope, in safe-critical tasks. However, like other learning from demonstration techniques, RS-IRL could also suffer inefficient learning due to redundant demonstrations. Inspired by the concept of active learning, this research derives a probabilistic disturbance sampling scheme to enable an RS-IRL agent to query expert support that is likely to expose unrevealed boundaries of the expert's risk envelope. Experimental results confirm that our approach accelerates the convergence of RS-IRL algorithms with lower variance while still guaranteeing unbiased convergence.

研究の動機と目的

  • 冗長なエキスパートデモによる RS-IRL の収束遅延を解消すること。
  • 一貫性のあるリスク測度とリスクエンvelope を用いて、曖昧性下での人間のリスク志向性をモデル化すること。
  • エキスパートのリスクエンvelope の未暴露境界を露呈する可能性の高い摂動を特定するアクティブラーニング方式を開発すること。
  • 各ステップで完全な最適化問題を解かずに、効率的かつ適応的なエキスパートデモのクエリを可能にすること。
  • リスク志向性を示す参加者(リスク好好型およびリスク回避型)を含む、シミュレートされたクルーズ・フォローワー・タスクで手法を検証すること。

提案手法

  • 本手法は、確率単体上での将来の精錬方向を推定する確率的摂動サンプリング方式を導出する。これにより、最適化問題を解かずに情報量の多い摂動を特定する。
  • 2次特徴関数を用いて、相対的距離、速度、制御効率のペナルティを含むコスト関数をモデル化する。
  • エキスパートデモからの半空間制約によりリスクエンvelope を推定し、アクティブラーニングはエンvelope境界を最も効果的に精錬する可能性の高い摂動を優先する。
  • 摂動の実現は、新たな半空間制約を生成する可能性を計算することで評価され、完全な最適化を回避する。
  • 連続的なエピソードにおける段階的摂動を分析することで、本手法を複数ステップ設定に一般化する。
  • シミュレーションおよび分析のため、エキスパートの反応シーケンスを15の代表的行動にクラスタリングするためにK-means法を用いる。

実験結果

リサーチクエスチョン

  • RQ1アクティブラーニングにより、情報量の多いデモを選択することで、リスクセンシティブな逆強化学習のサンプル効率が向上するか?
  • RQ2RS-IRLエージェントは、エキスパートのリスクエンvelope境界を最も効果的に精錬する可能性の高い摂動をどのように特定できるか?
  • RQ3提案手法のアクティブラーニング方式は、ランダムまたは均一なデモサンプリングと比較して、分散を低減し収束を加速するか?
  • RQ4本手法は、自動運転のような複数ステップの逐次意思決定タスクに一般化可能か?
  • RQ5リスク志向性(リスク好好型またはリスク回避型行動など)は、情報量の多い摂動の選択にどのように影響を与えるか?

主な発見

  • アクティブラーニング方式は、繰り返しのエピソードにおいて、ベースライン手法と比較して収束を著しく加速し、分散を低減した。
  • 本手法は、成功したリスクエンvelopeの精錬に至る摂動を特定した。特に、リスク好好型参加者のシミュレーションでは、ステージ25で支配的となる制約が得られた。
  • ステージ25では、加速行動のアクティブラーニングによるサンプリング確率が 0.4227 に達し、エキスパートのリスク志向性と整合した。
  • ステージ25における摂動サンプリング確率分布 p = [0.3802, 0.4227, 0.1971] は、エキスパートのリスクエンvelope を最も効果的に露呈する行動を優遇していた。
  • 本手法は、各ステップで完全な最適化問題を解かずに、精錬方向の推定に依存することで、リスクエンvelope の効率的推定を可能にした。
  • 実験結果は、バイアスのない収束を確認するとともに、冗長なデモを低減した。これにより、安全が重要な設定における手法の有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。