Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Constrained Reinforcement Learning

Usman Anwar, Shehryar Malik|arXiv (Cornell University)|Nov 19, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 7
ひとこと要約

本稿では、連続的で高次元な環境において、専門家のデモから任意のマルコフ型制約を推定する、モデルフリーでサンプルベースのフレームワークを提案する。重要度サンプリングとKLに基づく早期停止を用いて制約回復を学習問題として定式化することで、環境のダイナミクスを仮定せずに、異なる形状や報酬関数を持つ新たなエージェントに学習済み制約を効果的に転送でき、安全で専門家水準のパフォーマンスを実現する。

ABSTRACT

In real world settings, numerous constraints are present which are hard to specify mathematically. However, for the real world deployment of reinforcement learning (RL), it is critical that RL agents are aware of these constraints, so that they can act safely. In this work, we consider the problem of learning constraints from demonstrations of a constraint-abiding agent's behavior. We experimentally validate our approach and show that our framework can successfully learn the most likely constraints that the agent respects. We further show that these learned constraints are extit{transferable} to new agents that may have different morphologies and/or reward functions. Previous works in this regard have either mainly been restricted to tabular (discrete) settings, specific types of constraints or assume the environment's transition dynamics. In contrast, our framework is able to learn arbitrary extit{Markovian} constraints in high-dimensions in a completely model-free setting. The code can be found it: \url{https://github.com/shehryar-malik/icrl}.

研究の動機と目的

  • 強化学習における現実世界の制約を数学的に定式化する課題に取り組むこと、特にそれが暗黙的であるか、形式化が困難な場合を想定する。
  • 事前知識としての環境遷移ダイナミクスが不明な状況でも、専門家のデモから制約を推定可能にする。これは先行研究における制限要因である。
  • 表形式や離散的設定にとどまらず、高次元で連続的な状態空間および行動空間において、任意のマルコフ型制約を学習可能な手法を開発すること。
  • 異なる形状や報酬関数を持つ新たなエージェントに学習済み制約を転送し、新しい環境でも安全かつ専門家水準の行動を保証すること。
  • 報酬関数のみでは安全でない方策をとるのを防ぐために、専門家の行動から推定した制約を組み込むことで、報酬のいじり込み(reward hacking)や安全でない行動を回避すること。

提案手法

  • 本手法は、Scobee & Sastry (2020) の目的関数をサンプルベースのアプローチで近似することで、逆制約強化学習を学習問題として定式化し、モデルフリーな学習を可能にする。
  • 重要度サンプリングを用いて専門家の軌道を再重み付けし、デモから制約の尤度をより正確に推定する。
  • 最適化中に過学習を防ぐために、KLに基づく早期停止技術を採用し、安定した収束を確保する。
  • フレームワークは、$ c(\tau) = \prod_{t=1}^{T} c(s_t, a_t) $ の形の制約関数を学習する。ここで制約は現在の状態・行動ペアにのみ依存するため、マルコフ的である。
  • アプローチは完全にエンドツーエンドであり、環境の遷移ダイナミクスや報酬関数の事前知識を必要としない。
  • 学習済み制約をノーマル報酬関数と統合し、実世界の展開において安全制約を尊重するエージェントの訓練を可能にする。

実験結果

リサーチクエスチョン

  • RQ1環境の遷移ダイナミクスが未知であっても、連続的で高次元な環境において、専門家のデモから制約を効果的に推定できるか?
  • RQ2推定された制約は、異なる形状や報酬関数を持つ新たなエージェントに一般化可能か?
  • RQ3報酬のいじり込みや制約違反といった安全でない行動を防ぐ観点で、この手法は実世界の設定においてどの程度有効か?
  • RQ4重要度サンプリングと早期停止が、制約回復の安定性とパフォーマンス向上に果たす役割は何か?
  • RQ5行動データのみから、複雑で幾何的でない、あるいは凸でないような任意のマルコフ型制約を学習可能か?

主な発見

  • 提案手法は、環境のダイナミクスが未知であっても、専門家エージェントが遵守している最も可能性の高い制約を効果的に学習できる。
  • 学習済み制約は、異なる形状や報酬関数を持つ新たなエージェントへも効果的に一般化され、新しい設定でも専門家水準のパフォーマンスを達成できる。
  • アブレーションスタディの結果、重要度サンプリングとKLに基づく早期停止の両方がパフォーマンスに不可欠であることが示された。両方の要素を無効化すると、報酬が著しく低下し、制約違反も増加する。
  • HalfCheetah環境では、最小限の制約違反で専門家水準のパフォーマンスを達成し、制約を過剰に強調する行動学習やインスティチューションベースのベースラインを上回った。
  • 報酬関数のみではそのような行動を促進するにもかかわらず、報酬のいじり込みを防ぐために、危険な軌道(例:ライオンがいる経路)を避けるように学習済み制約が学習された。
  • フレームワークは高次元連続制御タスクへも効果的にスケーリング可能であり、実世界の強化学習展開の実現可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。