Skip to main content
QUICK REVIEW

[論文レビュー] Learning Safety Constraints from Demonstrations with Unknown Rewards

David Lindner, Xin Chen|arXiv (Cornell University)|May 25, 2023
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

この論文は、報酬関数が未知で環境のダイナミクスが不明な状況下で、制約付きマルコフ決定過程(CMDP)における安全制約の学習のための新規手法CoCoRLを提案する。多様で、おそらく最適でない示範から凸な安全集合を構築することで、CoCoRLは安全を保証し、近似的に最適な方策に対して漸近的最適性を達成する。これは、安全を保証できないIRLベースのベースラインよりも優れている。

ABSTRACT

We propose Convex Constraint Learning for Reinforcement Learning (CoCoRL), a novel approach for inferring shared constraints in a Constrained Markov Decision Process (CMDP) from a set of safe demonstrations with possibly different reward functions. While previous work is limited to demonstrations with known rewards or fully known environment dynamics, CoCoRL can learn constraints from demonstrations with different unknown rewards without knowledge of the environment dynamics. CoCoRL constructs a convex safe set based on demonstrations, which provably guarantees safety even for potentially sub-optimal (but safe) demonstrations. For near-optimal demonstrations, CoCoRL converges to the true safe set with no policy regret. We evaluate CoCoRL in gridworld environments and a driving simulation with multiple constraints. CoCoRL learns constraints that lead to safe driving behavior. Importantly, we can safely transfer the learned constraints to different tasks and environments. In contrast, alternative methods based on Inverse Reinforcement Learning (IRL) often exhibit poor performance and learn unsafe policies.

研究の動機と目的

  • 報酬関数が未知で、環境のダイナミクスが観測できない状況下で、CMDPにおける安全制約の学習の課題に対処すること。
  • 最適でないが安全な示範に対しても、安全を保証する方法を開発すること。
  • 報酬関数やダイナミクスの知識に依存せずに、近似的に最適な示範に対して漸近的最適性を達成すること。
  • 異なるタスクや環境間で学習した制約を転送できること。
  • IRLベースのアプローチがこのような状況下で安全を保証できないことを示すこと。

提案手法

  • CoCoRLは、示範を用いて特徴空間に凸な安全集合を構築し、この集合に属するすべての方策が共通の制約を満たすことを保証する。
  • 示された軌道の占有測度を変数とする凸最適化問題として制約推定を定式化する。
  • 安全な方策は、制約によって定義される半空間の共通部分に位置しなければならないという事実を活用し、凸多面体を形成する。
  • 近似的に最適な示範に対して、理論的分析により、CoCoRLはポリシーのレグレットがゼロに収束する、つまり真の安全集合に収束することを示している。
  • 環境の遷移ダイナミクスや示範者の報酬関数の知識を必要としない。
  • 手法は表形式の環境および複数の制約を含む連続的ドライブシミュレーションで評価されている。

実験結果

リサーチクエスチョン

  • RQ1根本的な報酬関数が未知な状況下で、示範から安全制約を信頼性高く推定できるか?
  • RQ2示範が最適ではなくても、制約学習手法が安全を保証できるか?
  • RQ3ダイナミクスや報酬の情報が入手不可な状況下で、近似的に最適な示範に対して漸近的最適性を達成できるか?
  • RQ4CoCoRLは、IRLベースのベースラインと比較して、安全性とパフォーマンスの面で優れているか?
  • RQ5推定された制約は、新しいタスクや環境へと効果的に転送できるか?

主な発見

  • CoCoRLは、推定された凸な安全集合から導かれるすべてのポリシーに対して安全を保証し、実験では安全でない解が一切観測されなかった。
  • 単一状態のCMDPでは、CoCoRLは少数の示範で高い報酬を達成し、示範数が増加するにつれて最適方策に収束する。
  • CoCoRLのサンプル複雑度は、定理3が予測するように特徴次元数に比例するが、真の制約数には相対的に敏感でない。
  • 最大エントロピーおよび最大マージンの変種を含む、すべてのIRLベースのベースラインは安全を保証できず、グリッドワールドおよびドライブ環境の両方で安全でない方策を返した。
  • ドライブシミュレーションでは、CoCoRLは安全なドライブ行動をもたらす制約を効果的に学習し、新しいタスクや環境へと一般化できたが、IRLベースラインは制約に違反し、性能も劣っていた。
  • 真の報酬にアクセス可能な「報酬が既知のIRLベースライン」ですら安全を保証できなかったため、IRLは安全が重要な応用には頼りにならないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。