Skip to main content
QUICK REVIEW

[論文レビュー] Provably Safe PAC-MDP Exploration Using Analogies

Melrose Roderick, Vaishnavh Nagarajan|arXiv (Cornell University)|Jul 7, 2020
Reinforcement Learning in Robotics参考文献 31被引用数 4
ひとこと要約

本稿では、確率的で未知のマルコフ決定過程(MDP)における、証明可能に安全な強化学習アルゴリズムである類似安全状態探索(ASE)を提案する。状態-行動の類似性と安全な初期集合を活用することで、探索中に安全を保証しつつ、高い確率でPAC-MDP最適性を達成し、従来の手法に比べて顕著に高いサンプル効率を実現する。

ABSTRACT

A key challenge in applying reinforcement learning to safety-critical domains is understanding how to balance exploration (needed to attain good performance on the task) with safety (needed to avoid catastrophic failure). Although a growing line of work in reinforcement learning has investigated this area of "safe exploration," most existing techniques either 1) do not guarantee safety during the actual exploration process; and/or 2) limit the problem to a priori known and/or deterministic transition dynamics with strong smoothness assumptions. Addressing this gap, we propose Analogous Safe-state Exploration (ASE), an algorithm for provably safe exploration in MDPs with unknown, stochastic dynamics. Our method exploits analogies between state-action pairs to safely learn a near-optimal policy in a PAC-MDP sense. Additionally, ASE also guides exploration towards the most task-relevant states, which empirically results in significant improvements in terms of sample efficiency, when compared to existing methods.

研究の動機と目的

  • 訓練中に災害的失敗を回避しなければならない安全が重要な強化学習の応用分野における安全な探索の課題に対処すること。
  • 既存の安全RL手法におけるギャップを埋めるために、確率的で未知の環境における探索中に安全を保証する手法を開発すること。
  • タスク関連の類似した状態-行動ペアに探索を誘導することで、ランダムまたは無差別な探索に代えて、サンプル効率を向上させること。
  • 訓練の全過程を通じて安全を維持しつつ、高い確率でPAC-MDP最適性を達成すること。

提案手法

  • ASEは、初期に安全な状態-行動ペアの集合と、類似度測度Δを用い、安全を保つ可能性が高い類似した状態-行動ペアを特定する。
  • 価値関数推定に基づく楽観的方策を構築し、それが既知の安全な遷移への類似性によって安全が保証される場合にのみ実行する。
  • 価値推定の信頼区間を維持し、類似性に基づいて状態-行動ペアを安全とマークできるかを判断するためのしきい値τ/2を用いる。
  • 安全な集合を、楽観的経路の安全性を高める情報を得るための状態-行動ペアの探索によって動的に拡大し、特に目標指向方策に類似したものを優先する。
  • 安全集合から目標に向かうエッジに注目する、方向性のある探索戦略を採用し、類似状態関数α(類似した状態間の遷移をマッピングする)によってガイドする。
  • 既存の探索アルゴリズム(例:MBIE、R-Max、ε-greedy)を、推定された安全集合Ẑ_safeに制限された行動に制限することで、安全なバージョンに変更する。

実験結果

リサーチクエスチョン

  • RQ1動的ダイナミクスが未知の確率的MDPにおいて、決定的または滑らかさの仮定に依存せずに、探索中に安全を保証することは可能か?
  • RQ2タスク関連の類似した状態-行動ペアに探索を集中させることで、安全RLにおけるサンプル効率をどのように向上させられるか?
  • RQ3高い確率で、すべての訓練軌道が安全であることを保証しつつ、PAC-MDP最適性を達成することは可能か?
  • RQ4類似性に基づく探索は、無差別または非方向性の探索に比べて、安全性およびサンプル効率においてどのように異なるか?

主な発見

  • ASEは、高い確率で訓練の全軌道の安全とPAC-MDP最適性を保証するが、これは確率的環境において画期的な貢献である。
  • 実験的結果から、ASEは、特に離散的プラットフォーマーゲームのような複雑なMDPにおいて、ベースラインの安全および非安全手法に比べて顕著に高いサンプル効率を達成している。
  • ASEの類似性に基づく安全チェックを用いたR-Maxの安全版は、標準のR-Maxおよびε-greedyよりも安全性とサンプル効率の両面で優れている。
  • すべての方向に探索する無差別ASEは、方向性を持つASEに比べて性能が劣っており、類似性による目標指向探索の利点を示している。
  • ASEはガウス過程に基づく不確実性モデリングを回避し、代わりに類似性と信頼区間に依存することで、固有の環境の確率的性質に対処できる。
  • ASEは、スパarsityな報酬や高リスク遷移を伴う環境において、既存の安全RLベースラインを安全性と学習速度の両面で上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。