Skip to main content
QUICK REVIEW

[論文レビュー] MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance

Michael Luo, Ashwin Balakrishna|arXiv (Cornell University)|Dec 7, 2021
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

MESAは、異なるオффラインデータセットから得た安全性の知識を、未確認のダイナミクスを示す新しい環境に迅速に適応可能な、オフラインメタ強化学習フレームワークを提案する。メタ学習により転送可能な安全性クリティックを学習し、最小限のテストデータでファインチューニングすることで、シミュレーションにおける5つの連続制御ドメインで、制約違反を最大50%まで低減しながらタスクパフォーマンスを維持する。

ABSTRACT

Safe exploration is critical for using reinforcement learning (RL) in risk-sensitive environments. Recent work learns risk measures which measure the probability of violating constraints, which can then be used to enable safety. However, learning such risk measures requires significant interaction with the environment, resulting in excessive constraint violations during learning. Furthermore, these measures are not easily transferable to new environments. We cast safe exploration as an offline meta-RL problem, where the objective is to leverage examples of safe and unsafe behavior across a range of environments to quickly adapt learned risk measures to a new environment with previously unseen dynamics. We then propose MEta-learning for Safe Adaptation (MESA), an approach for meta-learning a risk measure for safe RL. Simulation experiments across 5 continuous control domains suggest that MESA can leverage offline data from a range of different environments to reduce constraint violations in unseen environments by up to a factor of 2 while maintaining task performance. See https://tinyurl.com/safe-meta-rl for code and supplementary material.

研究の動機と目的

  • オンライン相互作用が高コストの失敗を引き起こすおそれがあるリスクセンシティブな強化学習環境における不安全な探索の課題に対処すること。
  • 部分的アクチュエータ故障やシステムパラメータの変化など、以前に観測されていなかったダイナミクスを示す新しい環境での安全な適応を可能にすること。
  • 訓練環境からのオフラインデータセットを活用することで、リスク測度を学習するためのオンライン相互作用への依存を低減すること。
  • テスト段階でタスク固有のデータを必要とせずに、環境間で安全性の知識を転送する手法を開発すること。
  • 未確認の環境での適応中に制約違反を最小限に抑えつつ、高いタスクパフォーマンスを維持すること。

提案手法

  • MESAは、異なるダイナミクスを示す複数の訓練環境からのオフラインデータセットを用いてメタトレーニングを行う、オフラインメタ強化学習としての安全な強化学習の定式化を行う。
  • 異なる環境全体にわたる制約違反のリスクを推定する、安全性クリティック $Q^{\text{risk}}_{\pi}$ をメタ学習する。
  • 適応段階では、以前に観測されていなかったダイナミクスを示す新しい環境からの小さなオフラインテストデータセットを用いて、メタ学習済みの安全性クリティックをファインチューニングする。
  • 適応された安全性クリティックは、回復ポリシー(recovery policy)と組み合わせて、テスト環境における安全なオンライン学習を可能にする。これは回復強化学習(Recovery RL)パラダイムに従う。
  • 異なる環境間でのリスク推定を一致させるためにコントラスト学習の目的関数を用い、分布外のダイナミクスへの一般化を向上させる。
  • タスクリターンとリスクの両方を同時に予測するマルチヘッドネットワークアーキテクチャを採用し、共有表現を用いたエンドツーエンドのトレーニングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1オフラインメタ強化学習は、多様な環境から得た安全性の知識を、未確認のダイナミクスを示す新しい環境に迅速に適応可能に転送できるか?
  • RQ2制約違反を最小限に抑えつつ、効果的な安全性の適応を可能にするために、テストデータセットはどのくらい小さくできるか?
  • RQ3部分的ジョイント故障など、顕著に異なるダイナミクスを示す環境において、MESAはベースライン手法と比較してどの程度一般化性能を発揮するか?
  • RQ4MESAは、適応段階で制約違反を最小限に抑えつつ、タスクパフォーマンスをどの程度維持できるか?
  • RQ5MESAは、テスト環境でのオンライン相互作用やタスク固有のデータを必要とせずに、安全な適応を達成できるか?

主な発見

  • MESAは、最小限のテストデータでさえも、以前のオフライン強化学習手法と比較して、未確認の環境における制約違反を最大2倍まで低減する。
  • MESAは、安全性およびサンプル効率の両面で、マルチタスク学習ベースラインを著しく上回りながらも、強いタスクパフォーマンスを維持する。
  • MESAは、部分的ジョイント故障を示す環境に対しても効果的に一般化し、マルチタスク学習と比較して優れたパフォーマンスと少ない制約違反を達成する。
  • テストデータセットが元のサイズの1/16(10K遷移)にまで縮小されても、パフォーマンスの低下はわずかにとどまる。これは、小さなテストデータに対して強いロバストネスを示している。
  • テストデータセットが元のサイズの1/4(10K遷移)にまで縮小された場合でも、MESAは高いパフォーマンスを維持する。これは、訓練データに比べてテストデータを最大40倍まで削減可能であることを示唆している。
  • アブレーションスタディの結果、MESAのメタ学習済みリスク測度は、メタトレーニング中に観測されていなかった部分的アクチュエータ故障のような分布外のダイナミクスに対しても、良好に一般化することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。