Skip to main content
QUICK REVIEW

[論文レビュー] Improving Safety in Reinforcement Learning Using Model-Based Architectures and Human Intervention

Bharat Prakash, Mohit Khatwani|arXiv (Cornell University)|Mar 22, 2019
Safety Systems Engineering in Autonomy被引用数 12
ひとこと要約

本論文は、モデル予測制御(MPC)、人間の介入を模倣するように訓練されたブロッカー・エージェント、およびモデルフリーのファインチューニングを統合したハイブリッドなモデルベース強化学習フレームワークを提案する。この手法により、サンプル効率性と安全性が向上し、災害的状態の訪問回数が5倍減少した。純粋なモデルフリー手法と比較して、人的監視の必要が著しく減少した。

ABSTRACT

Recent progress in AI and Reinforcement learning has shown great success in solving complex problems with high dimensional state spaces. However, most of these successes have been primarily in simulated environments where failure is of little or no consequence. Most real-world applications, however, require training solutions that are safe to operate as catastrophic failures are inadmissible especially when there is human interaction involved. Currently, Safe RL systems use human oversight during training and exploration in order to make sure the RL agent does not go into a catastrophic state. These methods require a large amount of human labor and it is very difficult to scale up. We present a hybrid method for reducing the human intervention time by combining model-based approaches and training a supervised learner to improve sample efficiency while also ensuring safety. We evaluate these methods on various grid-world environments using both standard and visual representations and show that our approach achieves better performance in terms of sample efficiency, number of catastrophic states reached as well as overall task performance compared to traditional model-free approaches.

研究の動機と目的

  • 現実世界の強化学習における安全でない探索の課題に対処すること。ここでは、災害的失敗が許されない。
  • 訓練中に継続的な人的監視に依存するのを減らすこと。これは費用がかかり、スケーラブルではない。
  • モデルベース計画と人間模倣学習を組み合わせることで、安全な強化学習におけるサンプル効率性を向上させること。
  • 複雑な環境におけるRLエージェントの、より高速で安全かつ効率的な訓練を可能にすること。

提案手法

  • モデルベースのアプローチを用いて、環境のダイナミクスを学習し、モデル予測制御(MPC)を介して高品質な軌道を生成することで、ポリシーの初期化を行う。
  • ブロッカー・エージェントは、教師あり学習として人間の介入を模倣し、災害的状態を引き起こす行動をブロックするように訓練される。
  • システムはまず200エピソードにわたりMPCを用い、ブロッカーの訓練およびポリシーの初期化に使用する安全で高品質なデータを収集する。
  • モデルベースフェーズの後、エージェントはMPCが生成した軌道からブートストラップされたモデルフリーのポリシー勾配訓練に移行する。
  • ブロッカー・エージェントは、モデルベースフェーズ中に収集されたデータに基づいて訓練され、より高品質な介入行動を確保する。
  • フレームワークは、標準的および視覚的状態表現を用いたグリッドワールドおよびビジュアルナビゲーション環境で評価された。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドなモデルベースとモデルフリーのRLフレームワークは、人的介入時間の短縮を図りながら、安全性とパフォーマンスを維持または向上させることができるか?
  • RQ2モデルベースフェーズ中にMPCが生成した軌道が、ブロッカー・エージェントの品質と全体のサンプル効率性に与える影響はいかほどか?
  • RQ3モデルフリーのデータではなくモデルベースのデータに基づいて訓練されたブロッカー・エージェントは、災害的状態の防止において、どれほど優れた性能を示すか?
  • RQ4MPCとブロッカー・エージェントの組み合わせにより、標準的なモデルフリーRLと比較して、収束が速くなり、タスクパフォーマンスが向上するか?
  • RQ5提案されたフレームワークは、同じ環境ダイナミクスとブロッカーを有する新しいタスクへ一般化可能か?

主な発見

  • ハイブリッド手法は、4x4グリッドワールドおよびアイランドナビゲーション環境において、標準的なモデルフリーのポリシー勾配法と比較して、災害的状態の発生回数を5倍減少させた。
  • システムは最大タスク報酬(グリッドワールドで45、アイランドナビゲーションで47)に到達したが、モデルフリーのベースラインは最適パフォーマンスに到達できなかった。
  • ブロッカー・エージェントを用いた訓練により、収束が速くなった。これは、サンプル効率性の向上とより安全な探索を示している。
  • モデルベースのデータに基づいて訓練されたブロッカー・エージェントは、モデルフリーのデータに基づいて訓練されたものよりも優れた性能を示した。これは、より高品質な示範データのおかげである。
  • 本手法は、標準的なモデルフリー手法と比較して、はるかに短い訓練時間で安定したポリシー学習を達成した。これは、サンプル効率性の向上を示している。
  • ダイナミクスモデルとブロッカー・エージェントはタスクに依存しないため、同じ環境ダイナミクスを持つ新しいタスクへの再利用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。