Skip to main content
QUICK REVIEW

[論文レビュー] Intervention Aided Reinforcement Learning for Safe and Practical Policy Optimization in Navigation

Fan Wang, Bo Zhou|arXiv (Cornell University)|Nov 15, 2018
Reinforcement Learning in Robotics参考文献 24被引用数 7
ひとこと要約

本論文は、人間の介入をフィードバックとして用いることで、衝突を避ける安全なUAVナビゲーションを実現する、介入支援強化学習(IARL)というフレームワークを提案する。この手法は、模倣学習と方策最適化を組み合わせ、人間の介入を最小限に抑えつつ、シミュレーションおよび実世界の両環境で頑健で衝突のない方策を学習する。シミュレーションではほぼゼロの衝突率と1%未満の介入率を達成し、実世界のテストでは介入頻度を顕著に低減した。

ABSTRACT

Combining deep neural networks with reinforcement learning has shown great potential in the next-generation intelligent control. However, there are challenges in terms of safety and cost in practical applications. In this paper, we propose the Intervention Aided Reinforcement Learning (IARL) framework, which utilizes human intervened robot-environment interaction to improve the policy. We used the Unmanned Aerial Vehicle (UAV) as the test platform. We built neural networks as our policy to map sensor readings to control signals on the UAV. Our experiment scenarios cover both simulation and reality. We show that our approach substantially reduces the human intervention and improves the performance in autonomous navigation, at the same time it ensures safety and keeps training cost acceptable.

研究の動機と目的

  • ロボットの強化学習、特にUAVナビゲーションのような高リスクな状況において、安全性と高い訓練コストの問題に対処すること。
  • 衝突のような失敗イベントに依存する高価で危険な試行錯誤学習に代わって、人間の介入をフィードバックとして組み込むこと。
  • 介入データを用いた模倣学習と方策最適化を統合した汎用性のあるフレームワークの開発。
  • マルチモーダルセンサ入力を用いて、地図なしのエンドツーエンドの視覚ナビゲーションを非構造的環境で実現すること。
  • 人間の介入を最小限に抑えつつ高い性能を維持することで、訓練の安全性と実用性を確保すること。

提案手法

  • IARLは、人間の介入を、いつ介入するかを判断する分類器と、誘導に用いる基準制御方策の組み合わせとして定式化する。
  • 行動方策は、ターゲット方策と介入方策の混合として定義され、安全な探索を可能にする。
  • フレームワークは、模倣学習により基準方策から学習する一方で、介入確率を最小化するように方策を最適化する。
  • 3次元深度画像、超音波センサ、速度、およびゴール方向を含むマルチモーダル観測入力を用い、制御意思決定を支援する。
  • ベースとなる強化学習アルゴリズムとして、プロキシマルポリシーオプティマイゼーション(PPO)と一般化された利得推定(GAE)を採用する。
  • 本手法はシミュレーションで訓練され、実世界のエキスパートデモンストレーションを用いてファインチューニングされた後、実UAVにデプロイされる。

実験結果

リサーチクエスチョン

  • RQ1強化学習の訓練中に人間が介入するのを、衝突のような失敗イベントに依存するのではなく、安全で効果的なフィードバック信号として活用できるか?
  • RQ2模倣学習を強化学習と統合することで、介入頻度を低減しつつ高いナビゲーション性能を維持できるか?
  • RQ3IARLは、最小限の人的監視で、非構造的で実世界の環境において、衝突のないナビゲーションをどの程度達成できるか?
  • RQ4安全性、一般化性能、訓練効率の観点から、IARLは標準的な強化学習および模倣学習手法と比べてどのように差をつけるか?
  • RQ5IARLフレームワークは、最小限の実世界データでシミュレーションから実世界のUAVナビゲーションに効果的に転送可能か?

主な発見

  • シミュレーションでは、IARL(模倣)はノーマルテストで平均0%の衝突率を達成し、RL(22.5%)およびDAgger(24%)を著しく上回った。
  • シミュレーションにおける介入率(IR)は、IARL(模倣)で1%未満に低下し、人間の介入にほとんど依存しないことを示した。
  • 実世界のテストでは、介入率が時間とともに低下し、センサのノイズや遅延があっても、モデルがより安全な方策を学習できることを示した。
  • 実世界の訓練中に平均パス時間と介入時間の両方が減少し、効率が向上し、人的負担が軽減されたことを示した。
  • IARLは、標準的なRLが危険な経路を取るのに対し、より慎重で安全な経路を学習し、障害物を効果的に回避した。
  • ノイズの多い実世界のセンサや最大0.4秒の遅延があっても、IARLは低い介入頻度を維持し、安定した安全なナビゲーションを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。