[論文レビュー] Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle
本稿では、自律水中航行機器(AUV)における経路追従学習の高速化を目的として、人間が形状を与えた報酬と環境報酬を組み合わせた深層インタラクティブ強化学習(Dirl)フレームワークを提案する。訓練中に人間のフィードバックを統合し、環境報酬による継続的適応を可能にすることで、環境報酬のみで訓練されたDQNエージェントと比較して収束が早く、より優れたロバスト性を達成した。シミュレーションにおいて、純粋な人間報酬手法と同等またはそれを上回る性能を発揮した。
Autonomous underwater vehicle (AUV) plays an increasingly important role in ocean exploration. Existing AUVs are usually not fully autonomous and generally limited to pre-planning or pre-programming tasks. Reinforcement learning (RL) and deep reinforcement learning have been introduced into the AUV design and research to improve its autonomy. However, these methods are still difficult to apply directly to the actual AUV system because of the sparse rewards and low learning efficiency. In this paper, we proposed a deep interactive reinforcement learning method for path following of AUV by combining the advantages of deep reinforcement learning and interactive RL. In addition, since the human trainer cannot provide human rewards for AUV when it is running in the ocean and AUV needs to adapt to a changing environment, we further propose a deep reinforcement learning method that learns from both human rewards and environmental rewards at the same time. We test our methods in two path following tasks---straight line and sinusoids curve following of AUV by simulating in the Gazebo platform. Our experimental results show that with our proposed deep interactive RL method, AUV can converge faster than a DQN learner from only environmental reward. Moreover, AUV learning with our deep RL from both human and environmental rewards can also achieve a similar or even better performance than that with the deep interactive RL method and can adapt to the actual environment by further learning from environmental rewards.
研究の動機と目的
- AUVの経路追従に向けた深層強化学習(DRL)における報酬の疎らさと学習の遅さという課題に対処すること。
- 従来のDRL手法が環境報酬に依存するため、サンプル効率が低く、その制限を克服すること。
- 人間の専門知識を形づくる報酬を通じて、インタラクティブ強化学習(IRL)を導入し、ポリシー学習の加速を図ること。
- 人間報酬と環境報酬の両方を活用するハイブリッド学習フレームワークを構築し、実際の海洋環境における長期的適応性を確保すること。
- Gazeboシミュレーションプラットフォームを用いて、直線追従とサインカーブ追従の2つの経路追従タスクにおいて、提案手法の有効性を実証すること。
提案手法
- 人間が提供する報酬と環境が提供する報酬を統合することで、学習信号を形状づける深層インタラクティブ強化学習(Dirl)手法を提案する。
- 状態観測(例:位置、速度、方位)を行動Q値にマッピングする価値関数近似として、ディープQネットワーク(DQN)を用いる。
- 人間が指定した形状報酬(学習の高速化を目的)と環境が定義するスパarsな報酬(長期的適応性のため)を組み合わせたハイブリッド報酬関数を設計する。
- 二段階の学習プロセスを実装する:初期段階では人間フィードバックによる学習で収束を加速し、その後は環境報酬による継続的学習でロバスト性を確保する。
- 直線追従とサインカーブ追従の2つの経路追従タスクについて、Gazeboベースのシミュレーション環境でエージェントを訓練および評価する。
- カリキュラム学習の原則に従い、訓練の進行に従って人間フィードバックを徐々に減少させ、環境報酬への依存度を高める。
実験結果
リサーチクエスチョン
- RQ1人間が形状を与えた報酬を用いたインタラクティブ強化学習は、環境報酬のみで学習する標準的なDQNと比較して、AUVの経路追従タスクにおけるサンプル複雑性を著しく低減し、収束を著しく加速できるか?
- RQ2人間報酬と環境報酬を組み合わせることで、動的で不確実な海洋環境下におけるAUVポリシーの最終的性能とロバスト性にどのような影響を与えるか?
- RQ3人間フィードバックが利用できなくなった後でも、人間報酬と環境報酬の両方で訓練されたDRLエージェントは、高い性能を維持し、予期しない環境変化に適応できるか?
- RQ4環境報酬のみ、人間報酬のみ、両方を組み合わせた場合の、エージェントの相対的な学習速度と最終的な追従精度はどの程度か?
- RQ5ハイブリッド報酬戦略は、サインカーブ追従のような複雑な経路追従タスクにおける一般化性能と安定性をどの程度向上させるか?
主な発見
- 人間報酬のみで学習するDQNHエージェントは、環境報酬のみで学習するDQNEエージェントと同等の追従誤差に到達したが、その性能に到達するまでのエピソード数は20にとどまり、収束が3倍速くなった。
- 人間報酬と環境報酬の両方で学習するDQNHEエージェントは、DQNHおよびDQNEエージェントよりも追従誤差をより速く低減し、25エピソード目にはほぼ最適な性能に到達した。
- DQNHEエージェントの累積環境報酬は約20エピソードでピークに達したが、DQNEエージェントは約80エピソードを要して同程度の水準に達したため、ハイブリッド報酬によるポリシー最適化がより速いことが示された。
- サインカーブ追従タスクにおいて、DQNHEエージェントは100エピソード目でのDQNEエージェントと同等の性能を、わずか25エピソードで達成した。これは、極めて優れたサンプル効率を示している。
- 人間フィードバックを停止しても、DQNHEエージェントは高い性能と適応性を維持し、実世界の展開状況においてもロバストであることを示した。
- 提案された深層インタラクティブ強化学習手法により、環境報酬のみで学習する標準的なDQNと比較して、より速く、より安定した学習が可能になった。人間を含めた形状づけの有効性がAUV制御において裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。