[論文レビュー] Hierarchical Reinforcement Learning with Advantage-Based Auxiliary Rewards
HAARは、HRLにおいて高レベルポリシーと低レベルスキルを同時に訓練するためのアドバンテージベースの補助報酬を導入し、学習効率と転移性を向上させ、タスク固有の報酬設計を必要としない。
Hierarchical Reinforcement Learning (HRL) is a promising approach to solving long-horizon problems with sparse and delayed rewards. Many existing HRL algorithms either use pre-trained low-level skills that are unadaptable, or require domain-specific information to define low-level rewards. In this paper, we aim to adapt low-level skills to downstream tasks while maintaining the generality of reward design. We propose an HRL framework which sets auxiliary rewards for low-level skill training based on the advantage function of the high-level policy. This auxiliary reward enables efficient, simultaneous learning of the high-level policy and low-level skills without using task-specific knowledge. In addition, we also theoretically prove that optimizing low-level skills with this auxiliary reward will increase the task return for the joint policy. Experimental results show that our algorithm dramatically outperforms other state-of-the-art HRL methods in Mujoco domains. We also find both low-level and high-level policies trained by our algorithm transferable.
研究の動機と目的
- 長期的なスパース報酬タスクを、階層型ポリシーで解決することへの動機付け。
- ドメイン特化の報酬に依存せず、低レベルスキルを下流タスクへ適応させることを可能にする。
- 効率性と転移性を高めるため、高レベルと低レベルのポリシーを同時訓練する方法を開発する。
提案手法
- 高レベルの離散的なアクションが低レベルスキルを選択する、二層のHRL。
- 高レベルアクションに条件付された低レベルポリシーが、kステップ実行する。
- 低レベルの補助報酬は、高レベルのアドバンテージ関数から計算され、スキル学習を導く。
- 高レベルアドバンテージの1ステップ推定を用いて、r_lを A_h(s^h_t,a^h_t) / k によって導出する。
実験結果
リサーチクエスチョン
- RQ1高レベルのアドバンテージ関数に基づく補助報酬は、タスクに依存しない形で低レベルスキル学習を導くことができるか?
- RQ2高レベルと低レベルのポリシーを同時に最適化すると、結合ポリシーの単調な改善を保持できるか?
- RQ3事前学習済みの多様な低レベルスキルは、高レベルの訓練の加速と全体的な性能向上に有益か?
- RQ4アニーリングされた長期実行長は、最終的なポリシー品質を犠牲にせずに学習を加速するか?
- RQ5学習された高レベルおよび低レベルのポリシーは、類似の下流タスクへ転用可能か?
主な発見
- HAARはMujocoのスパース報酬タスクで最先端のHRL手法を著しく上回る。
- 高レベルのアドバンテージに基づく補助報酬は、低レベルスキルの下流タスクへの適応を改善する。
- スキル長のアニーリングは学習を加速するが、最終ポリシー性能は変えない。
- HAARで訓練された高レベルと低レベルのポリシーは、類似の下流タスクへ転用可能である。
- このアプローチは、SNN4HRL、HAC、HIRO、TRPOなどのベースラインよりも収束が速く、最終的な性能が高い。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。