Skip to main content
QUICK REVIEW

[論文レビュー] Multi-objective Model-based Policy Search for Data-efficient Learning with Sparse Rewards

Rituraj Kaushik, Konstantinos Chatzilygeroudis|arXiv (Cornell University)|Jun 25, 2018
Reinforcement Learning in Robotics参考文献 14被引用数 8
ひとこと要約

この論文では、報酬が疎である強化学習タスクを効率的に解けるように、新規性駆動の探索とモデルベース最適化を組み合わせたマルチオブジェクティブなモデルベース方策探索アルゴリズム、Multi-DEXを提案する。Paretoに基づく進化的アルゴリズムを用いて、同時に軌道の新規性、累積報酬、モデルの正確性を最適化することで、振り子のスイングアップタスクでは100回未塔で、4-DOFのドア開閉タスクでは1,000回未塔で優れた性能を達成し、VIME、TRPO、GEP-PG、CMA-ES、Black-DROPSを上回った。

ABSTRACT

The most data-efficient algorithms for reinforcement learning in robotics are model-based policy search algorithms, which alternate between learning a dynamical model of the robot and optimizing a policy to maximize the expected return given the model and its uncertainties. However, the current algorithms lack an effective exploration strategy to deal with sparse or misleading reward scenarios: if they do not experience any state with a positive reward during the initial random exploration, it is very unlikely to solve the problem. Here, we propose a novel model-based policy search algorithm, Multi-DEX, that leverages a learned dynamical model to efficiently explore the task space and solve tasks with sparse rewards in a few episodes. To achieve this, we frame the policy search problem as a multi-objective, model-based policy optimization problem with three objectives: (1) generate maximally novel state trajectories, (2) maximize the expected return and (3) keep the system in state-space regions for which the model is as accurate as possible. We then optimize these objectives using a Pareto-based multi-objective optimization algorithm. The experiments show that Multi-DEX is able to solve sparse reward scenarios (with a simulated robotic arm) in much lower interaction time than VIME, TRPO, GEP-PG, CMA-ES and Black-DROPS.

研究の動機と目的

  • 報酬が疎またはだましの報酬である強化学習において、標準的なモデルベース手法が初期の正の報酬が欠如するため失敗するという課題に対処する。
  • 内在的興味と新規性駆動行動をモデルベース方策探索に統合することで、報酬が疎な環境における探索を改善する。
  • 学習された動的モデルを活用して、実世界のシステムとの相互作用時間を短縮し、高い報酬と高い探索的潜在能力を両立した方策最適化を促進する。
  • 未探索領域における高いモデル正確性を維持するため、最適化目的関数にモデルの不確実性を組み込む。
  • 新規性、報酬、モデルの信頼性の3つをマルチオブジェクティブ最適化することで、単一目的または純粋に探索志向の手法よりも高速に収束することを示す。

提案手法

  • 軌道の新規性、累積報酬、モデル正確性(不確実性の最小化)の3つの目的を最適化するマルチオブジェクティブ最適化問題として方策探索を定式化する。
  • 相互作用データからシステムの確率的動的モデルを学習するためにガウス過程(GP)を用いる。
  • Paretoに基づくマルチオブジェクティブ進化的アルゴリズム(MOEA)を用いて、3つの目的をバランスさせた非支配的方策の集合を生成する。
  • 探索と活用のトレードオフを制御するスカラライゼーションパrameter ε を用いて、Pareto集合から最終的な方策を選択する。
  • エピソードベースの相互作用ループを採用する:ロールアウト収集 → GPモデル学習 → マルチオブジェクティブ方策最適化 → 新たな方策の選択と実行。
  • 潜在空間または観測空間における以前に訪問した状態からの距離として定義される、状態空間の新規性を用いて内在的興味を統合する。

実験結果

リサーチクエスチョン

  • RQ1初期の正の報酬が存在しない状況下でも、モデルベース方策探索アルゴリズムが疎な報酬環境を効果的に探索できるか。
  • RQ2新規性、報酬、モデル不確実性の3つをマルチオブジェクティブ最適化することで、強化学習におけるデータ効率がどのように向上するか。
  • RQ3Paretoに基づくアプローチは、単一目的またはグリーディー最適化よりも、挑戦的な制御タスクにおけるデータの効率性を向上させられるか。
  • RQ4モデルベース学習に内在的興味を統合することで、収束速度と最終的なパフォーマンスにどのような影響を与えるか。
  • RQ5提案手法は、報酬が疎でないタスクにおいても優れたパフォーマンスを維持できるか。

主な発見

  • Multi-DEXは、偽の報酬構造を持つ振り子のスイングアップタスクをたった100回の試行(約6.6分の相互作用)で解決し、高い安定した正の報酬を達成した。
  • 一方、GEP-PGとTRPO-VIMEは2,500回の試行を経ても同等のパフォーマンスに到達できず、TRPO、Black-DROPS、CMA-ESは方向性のない探索が原因で報酬がほぼゼロのままであった。
  • 4-DOFのドア開閉タスクでは、Multi-DEXが中央値1,000回の試行でタスクを完全に達成したが、CMA-ESは同じ予算内で最終報酬の半分にとどまった。
  • 5-DOFアームを用いた非疎なゴール到達タスクでは、Multi-DEXの2つのバージョン(ε=0およびε=0.4)が標準的なBlack-DROPSと同等のパフォーマンスを達成し、報酬の疎らかさのレベルにかかわらず高いロバスト性を示した。
  • Multi-DEXが提供するPareto最適方策集合により、多様な行動が得られ、εによる最終方策選択により、探索と活用の動的調整が可能になった。
  • 目的関数にモデルの不確実性を組み込むことで、一般化性能が向上し、ランダムな探索への依存が著しく低下し、明確に試行回数の複雑さが減少した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。