Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Online Estimation of Empowerment for Reinforcement Learning

Ruihan Zhao, Pieter Abbeel|arXiv (Cornell University)|Jul 14, 2020
Reinforcement Learning in Robotics参考文献 39被引用数 5
ひとこと要約

本論文では、ニューラルネットワークを用いてエンジンを凸最適化問題に再定式化することにより、強化学習における権力の推定を効率的なオンラインアルゴリズムとして提案している。これにより、サンプル数と計算複雑性が顕著に低減される。この手法により、ドメイン固有の知識や手動リセットが不要な有効な内発的動機付けが可能となり、現実世界の環境におけるスケーラブルな学習が実現される。

ABSTRACT

Training artificial agents to acquire desired skills through model-free reinforcement learning (RL) depends heavily on domain-specific knowledge, and the ability to reset the system to desirable configurations for better reward signals. The former hinders generalization to new domains; the latter precludes training in real-life conditions because physical resets are not scalable. Recently, intrinsic motivation was proposed as an alternative objective to alleviate the first issue, but there has been no reasonable remedy for the second. In this work, we present an efficient online algorithm for a type of intrinsic motivation, known as empowerment, and address both limitations. Our method is distinguished by its significantly lower sample and computation complexity, along with improved training stability compared to the relevant state of the art. We achieve this superior efficiency by transforming the challenging empowerment computation into a convex optimization problem through neural networks. In simulations, our method manages to train policies with neither domain-specific knowledge nor manual intervention. To address the issue of resetting in RL, we further show that our approach boosts learning when there's no early termination. Our proposed method opens doors for studying intrinsic motivation for policy training and scaling up model-free RL training in real-life conditions.

研究の動機と目的

  • モデルフリー強化学習(RL)におけるスキル習得のためのドメイン固有の知識の必要性という課題に対処すること。
  • 現実世界のRL環境における物理的リセットの非現実性を克服し、早期終了や手動介入なしに学習を可能にすること。
  • 権力に基づく内発的動機付けのためのスケーラブルでサンプル効率の良い手法を開発し、学習の安定性と一般化性能を向上させること。
  • ニューラルネットワークを用いて複雑な権力計算を凸最適化問題に変換することで、効率性を向上させること。

提案手法

  • ポリシーおよび環境ダイナミクスのニューラルネットワークパラメータライゼーションを活用して、権力計算を凸最適化問題に再定式化する。
  • 微分可能でニューラルネットワークアーキテクチャを用いて、最大達成可能な状態分布を推定し、バックプロパゲーションを用いたエンドツーエンド学習を可能にする。
  • バッチ処理を回避するため、オンライン最適化技術を用いて、ポリシー学習中に権力推定値をリアルタイムで更新する。
  • 外在的報酬が疎である場合に依存せずに、探索を導くために権力信号を内発的報酬として統合する。
  • 反復的価値反復やモンテカルロロールアウトを避けることで、凸フレームワークにおける閉形式解を用いて計算効率を確保する。
  • 部分観測性や確率的遷移に対して頑健であるようにアルゴリズムを設計し、複雑な環境での安定性を高める。

実験結果

リサーチクエスチョン

  • RQ1権力が十分に効率的に推定可能であるか、オンラインでモデルフリーRLにおける実用的内発的報酬として機能するか。
  • RQ2提案手法は、先行手法と比較して、どの程度サンプル数と計算複雑性を低減できるか。
  • RQ3ドメイン固有の知識や手動リセットなしに、現実世界のシナリオで有効な学習が可能か。
  • RQ4凸最適化への再定式化は、学習の安定性と収束速度をどの程度向上させるか。
  • RQ5従来の内発的動機付け手法が高コストなため失敗する連続的制御タスクに、この手法はスケーラブルに適用可能か。

主な発見

  • 提案手法は、権力推定の最先端手法と比較して、顕著に低いサンプル数と計算複雑性を達成した。
  • アルゴリズムはドメイン固有の知識や手動リセットを必要とせず、安定的かつ効率的なオンラインポリシー学習を可能にした。
  • シミュレーションでの実験結果から、早期終了を無効にした場合でも、本手法が疎な報酬に対して頑健であることを示した。
  • 凸最適化の定式化により、非凸的または反復的代替手法と比較して、収束が速く安定性が向上した。
  • 本手法は連続的制御環境にスケーラブルに適用でき、現実世界のRLアプリケーションにおける権力に基づく内発的動機付けの実現可能性を示した。
  • 最適化問題のパラメータライゼーションにニューラルネットワークを用いることで、エンドツーエンドの微分可能となり、ディープRLパイプラインへのシームレスな統合が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。