Skip to main content
QUICK REVIEW

[論文レビュー] Exploration Conscious Reinforcement Learning Revisited

Lior Shani, Yonathan Efroni|arXiv (Cornell University)|Dec 13, 2018
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、ε-greedy やガウスノイズなどの固定された探索メカニズムを前提として方策を最適化することにより、探索に配慮した強化学習を導入する。探索を外部的摂動として扱うのではなく、代替のマーカフ・意思決定過程(surrogate MDP)として問題を定式化することで、表計算およびディープ強化学習の両設定において、より安定的かつサンプル効率の良い学習が可能になる。アタリおよびムジョコ環境において、経験的にも性能向上が得られている。

ABSTRACT

The Exploration-Exploitation tradeoff arises in Reinforcement Learning when one cannot tell if a policy is optimal. Then, there is a constant need to explore new actions instead of exploiting past experience. In practice, it is common to resolve the tradeoff by using a fixed exploration mechanism, such as $ε$-greedy exploration or by adding Gaussian noise, while still trying to learn an optimal policy. In this work, we take a different approach and study exploration-conscious criteria, that result in optimal policies with respect to the exploration mechanism. Solving these criteria, as we establish, amounts to solving a surrogate Markov Decision Process. We continue and analyze properties of exploration-conscious optimal policies and characterize two general approaches to solve such criteria. Building on the approaches, we apply simple changes in existing tabular and deep Reinforcement Learning algorithms and empirically demonstrate superior performance relatively to their non-exploration-conscious counterparts, both for discrete and continuous action spaces.

研究の動機と目的

  • 標準的な強化学習アルゴリズムが探索を固定された外部的メカニズムとして扱うため、方策学習が最適でないという限界を是正すること。
  • 特定の探索スキーム下で最適な方策をもたらす、探索に配慮した最適化基準を形式化すること。
  • 探索に配慮した方策学習を、標準的なMDP定式化に還元し、体系的なアルゴリズム設計を可能にすること。
  • 既存のアルゴリズムに探索への配慮を統合することで、表計算およびディープ強化学習の両設定で、より高いサンプル効率と頑健性を実証すること。

提案手法

  • 離散的および連続的行動空間における探索に配慮した基準を定義し、固定された探索メカニズムによって誘導される制限付き方策集合上の最適化として扱う。
  • 元のMDPの探索に配慮した最適方策に対応する最適方策を持つ代替MDPを構築する。
  • 価値ベースおよび方策ベースの2つの一般的なアルゴリズム的手法を提案し、探索に配慮した最適化問題を解く。
  • 既存の表計算およびディープ強化学習アルゴリズム(例:DQN、SAC)に、探索メカニズムを考慮したターゲットネットワークまたは方策更新を組み込むことで、探索への配慮を統合する。
  • 現在の方策と固定された探索方策の重み付き組み合わせを用いて、新たなターゲットQ値を定義し、探索制約下でも安定した学習を可能にする。
  • やや弱い仮定の下で、提案手法の収束を証明し、誤差が時間とともに減少し、方策が探索に配慮した最適方策に収束することを示す。

実験結果

リサーチクエスチョン

  • RQ1固定された探索メカニズム下で最適な方策をもたらす、原理的根拠のある最適化基準を定義できるか。すなわち、探索が方策学習とは独立であると仮定するのではなく、探索を内生的要因として扱えるか。
  • RQ2探索に配慮した方策学習問題を、解法が容易な標準的なMDP定式化に還元する方法は何か。
  • RQ3探索に配慮した学習における、バイアス(真の最適方策に対する相対的バイアス)と近似誤差への感受性のトレードオフは何か。
  • RQ4価値更新および方策更新に明示的に探索認識を組み込むことで、標準的な強化学習手法を上回る実用的アルゴリズムを設計できるか。
  • RQ5探索に配慮した学習は、離散的および連続的制御タスクの両方で、より高いサンプル効率とパフォーマンスをもたらすか。

主な発見

  • 代替MDP定式化を用いて導出された探索に配慮した方策は、真の最適方策に対してバイアスを持つが、関数近似誤差への感受性が著しく低減されている。
  • 提案手法は、標準的なDQNやRainbowエージェントに比べ、特に報酬がスパarsな環境において、アタリ環境で優れたパフォーマンスを達成している。
  • ムジョコを用いた連続的制御タスクでは、探索に配慮したSACの変種が、標準的なSACに比べ、サンプル効率および最終的リターンで優れている。特に初期学習段階で顕著な向上が見られた。
  • 標準的な仮定の下で、提案手法の収束が理論的に保証されており、誤差は割合γ(割引率)および探索重みαに比例して減少する。
  • 経験的結果から、探索に配慮した学習は、Cliff-Walkingのような環境で、標準的なε-greedyが崖の近くで危険な行動を取るのを緩和することが示された。
  • 本手法は表計算およびディープ強化学習の両設定に一般化可能であり、アーキテクチャの変更を除き、探索メカニズムをターゲット更新に組み込むだけで、一貫した向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。