Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Diverse Nearly Optimal Policies with Successor Features

Tom Zahavy, Brendan O’Donoghue|arXiv (Cornell University)|Jun 1, 2021
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、成功者特徴(SF)の多様性を最適化することで、近似的に最適な強化学習方策の集合を発見する Diverse Successive Policies を提案する。近似的に最適な性能を維持するための制約付きマルコフ決定過程(CMDP)を用いる。この手法は、SF間の相関を最小化する明示的多様性報酬を用い、先行手法(ロバストネスや識別性)を上回る性能を示し、三本脚での立ち姿勢やハイケンジングウォークといった質的に異なる歩行行動を発見する。

ABSTRACT

Finding different solutions to the same problem is a key aspect of intelligence associated with creativity and adaptation to novel situations. In reinforcement learning, a set of diverse policies can be useful for exploration, transfer, hierarchy, and robustness. We propose Diverse Successive Policies, a method for discovering policies that are diverse in the space of Successor Features, while assuring that they are near optimal. We formalize the problem as a Constrained Markov Decision Process (CMDP) where the goal is to find policies that maximize diversity, characterized by an intrinsic diversity reward, while remaining near-optimal with respect to the extrinsic reward of the MDP. We also analyze how recently proposed robustness and discrimination rewards perform and find that they are sensitive to the initialization of the procedure and may converge to sub-optimal solutions. To alleviate this, we propose new explicit diversity rewards that aim to minimize the correlation between the Successor Features of the policies in the set. We compare the different diversity mechanisms in the DeepMind Control Suite and find that the type of explicit diversity we are proposing is important to discover distinct behavior, like for example different locomotion patterns.

研究の動機と目的

  • 大多数の強化学習手法が単一の最適方策に焦点を当てるのに対し、質的に異なる複数の解決策を発見するという限界を克服すること。
  • 成功者特徴の多様性を主目的とする制約付きマルコフ決定過程(CMDP)として、多様で近似的に最適な方策の発見を形式化すること。
  • 異なる初期化条件下における、既存の内生的多様性メカニズム(ロバストネスおよび識別性)の感度および近似最適性の低下を分析すること。
  • 方策の成功者特徴間の相関を最小化する新たな明示的多様性報酬を提案し、多様性の向上と局所的最適解の回避を図ること。
  • DeepMind Control Suiteにおいて、多様で高報酬の行動を学習する手法の有効性を実証すること。特に、新たな歩行パターンの発見を含む。

提案手法

  • 成功者特徴(SF)の多様性を最大化することを目的とし、外在的報酬の観点から近似的に最適な方策を維持する制約を課す制約付きマルコフ決定過程(CMDP)として問題を形式化する。
  • 異なる方策のSF間の相関を最小化する内生的多様性報酬を定義し、特徴の線形結合を用いる。
  • ラグランジュ緩和法を用いて、多様性と近似的な最適性を同時に最適化し、制約の重みを動的に調整する。
  • 方策を段階的に訓練し、1つずつ集合に追加する。各段階では、事前に学習済み方策のSFに基づいた多様性目的を持つCMDPを解く。
  • Sparse-rewardおよびno-reward設定を用いて、DeepMind Control Suiteの環境で多様性と性能を評価する。
  • 提案手法の明示的多様性報酬を、先行手法(ロバストネス、識別性)と比較し、行動の多様性および収束安定性の観点から評価する。

実験結果

リサーチクエスチョン

  • RQ1成功者特徴の多様性を目的とする制約付きMDPフレームワークは、多様で近似的に最適な方策の集合を生成できるか?
  • RQ2既存の内生的多様性メカニズム(ロバストネスおよび識別性)は、行動の多様性および収束安定性においてどの程度の性能を示すか?
  • RQ3成功者特徴間の相関を明示的に最小化することは、暗黙的または間接的な多様性信号に比べ、より優れた多様性をもたらすか?
  • RQ4提案手法は、質的に異なる歩行行動(例:三本脚での立ち姿勢、ハイケンジングウォーク)を発見しつつ、近似的に最適な性能を維持できるか?
  • RQ5外在的報酬が訓練中に存在しないno-reward設定において、本手法はどの程度の性能を示すか?

主な発見

  • 成功者特徴間の相関を最小化する明示的多様性報酬は、ロバストネスおよび識別性手法を著しく上回り、多様な歩行行動の発見に優れた性能を示した。
  • Walker.walk環境では、片脚を上げる動作、ハイケンジングウォーク、つま先からかかとへの着地歩行といった明確に異なる歩行パターンを発見し、最大外在的報酬の98%を達成した。
  • Dog.stand環境では、三本脚での立ち姿勢のバリエーションを発見したが、多様性メカニズムなしのベースラインは四本脚での立ち姿勢に限定され、性能は同程度(最大報酬の92–106%)であった。
  • no-reward設定では、Walkerで後退膝立ち、クロール、フィックフラックジャンプといった複雑な歩行スキルを発見した。Cheetahでは前向き/後退走行およびジャンプを学習した。
  • 本手法は、最小限のハイパーパrameterチューニングで高い多様性を達成した一方、ロバストネスおよび識別性手法はしばしば部分最適解や静的行動(例:ヨガポーズ)に収束した。
  • 発見されたすべての方策が、近似的に最適性制約(最大外在的報酬の90%以上)を満たしており、多様性が性能の低下を伴わないことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。