Skip to main content
QUICK REVIEW

[論文レビュー] Learning Novel Policies For Tasks

Yunbo Zhang, Wenhao Yu|arXiv (Cornell University)|May 13, 2019
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

本稿では、タスク報酬とネオロジータ報酬のバランスを取ることで、与えられたタスクに対して多様で高いパフォーマンスを示すポリシーを発見する強化学習手法であるTask-Novelty Bisector (TNB)を提案する。自己符号化器を用いて以前に学習されたポリシーからの行動的乖離を測定し、勾配バイセクタを用いてタスクパフォーマンスとポリシー多様性の両方を同時に向上させる。TNBは、迷路ナビゲーション、ロボット制御、だましのタスクの全範囲で、ランダムな再初期化や重み付き和手法を上回る性能を示した。

ABSTRACT

In this work, we present a reinforcement learning algorithm that can find a variety of policies (novel policies) for a task that is given by a task reward function. Our method does this by creating a second reward function that recognizes previously seen state sequences and rewards those by novelty, which is measured using autoencoders that have been trained on state sequences from previously discovered policies. We present a two-objective update technique for policy gradient algorithms in which each update of the policy is a compromise between improving the task reward and improving the novelty reward. Using this method, we end up with a collection of policies that solves a given task as well as carrying out action sequences that are distinct from one another. We demonstrate this method on maze navigation tasks, a reaching task for a simulated robot arm, and a locomotion task for a hopper. We also demonstrate the effectiveness of our approach on deceptive tasks in which policy gradient methods often get stuck.

研究の動機と目的

  • 標準の強化学習アルゴリズムが、複数の異なる解が存在する場合でも、通常は1つのポリシーしか発見しないという限界を解決すること。
  • 手動での報酬設計やランダムシードのチューニングなしに、与えられたタスクに対して複数の多様で効果的なポリシーを発見できること。
  • 高いタスクパフォーマンスを達成しつつ、異なる行動パターンの探索を促進する方法を開発すること。
  • 標準のポリシーグラデント法がしばしば失敗する、だましの環境におけるサンプル効率とロバスト性を向上させること。
  • PPOなどのポリシーグラデントアルゴリズムに一般化可能なフレームワークを提供すること。

提案手法

  • 以前に発見されたポリシーの状態シーケンスに自己符号化器を訓練し、典型的な行動のコンact表現を学習する。
  • 自己符号化器の再構成誤差を用いて、過去のポリシーとの類似性をペナルティとするネオロジータ報酬関数を定義する。
  • 2つの目的(タスク報酬の最大化とネオロジータ報酬の最大化)を持つ多目的強化学習問題を定式化する。
  • タスク報酬とネオロジータ報酬の両方のポリシーグラデントをバランスよく、重みなしの方法で組み合わせる勾配バイセクタ法を適用する。
  • 得られた組み合わせ勾配を用いてポリシーネットワークを更新し、タスクパフォーマンスの低下を防ぎながら両方の目的で進行を確保する。
  • PPOをベースのRLアルゴリズムとして適用するが、SAC や TRPO などの他のポリシーグラデント法へも拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1手動での報酬形状なしに、1つのタスクに対して複数の明確に異なる高パフォーマンスのポリシーを強化学習アルゴリズムが発見可能か?
  • RQ2タスクパフォーマンスを維持したまま、行動的ネオロジータを効果的に測定・インcentivizeする方法は何か?
  • RQ3勾配ベースの多目的アプローチは、ランダムな再初期化や重み付き和報酬の組み合わせに比べて、多様なポリシーの発見において優れているか?
  • RQ4標準のRLアルゴリズムが局所最適にハマってしまうだましの環境でも、この手法は正常に動作するか?
  • RQ5自己符号化器の再構成誤差に基づくネオロジータ信号は、他の内発的好奇心やオプション発見手法と比較して、ポリシーの多様性とタスク成功の両面で優れているか?

主な発見

  • Task-Novelty Bisector (TNB) は、報酬関数のチューニングなしに、迷路ナビゲーション、ロボットアームの到達、ホッパーの移動、および2つのだましのバリエーションを含む全5つのタスクで、新たなポリシーを効果的に発見した。
  • だましの迷路とだましのリーチャータスクでは、標準のPPOとSACが完全に失敗したのに対し、TNBは4/5の成功ポリシーを達成した。
  • 報酬の重み付き和(WSR)手法は、ネオロジータ報酬とタスク報酬の比率のハイパーパrameterチューニングに細心の注意を要し、重みが最適でない場合に頻繁に失敗した。
  • TNBはランダムシードの再初期化を上回り、異なるシードで複数回実行しても多様性が得られない場合でも、一貫して異なるポリシーを発見できた。
  • 自己符号化器に基づくネオロジータ信号は、行動の違いを効果的に捉え、以前に発見されたポリシーのパターンの繰り返しを避けるのに有効であった。
  • 本手法は、連続的制御タスクや誤った局所最適がある複雑なだましのタスクを含む多様な環境で、ロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。