Skip to main content
QUICK REVIEW

[論文レビュー] Learning Shared Representations in Multi-task Reinforcement Learning

Diana Borsa, Thore Graepel|arXiv (Cornell University)|Mar 7, 2016
Reinforcement Learning in Robotics参考文献 17被引用数 13
ひとこと要約

この論文は、修正されたフィットドQイテレーション(Fitted Q-Iteration)およびフィットドポリシーアイテレーション(Fitted Policy Iteration)を用いて、複数のタスク間で共有される価値関数の表現を同時に学習するマルチタスク強化学習フレームワークを提案する。マルチタスク教師あり学習の技術を活用することで、データ効率性と一般化性能が向上し、高速なポリシー推論を可能にするコンactで転送可能な状態-行動の抽象化を学習する。

ABSTRACT

We investigate a paradigm in multi-task reinforcement learning (MT-RL) in which an agent is placed in an environment and needs to learn to perform a series of tasks, within this space. Since the environment does not change, there is potentially a lot of common ground amongst tasks and learning to solve them individually seems extremely wasteful. In this paper, we explicitly model and learn this shared structure as it arises in the state-action value space. We will show how one can jointly learn optimal value-functions by modifying the popular Value-Iteration and Policy-Iteration procedures to accommodate this shared representation assumption and leverage the power of multi-task supervised learning. Finally, we demonstrate that the proposed model and training procedures, are able to infer good value functions, even under low samples regimes. In addition to data efficiency, we will show in our analysis, that learning abstractions of the state space jointly across tasks leads to more robust, transferable representations with the potential for better generalization. this shared representation assumption and leverage the power of multi-task supervised learning. Finally, we demonstrate that the proposed model and training procedures, are able to infer good value functions, even under low samples regimes. In addition to data efficiency, we will show in our analysis, that learning abstractions of the state space jointly across tasks leads to more robust, transferable representations with the potential for better generalization.

研究の動機と目的

  • マルチタスク強化学習において、タスクごとに独立して学習することの非効率性を、タスク間の共有構造を活用することで解消すること。
  • 共有表現を用いて複数のタスクにまたがる最適価値関数を同時に学習する手法の開発。
  • 状態-行動空間の転送可能な低次元の抽象化を学習することで、データ効率性と一般化性能の向上。
  • 共有表現が明示的な部分目標の定義なしに、オプションに類似した挙動を暗黙的に捉えることができるかどうかの検証。

提案手法

  • 共有表現を用いて複数のタスクにまたがる価値関数を同時に学習するように、フィットドQイテレーション(FQI)およびフィットドポリシーアイテレーション(FPI)を拡張。
  • 価値関数を共有特徴とタスク固有の成分の線形結合としてモデル化し、共同最適化を可能にする。
  • 教師あり設定からのマルチタスク学習アルゴリズムを活用して、共有表現の正則化と一般化性能の向上。
  • 状態を表すために共有された低次元の特徴空間 $\psi_s$ を使用し、訓練中に転送可能な構造を捉えるように精錬。
  • 反復的に更新される共有表現 $\psi_s$ を採用し、改善するポリシーと価値関数を反映させる。
  • オフポリシー学習とエピソードリプレイを適用して、データ収集と価値関数学習を分離し、サンプル効率を向上。

実験結果

リサーチクエスチョン

  • RQ1複数のタスク間で共有される表現が、強化学習におけるデータ効率性を向上させることができるか?
  • RQ2標準的な価値反復およびポリシー反復手順を、共有表現の下で同時に価値関数を学習するようにどのように適合できるか?
  • RQ3明示的な部分目標の定義なしに、共有表現がどれほど転送可能なオプションに類似した挙動を捉えることができるか?
  • RQ4共同学習は、単一タスク学習と比較して、より頑健で一般化可能なポリシーをもたらすか?
  • RQ5学習中に観測されていない新しいタスクに対しても、学習済みの表現が一般化可能か?

主な発見

  • 提案手法は、タスクあたりのサンプル数を大幅に削減しても良好なポリシー性能を達成しており、低サンプル環境下でもデータ効率性が確認された。
  • 共有表現により、部分目標の明示的定義なしに、200サンプル/タスク程度の少量でオプションに類似したポリシーの推論が可能となった(例:特定の部屋へ移動)。
  • 価値関数がタスク間で一般化されることを示しており、単純なナビゲーションタスクでは10~30サンプルで十分な性能が得られた。
  • 共有特徴空間は、事前に定義された部分目標が不要なにもかかわらず、環境の圧縮され、転送可能な抽象化を捉えている。
  • 実験結果から、共同学習手順は単一タスクベースラインと比較して、より頑健で洗練された表現を学習していることが示された。
  • 訓練中に観測されていなかった新しいタスクに対しても、学習済みの共有表現が一般化可能であることが示され、強力な転送性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。