Skip to main content
QUICK REVIEW

[論文レビュー] ADAAPT: A Deep Architecture for Adaptive Policy Transfer from Multiple Sources

Janarthanan Rajendran, Prateek Prasanna|arXiv (Cornell University)|Oct 10, 2015
Reinforcement Learning in Robotics参考文献 30被引用数 10
ひとこと要約

ADAAPT は、複数のソースタスクからターゲットタスクへ適応的かつ選択的なポリシー転送を可能にする深層強化学習アーキテクチャであり、負の転送を軽減し、学習効率を向上させる。シミュレートされた環境における実験的結果から、タスク間で共有される状態-行動空間を効果的に活用していることが示され、非転送法や非適応的法よりも優れた性能を発揮している。

ABSTRACT

The ability to transfer knowledge from learnt source tasks to a new target task can be very useful in speeding up the learning process of a Reinforcement Learning agent. This has been receiving a lot of attention, but the application of transfer poses two serious challenges which have not been adequately addressed in the past. First, the agent should be able to avoid negative transfer, which happens when the transfer hampers or slows down the learning instead of speeding it up. Secondly, the agent should be able to do selective transfer which is the ability to select and transfer from different and multiple source tasks for different parts of the state space of the target task. We propose ADAAPT: A Deep Architecture for Adaptive Policy Transfer, which addresses these challenges. We test ADAAPT using two different instantiations: One as ADAAPTive REINFORCE algorithm for direct policy search and another as ADAAPTive Actor-Critic where the actor uses ADAAPT. Empirical evaluations on simulated domains show that ADAAPT can be effectively used for policy transfer from multiple source MDPs sharing the same state and action space.

研究の動機と目的

  • マルチソース強化学習における負の転送の課題に対処すること。
  • ターゲットタスクの状態空間の異なる領域に基づいて、どのソースポリシーを適用するかを適応的に選択することによる選択的転送を可能にすること。
  • 複数のソースタスクからのポリシーを動的に統合できる深層アーキテクチャを設計し、ターゲットタスクの学習を改善すること。
  • 共有される状態空間と行動空間を持つシミュレート環境において、適応的転送の有効性を評価すること。

提案手法

  • ADAAPT は、現在の状態に応じて複数のソースタスクからのポリシーをゲーティングおよび組み合わせる学習を行う深層ニューラルネットワークアーキテクチャを採用している。
  • 入力状態に応じて関連するソースポリシーを適応的に選択するルーティング機構を用いており、関係のないソースからの干渉を最小限に抑える。
  • モデルは ADAAPTive REINFORCE および ADAAPTive Actor-Critic としてインスタンス化され、直接的なポリシー探索とアクター・クリティック学習の両方を可能にしている。
  • ポリシー勾配法を用いてエンドツーエンドで訓練され、有用なソースポリシーを優先するような注目メカニズムに類似したルーティングが採用されている。
  • 本手法は、有益な知識のみが転送されることを保証しており、負の転送のリスクを低減する。

実験結果

リサーチクエスチョン

  • RQ1複数のソースからの適応的ポリシー転送は、強化学習における負の転送を軽減できるか?
  • RQ2エージェントは、現在の状態に応じて、異なるソースタスクからのポリシーをどれだけ効果的に選択・統合できるか?
  • RQ3選択的転送は、共有される状態-行動空間を持つターゲットタスクにおいて、学習速度とパフォーマンスを向上させるか?
  • RQ4シミュレート環境において、ADAAPT は非適応的または単一ソース転送法と比較してどのように優れているか?

主な発見

  • ADAAPT は、各状態領域に対して関連するソースポリシーのみを選択的に有効化することで、負の転送を顕著に低減している。
  • アーキテクチャは、非転送法および非適応的転送ベースラインと比較して、ターゲットタスクにおける収束が速くなっている。
  • 実験的評価から、共有される状態空間と行動空間を持つ複数のシミュレートドメインにおいて一貫したパフォーマンス向上が確認された。
  • 適応的ルーティング機構は、状態空間の異なる部分に対して最も有益なソースポリシーを効果的に同定・利用している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。