Skip to main content
QUICK REVIEW

[論文レビュー] Attend, Adapt and Transfer: Attentive Deep Architecture for Adaptive Transfer from multiple sources in the same domain

Janarthanan Rajendran, Aravind Srinivas|arXiv (Cornell University)|Oct 10, 2015
Domain Adaptation and Few-Shot Learning参考文献 25被引用数 5
ひとこと要約

本論文は、注意メカニズムを用いて複数のソースタスクからの寄与を動的に重み付けすることで、同じドメイン内の複数のソースタスクからの選択的・適応的転送を可能にする深層ニューラルネットワークアーキテクチャA2T(Attend, Adapt and Transfer)を提案する。この方法により、負の転送を回避し、学習効率と性能が向上し、さまざまな強化学習タスクで、異なる状態空間領域に対して最も関連性の高いソース方策や価値関数に注目する能力を学習することで、初期学習やベースラインの転送手法を上回る。

ABSTRACT

Transferring knowledge from prior source tasks in solving a new target task can be useful in several learning applications. The application of transfer poses two serious challenges which have not been adequately addressed. First, the agent should be able to avoid negative transfer, which happens when the transfer hampers or slows down the learning instead of helping it. Second, the agent should be able to selectively transfer, which is the ability to select and transfer from different and multiple source tasks for different parts of the state space of the target task. We propose A2T (Attend, Adapt and Transfer), an attentive deep architecture which adapts and transfers from these source tasks. Our model is generic enough to effect transfer of either policies or value functions. Empirical evaluations on different learning algorithms show that A2T is an effective architecture for transfer by being able to avoid negative transfer while transferring selectively from multiple source tasks in the same domain.

研究の動機と目的

  • 転送学習における負の転送、すなわち、ソースタスクからの事前知識がターゲットタスクの学習を妨げる問題に対処すること。
  • エージェントがターゲットタスクの状態空間の異なる部分で異なるソースタスクを使用できるように、選択的転送を可能にすること。
  • 方策と価値関数の両方の転送をサポートする汎用的な深層アーキテクチャを設計すること。
  • どのソースタスクにも存在しない新しいスキルをベースネットワークが学習できることで、ソース知識が不適切または最適でない場合のロバストネスを確保すること。
  • 微分可能でソフトなメタコントローラーとしての注意メカニズムを設計し、ソースタスクの寄与に対して連続的かつ適応的な意思決定を可能にすること。

提案手法

  • A2Tフレームワークは、ターゲットタスクでからくも訓練されたベースネットワークと、関連タスクで事前訓練された複数のソースタスクネットワークを組み合わせる。
  • 注意ネットワークは、各ソースネットワークおよびベースネットワークの状態依存の重みを計算し、各状態でどの知識を使用するかを決定する。
  • 最終出力は、ソースネットワークの予測とベースネットワークの出力の重み付き組み合わせであり、重みはバックプロパゲーションによりエンドツーエンドで学習される。
  • 注意メカニズムにより、ソースネットワークに対するソフトゲーティングが可能となり、エージェントが異なる状態領域に対して最も関連性の高いエキスパートに選択的に注目できる。
  • アーキテクチャは標準の強化学習目的で訓練され、注意ネットワークはターゲットタスクの報酬を最小化するように同時に最適化される。
  • フレームワークは方策転送と価値関数転送の両方をサポートし、共有された状態空間と行動空間を持つタスクに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1深層アーキテクチャは、複数のソースタスクから動的にかつ適応的に選択的に学習を改善できるか、また負の転送を回避できるか?
  • RQ2固定平均化や単一エキスパート転送と比較して、注意メカニズムはどのように転送性能を向上させるか?
  • RQ3ベースネットワークは、ソースタスクに存在しない新しいスキルを学習できるか、特にソース知識が不適切または最適でない場合にその能力を示せるか?
  • RQ4A2Tは、連続制御およびゲーム環境において、初期学習やベースラインの転送手法をどの程度上回るか?
  • RQ5注意メカニズムは、階層的および継続的強化学習の設定において、微分可能でソフトなメタコントローラーとして機能できるか?

主な発見

  • Pong環境では、A2Tは初期学習や単一エキスパート転送を上回り、収束が速く、平均報酬も高い。
  • 部分的なエキスパート(平均8/21)と負のエキスパートが存在する状況でも、A2Tは初期学習や単一負のエキスパート転送を上回る。
  • ソース知識が有害な場合にベースネットワークに依存することで、テニスにおけるドロップショットのような、どのソースネットワークにも存在しない新しいスキルを効果的に発見・学習した。
  • 注意メカニズムは、異なる状態領域に対して最も関連性の高いソースネットワークに注目する能力を効果的に学習し、手動による介入なしに選択的転送を実現した。
  • 実験的結果から、A2Tはソースタスクが不完全または部分的に不適切であっても性能を維持することが示され、負の転送に対してロバストであることが確認された。
  • 注意ネットワークにより、階層的および継続的学習の設定で使用可能な微分可能でソフトなメタコントローラーが実現され、転送学習の適用範囲が拡張された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。