Skip to main content
QUICK REVIEW

[論文レビュー] Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers

Benjamin Eysenbach, Swapnil Asawa|arXiv (Cornell University)|Jun 24, 2020
Viral Infectious Diseases and Gene Expression in Insects被引用数 15
ひとこと要約

本論文は、分類器を用いてソースドメインとターゲットドメインの遷移を区別することで報酬関数を変更することにより強化学習におけるポリシー転送を向上させるDARC(報酬からの分類器を用いたドメイン適応)を提案する。ソースに似たダイナミクスを罰するようにすることで、より安全なソースドメインで訓練されたポリシーが、ダイナミクスが異なるターゲットドメインに効果的に一般化可能となり、わずかな仮定のもとで理論的保証とともにほぼ最適な性能を達成する。

ABSTRACT

We propose a simple, practical, and intuitive approach for domain adaptation in reinforcement learning. Our approach stems from the idea that the agent's experience in the source domain should look similar to its experience in the target domain. Building off of a probabilistic view of RL, we formally show that we can achieve this goal by compensating for the difference in dynamics by modifying the reward function. This modified reward function is simple to estimate by learning auxiliary classifiers that distinguish source-domain transitions from target-domain transitions. Intuitively, the modified reward function penalizes the agent for visiting states and taking actions in the source domain which are not possible in the target domain. Said another way, the agent is penalized for transitions that would indicate that the agent is interacting with the source domain, rather than the target domain. Our approach is applicable to domains with continuous states and actions and does not require learning an explicit model of the dynamics. On discrete and continuous control tasks, we illustrate the mechanics of our approach and demonstrate its scalability to high-dimensional tasks.

研究の動機と目的

  • ソースドメイン(例:シミュレータ)からターゲットドメインにポリシーを転送する課題に取り組むこと、ここでターゲットドメインでの直接的な訓練は費用がかかりすぎたり、安全でなかったりする。
  • 遷移確率をモデル化しない方法を開発することで、動的差を補償し、高次元制御タスクにおけるスケーラブルな転送を可能にすること。
  • 軽微な仮定のもとで、ターゲットドメインにおけるほぼ最適な性能を保証する理論的根拠に基づいたアプローチを提供すること。
  • 学習済み分類器による報酬の変更が、明示的な報酬形状なしに安全で効果的な行動を暗黙的に学習できることを示すこと。

提案手法

  • 本手法は、状態-行動-次状態タプルを用いてトレーニングされた2つのバイナリ分類器を用い、ソースドメインとターゲットドメインの遷移を区別する。
  • これらの分類器が推定する密度比の対数を用いて報酬関数を変更し、ソースドメインのダイナミクスに類似した遷移を罰する。
  • 変更された報酬関数は、期待リターンの変分下界に基づいて導出され、ソースドメインとターゲットドメインのポリシーの整合性を保証する。
  • 本手法はダイナミクスや遷移確率の明示的モデル化を必要としないため、高次元連続制御タスクへのスケーラビリティが保証される。
  • 本手法はソースドメインでのトレーニング中に適用され、その目的はターゲットドメインにうまく一般化できるポリシーを生成することにある。
  • 分類器は状態と行動の両方に条件付けられており、これは周辺状態分布が類似している場合にダイナミクスの差を識別する上で極めて重要である。

実験結果

リサーチクエスチョン

  • RQ1学習済み分類器によるソース対ターゲット遷移の区別に基づいて報酬関数を変更することで、強化学習における有効なドメイン適応を達成できるか?
  • RQ2分類器ベースの密度比推定による報酬変更が、どのような条件下でターゲットドメインにおいてほぼ最適なポリシーを生み出すか?
  • RQ3状態と行動の両方に条件付けた分類器は、行動に依存しないアプローチと比較して、ダイナミクス適応においてどのように性能を向上させるか?
  • RQ4本手法は、明示的なダイナミクスモデル化なしに高次元連続制御タスクに一般化可能か?
  • RQ5明示的な安全報酬がなくても、本手法は暗黙的に安全な行動を学習するか?

主な発見

  • DARCは、ダイナミクスが異なるターゲットドメインにポリシーを効果的に転送し、離散的および連続的制御タスクの両方でほぼ最適な性能を達成した。
  • 111次元のAntタスクでは、DARCはダイナミクスモデル推定を必要とせず、サンプル効率と安定性の面でモデルベースのベースラインを上回った。
  • 逆転したアクション効果を持つグリッドワールド環境では、DARCは80%の試行で成功したが、行動条件付けを欠いたMATLは100%の試行で失敗した。
  • 本手法により、ターゲットドメインでエピソード終了を引き起こす可能性のある、ソースドメイン内の安全でない行動を回避することができた。これは、明示的な報酬形状なしに、自然に安全な行動が学習されたことを示唆している。
  • 実験の結果、DARCはMATLや標準的な強化学習のベースラインを、確率的ポリシーと微細なダイナミクスシフトを伴うタスクを含め、すべての評価タスクで上回った。
  • 理論的分析により、軽微な仮定のもとで、DARCはターゲットドメインにおいて最適に近い性能を持つポリシーを生成することが保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。