Skip to main content
QUICK REVIEW

[論文レビュー] Generalization in Transfer Learning

Suzan Ece Ada, Emre Uğur|arXiv (Cornell University)|Sep 3, 2019
Reinforcement Learning in Robotics参考文献 36被引用数 5
ひとこと要約

本論文は、連続的制御における転移強化学習の一般化を向上させるために、きついクリッピング、早期停止、最大エントロピーの敵対的学習という正則化手法を提案する。訓練反復回数をハイパーパrameterとして扱い、ポリシーのスナップショットを用いることで、多様なボディ形状および環境的ダイナミクスにおいて優れた転移性能を達成し、先行研究を上回る一般化範囲を拡張する。

ABSTRACT

Agents trained with deep reinforcement learning algorithms are capable of performing highly complex tasks including locomotion in continuous environments. We investigate transferring the learning acquired in one task to a set of previously unseen tasks. Generalization and overfitting in deep reinforcement learning are not commonly addressed in current transfer learning research. Conducting a comparative analysis without an intermediate regularization step results in underperforming benchmarks and inaccurate algorithm comparisons due to rudimentary assessments. In this study, we propose regularization techniques in deep reinforcement learning for continuous control through the application of sample elimination, early stopping and maximum entropy regularized adversarial learning. First, the importance of the inclusion of training iteration number to the hyperparameters in deep transfer reinforcement learning will be discussed. Because source task performance is not indicative of the generalization capacity of the algorithm, we start by acknowledging the training iteration number as a hyperparameter. In line with this, we introduce an additional step of resorting to earlier snapshots of policy parameters to prevent overfitting to the source task. Then, to generate robust policies, we discard the samples that lead to overfitting via a method we call strict clipping. Furthermore, we increase the generalization capacity in widely used transfer learning benchmarks by using maximum entropy regularization, different critic methods, and curriculum learning in an adversarial setup. Subsequently, we propose maximum entropy adversarial reinforcement learning to increase the domain randomization. Finally, we evaluate the robustness of these methods on simulated robots in target environments where the morphology of the robot, gravity, and tangential friction coefficient of the environment are altered.

研究の動機と目的

  • 深層強化学習の転移学習における一般化の欠如と過学習の問題に対処すること。
  • ソースタスクの性能がターゲットタスクの一般化能力を示すものではないことを示すこと。
  • 訓練反復回数をハイパーパrameterとして扱うことで、転移学習のロバスト性を向上させること。
  • 形状やダイナミクスが変更された未観測タスクへのポリシー転送を向上させる正則化手法を開発すること。
  • 既存の手法を上回る範囲で、転移学習ベンチマークの一般化範囲を拡張すること。

提案手法

  • 過学習を引き起こすサンプルを排除するために、PPOのクリッピングパラメータを極めて小さな値にまで低減するStrict Clipping PPO(SC-PPO)を導入する。
  • 過学習を防ぐために、より早い段階のポリシーのスナップショットを選択することで、早期停止を実装する。
  • 探索性とロバスト性を向上させるために、敵対的RLの枠組みで最大エントロピー正則化を適用する。
  • ドメインランダム化された環境における敵対的ポリシー学習を改善するために、カリキュラム学習とエントロピー報酬を用いる。
  • SC-PPOと早期停止、エントロピー正則化の敵対的訓練を組み合わせることで、困難なターゲットタスクにおける一般化を向上させる。
  • より良い一般化選択が可能になるよう、訓練反復の各段階で複数のポリシーのスナップショットを格納・評価するポリシー・バッファを維持する。

実験結果

リサーチクエスチョン

  • RQ1ソースタスクの性能は、転移強化学習における一般化能力を信頼性を持って予測できるか?
  • RQ2訓練反復回数をハイパーパラメータとして扱うことで、転移学習の性能が向上するか?
  • RQ3きついクリッピングと早期停止は、ソースタスクへの過学習をどれほど効果的に低減できるか?
  • RQ4エントロピー正則化の敵対的訓練は、形状的およびダイナミックに多様なターゲットタスクにおける一般化をどの程度向上できるか?
  • RQ5正則化手法の組み合わせにより、既存のベンチマークを上回る範囲で転移学習の一般化範囲を拡張できるか?

主な発見

  • SC-PPOと早期停止は、高次元のヒューマノイド環境ですら、ソースタスクへの過学習を防ぐことで、ターゲットタスクの性能を顕著に向上させる。
  • 本手法により、ホッパーのボディ形状タスクの一般化範囲が、RARRLと比較して[2.5, 4.75]から[1, 6]に拡張された。
  • 重力の変動に対して、本手法は[0.5G, 1.75G]の範囲でターゲットタスクにおける前進走破を可能にし、ベースライン手法を上回る。
  • エントロピー正則化の敵対的訓練により、高摩擦(3.5倍)および高重力(1.75G)環境での性能が向上した。
  • ポリシー・バッファと反復ベースのハイパーパラメータ選択を用いることで、未観測のターゲットタスクにおけるスナップショット性能が向上した。
  • SC-PPO、早期停止、およびエントロピー正則化の組み合わせにより、ソースタスクから抽出可能な一般化可能なポリシーの数が増加した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。