Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Learning for Continuous Control

Himani Arora, Rajath Kumar|arXiv (Cornell University)|Feb 3, 2018
Reinforcement Learning in Robotics参考文献 7被引用数 11
ひとこと要約

本論文は、複数のMuJoCo環境において、複数のタスクに共通する方策および価値ネットワークを用いた連続的制御タスクのためのマルチタスク強化学習を提案し、評価している。vanillaマルチタスク学習が単一タスク学習および知識蒸留よりも優れた性能を示し、より少ない学習ステップで高い性能を達成するとともに、深刻な忘却(catastrophic forgetting)の影響を軽減していることが示された。

ABSTRACT

Reliable and effective multi-task learning is a prerequisite for the development of robotic agents that can quickly learn to accomplish related, everyday tasks. However, in the reinforcement learning domain, multi-task learning has not exhibited the same level of success as in other domains, such as computer vision. In addition, most reinforcement learning research on multi-task learning has been focused on discrete action spaces, which are not used for robotic control in the real-world. In this work, we apply multi-task learning methods to continuous action spaces and benchmark their performance on a series of simulated continuous control tasks. Most notably, we show that multi-task learning outperforms our baselines and alternative knowledge sharing methods.

研究の動機と目的

  • 現実のロボット制御における強化学習のサンプル非効率性を解消するため、関連するタスク間での知識移譲を可能にする。
  • コンピュータビジョンや離散的行動空間で有効なマルチタスク学習手法が、連続的制御タスクにも一般化可能かどうかを調査する。
  • 単一タスク学習と比較して、vanillaマルチタスク学習と知識蒸留を、連続的行動空間の環境でベンチマーク化する。
  • マルチタスク強化学習における、学習速度、性能の安定性、深刻な忘却のトレードオフを評価する。
  • MuJoCo環境を用いた今後のマルチタスク連続的制御分野の研究の再現可能性を高めるためのベンチマークを提供する。

提案手法

  • 6つのMuJoCo環境で、共有された隠れ層とタスク固有の出力ヘッドを持つ6ヘッドのアクター・クリティックネットワークを訓練し、各ヘッドを100万フレーム分、環境を順番に切り替えながら学習する。
  • ポリシーと価値関数のパラメータを更新するために、オンポリシーのロールアウトとnステップリターンを用いたアドバンテージ・アクター・クリティック(A2C)アルゴリズムを適用する。
  • 教師ネットワークを事前に学習させ、その行動を模倣するように学生ネットワークを訓練することで知識蒸留を実装し、ポリシーおよび特徴量の回帰損失の両方を用いる。
  • 探索を促進し、局所最適解への過早収束を防ぐためにエントロピー正則化を適用する。
  • 新しい環境で事前学習済みネットワークを微調整することで深刻な忘却を評価し、元のポリシーの重みを初期値とし、最終層のみを更新する。
  • 20回のロールアウトにおける累積報酬を用いて性能を評価し、タスクおよび学習手法ごとの平均値と標準偏差を比較する。

実験結果

リサーチクエスチョン

  • RQ1連続的制御環境において、マルチタスク学習は単一タスク学習と比較して、サンプル効率性と最終的な性能を向上させるか?
  • RQ2vanillaマルチタスク学習と知識蒸留の間で、連続的制御タスクにおける学習速度、性能、分散の観点から、どちらが優れているか?
  • RQ3事前学習済みポリシーを新しい環境で微調整することで、元のタスクにおける深刻な忘却がどの程度発生するか?
  • RQ4複数の関連タスク間で共有される表現が、連続的制御における収束速度の向上と一般化性能の向上に寄与するか?
  • RQ5知識蒸留はマルチタスク連続的制御設定において、学習を安定化させたり分散を低減させたりするか?

主な発見

  • vanillaマルチタスク学習は単一タスク学習を上回り、単一タスク学習で300万フレームを要する性能を100万フレームで達成している。
  • vanillaマルチタスクエージェントは、すべての環境において単一タスクおよび蒸留ベースラインと比較して、平均累積報酬がより高い。
  • 知識蒸留は学習時間を短縮するが、報酬1000に到達するまでの時間がvanillaエージェントよりも速い一方で、性能の分散が大きくなっている。
  • HalfCheetahBigTorsoおよびHalfCheetahSmallThighにおいて、蒸留エージェントの性能の標準偏差は、vanillaエージェントよりも顕著に大きいことから、学習がより不安定であることが示された。
  • 事前学習済みネットワークの微調整は深刻な忘却を引き起こし、ターゲットタスクで性能が向上する一方で、元の環境での性能が低下している。
  • 共有表現を用いたマルチタスク学習は、再訓練を完全に回避する必要を大幅に軽減し、関連するタスク間でより速い収束を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。