Skip to main content
QUICK REVIEW

[論文レビュー] Multitask Soft Option Learning

Maximilian Igl, Andrew Gambardella|arXiv (Cornell University)|Apr 1, 2019
Reservoir Engineering and Simulation Methods参考文献 61被引用数 7
ひとこと要約

Multitask Soft Option Learning (msol) は、共有事前分布で正則化されたタスク固有の変分後期分布を用いる階層的強化学習フレームワークを導入し、安定したマルチタスク学習と効率的な転移学習を可能にする。柔軟なオプション適合性を実現しながら忘却を防ぎ、自然に終了方策を学習し、局所最適解を回避する。

ABSTRACT

We present Multitask Soft Option Learning(MSOL), a hierarchical multitask framework based on Planning as Inference. MSOL extends the concept of options, using separate variational posteriors for each task, regularized by a shared prior. This ''soft'' version of options avoids several instabilities during training in a multitask setting, and provides a natural way to learn both intra-option policies and their terminations. Furthermore, it allows fine-tuning of options for new tasks without forgetting their learned policies, leading to faster training without reducing the expressiveness of the hierarchical policy. We demonstrate empirically that MSOL significantly outperforms both hierarchical and flat transfer-learning baselines.

研究の動機と目的

  • オプションと上位レベル方策を同時に最適化する際の不安定性と性能の劣化を解消すること。
  • 完全なオプションの整合性や手動による部分目標の指定を必要とせず、新しいタスクへの効率的な転移を可能にすること。
  • 複雑なタスクの目的の衝突による最適化の局所最適解やスケジューリングの複雑化を回避する安定した学習体制を提供すること。
  • 手動での期間固定を必要とせず、自然にオプション終了方策を学習すること。
  • 学習済み方策を保持したまま新しいタスク向けにオプションを微調整可能にし、探索性と収束性を向上させること。

提案手法

  • msol は、各オプションについて共有事前分布とタスク固有の後期分布の区別を行う、計画を推論として扱う(PAI)フレームワークを用いてオプションを定式化する。
  • 各タスクごとの後期分布を最適化するために変分推論を用い、事前分布と後期分布の間のKL正則化項を導入することで、タスク間の一貫性を促進する。
  • このソフトオプションフレームワークにより、オプション方策と終了方策の学習が上位レベル方策から分離され、各タスクごとに独立して適応可能になる。
  • 事前分布は学習された報酬形状として機能し、新しいタスクにおける探索を以前に有効であった行動に導くが、正確な再現を強制はしない。
  • 終了方策は同じPAI定式化に基づきエンドツーエンドで学習され、固定期間や手動によるサブゴール指定を回避する。
  • 複数のタスクにわたる共同学習が行われ、共有事前分布がスキルの転送可能性と多様性を促進する。

実験結果

リサーチクエスチョン

  • RQ1ソフトオプションフレームワークは、マルチタスク階層的強化学習における学習安定性と最適化収束性を向上させることができるか?
  • RQ2事前分布と後期分布の分離は、分布外タスクにおける転送性能にどのように影響するか?
  • RQ3手動での期間指定なしにソフトオプションは効果的な終了方策を学習できるか?
  • RQ4ソフトオプションアプローチは、競合するタスクの目的によって引き起こされる局所最適解をどれほど効果的に回避できるか?
  • RQ5タスク固有の後期分布と共有事前分布を用いるアプローチは、ハードオプションやフラット方策と比較して、サンプル効率性と一般化性能においてどのように差がつくか?

主な発見

  • msol は、特に探索が困難な大きなグリッドにおいて、階層的ベースライン(例:Option Critic)およびフラット方策を顕著に上回る。
  • ピックアップ/ドロップオフ位置がシフトした分布外タスクにおいて、msol はフラット方策よりも迅速に学習を達成するが、ハードオプションは仕様ミスのため完全に失敗する。
  • 小さなグリッドのTaxiバージョンでは msol はフラット方策と同等の性能を示すが、より大きなグリッドでは学習が著しく加速され、複雑な環境における転送の価値を示している。
  • msol は共有事前分布からの後期分布の微調整により、新しいタスクへの適応が効果的に可能となり、以前に学習したスキルを忘却することなく、高速な収束を実現する。
  • ソフトオプションフレームワークはエンドツーエンドで終了方策を効果的に学習し、固定期間や手動によるサブゴール指定の必要性を排除した。
  • 事前分布と後期分布の間のKL正則化により、オプションがタスク間で一貫性を保ちつつ、タスク固有の適応が可能となり、最適化の安定性が向上し、局所最適解の回避が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。