Skip to main content
QUICK REVIEW

[論文レビュー] Lifelong Inverse Reinforcement Learning

Jorge A. Mendez, Shashank Shivkumar|arXiv (Cornell University)|Jul 1, 2022
Reinforcement Learning in Robotics参考文献 27被引用数 7
ひとこと要約

本稿では、複数の示範タスク間で知識を転送することで、示範の必要を減らすことができる、生涯にわたり逆強化学習(LIRL)のフレームワークを提案する。最大エントロピーIRLを共有潜在報酬表現で拡張することで、提案されたELIRLアルゴリズムは、継続的な最適化を通じて、新しいタスクおよび以前に学習したタスクの両方のパフォーランスを向上させ、計算コストをほとんど増加させることなく、単一タスクIRLに比べ顕著な向上を達成する。

ABSTRACT

Methods for learning from demonstration (LfD) have shown success in acquiring behavior policies by imitating a user. However, even for a single task, LfD may require numerous demonstrations. For versatile agents that must learn many tasks via demonstration, this process would substantially burden the user if each task were learned in isolation. To address this challenge, we introduce the novel problem of lifelong learning from demonstration, which allows the agent to continually build upon knowledge learned from previously demonstrated tasks to accelerate the learning of new tasks, reducing the amount of demonstrations required. As one solution to this problem, we propose the first lifelong learning approach to inverse reinforcement learning, which learns consecutive tasks via demonstration, continually transferring knowledge between tasks to improve performance.

研究の動機と目的

  • 模倣学習による複数タスクの学習負荷を軽減するため、タスク間で継続的な知識転送を可能にする。
  • 生涯学習を示範から形式化し、逆強化学習におけるオンラインマルチタスク学習問題として定式化する。
  • 既存のIRL手法をラップアップする一般化されたフレームワークを構築する。
  • 共有報酬表現を通じて逆転転送(過去のタスクでのパフォーランス向上)が達成できるかどうかを評価する。
  • フレームワークをドメイン間および連続的状態・行動空間に拡張する。

提案手法

  • 共有潜在要因を報酬関数間でモデル化するために低ランク行列分解を用い、行列Lとして表現する。
  • 各タスクの報酬関数は、タスク固有の重みs^(t)でパrameter化された共有潜在要因の線形結合としてモデル化される。
  • アルゴリズムはオンライン学習を実行し、各新しいタスクごとに共有潜在要因Lとタスク固有の重みs^(t)を更新する。
  • 最大エントロピーIRLをベースラーナーとして採用し、Lとs^(t)の共同最適化により、生涯学習設定に適応させる。
  • Lの継続的最適化により、過去に学習したタスクのモデリングが自動で向上するため、逆転移転送を実現する。
  • 拡張として、ドメイン適応特徴アライメントを用いたドメイン間転送、および径数基底関数表現による連続的状態・行動空間への適応が可能。

実験結果

リサーチクエスチョン

  • RQ1過去に学習したタスクからの知識が、逆強化学習における新規タスクの学習を加速するために効果的に転送可能か。
  • RQ2共有潜在報酬成分の継続的最適化が、過去に学習したタスクでのパフォーランス向上(逆転移転送)をもたらすか。
  • RQ3サンプル効率および計算コストの観点から、生涯IRLは単一タスクIRLに比べてどのように差がつくか。
  • RQ4異なる特徴空間や連続的状態・行動空間を持つタスク間で、このフレームワークは一般化可能か。
  • RQ5各タスクごとにタスク固有の重みs^(t)を再最適化することで、多様なタスクにおけるパフォーランスと安定性がどの程度向上するか。

主な発見

  • ELIRLは単一タスクMaxEnt IRLを顕著に上回り、ガウス過程ベースのIRLよりもはるかに少ない計算コストで同等または優れたパフォーランスを達成する。
  • アルゴリズムは逆転移転送を示す:より多くのタスクが学習されるほど、初期のタスクでのパフォーランスが向上し、全タスク学習完了後に平均的なパフォーランス向上が観察される。
  • CD-ELIRLによるドメイン間転送は、ドメイン内ELIRLと比較して報酬差を最大30%まで低減し、異なる特徴空間間でも有効であることが示された。
  • 連続的平面ナビゲーションタスクでは、ELIRLは単一タスクAME-IRLを上回り、学習タスクが増えるほどパフォーランス向上が顕著になる。
  • 各タスク後にs^(t)を再最適化することで、逆転移転送が向上し、特にグリッドサイズが異なるドメイン間遷移時においてパフォーランスの安定性が向上する。
  • 共有潜在行列Lは意味のあるタスク構造を捉えており、Objectworld環境では学習された成分が特定の色の周辺領域に対応していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。