Skip to main content
QUICK REVIEW

[論文レビュー] On Multi-objective Policy Optimization as a Tool for Reinforcement Learning.

Abbas Abdolmaleki, Sandy H. Huang|arXiv (Cornell University)|Jun 15, 2021
Reinforcement Learning in Robotics参考文献 52被引用数 7
ひとこと要約

この論文は、深層強化学習(DRL)の改善を統一的原則として捉え、タスク報酬と行動コーピングなどの補助的目標を最適化するスケール不変なアルゴリズムであるDiMEを導入する。オフラインRLベンチマークにおいて優れた性能を示し、模倣学習とオフラインRLをMO問題として扱うことで、最先端の手法を上回る性能を発揮する。

ABSTRACT

Many advances that have improved the robustness and efficiency of deep reinforcement learning (RL) algorithms can, in one way or another, be understood as introducing additional objectives, or constraints, in the policy optimization step. This includes ideas as far ranging as exploration bonuses, entropy regularization, and regularization toward teachers or data priors when learning from experts or in offline RL. Often, task reward and auxiliary objectives are in conflict with each other and it is therefore natural to treat these examples as instances of multi-objective (MO) optimization problems. We study the principles underlying MORL and introduce a new algorithm, Distillation of a Mixture of Experts (DiME), that is intuitive and scale-invariant under some conditions. We highlight its strengths on standard MO benchmark problems and consider case studies in which we recast offline RL and learning from experts as MO problems. This leads to a natural algorithmic formulation that sheds light on the connection between existing approaches. For offline RL, we use the MO perspective to derive a simple algorithm, that optimizes for the standard RL objective plus a behavioral cloning term. This outperforms state-of-the-art on two established offline RL benchmarks.

研究の動機と目的

  • 探索ボーナス、エントロピー正則化、模倣学習などの多様なDRLの改善手法を、多目的強化学習(MORL)の枠組みで統一すること。
  • タスク報酬と補助的目標(例:エキスパートの模倣、探索)の間にある本質的な対立を、多目的最適化問題として定式化すること。
  • 異なる目標のスケールにかかわらず性能が安定するように保つスケール不変なアルゴリズムを開発すること。
  • MORLの視点を実用的に応用することで、オフラインRLおよび模倣学習に応用し、性能向上を実証すること。

提案手法

  • タスク報酬と補助的目標を重み付き和またはスカラライゼーションによって統合する多目的方策最適化アルゴリズムであるDiME(エキスパートの混合物の蒸留)を提案する。
  • 目的の相対的スケールにかかわらず一貫した最適化性能を保証するスケール不変な定式化を採用する。
  • 標準的なRLの目的とエキスパートのデモンストレーションに一致する行動コーピング項を組み合わせることで、オフラインRLを多目的問題として再定式化する。
  • タスクパフォーマンスとエキスパート行動の両方をバランスさせる方策を学習するためのエキスパートの混合物のアプローチを用い、一般化性能を向上させる。
  • トレーニング中に競合する目標をバランスさせるために、適応的重みを用いたスカラライズド多目的最適化を適用する。
  • タスク報酬を最大化しつつエキスパートデータに一致するように方策を促進するための蒸留メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1エントロピー正則化やエキスパートの模倣といった既存のDRLの改善手法が、単一の多目的最適化フレームワークで統合可能か?
  • RQ2多目的強化学習をどのようにスケール不変にすることで、異なる目標スケールにおいても安定的かつ一貫した最適化を実現できるか?
  • RQ3オフラインRLを多目的問題として再定式化することで、従来のアプローチと比較して性能が向上するか?
  • RQ4MORLの視点によって、行動コーピングやオフラインRLといった既存のRLアルゴリズムの間の関係に新たな洞察が得られるか?

主な発見

  • DiMEアルゴリズムは、タスク報酬と行動コーピングを同時に最適化することで、2つの標準的なオフラインRLベンチマークで最先端の性能を達成した。
  • 多目的視点は、模倣学習とオフラインRLの目的を自然かつ直感的な形で統合するための定式化を提供する。
  • 提案されたアルゴリズムは、特定の条件下でスケール不変であることが確認され、目的の相対的大きさに関わらず一貫した最適化が保証された。
  • オフラインRLを多目的問題として再定式化することで、単純ながらも効果的なアルゴリズムが得られ、標準ベンチマークで既存手法を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。