Skip to main content
QUICK REVIEW

[論文レビュー] Offline RL Policies Should be Trained to be Adaptive

Dibya Ghosh, Anurag Ajay|arXiv (Cornell University)|Jul 5, 2022
Machine Learning and Algorithms被引用数 4
ひとこと要約

この論文は、限られたデータセットに起因する認識的不確実性が暗黙の部分的観測可能性を引き起こすため、オフライン強化学習(RL)のポリシーは、純粋に慎重な方針ではなく、適応的であるべきだと主張している。著者らは、推論時に複数の価値関数から適応的に選択する、アンサンブルベースの手法APE-Vを提案し、Procgen Mazes や D4RL といったオフラインRLベンチマークで、静的で慎重なベースラインを上回る優れた性能を達成した。

ABSTRACT

Offline RL algorithms must account for the fact that the dataset they are provided may leave many facets of the environment unknown. The most common way to approach this challenge is to employ pessimistic or conservative methods, which avoid behaviors that are too dissimilar from those in the training dataset. However, relying exclusively on conservatism has drawbacks: performance is sensitive to the exact degree of conservatism, and conservative objectives can recover highly suboptimal policies. In this work, we propose that offline RL methods should instead be adaptive in the presence of uncertainty. We show that acting optimally in offline RL in a Bayesian sense involves solving an implicit POMDP. As a result, optimal policies for offline RL must be adaptive, depending not just on the current state but rather all the transitions seen so far during evaluation.We present a model-free algorithm for approximating this optimal adaptive policy, and demonstrate the efficacy of learning such adaptive policies in offline RL benchmarks.

研究の動機と目的

  • オフラインRLにおける保守的で静的であるポリシーへの依存を疑問視すること。これは、保守的ハイパーパrameterに敏感であるため、最適でない可能性がある。
  • 認識的不確実性が暗黙の部分的観測可能性を引き起こすため、オフラインRLをベイズ的問題として形式化し、適応的ポリシーの必要性を明示すること。
  • オフラインRLにおけるエピソード内適応を可能にする実用的なアルゴリズムを開発し、静的ポリシーと比較して評価時の性能を向上させること。
  • データが乏しい状況でも、価値関数の仮説の間で動的に選択することで、適応的ポリシーが保守的ポリシーを上回ることを示すこと。

提案手法

  • 認識的不確実性によって誘発される部分的観測マルコフ決定過程(POMDP)としてオフラインRLを形式化し、エージェントのMDPに関する信念が観測された遷移に基づいて進化することを定式化する。
  • 履歴に基づく適応的ポリシーのためのポリシー勾配目的関数を導出する。ここでは、MDPの事後分布と価値関数の分布を用いて不確実性をモデル化する。
  • APE-Vを提案する。これは、Q関数のアンサンブルを維持し、評価時にそれらの間の信念分布を用いて行動選択をガイドする、モデルフリーなアルゴリズムである。
  • 観測された遷移に基づいて信念状態を動的に更新することで、エピソード内適応を実装し、初期の予測が誤っている場合に戦略を切り替えることを可能にする。
  • implicit POMDP目的関数を用いて、データセットと評価中のリアルタイムフィードバックの両方から学習できるように、適応的ポリシーを最適化するポリシー勾配更新を採用する。
  • SAC-nをベースの価値関数学習者として用い、Procgen Mazes や D4RL といったオフラインRLベンチマークにこの手法を適用し、CQL や SAC-n といった保守的ベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1オフラインRLにおける静的で保守的なポリシーは、評価中に新しい情報を適応できないため、保守的ハイパーパrameterに依存して、任意に劣った性能を示す可能性があるか?
  • RQ2データセットの不確実性に起因する暗黙の部分的観測可能性は、オフラインRLにおける適応的行動を必要とするか?
  • RQ3モデルフリーでアンサンブルベースの手法は、オフラインRLにおけるベイズ最適な適応的ポリシーを効果的に近似できるか?
  • RQ4価値関数の信念状態を更新するエピソード内適応は、静的で保守的なポリシーと比較して、評価時の性能を向上させるか?
  • RQ5どのような状況で、適応性が保守的アプローチを上回る顕著な利点を示すか?

主な発見

  • APE-Vは、Procgen環境のホールドアウトマップで79%の成功率を達成し、保守的および非適応的メソッドを上回った。
  • 200個の訓練マップしか用意されていない低データ環境でも、APE-Vはホールドアウトマップで31%の成功率を達成したのに対し、保守的メソッドは23%であった。
  • D4RLでは、APE-Vは中程度の性能と中程度のリプレイデータセットにおいて、SAC-n や CQL を上回り、アンサンブルの各メンバーの平均報酬を上回った。
  • D4RLにおける適応的ポリシーは、常に固定された価値関数の選択を上回り、推論時に動的信念更新がもたらす利点を示した。
  • データ分布に曖昧さが少ないタスク、例えばエキスパートポリシーやランダムポリシーが収集したデータのようなものでは、適応性による向上は限定的であった。
  • 結果は、不確実性下で静的ポリシーが任意に劣った性能を示す可能性があるため、最適なオフラインRL性能を達成するには適応性が必要であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。