[論文レビュー] Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL
この論文では、不確実性の推定を必要とせずに、性能とドメイン一般化能力を向上させるために、適応的行動事前分布と学習済みのダイナミクスモデルを組み合わせた、モデルベースのオフライン強化学習アルゴリズムMABEを提案する。MABEはD4RLベンチマークで最先端の性能を達成し、ドメイン間転送においても優れた結果を示す。これは、KLダイバージェンスを用いてポリシーを適応的行動事前分布に正則化することで明示的に制御されているためである。
Offline Reinforcement Learning (RL) aims to extract near-optimal policies from imperfect offline data without additional environment interactions. Extracting policies from diverse offline datasets has the potential to expand the range of applicability of RL by making the training process safer, faster, and more streamlined. We investigate how to improve the performance of offline RL algorithms, its robustness to the quality of offline data, as well as its generalization capabilities. To this end, we introduce Offline Model-based RL with Adaptive Behavioral Priors (MABE). Our algorithm is based on the finding that dynamics models, which support within-domain generalization, and behavioral priors, which support cross-domain generalization, are complementary. When combined together, they substantially improve the performance and generalization of offline RL policies. In the widely studied D4RL offline RL benchmark, we find that MABE achieves higher average performance compared to prior model-free and model-based algorithms. In experiments that require cross-domain generalization, we find that MABE outperforms prior methods. Our website is available at https://sites.google.com/berkeley.edu/mabe .
研究の動機と目的
- 低品質または非エキスパートのオフラインデータが存在する状況における、オフライン強化学習アルゴリズムの性能とロバスト性の向上を目的とする。
- 不確実性の推定に依存せずに、ドメイン一般化能力および転移学習能力を向上させることを目的とする。
- ダイナミクスモデルによるドメイン内一般化と、行動事前分布によるドメイン間一般化を両方活用するモデルベースのRLフレームワークの開発を目的とする。
- 適応的行動事前分布による明示的なポリシー正則化が、不確実性に基づく保守的戦略を上回ることを示すこと。
提案手法
- MABEは、教師付き学習を用いてオフラインデータセットからダイナミクスモデルと報酬関数を学習する。
- データセット内の高報酬軌道に高い重要度を割り当てる適応的行動事前分布を構築する。
- 学習済みのダイナミクスモデルを用いて合成的なロールアウトを生成することで、モデルベースの強化学習を実行する。
- SACを用いてポリシーを訓練するが、KLダイバージェンスのペナルティ項を明示的に導入し、ポリシーが適応的行動事前分布に近づくように正則化することで、保守性を確保する。
- 適応的行動事前分布は強化学習によるファインチューニングによりエンドツーエンドで学習され、重みなしの事前分布よりも安定性と漸近的性能が向上する。
- 不確実性推定を避けるために、適応的行動事前分布を直接の正則化信号として用いることで、複雑な不確実性推定への依存を低減する。
実験結果
リサーチクエスチョン
- RQ1ダイナミクスモデルと適応的行動事前分布を組み合わせることで、従来のモデルフリーおよびモデルベース手法を上回るオフラインRLの性能向上が達成可能か?
- RQ2報酬に基づいて重み付けされた適応的行動事前分布は、重みなしまたは非適応的事前分布と比較して、学習の安定性と最終的なポリシー性能を向上させるか?
- RQ3ダイナミクスモデルにおける不確実性推定を必要とせずに、MABEは強力なゼロショットドメイン転送性能を達成できるか?
- RQ4データ品質の悪化に強く、サンプル効率に優れた点で、MABEはD4RLベンチマークにおいて最先端のオフラインRLアルゴリズムと比較してどうなるか?
主な発見
- MABEはD4RLベンチマークの9つの環境において平均性能が最も高く、9つのデータセットのうち7つでトップスコアを記録した。
- ドメイン間一般化タスクにおいて、MABEは従来の手法を著しく上回り、異なるドメイン間での高い転送性を示した。
- 適応的行動事前分布の導入により、重みなしまたは正則化なしの事前分布と比較して、より安定した学習と優れた漸近的性能が得られた。
- MABEはダイナミクスモデルにおける不確実性推定を必要とせず、高次元または混同が生じやすい設定においても適用可能である。
- アブレーションスタディの結果、行動事前分布の強化学習によるファインチューニングが性能向上に不可欠であり、重みなしの事前分布では劣った結果が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。