Skip to main content
QUICK REVIEW

[論文レビュー] Robust Reinforcement Learning using Offline Data

Kishan Panaganti, Zaiyan Xu|arXiv (Cornell University)|Aug 10, 2022
Adversarial Robustness in Machine Learning被引用数 15
ひとこと要約

本稿では、オフラインデータのみを用いてモデルの不確実性に対してロバストな方策を学習する、新しいオフライン強化学習アルゴリズムであるロバスト・フィットドQイテレーション(RFQI)を提案する。オフラインロバストRLにおける課題——不偏推定と不確実性集合上の最適化——に取り組むことで、RFQIは著しく優れたロバスト性能を達成し、標準的なFQIが1400にまで低下するのに対し、摂動下で最大3200のエピソード報酬を達成する。これはMuJoCoベンチマークにおける優れた一般化性能を示している。

ABSTRACT

The goal of robust reinforcement learning (RL) is to learn a policy that is robust against the uncertainty in model parameters. Parameter uncertainty commonly occurs in many real-world RL applications due to simulator modeling errors, changes in the real-world system dynamics over time, and adversarial disturbances. Robust RL is typically formulated as a max-min problem, where the objective is to learn the policy that maximizes the value against the worst possible models that lie in an uncertainty set. In this work, we propose a robust RL algorithm called Robust Fitted Q-Iteration (RFQI), which uses only an offline dataset to learn the optimal robust policy. Robust RL with offline data is significantly more challenging than its non-robust counterpart because of the minimization over all models present in the robust Bellman operator. This poses challenges in offline data collection, optimization over the models, and unbiased estimation. In this work, we propose a systematic approach to overcome these challenges, resulting in our RFQI algorithm. We prove that RFQI learns a near-optimal robust policy under standard assumptions and demonstrate its superior performance on standard benchmark problems.

研究の動機と目的

  • 訓練環境とテスト環境のモデルパラメータの不確実性による差異がある状況において、ロバストな方策を学習する課題に対処すること。
  • オンライン相互作用を一切行わず、事前に収集されたデータセットのみを用いて動作するオフライン強化学習アルゴリズムを開発し、モデルの変動に対してロバストであることを維持すること。
  • オフラインロバストRLにおける主な課題——不偏推定、不確実性集合上の最適化、データの分布シフト——を克服すること。
  • 標準的な仮定の下で、近似的に最適なロバスト方策学習を保証する理論的根拠を提供し、フィットドQイテレーションをロバストMDPフレームワークに拡張すること。
  • FQI や TD3 などの非ロバストなオフラインRLベースラインと比較して、標準的なMuJoCoベンチマークにおいて優れたロバスト性を示すこと。

提案手法

  • 不確実性集合内の最悪のモデルにおいて性能を最適化する必要があるという点を踏まえ、ロバストMDP(RMDP)を用いてロバスト強化学習問題を定式化する。
  • Q値の更新時に不確実性集合上でミニマックス最適化を組み込むことで、フィットドQイテレーション(FQI)の拡張版であるRFQIを提案する。
  • 大規模な状態空間に対応するため関数近似を用い、連続制御タスクへのスケーラビリティを実現する。
  • オフラインデータから不確実性集合を推定する体系的なアプローチを導入し、分布シフトにもかかわらず不偏な価値関数更新を実現する。
  • ロバスト性ハイパーパrameter ρ をグリッドサーチで最適化し、ロバスト性と性能のバランスを図る。Hopperではρ=0.5、Half-Cheetahではρ=0.3を採用する。
  • オンラインロールアウトを一切行わず、安全かつ効率的なデプロイメントを実現するため、オフラインデータセット(例:D4RL)を活用して方策を学習する。

実験結果

リサーチクエスチョン

  • RQ1オンラインデータ収集なしに、モデルパramータの摂動に対してオフライン強化学習アルゴリズムがロバストな性能を達成できるか?
  • RQ2不確実性集合上のミニマックス最適化を、オフラインFQIに効果的に統合することで、安定的かつ不偏な学習を実現できるか?
  • RQ3オフラインデータの質と代表性が、学習された方策のロバスト性に与える影響は何か?
  • RQ4環境の摂動が変化する条件下で、RFQIはFQI や TD3 といった非ロバストなオフラインベースラインと比べてどのように差をつけるか?
  • RQ5ロバスト性が失敗する条件は何か?また、データカバレッジはロバスト方策学習の制限要因または促進要因として果たす役割は何か?

主な発見

  • Hopper環境では、RFQIは30%のjoint_damping摂動下でも3000のエピソード報酬を達成したのに対し、FQIはわずか1400にまで低下した。
  • Half-Cheetahでは、50%を超えるactuator_ctrlrange摂動下でもRFQIは約5500の報酬を維持したが、FQIは4300にまで低下した。
  • Hopperでは、重力、joint_damping、joint_frictionlossのすべてのテスト摂動において、RFQIが滑らかに性能を低下させ、FQIを常に上回った。
  • D4RLベンチマークデータセットにおいて、RFQIは複数のモデルパラメータにわたりロバスト性を示し、FQIが急激に劣化するのに対し、性能が安定した。
  • 一部のケース(例:Hopperにおけるactuator_ctrlrange や thigh_joint_stiffness)では、RFQIとFQIの性能が類似していたため、特定のパラメータに関してはデータカバレッジの制限が顕在した。
  • RFQIのロバスト性はオフラインデータの質に敏感である。摂動されたパラメータを適切にカバーしていないデータの場合、性能向上が顕著でなくなるため、データ依存性が顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。