Skip to main content
QUICK REVIEW

[論文レビュー] Corruption-Robust Offline Reinforcement Learning

Xuezhou Zhang, Yiding Chen|arXiv (Cornell University)|Jun 11, 2021
Adversarial Robustness in Machine Learning参考文献 45被引用数 7
ひとこと要約

本稿は、腐敗に強いオフライン強化学習アルゴリズムを提案し、攻撃的データ腐敗下でも近似的最適性能を達成する。ロバストな教師あり学習オラクルと、新たな懸念バイアスを用いる。線形MDPにおいて、根本的な$Ω(d\varepsilon)$の最適性ギャップを確立し、オフライン設定におけるアグノスティックな学習のためには腐敗レベル$ε$を知ることが必要であることを証明する。これは、オフラインとオンラインのロバスト強化学習の間の重要な難易度の差を示している。

ABSTRACT

We study the adversarial robustness in offline reinforcement learning. Given a batch dataset consisting of tuples $(s, a, r, s')$, an adversary is allowed to arbitrarily modify $ε$ fraction of the tuples. From the corrupted dataset the learner aims to robustly identify a near-optimal policy. We first show that a worst-case $Ω(dε)$ optimality gap is unavoidable in linear MDP of dimension $d$, even if the adversary only corrupts the reward element in a tuple. This contrasts with dimension-free results in robust supervised learning and best-known lower-bound in the online RL setting with corruption. Next, we propose robust variants of the Least-Square Value Iteration (LSVI) algorithm utilizing robust supervised learning oracles, which achieve near-matching performances in cases both with and without full data coverage. The algorithm requires the knowledge of $ε$ to design the pessimism bonus in the no-coverage case. Surprisingly, in this case, the knowledge of $ε$ is necessary, as we show that being adaptive to unknown $ε$ is impossible.This again contrasts with recent results on corruption-robust online RL and implies that robust offline RL is a strictly harder problem.

研究の動機と目的

  • 攻撃的ロバストネスを、データ腐敗下でのオフライン強化学習において研究する。ここでの敵対的攻撃は、データセットの最大$\varepsilon$の割合を腐敗させることができる。
  • 線形MDPにおいて$\varepsilon$-腐敗下での最適性ギャップに関する情報理論的下界を確立する。
  • ロバストな教師あり学習オラクルを活用し、近似的最適性能を達成する、最小二乗価値反復(LSVI)のロバストな変種を設計する。
  • オフライン設定において、$\varepsilon$を事前に知らない状態で学習する「アグノスティックな学習」が可能かどうかを調査する。これは、オンラインRLの結果と対比する。
  • オフラインRLにおける完全データカバレッジ仮定を弱めるために、比較政策に関する相対的条件数に基づく部分的カバレッジ条件を導入する。

提案手法

  • 腐敗データに対処するため、ロバストな教師あり学習オラクルを統合した、腐敗に強いLS-VIアルゴリズムを提案する。
  • 既知の腐敗レベル$\varepsilon$に依存する、新たな懸念バイアス項を導入し、完全なデータカバレッジがなくてもロバスト性を確保する。
  • 相対的条件数に基づく仮定を用いて、完全カバレッジ要件を緩和し、部分的カバレッジ下でも学習を可能にする。
  • 2つの環境構成を用いて、$\varepsilon$を知らない状態でのアグノスティックな学習が、オフラインRLでは不可能であることを証明する。この証明は、ヘルパー政策が存在する場合でさえ成立する。
  • 腐敗下における線形MDPの最悪ケースの最適性ギャップを分析し、下界$\Omega(Hd\varepsilon)$を示す。
  • 提案されたアルゴリズムが、完全カバレッジおよび部分的カバレッジの両設定において、下界にほぼ一致する性能を達成することを示す。

実験結果

リサーチクエスチョン

  • RQ1オフライン強化学習において$\varepsilon$-割合のデータ腐敗下で、ロバストな最適方策同定の根本的限界は何か?
  • RQ2腐敗に強いオフラインRLアルゴリズムは、完全カバレッジおよび部分的カバレッジ仮定の両方で近似的最適性能を達成できるか?
  • RQ3オンラインRLとは対照的に、$\varepsilon$を知らない状態で良好な性能を達成できる「アグノスティックな学習」は、オフラインRLで可能か?
  • RQ4MDPの相対的条件数は、部分的カバレッジ下でのロバストなオフライン学習の可能性にどのように影響するか?
  • RQ5データ腐敗の下で、なぜロバストなオフラインRLはロバストなオンラインRLよりも厳密に難しいのか?このギャップを説明する構造的差異は何か?

主な発見

  • 線形MDPにおいて、$\varepsilon$-腐敗下でも、報酬のみが腐敗しても、$\Omega(Hd\varepsilon)$の最適性ギャップは避けられない。
  • 提案された腐敗に強いLS-VIアルゴリズムは、完全カバレッジおよび部分的カバレッジの両設定で、下界にほぼ一致する性能を達成する。
  • 完全なデータカバレッジがない状況では、$\varepsilon$を知ることがロバスト学習に不可欠である。アグノスティックな学習は不可能であり、これはオンラインRLとは明確な分離を示している。
  • 相対的条件数に基づく部分的カバレッジ仮定は、Jinら(2020)の完全カバレッジ仮定よりも厳密に弱い。これは、腐敗なしの状況でも同様に成り立つ。
  • 腐敗レベル$\varepsilon$を知ることが必要であることを示すために用いられた構成は、オフライン設定ではポリシーに沿ったデータ収集ができないことに依存しており、これが腐敗下での正確な推定を不可能にする。
  • 本稿では、部分的カバレッジの下界における$\sqrt{\varepsilon}$依存性が、下界の$\varepsilon$依存性と比較して非効率であると特定し、より緊密なバイアス設計の余地があると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。