Skip to main content
QUICK REVIEW

[論文レビュー] When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning

Jianxiong Li, Xianyuan Zhan|arXiv (Cornell University)|May 23, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、訓練データの凸包に近い幾何的近接度を測る状態条件付き距離関数を用いて、データ分布外への一般化を向上させる、新しいオフライン強化学習手法DOGEを提案する。訓練データに近い幾何的近さに基づく方策の制約により、DOGEは深層Q関数を用いた安全な外挿を可能にし、D4RLベンチマークで最先端の性能を達成するとともに、従来手法に比べて過剰に慎重になるのを軽減する。

ABSTRACT

In offline reinforcement learning (RL), one detrimental issue to policy learning is the error accumulation of deep Q function in out-of-distribution (OOD) areas. Unfortunately, existing offline RL methods are often over-conservative, inevitably hurting generalization performance outside data distribution. In our study, one interesting observation is that deep Q functions approximate well inside the convex hull of training data. Inspired by this, we propose a new method, DOGE (Distance-sensitive Offline RL with better GEneralization). DOGE marries dataset geometry with deep function approximators in offline RL, and enables exploitation in generalizable OOD areas rather than strictly constraining policy within data distribution. Specifically, DOGE trains a state-conditioned distance function that can be readily plugged into standard actor-critic methods as a policy constraint. Simple yet elegant, our algorithm enjoys better generalization compared to state-of-the-art methods on D4RL benchmarks. Theoretical analysis demonstrates the superiority of our approach to existing methods that are solely based on data distribution or support constraints.

研究の動機と目的

  • 訓練データ分布内に制限される既存のオフラインRL手法の過剰な慎重さを是正し、一般化性能を損なわないようにすること。
  • データ分布外(OOD)領域において、データ幾何に基づいて誘導された場合に、深層Q関数が効果的に一般化できるかどうかを調査すること。
  • 深層ネットワークの補間能力を活用しつつ、OOD領域での信頼性の低い外挿を回避する手法を開発すること。
  • 標準のアクター・クリティックフレームワークに幾何的インダクティブバイアスを統合するためのプラグイン型制約機構を設計すること。
  • オンライン相互作用を必要とせず、複雑なアーキテクチャの変更も最小限に抑えた状態で、D4RLベンチマークにおける一般化性能の向上を実証すること。

提案手法

  • 訓練データの凸包に近い状態行動ペアの幾何的近接度を測る状態条件付き距離関数を提案する。
  • 距離関数を学習可能で微分可能である制約として、アクター・クリティックフレームワークに統合し、方策更新を正則化する。
  • ミニバッチ内の距離の上位分位数を表すハイパーパrameter $ G $ を導入し、OOD領域への探索範囲を制御する。
  • 学習済み距離に基づき、訓練データから遠い行動を取る方策に対してペナルティを与える制約付き最適化問題を定式化する。
  • 制約の強制と方策最適化のバランスを取るために、ラグランジュ緩和スキームを用いて距離関数と主なRLコンponentsをエンドツーエンドで訓練する。
  • SACなどの標準的なオフラインRLアルゴリズムに最小限のアーキテクチャ変更を加えて適用し、即挿し可能な統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1訓練データへの幾何的近接度に基づいて誘導された場合に、深層Q関数がデータ分布外領域で信頼性高く一般化できるか?
  • RQ2方策制約にデータセット幾何を組み込むことで、サンプル効率や安全性を損なわずに一般化性能が向上するか?
  • RQ3距離閾値($ G $ による)の選択が、OOD一般化における慎重さとパフォーマンスのトレードオフにどのように影響するか?
  • RQ4単純な幾何に配慮した制約が、単にデータ分布やサポート制約に依存する既存手法を上回ることができるか?
  • RQ5ハイパーパrameter $ G $, $ eta $, および $ N $ の変化に対して、提案手法はどの程度頑健か?

主な発見

  • DOGEはD4RLベンチマークで最先端のパフォーマンスを達成し、MujocoおよびAntMaze環境の複数のタスクでSAC, TD3, CQLなどのSOTA手法を上回った。
  • 過剰な慎重さが顕著に軽減された:例えば、hopper-m-r-v2環境では $ G=50\text{th} $ 分位数で 76.2±17.7 のスコアを達成し、より慎重なベースラインを上回った。
  • アブレーションスタディの結果、$ G=50\text{th} $ 分位数が、多様なタスクにおいて探索と安全性のバランスをとる強固なデフォルト設定であることが示された。
  • $ G=30\text{th} $ 分位数を使用すると、制約の過剰な強制により $ \theta \to \theta_{\text{old}} $ となり、最適性ギャップの支配によりパフォーマンスが低下した。
  • $ G=90\text{th} $ または $ 100\text{th} $ 分位数を使用すると、価値の過剰推定と分散が増加し、hopper-m-r-v2 や walker2d-m-r-v2 などの高分散タスクでパフォーマンスが低下した。
  • ハイパーパrameter $ \beta $ および $ N $ の変更に対しても、性能にほとんど影響を及ぼさないため、強いハイパーパramータ安定性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。