[論文レビュー] Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning
本稿では、収縮的ベルマンバックアップを用いて、到達・回避集合を近似するスーパーゼロレベル集合を持つ値関数を定義する、無限時間枠の到達・回避ゼロ和ゲームに対する深層強化学習手法を提案する。保守的Q学習を拡張することで、高次元システムにおける安全な制御方策およびバイアビリティカーネルの信頼性ある学習が可能となり、次元の呪いを克服するとともに、敵対的摂動下でも保守的な近似が保証される。
In this paper, we consider the infinite-horizon reach-avoid zero-sum game problem, where the goal is to find a set in the state space, referred to as the reach-avoid set, such that the system starting at a state therein could be controlled to reach a given target set without violating constraints under the worst-case disturbance. We address this problem by designing a new value function with a contracting Bellman backup, where the super-zero level set, i.e., the set of states where the value function is evaluated to be non-negative, recovers the reach-avoid set. Building upon this, we prove that the proposed method can be adapted to compute the viability kernel, or the set of states which could be controlled to satisfy given constraints, and the backward reachable set, or the set of states that could be driven towards a given target set. Finally, we propose to alleviate the curse of dimensionality issue in high-dimensional problems by extending Conservative Q-Learning, a deep reinforcement learning technique, to learn a value function such that the super-zero level set of the learned value function serves as a (conservative) approximation to the reach-avoid set. Our theoretical and empirical results suggest that the proposed method could learn reliably the reach-avoid set and the optimal control policy even with neural network approximation.
研究の動機と目的
- 高次元システムにおける最悪の摂動下での無限時間枠の到達・回避ゼロ和ゲームを解く課題に対処すること。
- 深層強化学習を用いてハミルトニアン=ジャコビ到達可能性解析における次元の呪いを克服すること。
- スーパーゼロレベル集合が到達・回避集合、バイアビリティカーネル、および後向き到達集合を回復する値関数を開発すること。
- 修正された保守的Q学習フレームワークを用いて、安全を要する集合の保守的近似を保証すること。
- 敵対的不確実性と長時間枠制約下での自律システムの信頼性ある方策学習を可能にすること。
提案手法
- スーパーゼロレベル集合が到達・回避集合に対応する値関数を定義する収縮的ベルマンバックアップを提案する。
- 誤差が有界となるように設計された修正された保守的Q学習アルゴリズムを導入し、到達・回避集合の保守的近似を保証する。
- 時間割引値関数を用い、γ → 1 の極限にかけて徐々に緩和することで、無限時間枠の挙動をモデル化する。
- ベルマン更新において制御入力と摂動入力を用いたミニマックス定式化を採用し、最悪の性能を捉える。
- 値関数にニューラルネットワーク関数近似を適用し、高次元状態空間へのスケーラビリティを実現する。
- 学習された値関数が真の値関数に対して境界を満たすことを証明し、理論的収束性と保守性を保証する。
実験結果
リサーチクエスチョン
- RQ1敵対的摂動下での無限時間枠ゼロ和ゲームにおいて、深層強化学習手法が到達・回避集合を信頼性高く近似できるか?
- RQ2保守的関数近似を用いた深層RLにより、ハミルトニアン=ジャコビ到達可能性における次元の呪いをどのように軽減できるか?
- RQ3提案手法により、バイアビリティカーネルと後向き到達集合が到達・回避集合の特別なケースとして計算可能か?
- RQ4保守的Q学習を組み合わせた収縮的ベルマンバックアップは、安全を要する集合の保守的かつ安定した学習を保証するか?
- RQ5高次元システムにおける学習された値関数の収束性と保守性について、どのような理論的保証を提供できるか?
主な発見
- 提案手法は、高次元システムでさえも、深層ニューラルネットワークを用いて到達・回避集合の保守的近似を的確に学習可能である。
- 学習された値関数のスーパーゼロレベル集合は、保守性に関する理論的保証とともに、到達・回避集合を正確に回復する。
- 報酬関数と制約関数の調整により、バイアビリティカーネルと後向き到達集合の両方を特別なケースとして一般化可能である。
- 理論的分析により、学習された値関数が真の値関数からγ重み付き誤差項を引いた値と定数を引いた値の間で境界を満たすことが示され、収束性が保証される。
- 実験結果により、敵対的摂動下でも最適制御方策と安全な状態集合の信頼性ある学習が示された。
- 保守的Q学習のこの設定への拡張により、安定した学習が可能となり、値関数推定の過大評価が防止された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。