[論文レビュー] On the Complexity of Adversarial Decision Making
本稿では、モデルクラスの凸包に適用された意思決定推定係数(DEC)が、敵対的意思決定(構造的バンディットおよび敵対的ダイナミクスを伴う強化学習を含む)において、低レグレットを達成するための必要十分条件であることを確立している。主な結果は、モデルクラスの凸化が、敵対的設定におけるレジリエンスの統計的コストを規定することを示している。
A central problem in online learning and decision making -- from bandits to reinforcement learning -- is to understand what modeling assumptions lead to sample-efficient learning guarantees. We consider a general adversarial decision making framework that encompasses (structured) bandit problems with adversarial rewards and reinforcement learning problems with adversarial dynamics. Our main result is to show -- via new upper and lower bounds -- that the Decision-Estimation Coefficient, a complexity measure introduced by Foster et al. in the stochastic counterpart to our setting, is necessary and sufficient to obtain low regret for adversarial decision making. However, compared to the stochastic setting, one must apply the Decision-Estimation Coefficient to the convex hull of the class of models (or, hypotheses) under consideration. This establishes that the price of accommodating adversarial rewards or dynamics is governed by the behavior of the model class under convexification, and recovers a number of existing results -- both positive and negative. En route to obtaining these guarantees, we provide new structural results that connect the Decision-Estimation Coefficient to variants of other well-known complexity measures, including the Information Ratio of Russo and Van Roy and the Exploration-by-Optimization objective of Lattimore and György.
研究の動機と目的
- 敵対的意思決定設定における標本効率的学習が可能となる構造的条件を特定すること。
- 特に強化学習および構造的バンディットにおいて、敵対的報酬およびダイナミクスの下でのオンライン学習の統計的複雑性を理解すること。
- 確率的と敵対的意思決定の間のギャップを埋め、レグレット最小化の必要十分条件を特定すること。
- DECと情報比や最適化による探索といった他の複雑性測度との正式な関係を確立すること。
- モデルクラスの凸包に依存する、タイトな上界および下界のレグレットを提供することにより、敵対的環境におけるレジリエンスのコストを明らかにすること。
提案手法
- 敵対的選択が可能なモデルを備えた、構造的観測における意思決定(DMSO)フレームワークの敵対的変種を導入する。
- 敵対的設定における意思決定推定係数(DEC)を定義し、その凸化されたバージョンがレグレットバウンドを規定することを証明する。
- 新しい構造的解析を用いて、モデルクラスの凸包におけるDECが、低レグレットのための必要十分条件であることを示す。
- 凸化されたDECと既存の複雑性測度(情報比(Russo & Van Roy, 2018)および最適化による探索目的関数(Lattimore & György, 2021))との関係を確立する。
- 還元に基づく議論を用いて、族のMDPを構築し、それらの凸化下での挙動を分析することで、レグレットの下界を導出する。
- ミニマックス議論と、MDPの巧みな摂動を用いて、状態数および行動数に比例するスケーリングを持つDECの下界を導出する。
実験結果
リサーチクエスチョン
- RQ1モデルクラスのどのような構造的性質が、敵対的意思決定におけるミニマックスレグレットを決定するか?
- RQ2意思決定推定係数(DEC)は、敵対的設定で低レグレットを達成するための十分かつ必要条件か?
- RQ3モデルクラスの凸化が、敵対的意思決定の複雑性にどのように影響するか?
- RQ4DECと情報比や最適化による探索といった既知の複雑性測度との関係は何か?
- RQ5凸化されたDECを用いて、敵対的強化学習および構造的バンディットにおけるタイトなレグレットバウンドを導出できるか?
主な発見
- 凸化された意思決定推定係数(DEC)は、敵対的意思決定において低レグレットを達成するための必要十分条件である。
- 適切な尾部挙動を有する任意のアルゴリズムについて、最適なレグレットは、凸化されたDECの局所化されたバージョンによって下から抑えられる。
- 本稿では、凸化されたDECに比例するようにスケーリングされる、上界のレグレットバウンドを確立しており、これがDECの十分性を証明している。
- 下界の構築により、モデルクラスの凸包におけるDECが根本的な複雑性測度であることが示され、表計算MDPでは下界が $ \frac{A^{\text{min}\{S-1,H,K\}}}{24\gamma} $ に達することが判明した。
- 結果は、敵対的バンディットおよび強化学習における、既存の肯定的および否定的結果を回復・統合している。
- 解析により、敵対的設定におけるレジリエンスのコストが、モデルクラスの凸化下での挙動によって規定されることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。