Skip to main content
QUICK REVIEW

[論文レビュー] Faster Rates for Policy Learning

Alexander R. Luedtke, Antoine Chambaz|arXiv (Cornell University)|Apr 21, 2017
Advanced Bandit Algorithms Research参考文献 14被引用数 7
ひとこと要約

本稿は、一般な条件下において、最適方針学習における通常の n^{-1/2} よりも速いレジーム減衰率を確立する。Donsker 集合上の経験的リスク最小化が、マージン仮定なしに2次レジーム減衰を達成することを示している。さらに、マージン条件が成り立つ場合には、プラグイン推定量が ERM よりも速いレジーム減衰率を達成できることを示している。これらの結果は、個別化医療およびコンテキストバンドイット問題への応用を含む。

ABSTRACT

This article improves the existing proven rates of regret decay in optimal policy estimation. We give a margin-free result showing that the regret decay for estimating a within-class optimal policy is second-order for empirical risk minimizers over Donsker classes, with regret decaying at a faster rate than the standard error of an efficient estimator of the value of an optimal policy. We also give a result from the classification literature that shows that faster regret decay is possible via plug-in estimation provided a margin condition holds. Four examples are considered. In these examples, the regret is expressed in terms of either the mean value or the median value; the number of possible actions is either two or finitely many; and the sampling scheme is either independent and identically distributed or sequential, where the latter represents a contextual bandit sampling scheme.

研究の動機と目的

  • 本稿の目的は、標準的な n^{-1/2} のレートを超えて、最適方針推定におけるレジーム減衰レートを改善することである。
  • 制限的なマージン仮定に依存せずに、より速いレートが達成可能かどうかを調査することである。
  • 研究は、Donsker 集合内での経験的リスク最小化(ERM)およびマージン条件の下でのプラグイン推定量の推定に焦点を当てる。
  • これらの結果は、独立同一分布および逐次的(コンテキストバンドイット)サンプリング方式を含む、個別化医療における個別化治療ルールへの応用に適用される。
  • より速いレジーム収束が達成可能な一般な条件を確立することである。

提案手法

  • 分析は、Donsker 集合上での経験的リスク最小化(ERM)を用いて最適方針を推定する。
  • P-Donsker 集合内での一様収束および連続性の議論を通じて、レジーム減衰レートを確立する。
  • 本稿は、方針学習を分類理論と結びつけ、マージン条件を活用してより速いレートを導出する。
  • 価値関数の差の安定性を保証するため、方針のLipschitz連続変換を導入する。
  • 証明は、経験過程の一様連続性および条件付き密度の有界性に依存する。
  • 関数的デルタ法および経験過程論を用いて、レジームを経験過程ノルムの観点から評価する。

実験結果

リサーチクエスチョン

  • RQ1マージン仮定なしに、方針学習における n^{-1/2} より速いレジーム減衰率を確立できるか?
  • RQ2Donsker 集合上での経験的リスク最小化が、2次レジーム減衰をもたらすか?
  • RQ3プラグイン推定量が ERM よりも速いレジーム減衰率を達成できる条件は何か?
  • RQ4マージン条件が方針学習におけるレジーム減衰レートにどのように影響するか?
  • RQ5異なるサンプリング方式の下で、方針価値の連続性とレジーム減衰の関係は何か?

主な発見

  • Donsker 集合上での経験的リスク最小化のレジームは、効率的推定量の標準誤差よりも速い2次レートで減衰する。
  • 本稿は、いかなるマージン条件も要しない状況で、レジーム減衰が n^{-1/2} を超えて速くなる可能性を確立している。
  • マージン条件が成り立つ場合、プラグイン推定量は ERM よりもさらに速いレジーム減衰率を達成する。
  • 方針間の価値関数差は、方針差の L2(P)-ノルムによって有界であり、安定性が保証される。
  • マージン条件および有界密度仮定の下で、写像 π ↦ ˙Fπ(V(π)) は一様連続である。
  • 結果は、独立同一分布および逐次的(コンテキストバンドイット)サンプリング方式の両方に対して成り立ち、個別化医療への応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。