Skip to main content
QUICK REVIEW

[論文レビュー] Bandit problems with Levy payoff processes

Asaf Cohen, Eilon Solan|ArXiv.org|Jun 4, 2009
Stochastic processes and financial applications被引用数 9
ひとこと要約

本稿は、連続時間における2腕の Lévy バンディット問題を研究している。一方の腕は一定報酬をもたらし、他方の腕は Lévy プロセス(ブラウン運動とジャンプを併せ持つ)によって支配される確率的報酬をもたらす。正則性条件下では、最適戦略は一意のカットオフルールである:リスクの高い腕がハイタイプであるという事後確信度が閾値を上回る間は実験を続け、それより低いと安全な腕に切り替える。本稿では、非線形常微分方程式系の解を用いて、カットオフ点および最適報酬の明示的公式を導出する。

ABSTRACT

We study two-armed Levy bandits in continuous-time, which have one safe arm that yields a constant payoff s, and one risky arm that can be either of type High or Low; both types yield stochastic payoffs generated by a Levy process. The expectation of the Levy process when the arm is High is greater than s, and lower than s if the arm is Low. The decision maker (DM) has to choose, at any given time t, the fraction of resource to be allocated to each arm over the time interval [t,t+dt). We show that under proper conditions on the Levy processes, there is a unique optimal strategy, which is a cut-off strategy, and we provide an explicit formula for the cut-off and the optimal payoff, as a function of the data of the problem. We also examine the case where the DM has incorrect prior over the type of the risky arm, and we calculate the expected payoff gained by a DM who plays the optimal strategy that corresponds to the incorrect prior. In addition, we study two applications of the results: (a) we show how to price information in two-armed Levy bandit problem, and (b) we investigate who fares better in two-armed bandit problems: an optimist who assigns to High a probability higher than the true probability, or a pessimist who assigns to High a probability lower than the true probability.

研究の動機と目的

  • Lévy プロセスを報酬生成子として用いる不確実性下での動的意思決定をモデル化すること。
  • 2腕のバンディット問題における Lévy 報酬に対して、最適戦略がカットオフ戦略である条件を確立すること。
  • モデルパラメータの関数として最適カットオフ点および期待報酬の明示的公式を導出すること。
  • 意思決定者がリスクのある腕のタイプについて誤った信念を持っている場合、期待報酬に及ぼす誤った事前分布の影響を分析すること。
  • 得られた結果を情報価格付けに応用し、バンディット設定における楽観的思考者と悲観的思考者のパフォーマンスを比較すること。

提案手法

  • 2つの腕(安全な腕(一定報酬 s)、リスクのある腕(2つのタイプ:ハイまたはロウの可能性を有する Lévy プロセス))をもつバンディット問題を、連続時間における最適制御問題としてモデル化する。
  • 観察された Lévy プロセスの経路に基づき、リスクのある腕がハイタイプである確率の事後確信度をベイズ更新によって追跡する。
  • 最適期待報酬の動的プログラミング方程式を定式化し、価値関数と事後確信度を含む非線形常微分方程式系を導出する。
  • 常微分方程式系を解き、モデルパラメータ(s, g1, g2, g1', g2', など)の関数として最適カットオフ点 p* の明示的表現を導出する。
  • 最適戦略が閾値ルールとして特徴付けられることを示す:信念度が p* より高い間は探索を継続し、それ以下なら安全な腕に切り替える。
  • 解を用いて、誤った事前分布を用いた場合の期待報酬を計算し、楽観的思考者と悲観的思考者のパフォーマンスを比較する。

実験結果

リサーチクエスチョン

  • RQ1連続時間の Lévy プロセス報酬を有する2腕の Lévy バンディット問題において、一意の最適カットオフ戦略が存在する条件は何か?
  • RQ2モデルのパラメータの関数として、最適カットオフ点およびそれに伴う最適期待報酬の明示的公式は何か?
  • RQ3意思決定者がリスクのある腕のタイプについて誤った事前分布を使用する場合、期待報酬はどのように変化するか?
  • RQ4最適戦略の価値に基づいて、この2腕の Lévy バンディット枠組みにおいて情報はどのように価格付けできるか?
  • RQ5楽観的思考者(ハイタイプの確率を高めに推定)と悲観的思考者(低めに推定)のどちらが、最適戦略下でより高い期待報酬を達成するか?

主な発見

  • 最適戦略は一意のカットオフ戦略である:意思決定者は、リスクのある腕がハイタイプであるという事後確信度が閾値 p* を上回る間は実験を続け、信念度が p* を下回ると安全な腕に切り替える。
  • カットオフ点 p* は、Lévy プロセスのドリフトおよびジャンプ特性と安全な腕の報酬 s を含む非線形方程式の解として明示的に導出される。
  • 最適期待報酬は、初期信念度 p0、カットオフ点 p*、Lévy プロセスおよび安全な腕のパラメータに依存する閉形式の式で与えられる。
  • 意思決定者が誤った事前分布を使用する場合、正しい事前分布を用いた場合より期待報酬は厳密に低くなり、その損失は導出された価値関数によって定量的に評価できる。
  • 常微分方程式系の解 α が α > 1 を満たす場合、楽観的思考者(q0 > p0)は悲観的思考者(q0 < p0)を上回るパフォーマンスを達成するが、そうでない場合、特定の信念範囲では悲観的思考者が優位になる可能性がある。
  • 本稿では、情報に正の価値があることを確立した:最適戦略の期待報酬は事前分布の精度が高くなるにつれて増加し、導出された公式を用いて情報の価値を明示的に価格付けできる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。