Skip to main content
QUICK REVIEW

[論文レビュー] Partially Observable Risk-Sensitive Stopping Problems in Discrete Time

Nicole Bäuerle, Ulrich Rieder|arXiv (Cornell University)|Mar 28, 2017
Risk and Portfolio Optimization参考文献 19被引用数 3
ひとこと要約

本稿は、凹型効用関数から導かれる確実性等価を用いてリスク志向性をモデル化することで、離散時間における部分的に観測可能なリスク感受性最適停止問題を解く一般枠組みを構築する。最適停止時刻の存在を証明し、リスク回避性の増加が停止時刻の遅れをもたらすことを示し、指数型効用関数下でのベイジアン・ハウスセリング問題における予備価格の明示的再帰的アルゴリズムを提示する。

ABSTRACT

In this paper we consider stopping problems with partial observation under a general risk-sensitive optimization criterion for problems with finite and infinite time horizon. Our aim is to maximize the certainty equivalent of the stopping reward. We develop a general theory and discuss the Bayesian risk-sensitive house selling problem as a special example. In particular we are able to study the influence of the attitude towards risk of the decision maker on the optimal stopping rule.

研究の動機と目的

  • 有限および無限時間ホライズンを持つ部分観測可能なマルコフ過程へのリスク感受性最適停止理論の拡張を目的とする。
  • 効用関数がリスク志向性を捉えるように、確実性等価を確率的報酬の最適化基準として用いる意思決定のモデル化を目的とする。
  • 最適停止時刻の存在条件を確立し、その計算のための再帰的アルゴリズムの開発を目的とする。
  • リスク回避性が最適停止ルールに与える影響、特にベイジアン・ハウスセリング問題における影響を分析することを目的とする。
  • 部分情報と指数型効用関数を想定した状況下で、既存のリスク中立的結果をリスク感受性ケースに一般化することを目的とする。

提案手法

  • 最適化基準として、$ U $ を凹型効用関数とするときの確実性等価 $ \rho_U(X) = U^{-1}(\mathbb{E}[U(X)]) $ を用いる。
  • リスク感受性を特徴付けるために、アーロウ=プラットの絶対的リスク回避度 $ l_U(x) = -U''(x)/U'(x) $ を適用する。
  • 信念状態 $ \mu_n $ と蓄積コスト $ s_n $ を用いた、有限ホライズン問題の再帰的価値反復アルゴリズムを構築する。
  • 部分観測系における各観測後の事後信念を伝搬するための更新作用素 $ \Phi $ を導入する。
  • 無限ホライズンケースにおける予備価格の固定点方程式を導出し、特に指数型効用 $ U(x) = \frac{1}{\gamma}e^{\gamma x} $($ \gamma < 0 $)の下で検討する。
  • 後退帰納法により導かれる時刻および信念依存の予備価格 $ x_{n,\infty}^*(\mu) $ に基づく停止ルールの最適性を証明する。

実験結果

リサーチクエスチョン

  • RQ1一般効用関数を用いた部分観測可能な離散時間システムにおけるリスク感受性最適停止問題をどのように定式化できるか?
  • RQ2不完全情報を持つベイジアンモデルにおいて、リスク回避性が最適停止時刻に与える影響は何か?
  • RQ3無限ホライズンケースにおいて予備価格を特徴づけることは可能か?また、それらは信念状態および時刻にどのように依存するか?
  • RQ4効用関数の選択が最適停止ルールの構造に与える影響は何か?
  • RQ5最適停止時刻が存在する条件は何か?また、再帰的に計算可能か?

主な発見

  • 最適停止時刻は、時刻および信念状態に依存する予備価格 $ x_{n,\infty}^*(\mu) $ によって特徴づけられ、再帰的固定点方程式により計算可能である。
  • 指数型効用 $ U(x) = \frac{1}{\gamma}e^{\gamma x} $($ \gamma < 0 $)の下では、予備価格は $ x_{\infty}^*(\mu) = -c + \frac{1}{\gamma}\ln\left(\int e^{\gamma \max\{x, x_{\infty}^*(\Phi(x,\mu))\}} Q(dx|\mu)\right) $ を満たす。
  • 一般条件下では、厳密に負の継続コストが存在する場合でさえも、最適停止時刻はほとんど確実に有限である。
  • よりリスク回避性の強い意思決定者($ \gamma $ が小さい)は、リスク回避性の増加に伴い停止時刻が遅れることを示す、$ x_{n,\infty}^*(\mu, U) $ のリスク回避性に関する単調性により裏付けられる。
  • 効用関数がDARA(絶対的リスク回避度が減少)であるとき、予備価格 $ x_{n,\infty}^*(\mu) $ は時刻 $ n $ に対して単調に減少する。
  • 価値関数は有界であり、動的計画法の原理を満たしており、最適方策の再帰的計算が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。