QUICK REVIEW
[论文解读] Partially Observable Risk-Sensitive Stopping Problems in Discrete Time
Nicole Bäuerle, Ulrich Rieder|arXiv (Cornell University)|Mar 28, 2017
Risk and Portfolio Optimization参考文献 19被引用 3
一句话总结
本文提出了一套通用框架,用于求解离散时间下部分可观测的风险敏感最优停时问题,利用由凹函数效用导出的确定等价性来建模风险偏好。证明了最优停时的存在性,并表明风险规避程度越高,停时越晚,同时在指数效用下的贝叶斯房屋出售问题中,给出了计算保留水平的显式递归算法。
ABSTRACT
In this paper we consider stopping problems with partial observation under a general risk-sensitive optimization criterion for problems with finite and infinite time horizon. Our aim is to maximize the certainty equivalent of the stopping reward. We develop a general theory and discuss the Bayesian risk-sensitive house selling problem as a special example. In particular we are able to study the influence of the attitude towards risk of the decision maker on the optimal stopping rule.
研究动机与目标
- 将风险敏感最优停时理论扩展至具有有限和无限时域的局部可观测马尔可夫过程。
- 使用随机收益的确定等价性来建模风险下的决策行为,其中效用函数捕捉风险偏好。
- 建立最优停时存在性的条件,并开发其计算的递归算法。
- 分析风险规避性如何影响最优停时规则,特别是在贝叶斯房屋出售问题中。
- 将现有的风险中性结果推广至具有部分信息和指数效用的风险敏感情形。
提出的方法
- 使用确定等价性 $ \rho_U(X) = U^{-1}(\mathbb{E}[U(X)]) $ 作为优化准则,其中 $ U $ 为凹效用函数。
- 应用 Arrow-Pratt 绝对风险规避度量 $ l_U(x) = -U''(x)/U'(x) $ 来表征风险敏感性。
- 针对有限时域问题,基于信念状态 $ \mu_n $ 和累积成本 $ s_n $,开发了递归值迭代算法。
- 引入一个更新算子 $ \Phi $,用于在部分可观测系统中每次观测后传播后验信念。
- 推导了无限时域情况下的保留水平固定点方程,特别是在指数效用 $ U(x) = \frac{1}{\gamma}e^{\gamma x} $($ \gamma < 0 $)下。
- 证明了基于时间与信念相关保留水平 $ x_{n,\infty}^*(\mu) $ 的停时规则是最优的,这些水平通过向后归纳法导出。
实验结果
研究问题
- RQ1如何在具有通用效用函数的部分可观测离散时间系统中,形式化风险敏感最优停时问题?
- RQ2在不完全信息的贝叶斯模型中,风险规避性对最优停时有何影响?
- RQ3在无限时域情况下,能否对保留水平进行表征?它们如何依赖于信念状态和时间?
- RQ4效用函数的选择如何影响最优停时规则的结构?
- RQ5在何种条件下最优停时存在?是否能够递归计算?
主要发现
- 最优停时由依赖于时间和信念的保留水平 $ x_{n,\infty}^*(\mu) $ 表征,这些水平通过递归固定点方程计算得出。
- 对于指数效用 $ U(x) = \frac{1}{\gamma}e^{\gamma x} $($ \gamma < 0 $),保留水平满足 $ x_{\infty}^*(\mu) = -c + \frac{1}{\gamma}\ln\left(\int e^{\gamma \max\{x, x_{\infty}^*(\Phi(x,\mu))\}} Q(dx|\mu)\right) $。
- 在一般条件下,即使运行成本严格为负,最优停时也几乎必然有限。
- 风险规避性更强的决策者($ \gamma $ 更小)会更晚停止,这由 $ x_{n,\infty}^*(\mu, U) $ 在风险规避性上的单调性所证明。
- 当效用函数为 DARA(递减绝对风险规避)时,保留水平 $ x_{n,\infty}^*(\mu) $ 随时间 $ n $ 递减。
- 值函数有界,并满足动态规划原理,从而支持最优策略的递归计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。