Skip to main content
QUICK REVIEW

[论文解读] Process-Based Risk Measures and Risk-Averse Control of Discrete-Time Systems

Jingnan Fan, Andrzej Ruszczyński|arXiv (Cornell University)|Nov 11, 2014
Risk and Portfolio Optimization参考文献 43被引用 5
一句话总结

本文为受控离散时间随机过程引入了基于过程的风险度量,聚焦于马尔可夫决策过程中的风险规避控制。提出了一种新颖的随机条件时间一致性概念,通过在状态空间函数上使用静态、分布不变的风险度量,实现了动态规划公式的构建,推广了先前的方法,并为风险规避马尔可夫控制问题提供了理论基础。

ABSTRACT

For controlled discrete-time stochastic processes we introduce a new class of dynamic risk measures, which we call process-based. Their main features are that they measure risk of processes that are functions of the history of a base process. We introduce a new concept of conditional stochastic time consistency and we derive the structure of process-based risk measures enjoying this property. We show that they can be equivalently represented by a collection of static law-invariant risk measures on the space of functions of the state of the base process. We apply this result to controlled Markov processes and we derive dynamic programming equations.

研究动机与目标

  • 为现有受控马尔可夫过程动态风险度量理论中的局限性(尤其是时间一致性和分布不变性方面)提供解决方案。
  • 构建一个统一的风险规避控制框架,以推广效用模型、指数模型和均值-方差模型。
  • 提出一种新的随机条件时间一致性概念,支持通过状态相关风险映射实现递归风险评估。
  • 为一般受控马尔可夫过程下的风险规避控制推导出动态规划方程。
  • 为基于过程的风险度量提供严格的理论基础,解决先前工作中存在的临时构造问题。

提出的方法

  • 引入基于过程的风险度量,用于评估受控过程整个样本路径的风险,重点关注形式为 $ Z_t = c_t(X_t, u_t) $ 的代价函数。
  • 提出一种新的时间一致性概念——随机条件时间一致性,基于条件分布和随机优势,而非逐点比较。
  • 将满足该性质的风险度量表征为定义在状态空间 $ \mathcal{X} $ 上函数族的静态、分布不变风险度量。
  • 通过在状态空间函数上定义的一步映射递归表达风险度量,推导出动态规划方程。
  • 在概率测度的弱收敛下,建立风险映射的弱连续性和下确界连续性,确保优化过程的稳定性。
  • 将该框架应用于受控马尔可夫过程,恢复并推广了文献 [40] 的早期结果,具有更广泛的应用范围。

实验结果

研究问题

  • RQ1在受控离散时间系统中,如何对整个随机过程一致地定义动态风险度量?
  • RQ2在受控马尔可夫过程背景下,风险度量必须具备何种形式,才能确保随机条件时间一致性?
  • RQ3能否在保持递归结构的前提下,使用状态空间函数上的静态、分布不变风险度量来表述风险规避控制问题?
  • RQ4基于过程的风险度量如何推广现有的效用模型、熵型模型和均值-方差方法?
  • RQ5何种条件可确保结果风险映射的连续性和下确界连续性,以满足优化需求?

主要发现

  • 本文证明,满足随机条件时间一致性的基于过程的风险度量,等价于定义在状态空间函数族上的静态、分布不变风险度量族。
  • 在一般受控转移核下,推导出受控马尔可夫过程风险规避控制的动态规划原理。
  • 该框架推广了基于效用和熵型风险模型,但因时间不一致性而排除了均值-方差模型。
  • 证明风险映射 $ \sigma(x, q, v) $ 在 $ q $ 上弱连续,在 $ v $ 上下确界连续,确保了优化过程的稳定性。
  • 对于状态依赖的 $ \alpha(x) $ 的平均风险价值(Average-Value-at-Risk),在 $ \alpha(x) $ 连续时,该映射连续,支持数值方法的应用。
  • 该理论为文献 [40] 中早期的启发式构造提供了坚实的理论基础,通过严格的公理化推导解决了其临时性问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。