Skip to main content
QUICK REVIEW

[论文解读] Optimal Best-Arm Identification Methods for Tail-Risk Measures

Shubhada Agrawal, Wouter M. Koolen|arXiv (Cornell University)|Aug 17, 2020
Advanced Bandit Algorithms Research参考文献 55被引用 7
一句话总结

本文提出了一种δ-正确、渐近最优的算法,用于在重尾分布下的多臂赌博机中识别最优臂,目标为尾部分布风险度量——具体为CVaR、VaR和均值-CVaR。该方法使用非渐近经验似然浓度界限,并通过在概率测度空间上求解非凸优化问题,实现样本复杂度与信息论下界一致,即使在臂分布的(1+ϵ)-阶矩约束下亦成立。

ABSTRACT

Conditional value-at-risk (CVaR) and value-at-risk (VaR) are popular tail-risk measures in finance and insurance industries as well as in highly reliable, safety-critical uncertain environments where often the underlying probability distributions are heavy-tailed. We use the multi-armed bandit best-arm identification framework and consider the problem of identifying the arm from amongst finitely many that has the smallest CVaR, VaR, or weighted sum of CVaR and mean. The latter captures the risk-return trade-off common in finance. Our main contribution is an optimal $δ$-correct algorithm that acts on general arms, including heavy-tailed distributions, and matches the lower bound on the expected number of samples needed, asymptotically (as $δ$ approaches $0$). The algorithm requires solving a non-convex optimization problem in the space of probability measures, that requires delicate analysis. En-route, we develop new non-asymptotic empirical likelihood-based concentration inequalities for tail-risk measures which are tighter than those for popular truncation-based empirical estimators.

研究动机与目标

  • 解决在多臂赌博机中缺乏系统性方法来识别CVaR和VaR等尾部分布风险度量下最优臂的问题。
  • 在固定置信度δ-正确设置下,形式化风险敏感目标(CVaR、VaR、均值-CVaR)下的最优臂识别问题。
  • 提出一个理论上最优的算法,其期望样本复杂度与识别最小尾部风险臂的信息论下界相匹配。
  • 通过在臂分布上施加(1+ϵ)-阶矩约束,建立CVaR最优臂识别问题可学习的条件。
  • 基于经验似然,开发针对尾部分布风险估计量的更紧致的非渐近浓度不等式,优于标准截断方法。

提出的方法

  • 提出一种δ-正确算法,通过自适应采样识别具有最小CVaR、VaR或均值-CVaR的臂,确保正确性概率至少为1−δ。
  • 使用基于经验似然的浓度不等式来限制尾部分布风险度量的估计误差,实现比截断估计器更紧的界限。
  • 将最优采样策略形式化为在概率测度空间上的非凸优化问题,需精细分析以求解。
  • 引入基于广义似然比检验(GLRT)的停止规则,当达到足够置信度时终止算法。
  • 通过二分查找和单步对偶点求解器,实现计算高效的变体,以近似最优采样分布。
  • 应用C追踪和√n强制探索策略,以维持探索平衡并确保实际中的收敛性。

实验结果

研究问题

  • RQ1能否设计一种δ-正确算法,用于CVaR和VaR目标下的最优臂识别,使其样本复杂度达到渐近下界?
  • RQ2哪些分布族条件可确保CVaR最优臂识别问题的可学习性?
  • RQ3与基于截断的估计量相比,尾部分布风险度量的非渐近浓度不等式在紧致性和样本效率方面表现如何?
  • RQ4样本复杂度对(1+ϵ)-阶矩约束B和尾指数ϵ的依赖关系如何?
  • RQ5在有限δ的实用模拟中,能否观察到该算法的理论渐近最优性?

主要发现

  • 所提算法在样本复杂度上达到渐近最优,与δ-正确最优臂识别在CVaR和VaR目标下的信息论下界完全一致。
  • 当ϵ < 1时,样本复杂度按B^{1/ϵ}缩放,该函数在B上为凸,且在更紧的矩约束下迅速增加;当ϵ > 1时,样本复杂度与B呈线性关系。
  • 实验结果表明,平均停止时间与理论下界极为接近,即使在中等δ值下也验证了其在实际中的渐近最优性。
  • 该算法性能对矩约束B的正确估计高度敏感,尤其在ϵ < 1时,样本复杂度随B迅速增长。
  • 针对尾部分布风险度量的非渐近经验似然浓度界限比基于截断的方法更紧,从而实现更高效的采样。
  • 对特征时间1/Ṽ(µ)的可解释夹逼界确认:当ϵ < 1时,样本复杂度按B^{1/ϵ}缩放,当ϵ > 1时呈线性关系,且乘法因子为2^{1/ϵ}。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。