Skip to main content
QUICK REVIEW

[论文解读] A scoring framework for tiered warnings and multicategorical forecasts based on fixed risk measures

Robert Taggart, Loveday, Nicholas|arXiv (Cornell University)|Aug 29, 2021
Forecasting Techniques and Applications参考文献 20被引用 16
一句话总结

本文提出了FIxed Risk Multicategory(FIRM)预测框架,这是一种用于评估有序多类别预测(如分级天气预警)的灵活评分函数族,基于固定的风险阈值(α)。该框架采用风险一致的评分矩阵,支持用户自定义权重,并可选地引入基于距离的折扣机制以处理接近错误的情况,确保评分优化与决策理论指令一致,为传统依赖可变阈值和基础率的公平评分提供稳健替代方案。

ABSTRACT

The use of tiered warnings and multicategorical forecasts are ubiquitous in meteorological operations. Here, a flexible family of scoring functions is presented for evaluating the performance of ordered multicategorical forecasts. Each score has a risk parameter $\alpha$, selected for the specific use case, so that it is consistent with a forecast directive based on the fixed threshold probability $1-\alpha$ (equivalently, a fixed $\alpha$-quantile mapping). Each score also has use-case specific weights so that forecasters who accurately discriminate between categorical thresholds are rewarded in proportion to the weight for that threshold. A variation is presented where the penalty assigned to near misses or close false alarms is discounted, which again is consistent with directives based on fixed risk measures. The scores presented provide an alternative to many performance measures currently in use, whose optimal threshold probabilities for forecasting an event typically vary with each forecast case, and in the case of equitable scores are based around sample base rates rather than risk measures suitable for users.

研究动机与目标

  • 解决现有公平评分函数的局限性,这些函数针对与样本基础率相关的可变阈值概率进行优化,而非用户特定的风险承受能力。
  • 开发一种评分框架,使预测性能评估与固定风险指令保持一致,例如当事件概率超过1−α时发布预警。
  • 提供一种与决策理论一致的方法,用于评估多类别预测,尤其适用于虚假警报与漏报成本不对称的公共预警系统。
  • 使预报员能够因其在高影响阈值之间准确区分的能力而获得奖励,使用类别特定的权重。
  • 引入基于距离的惩罚折扣机制,以反映现实世界中对预报接近度的容忍度,从而降低对临近错误的惩罚。

提出的方法

  • 提出一族由风险水平α参数化的评分函数,其中预测根据其是否包含预测分布的α-分位数进行评估。
  • 使用评分矩阵为预报-观测对分配惩罚,其条目源自分位数和期望值的初等评分函数。
  • 引入用户指定的权重(wi),以奖励在高优先级阈值处的准确区分。
  • 引入折扣参数'a',当观测值落在预报类别的距离'a'范围内时,降低惩罚,以建模Huber分位数或期望值。
  • 基于成本-损失模型从决策理论推导该框架,确保评分优化与固定风险度量下的最优用户行为保持一致。
  • 将该框架应用于真实降雨预警数据,通过经验校准和信号检测理论演示参数估计方法。

实验结果

研究问题

  • RQ1能否构建一种评分函数,使其在所有预报类别中均与固定风险阈值(1−α)保持一致,而非随基础率或样本频率变化?
  • RQ2如何通过评分函数中的类别特定权重,激励预报员准确区分高影响阈值?
  • RQ3对临近错误或接近误报的惩罚进行折扣,在多大程度上能提升预报评分与现实世界用户容忍度及决策行为的一致性?
  • RQ4当现有预警系统未明确定义风险参数时,如何从历史列联表或预报-观测数据中估计α?
  • RQ5在多阶段预警系统中,若随提前期变化调整风险参数α,是否能提升预报系统性能?最优阈值应如何选择?

主要发现

  • FIRM评分框架确保评分优化行为与固定风险指令一致,例如当事件概率超过1−α时发布预警。
  • 对于校准良好的预报系统,漏报与误报之比并非可靠的性能指标,因为当α与基础率不一致时,该比值可能具有误导性。
  • 基于信号检测理论的估计量˜α比经验估计量ˆα更可靠,尤其在基础率较低且系统校准不完善时。
  • 当α随阈值变化(如α1=0.1,α2=0.9)时,预报员可能被激励跳过中间类别(如C1),导致次优行为并违背直观的预报逻辑。
  • 在多提前期预警系统中,最优早期预警阈值(β)高于标准时间阈值(α),在新南威尔士州降雨数据集中,OCF的β=0.65,Official的β=0.60,反映出撤回预警的更高成本。
  • 该框架的灵活性可通过在a>0时对靠近预报类别的观测值降低惩罚,减轻预警疲劳和对误报的容忍度,从而减少其影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。