QUICK REVIEW
[论文解读] Use of the likelihood for measuring the skill of probabilistic forecasts
Stephen Jewson|ArXiv.org|Aug 12, 2003
Meteorological Phenomena and Simulations参考文献 6被引用 10
一句话总结
本文提出似然函数作为统一的、数学上最优的框架,用于评估所有气象变量、预报时效和位置的概率预报技巧。它表明,似然性评分在预报误差具有自相关性时,能统一并超越传统的均方根误差(RMSE)和‘无知’评分,尤其在提供一致的校准与评估方面,其基础是经典估计理论的单一统计范式。
ABSTRACT
We define the likelihood and give a number of justifications for its use as a skill measure for probabilistic forecasts. We describe a number of different scores based on the likelihood, and briefly investigate the relationships between the likelihood, the mean square error and the ignorance.
研究动机与目标
- 开发一种适用于所有气象变量和预报配置的单一、一致的概率预报技巧度量方法。
- 通过基于经典估计理论的统计最优替代方案,解决现有度量方法(如RMSE和Brier评分)的局限性。
- 在单一基于似然的框架下统一预报校准与评估,确保建模与验证过程的一致性。
- 研究似然与其它成熟评分(如‘无知’评分和RMSE)之间的关系,特别是在误差自相关情况下的表现。
- 实现单一、连贯的评分,用于多变量、多地点和多时效的预报评估。
提出的方法
- 将似然定义为给定预报分布下观测数据的概率,采用Fisher(1912)提出的经典统计定义。
- 使用对数似然(LL)及其负值(MLL)构建可解释、尺度压缩的技巧评分,MLL越小表示预报越好。
- 推导多元正态分布的似然函数,通过预报误差协方差矩阵Σ纳入时间相关性和变量间相关性。
- 以一致方式将似然框架应用于校准(通过最大化似然进行参数估计)和评估(技巧评分)。
- 证明在独立同分布正态误差下,似然与RMSE的排序等价,表明似然将RMSE推广至误差相关结构。
- 将‘无知’评分(Roulston & Smith, 2002)与似然关联,当误差不相关且仅考虑单一变量/地点/时效时,‘无知’评分是似然的一个特例。
实验结果
研究问题
- RQ1似然函数能否作为适用于所有类型概率预报(无论变量、时效或位置)的通用、数学上最优的技巧度量?
- RQ2在预报误差具有自相关性时,基于似然的框架与RMSE和‘无知’评分相比,在预报排序方面表现如何?
- RQ3在校准过程中,是否必须精确估计预报误差协方差矩阵?还是可采用简化假设(如误差不相关)而不显著扭曲预报排序?
- RQ4似然与其它成熟评分规则(如连续秩概率评分或Brier评分)之间存在何种关系?
- RQ5似然能否在统一框架下同时用于校准(参数拟合)和评估(技巧评分),从而确保统计建模流程的一致性?
主要发现
- 似然提供了一致且最优的概率预报评估框架,其估计值在标准正则条件下为最精确的可能结果。
- 基于似然的评分(特别是负对数似然,MLL)在预报误差为独立同分布正态分布时,与RMSE在数学上等价,表明似然将RMSE推广至误差相关结构。
- 在假设误差不相关时,‘无知’评分等价于负对数似然,因此似然将‘无知’评分推广至多变量、多时效及误差相关场景。
- 似然框架能自然地将多维预报(多变量、多地点、多时效)整合为单一评分,即使各分量之间存在交叉相关性。
- 在建模流程中同时使用似然进行校准与评估,可确保整个流程的一致性,符合更广泛建模工作中标准的统计实践。
- 本文建议,对预报误差协方差矩阵进行近似处理(如假设误差不相关)在实践中可能不会显著扭曲预报排序,尽管仍需进一步研究验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。