Skip to main content
QUICK REVIEW

[论文解读] An imprecise-probabilistic characterization of frequentist statistical inference

Ryan R. Martin|arXiv (Cornell University)|Dec 20, 2021
Statistical Mechanics and Entropy被引用 8
一句话总结

本文证明了频率学派统计推断——特别是p值和置信区间——可以使用似然性理论(imprecise probability theory)进行严格刻画,具体通过一致的似然函数(consonant plausibility functions)实现。本文证明了每一个有效的频率学派程序都对应一个保持错误率控制的似然度量,并为p值提供了数学上严谨的解释:p值是似然度量,而非概率。

ABSTRACT

Between the two dominant schools of thought in statistics, namely, Bayesian and classical/frequentist, a main difference is that the former is grounded in the mathematically rigorous theory of probability while the latter is not. In this paper, I show that the latter is grounded in a different but equally mathematically rigorous theory of imprecise probability. Specifically, I show that for every suitable testing or confidence procedure with error rate control guarantees, there exists a consonant plausibility function whose derived testing or confidence procedure is no less efficient. Beyond its foundational implications, this characterization has at least two important practical consequences: first, it simplifies the interpretation of p-values and confidence regions, thus creating opportunities for improved education and scientific communication; second, the constructive proof of the main results leads to a strategy for new and improved methods in challenging inference problems.

研究动机与目标

  • 通过证明频率学派推断建立在模糊概率的数学严谨框架之上,弥合其基础性缺陷。
  • 解决p值和置信区间被普遍误解为概率的问题,这种误解导致混淆,并加剧了可重复性危机。
  • 利用似然度量提供一种连贯、直观且数学上有效的经典统计输出解释。
  • 证明频率学派程序可从明确定义的模糊概率模型中推导得出,使其与现代不确定性量化理论保持一致。
  • 通过用基于似然度的解释替代概率性误解,实现统计教育和科学交流的改进。

提出的方法

  • 使用Martin和Liu(2015b)提出的推断模型(inferential model, IM)框架,从嵌套的随机集合构造有效的似然度量。
  • 将一致的似然函数定义为一类特殊的模糊概率模型,确保错误率控制的有效性。
  • 构建从任意有效频率学派程序(如t检验、方差分析、线性回归)到对应似然函数的映射,使其复制原始程序的错误率保障。
  • 应用似然度量的次可加性性质,为p值作为“对原假设的证据不足程度”的直观解释提供理论支持。
  • 证明由此产生的基于似然度的解释在逻辑上连贯,避免将p值误认为后验概率的陷阱。
  • 在频率学派推断与模糊概率之间建立理论桥梁,表明频率学派方法的有效性对应于模糊概率框架中的连贯性,涵盖有效性与避免确定损失。

实验结果

研究问题

  • RQ1频率学派推断能否在模糊概率的数学理论中得到严格奠基?
  • RQ2p值和置信区间是否对应于一个明确定义的、能保持错误率控制的似然度量?
  • RQ3能否在不依赖贝叶斯后验概率的前提下,将p值作为“似然度量”的直观解释数学化?
  • RQ4是否存在一种通用方法,可从似然函数推导出效率高的频率学派程序,使其采样性质保持一致?
  • RQ5这种模糊概率表征在科学与教育中如何改善统计结果的解释与交流?

主要发现

  • 对于每一个具有错误率控制的有效频率学派检验或置信区间程序,都存在一个一致的似然函数,其效率至少与原程序相当。
  • 由标准程序(如t检验、方差分析、线性回归)导出的p值和置信区间,在IM框架下恰好对应于似然度量。
  • p值的似然解释——即‘在给定数据的前提下,原假设的似然程度’——在模糊概率框架内数学上正确且逻辑一致。
  • 该框架避免了将p值误解为后验概率的常见错误,解决了统计实践中一个关键的混淆来源。
  • 该表征建立了一个连贯的频率学派连贯性理论,其形式与de Finetti对精确概率的连贯性理论相呼应,扩展至有效性与避免确定损失。
  • 该方法支持统计教育的改进:学生可基于似然度理解p值和置信区间,而无需事先掌握模糊概率理论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。