Skip to main content
QUICK REVIEW

[论文解读] First Order Approximations of the Pythagorean Won-Loss Formula for Predicting MLB Teams' Winning Percentages

Kevin Dayaratna, Steven J. Miller|arXiv (Cornell University)|May 21, 2012
Sports Analytics and Performance被引用 5
一句话总结

本文从数学上证明了琼斯与坦平(2005)提出的线性胜率预测模型,是比尔·詹姆斯的幂律胜率公式的首阶近似,其系数估计值在统计上与经验上公认的指数1.82无显著差异。利用20个赛季的MLB数据,作者证实该线性模型强大的预测能力源于其源自广为人知的幂律指数的推导过程。

ABSTRACT

We mathematically prove that an existing linear predictor of baseball teams' winning percentages (Jones and Tappin 2005) is simply just a first-order approximation to Bill James' Pythagorean Won-Loss formula and can thus be written in terms of the formula's well-known exponent. We estimate the linear model on twenty seasons of Major League Baseball data and are able to verify that the resulting coefficient estimate, with 95% confidence, is virtually identical to the empirically accepted value of 1.82. Our work thus helps explain why this simple and elegant model is such a strong linear predictor.

研究动机与目标

  • 从数学上将琼斯与坦平(2005)的线性胜率预测模型与比尔·詹姆斯的幂律胜率公式联系起来。
  • 确定线性模型的系数是否与经验上公认的幂律指数1.82在统计上等价。
  • 通过使用20个赛季的MLB数据来估计该模型,以验证其预测能力。
  • 提供一个理论基础,解释为何该线性模型在预测MLB球队胜率方面表现如此出色。

提出的方法

  • 在平均球队每场得分的附近,对幂律胜率公式进行首阶泰勒展开。
  • 将所得的线性近似表达为得分和失分的形式,使其与琼斯-坦平模型的形式一致。
  • 使用20个赛季的美国职业棒球大联盟数据(1990–2009)来估计该线性模型。
  • 对估计的系数进行95%置信区间检验,以与标准幂律指数1.82进行比较。
  • 利用统计推断评估估计系数是否在统计上与1.82无显著差异。
  • 在附录中通过级数展开技术提供另一种证明,以加强分析推导的严谨性。

实验结果

研究问题

  • RQ1琼斯-坦平线性模型在数学上是否等价于幂律胜率公式的首阶近似?
  • RQ2线性模型中估计的系数是否与经验上公认的幂律指数1.82一致?
  • RQ3线性模型表现出强大预测性能的原因是否可通过其源自幂律公式的理论推导来解释?
  • RQ4该线性模型在20个赛季的时间跨度内,对实际MLB球队胜率的拟合程度如何?

主要发现

  • 琼斯-坦平线性模型在数学上等价于幂律胜率公式的首阶泰勒展开。
  • 基于20个赛季MLB数据估计的线性模型系数,在95%置信水平下与标准幂律指数1.82在统计上无显著差异。
  • 因此,该线性模型强大的预测准确性可归因于其源自广为人知的幂律公式的推导。
  • 本文证实,线性预测器并非一种临时拼凑的模型,而是广泛使用的棒球分析工具的数学上合理的近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。