[论文解读] Competing Process Hazard Function Models for Player Ratings in Ice Hockey
本文提出了一种竞争过程风险函数模型,通过将进球速率建模为受在场球员影响的半马尔可夫过程,来评估NHL球员的进攻与防守能力。该方法在传统正负值基础上进行了改进,纳入了比赛情境、队友/对手质量以及通过贝叶斯分层模型或惩罚似然法的正则化,从而生成具有可解释性且具备预测能力的球员评分,能够有效处理稀有进球事件与换人轮换动态。
Evaluating the overall ability of players in the National Hockey League (NHL) is a difficult task. Existing methods such as the famous "plus/minus" statistic have many shortcomings. Standard linear regression methods work well when player substitutions are relatively uncommon and scoring events are relatively common, such as in basketball, but as neither of these conditions exists for hockey, we use an approach that embraces the unique characteristics of the sport. We model the scoring rate for each team as its own semi-Markov process, with hazard functions for each process that depend on the players on the ice. This method yields offensive and defensive player ability ratings which take into account quality of teammates and opponents, the game situation, and other desired factors, that themselves have a meaningful interpretation in terms of game outcomes. Additionally, since the number of parameters in this model can be quite large, we make use of two different shrinkage methods depending on the question of interest: full Bayesian hierarchical models that partially pool parameters according to player position, and penalized maximum likelihood estimation to select a smaller number of parameters that stand out as being substantially different from average. We apply the model to all five-on-five (full-strength) situations for games in five NHL seasons.
研究动机与目标
- 解决传统球员评分系统(如正负值)的局限性,后者未能考虑队友与对手质量、比赛情境以及冰球比赛中稀有的进球事件。
- 开发一种统计严谨的方法,将进球速率建模为竞争性半马尔可夫过程,其中每位球员同时对进攻与防守风险函数产生影响。
- 采用正则化技术——贝叶斯分层模型与惩罚最大似然法——以提升估计稳定性,并识别出能力显著高于或低于平均水平的球员。
- 生成可直接解释为不同比赛情境下进球数或阻止进球数的球员评分,具有明确的对比赛结果的解释意义。
- 在五季五对五NHL数据上评估模型性能,检验其预测能力以及对数据稀疏性和右删失的鲁棒性。
提出的方法
- 将每支队伍的进球过程建模为半马尔可夫过程,其时变风险函数依赖于在场球员的组合。
- 采用带有时变协变量的Cox比例风险框架,以表示球员对进攻与防守进球速率的影响。
- 应用两种正则化策略:基于球员位置对参数进行分组的完整贝叶斯分层模型,以及用于识别具有显著高于或低于平均水平影响的球员的惩罚最大似然法。
- 通过将换人时长建模为右删失观测值,纳入比赛状态与换人轮换动态,风险函数根据比赛情境而变化。
- 通过分析在进球事件条件下换人时长的分布,处理非外生删失(如换人),并提出通过球权位置与控球状态等协变量进行调整。
- 考虑将射门作为中间事件(未删失)纳入模型,以提高数据精度,尽管由于射门转进球率的可变性,这一扩展仍面临挑战。
实验结果
研究问题
- RQ1竞争过程风险模型是否能通过考虑队友与对手质量,更准确地估计球员的进攻与防守贡献,优于传统的正负值?
- RQ2反映比赛状态(如争球后或区域控球)的时变风险函数在冰球等低得分运动中,能否提升球员评分的准确性?
- RQ3通过贝叶斯分层模型或惩罚似然法进行正则化,在稀疏、高维的球员评分估计中,能在多大程度上提升预测性能并减少过拟合?
- RQ4由球员换人驱动的删失机制如何影响估计偏差?是否可通过引入球权位置与控球状态的协变量进行校正?
- RQ5能否将模型扩展以包含非进球事件(如射门)作为中间结果,以在不引入偏差的前提下提高估计精度?
主要发现
- 该模型生成的进攻与防守球员评分可直接解释为预期进球速率或阻止进球速率,与比赛结果有明确关联。
- 通过贝叶斯分层模型进行正则化,成功地在相同位置的球员之间共享信息,降低了方差,提升了稀疏数据场景下的估计稳定性。
- 惩罚最大似然估计能有效识别出具有非平均进攻或防守影响的一小部分球员,有助于发现表现突出的球员。
- 以进球结束的换人时长平均略长,表明进球事件与换人时长并非独立,提示删失具有轻微信息性,应显式建模。
- 引入基于比赛状态(如争球后或区域控球)的时变风险函数,可降低球员评分的偏差,尤其对频繁在防守区争球时被替换的球员更为显著。
- 该模型在扩展至多打少情况方面展现出潜力,但当前对平滑随机过程的假设可能无法完全捕捉多打少时的结构化、高压特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。