Skip to main content
QUICK REVIEW

[論文レビュー] iWinRNFL: A Simple, Interpretable & Well-Calibrated In-Game Win Probability Model for NFL

Konstantinos Pelechrinis|arXiv (Cornell University)|Apr 1, 2017
Sports Analytics and Performance参考文献 7被引用数 3
ひとこと要約

本論文は、7年間のプレー・バイ・プレーデータから得た10のゲーム状態特徴を用いて、NFLの試合内での勝利確率を推定するシンプルで解釈可能で、良好にキャリブレーションされたロジスティック回帰モデルiWinRNFLを紹介する。このモデルは試合の勝者を75%の正確さで予測し、ベースラインの事前モデルを著しく上回り、あらゆる信頼度レベルで良好にキャリブレーションされた確率を維持しており、ニューラルネットワークやベイジアン分類器といったより複雑なモデルによる有意義な改善は得られていない。

ABSTRACT

During the last few sports seasons a lot of discussion has been generated for the several, high-profile, "comebacks" that were observed in almost all sports. The Cavaliers won the championship after being down 3-1 in the 2016 NBA finals' series against the Golden State Warriors, which was exactly the case for Chicago Cubs and the World Series. The Patriots won the Super Bowl in 2016 even though they were trailing by 25 points late in the third quarter, while FC Barcelona in the top-16 round of the 2016-17 Champions League scored 3 goals during the last 7 minutes of the game (including stoppage time) against PSG to advance in the tournament. This has brought the robustness and accuracy of the various probabilistic prediction models under high scrutiny. Many of these models are proprietary, which makes it hard to evaluate. In this paper, we build a simple and open, yet robust and well-calibrated, in-game probability model for predicting the winner in an NFL (iWinRNFL) game. In particular, we build a logistic regression model that utilizes a set of 10 variables to predict the running win probability for the home team. We train our model using detailed play-by-play data from the last 7 NFL seasons obtained through the league's API. Our results indicate that in 75% of the cases iWinRNFL provides an accurate winner projection, as compared to a 63% accuracy of a baseline pre-game win probability model. Most importantly the probabilities that iWinRNFL provides are well-calibrated. Finally, we have also evaluated more complex, non-linear, models using the same set of features, without any significant improvement in performance.

研究の動機と目的

  • トレーサビリティがあり、オープンで解釈可能なNFL試合内勝利確率モデルを構築し、劣位チームの勝利確率に対する過信を回避すること。
  • シンプルな一般化線形モデルが、非線形な複雑なモデルと同等の性能を達成できるかどうかを評価すること。
  • モデルが予測した確率が、特に終盤の逆転劇のような極端な状況を含め、全範囲の勝利確率において良好にキャリブレーションされているかを保証すること。
  • オープンでコミュニティレビュー可能なメソッドを通じて、今後の勝利確率モデルの評価と改善のベンチマークを提供すること。

提案手法

  • モデルは、残り時間、得点差、ボール支配、進攻段階、得点までの距離、フィールドポジション、チーム力、ホームアドバンテージ、およびゲーム状態(前半/後半、ハーフ終了時/ゲーム終了時)の10の主要なゲーム状態変数を用いたロジスティック回帰フレームワークに基づく。
  • モデルの学習は、NFL公式APIを介して入手した7年間(2009–2015年)の詳細なプレー・バイ・プレーデータに基づく。
  • 標準的な指標を用いてモデルを評価する:正確度、ブライアースコア、確率ビンごとのキャリブレーションの信頼性。
  • 非線形モデル(ベイジアン分類器およびフィードフォワードニューラルネットワーク)は、同じ10の特徴を用いて学習され、ロジスティック回帰ベースラインとの性能比較がなされる。
  • モデルのキャリブレーションは、確率ビンごとの予測確率と実際の勝利頻度を比較することで評価される。
  • 事例的評価では、25点の劣位を逆転したスーパーボウル51を対象とし、極端な状況下でのモデルの挙動をテストする。

実験結果

リサーチクエスチョン

  • RQ1シンプルで解釈可能なロジスティック回帰モデルは、NFLの試合内勝利確率予測において高い正確度と良好なキャリブレーションを達成できるか?
  • RQ2iWinRNFLの性能は、正確度とキャリブレーションの観点から、ベースラインの事前勝利確率モデルと比べてどの程度優れているか?
  • RQ3同じ入力特徴を用いた場合、より複雑な非線形モデル(例:ニューラルネットワーク、ベイジアン分類器)は、シンプルなロジスティック回帰モデルを著しく上回る性能を示すか?
  • RQ4モデルは、2017年スーパーボウル51のペイトリオッツの逆転劇のような極端な状況をどの程度適切に処理できるか?
  • RQ5特に1000分の1の確率のような極めて低い確率事象においても、モデルのキャリブレーションは全確率スケールにわたり頑健か?

主な発見

  • iWinRNFLは、試合の勝者を75%の正確さで予測し、ベースラインの事前勝利確率モデルの63%を著しく上回っている。
  • モデルが予測した確率は、あらゆる確率ビンで良好にキャリブレーションされており、20%の勝利確率が割り当てられたチームが実際に約20%の確率で勝利していることを意味する。
  • 2017年スーパーボウル51の逆転劇のような極端な事例でさえ、iWinRNFLはペイトリオッツの最低点で保守的な2.1%の勝利確率を割り当てており、一部の特許取得済みモデルで見られる過信を回避している。
  • 四半期終盤に非線形的ダイナミクスの兆候が見られるにもかかわらず、フィードフォワードニューラルネットワーク(FNN)のようなより複雑なモデルは、ブライアースコアおよび正確度において僅かな改善しか得られておらず、特に試合後半において顕著でない。
  • モデルの性能は試合が進むにつれて向上し、試合終了に近づくと、チームレーティングよりも試合内ダイナミクスの重要性が高まる傾向に一致して、最先端水準に近づく。
  • 本研究は、シンプルで解釈可能なモデル(例:iWinRNFL)が、非線形モデルの複雑さを必要とせずに、頑健な試合内勝利確率予測に十分であると結論づける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。