Skip to main content
QUICK REVIEW

[論文レビュー] Predicting the NFL Using Twitter

Shiladitya Sinha, Chris Dyer|arXiv (Cornell University)|Oct 25, 2013
Sports Analytics and Performance参考文献 18被引用数 29
ひとこと要約

この論文では、NFLの試合結果およびベッティング結果を予測するために、ツイッターのセンチメントとボリューム指標を活用することを提案している。その結果、特にツイート数の変化率(rate-of-change)に基づく単純なツイッター由来の特徴量が、従来の統計的特徴量を上回るか同等の性能を示した。主な発見は、ツイート数の変化率を表す「rateS」特徴量が、スプレッド勝者を55.3%の精度で予測でき、ベッティング会社の手数料を差し引いた利益を得るための53%の閾値を超えたことである。

ABSTRACT

We study the relationship between social media output and National Football League (NFL) games, using a dataset containing messages from Twitter and NFL game statistics. Specifically, we consider tweets pertaining to specific teams and games in the NFL season and use them alongside statistical game data to build predictive models for future game outcomes (which team will win?) and sports betting outcomes (which team will win with the point spread? will the total points be over/under the line?). We experiment with several feature sets and find that simple features using large volumes of tweets can match or exceed the performance of more traditional features that use game statistics.

研究の動機と目的

  • ツイッターからのソーシャルメディアデータが、従来の試合統計よりも高い精度でNFLの試合結果およびベッティング結果を予測できるかどうかを調査すること。
  • センチメント、ボリューム、変化率といったさまざまなツイッター由来の特徴量(特に率)が、従来の統計的特徴量と比較して、NFLの試合結果を予測する上でどれほど有効であるかを評価すること。
  • 2010年から2012年までの期間にわたる、NFLの試合と一致する大規模かつアノテーション済みのツイートデータセットを構築し、学術的リサーチのための公開を実施すること。
  • リアルタイムでのソーシャルメディアのセンチメントとボリュームトレンドが、チームのパフォーマンスやベッティング市場の動きを示す先行指標として機能するかどうかを特定すること。

提案手法

  • 2010年から2012年のNFLシーズン中に、ツイッター・ストリームの10%(ガーデンホース)を収集し、twokenizeトークナイザーを用いて1日あたり約4200万件のツイートを処理した。
  • 手動でキュレートされたハッシュタグ(例:#giants, #jets)を用いてツイートをNFLチームに割り当て、複数のチームハッシュタグが含まれるツイートは除外することで、チーム固有のセンチメントを保証した。
  • 時間ベースのフィルタリングを用いて、試合前(24~1時間前)、試合後(4~28時間後)、週次(試合間)の3つのツイートカテゴリを定義した。
  • ユニグラム単語頻度(例:'win', 'loss')や、新しいレート特徴量である rateS(vprev, ∆=500) と rateP(vprev, θ) を抽出した。これらは、前回のツイート数に対する変化率を測定するものである。
  • ツイッター特徴量と統計的ゲーム特徴量を組み合わせるために、標準化相関分析(CCA)を用い、3つの予測タスク(勝者、スプレッド付き勝者(WTS)、オーバー/アンダー)のためのバイナリ分類器を訓練した。
  • 動的特徴量選択を実装:各週において、直近2週間のうち最も高い性能を示した特徴量セットを選択し、モデルの適応的更新を可能にした。

実験結果

リサーチクエスチョン

  • RQ1特にボリュームとセンチメントトレンドに注目したツイッター由来の特徴量が、従来の試合統計と同等かそれ以上の精度でNFLの試合結果を予測できるか?
  • RQ2ツイート数の変化率(例:rateS, rateP)特徴量が、静的のツイート数やセンチメント特徴量よりも、試合結果の予測において優れているか?
  • RQ3ソーシャルメディアのセンチメントと実際の試合結果の間に測定可能な相関関係があるか、特にスポーツベッティング市場の文脈でその関係が顕在するか?
  • RQ4過去のパフォーマンスに基づく動的特徴量選択が、実世界の予測設定において、時間の経過とともに予測精度を向上させられるか?
  • RQ5ゲーム統計を一切使用しない状況で、ツイッター特徴量のみでNFLベッティングにおいて利益を上げられる(つまり、WTS予測で53%以上の精度を達成できる)か?

主な発見

  • ツイッターの rateS 特徴量(vprev と ∆=500 を使用)は、スプレッド付き勝者(WTS)を55.3%の精度で予測でき、ベッティング会社の手数料を差し引いた利益を得るための53%の閾値を超えた。
  • ツイッターのユニグラム特徴量のみで、オーバー/アンダー予測の精度が54.3%に達し、他のほとんどの特徴量セットを上回った。これは、純粋なツイートボリュームと語彙頻度に強い信号が存在することを示唆している。
  • CCA を用いてツイッターのユニグラム特徴量と統計的特徴量を組み合わせた場合、WTS予測の精度は4成分で51.0%に向上したが、最も高い性能を示したのはレート特徴量を含むハイブリッドモデルであった。
  • WTS予測の最良の特徴量セットは頻繁に変化しており、13週間のうち8つの異なるセットが使用された。これは、時間的に変化する特徴量選択が不可欠であることを示している。
  • F5 ∪ F9 ∪ ツイッターの rateP (vprev, θ=0.2) の組み合わせは、勝者予測で65.9%、WTS予測で51.4%の精度を達成し、ベースラインモデルを上回った。これは、複数の特徴量を組み合わせた場合の強い予測力の証明である。
  • 一部の特徴量セットでは高い精度(例:F3 ∪ F4 ∪ ツイッターの rateS ではオーバー/アンダー予測で58.2%)を示したが、動的特徴量選択戦略のオーバー/アンダー予測精度は44.1%にとどまり、このタスクにおける改善の余地が明確に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。