Skip to main content
QUICK REVIEW

[논문 리뷰] Using Machine Learning to Predict the Outcome of English County twenty over Cricket Matches

Stylianos Kampakis, William Thomas|arXiv (Cornell University)|2015. 11. 18.
Sports Analytics and Performance참고 문헌 6인용 수 14
한 줄 요약

이 연구는 영국 컨티 카운티 T20 크리켓 경기의 결과를 예측하기 위해 기계학습을 사용하며, 팀 및 선수 통계 500개 이상을 활용한다. 계층적 특징을 조합한 단순 예측 모델을 통해 산업 기준보다 유의미하게 뛰어난 성능을 달성하여 스포츠 베팅 응용 분야에서 강력한 예측 능력을 입증한다.

ABSTRACT

Cricket betting is a multi-billion dollar market. Therefore, there is a strong incentive for models that can predict the outcomes of games and beat the odds provided by bookers. The aim of this study was to investigate to what degree it is possible to predict the outcome of cricket matches. The target competition was the English twenty over county cricket cup. The original features alongside engineered features gave rise to more than 500 team and player statistics. The models were optimized firstly with team features only and then both team and player features. The performance of the models was tested over individual seasons from 2009 to 2014 having been trained over previous season data in each case. The optimal model was a simple prediction method combined with complex hierarchical features and was shown to significantly outperform a gambling industry benchmark.

연구 동기 및 목표

  • 기계학습을 활용해 영국 컨티 카운티 T20 크리켓 경기 결과 예측의 가능성을 탐색한다.
  • 팀 수준 및 선수 수준의 특징이 예측 성능에 미치는 영향을 평가한다.
  • 2009년에서 2014년까지의 역사적 데이터를 활용해 모델 성능을 최적화하며, 이전 시즌을 학습하고 개별 시즌을 테스트한다.
  • 실제 스포츠 베팅 환경에서의 예측 우위를 평가하기 위해 모델 성능을 도박 산업 기준과 비교한다.
  • 스포츠 결과 예측에 가장 효과적인 특징 공학 및 모델링 접근 방식을 규명한다.

제안 방법

  • 원본 팀 및 선수 통계에서 500개 이상의 특징을 구축하며, 공학된 계층적 특징을 포함한다.
  • 이전 시즌의 데이터로 모델을 학습하고 개별 시즌(2009–2014)에서 테스트하여 실시간 예측을 시뮬레이션한다.
  • 두 가지 모델링 접근 방식을 평가한다: 팀 특징만 사용하는 경우와 팀 및 선수 특징을 조합하는 경우.
  • 단순한 예측 방법과 복잡한 계층적 특징을 조합한 것이 최적임이 밝혀졌으며, 이는 모델의 해석 가능성과 성능을 향상시킨다.
  • 표준 평가 지표를 사용해 모델 성능을 평가하고, 도박 산업 기준과의 비교를 수행한다.
  • 초기화수치 최적화 및 교차 검증을 적용해 시즌 간의 일반화 능력을 최적화한다.

실험 결과

연구 질문

  • RQ1기계학습 모델은 팀 및 선수 통계를 활용해 영국 컨티 카운티 T20 크리켓 경기 결과를 정확하게 예측할 수 있는가?
  • RQ2선수 수준의 특징을 포함할 경우 팀 수준의 특징만 사용할 때와 비교해 예측 성능에 어떤 영향을 미치는가?
  • RQ3계층적 특징 공학이 스포츠 결과 예측의 정확도 향상에 얼마나 기여하는가?
  • RQ4제안된 모델은 도박 산업에서 널리 사용되는 기준을 뛰어넘는가?
  • RQ5이전 시즌 데이터로 학습한 모델이 다양한 시즌 간에 예측 성능이 얼마나 안정적인가?

주요 결과

  • 단순한 예측 방법과 복잡한 계층적 특징을 조합한 최적의 모델이 도박 산업 기준을 유의미하게 뛰어넘었다.
  • 팀 특징과 선수 특징을 모두 포함한 모델이 팀 특징만 사용한 경우보다 예측 성능이 향상되었다.
  • 모델은 2009년에서 2014년까지 테스트한 모든 시즌에서 일관되고 뛰어난 성능을 보였다.
  • 특징 공학이 핵심적인 역할을 했으며, 계층적 특징이 모델 정확도 향상에 크게 기여했다.
  • 이 연구는 기계학습이 T20 크리켓에서 높은 정밀도로 스포츠 결과를 효과적으로 예측할 수 있음을 확인했다.
  • 결과는 이러한 모델이 스포츠 베팅 시장에서 실질적인 이점을 제공할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.