Skip to main content
QUICK REVIEW

[논문 리뷰] Multivariate Generalized Linear Mixed Models for Joint Estimation of Sporting Outcomes

Jennifer Broatch, Andrew T. Karl|arXiv (Cornell University)|2017. 10. 15.
Sports Analytics and Performance참고 문헌 17인용 수 6
한 줄 요약

이 논문은 다변량 일반화선형혼합모형(GLMM)을 제안하며, 정규분포, 포아송분포, 이항분포 등의 다양한 응답분포에서 상관된 팀 수준의 난수 효과를 모델링함으로써 승리 여부, 승리 점수, 페널티 라인 수 등의 다수의 스포츠 결과를 동시에 추정한다. 이 방법은 응답 간 상관관계가 높을 경우 예측 정확도를 향상시키며, 다양한 성과 지표에 걸쳐 팀 수준의 영향을 동시에 추론할 수 있도록 한다. 이를 통해 NCAA 풋볼 및 농구 데이터에서 R 패키지 mvglmmRank를 활용하여 검증되었다.

ABSTRACT

This paper explores improvements in prediction accuracy and inference capability when allowing for potential correlation in team-level random effects across multiple game-level responses from different assumed distributions. First-order and fully exponential Laplace approximations are used to fit normal-binary and Poisson-binary multivariate generalized linear mixed models with non-nested random effects structures. We have built these models into the R package mvglmmRank, which is used to explore several seasons of American college football and basketball data.

연구 동기 및 목표

  • 다른 결과를 별도로 다루는 대신, 여러 경기 수준의 결과를 공동으로 모델링하여 스포츠 분석에서 예측 정확도를 향상시키는 것.
  • 다양한 응답 유형(예: 득점, 승패, 페널티) 간의 상관된 팀 수준의 난수 효과를 다변량 정규분포를 사용해 모델링하는 것.
  • 개별 모형이 극단적인 기록(예: 무패팀)으로 인해 실패할 수 있는 상황에서도, 팀별 공격력, 수비력, 승리 가능성에 대한 영향을 동시에 추론할 수 있도록 하는 것.
  • 정규분포, 포아송분포, 이항분포가 혼합된 응답을 공동으로 추정하기 위한 계산적으로 안정적인 프레임워크를 개발하는 것.
  • 실제 스포츠 데이터셋에서 공동 모델링를 구현하고 테스트할 수 있도록 개방소스 R 패키지(mvglmmRank)를 제공하는 것.

제안 방법

  • 비중첩된 난수 효과 구조를 가진 다변량 GLMM을 설정하여, 서로 다른 응답 유형 간 팀 수준의 난수 효과 간 상관관계를 허용한다.
  • 특히 비정규분포 응답에 대해 효율적인 모형 파rameter 추정을 위해 일阶 및 완전 지수형 라플라스 근사(approximation)를 사용한다.
  • 응답을 다양한 분포로 모델링: 고득점 스포츠(예: 농구)에는 정규분포, 저득점 스포츠(예: 축구)에는 포아송분포, 승패 결과에는 이항분포를 사용한다.
  • 정규분포 사전분포를 팀 수준의 난수 효과(공격, 수비, 승리 가능성)에 부여하여 추정을 정규화하고 극단적인 팀 기록을 처리한다.
  • 난수 효과의 공분산 구조(G 및 R 행렬)를 추정하여 성과 지표 간 및 승리 결과 간의 의존성을 포착한다.
  • R 패키지 mvglmmRank에 모델을 구현하여, 모형 피팅(mvglmmRank), 예측(game.pred), 헤시안 기반 추론을 위한 기능을 제공한다.

실험 결과

연구 질문

  • RQ1다양한 스포츠 결과(예: 득점과 승패 여부)를 공동으로 모델링할 경우, 단변량 모형보다 예측 정확도가 향상되는가?
  • RQ2다른 응답에 대해 팀 수준의 난수 효과 간 상관관계가 모형 성능과 예측 오차에 어떤 영향을 미치는가?
  • RQ3개별 모형이 희소하거나 극단적인 데이터로 인해 불안정해질 경우, 공동 모델링이 팀 수준의 영향(예: 공격력, 수비력)에 대한 추론을 향상시킬 수 있는가?
  • RQ4응답 분포 선택(정규분포 대비 포아송분포 대비 이항분포)이 다양한 스포츠에서 모형 적합도와 예측 성능에 어떤 영향을 미치는가?
  • RQ5고위험 결과(예: 전국 챔피언십 결승전) 예측에서 전통적인 단일 응답 모형에 비해 공동 모델은 어떻게 비교되는가?

주요 결과

  • 교차검증에서 다수의 응답에 대해 공동 모델링이 중앙값 로그손실과 절대잔차를 크게 향상시켰으며, 특히 승패 여부가 게임 수준의 응답과 높은 상관관계를 보일 경우 두드러졌다.
  • 정규-이항 모형은 2012년 전국 챔피언십에서 노트리돌이 앨라배마를 이길 가능성을 22.2%로 예측했으나, 단변량 이항 모형은 노트리돌의 승리 가능성을 잘못 62.5%로 예측했다.
  • 상관된 난수 효과를 가진 다변량 모형은 무패 또는 무승팀에 대해 더 안정적인 추정치를 제공했으며, 공유된 팀 수준의 효과를 통해 승리 가능성 평가를 정규화했다.
  • 승리 가능성과 공격/수비 효과 간 상관계수가 높았으며(예: 승리 가능성과 공격력 간 상관계수 0.855), 팀 실력과 승리 결과 사이에 강한 관계가 있음을 시사했다.
  • mvglmmRank 패키지는 라플라스 근사를 사용하여 최대 3개의 응답(예: 플레이당 요드, 스택, 승패 여부)을 가진 모형을 성공적으로 피팅하여 계산적 안정성과 확장성(스케일러빌리티)을 입증했다.
  • 모형에서 헤시안 기반 표준오차를 사용하여 불확실성을 평가하였으며, 전체 헤시안 행렬은 추론 및 모형 진단에 활용 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.