Skip to main content
QUICK REVIEW

[논문 리뷰] Hockey Player Performance via Regularized Logistic Regression

Robert B. Gramacy, Matt Taddy|arXiv (Cornell University)|2016. 12. 21.
Sports Analytics and Performance참고 문헌 19인용 수 3
한 줄 요약

이 논문은 팀메이트와 상대팀의 영향을 동시에 모델링하여 골 기여도에 대한 개인의 부분 기여도를 추정하기 위해 정규화된 로지스틱 회귀 모델을 제안한다. 고차원의 경기 데이터에 펜라이즈드 우도 추정을 적용함으로써 표준 최대우도 추정이 실패하는 고차원 파rameter 공간에서 과적합 또는 식별불가 문제로 인한 노이즈에서 벗어나 각 선수의 영향력을 분리하여 추정함으로써, 기존의 플러스마이너스보다 더 정확하고 안정적인 성과 측정법을 제공한다.

ABSTRACT

A hockey player's plus-minus measures the difference between goals scored by and against that player's team while the player was on the ice. This measures only a marginal effect, failing to account for the influence of the others he is playing with and against. A better approach would be to jointly model the effects of all players, and any other confounding information, in order to infer a partial effect for this individual: his influence on the box score regardless of who else is on the ice. This chapter describes and illustrates a simple algorithm for recovering such partial effects. There are two main ingredients. First, we provide a logistic regression model that can predict which team has scored a given goal as a function of who was on the ice, what teams were playing, and details of the game situation (e.g. full-strength or power-play). Since the resulting model is so high dimensional that standard maximum likelihood estimation techniques fail, our second ingredient is a scheme for regularized estimation. This adds a penalty to the objective that favors parsimonious models and stabilizes estimation. Such techniques have proven useful in fields from genetics to finance over the past two decades, and have demonstrated an impressive ability to gracefully handle large and highly imbalanced data sets. The latest software packages accompanying this new methodology -- which exploit parallel computing environments, sparse matrices, and other features of modern data structures -- are widely available and make it straightforward for interested analysts to explore their own models of player contribution.

연구 동기 및 목표

  • 기존의 플러스마이너스가 개인 선수 기여도를 분리하는 데에 한계를 보이는 문제를 해결하기 위해.
  • 팀메이트, 상대팀, 경기 상황을 고려하여 모든 선수의 공동 영향력을 목표 결과에 대해 모델링하기 위해.
  • 고차원적이고 불균형한 아이스하키 데이터에 대해 안정적이고 단순한 추정 방법을 개발하기 위해.
  • 현대적 정규화 기법을 활용하여 전통적인 단일 지표(예: 플러스마이너스)의 통계적으로 엄밀한 대안을 제공하기 위해.
  • 접근 가능한 소프트웨어와 계산 효율성으로 인해 분석가들이 실용적으로 플레이어 평가 모델을 적용할 수 있도록 하기 위해.

제안 방법

  • 골이 기록된 팀을 결과로 하는 로지스틱 회귀 모델을 설정하며, 이는 선수의 경기 출전 여부, 팀 식별자, 경기 상황(예: 파워플레이, 일치상황 등)을 기반으로 한다.
  • 표준 최대우도 추정이 실패하는 고차원 파rameter 공간에서 추정을 안정화하기 위해 정규화(예: L1 또는 L2 페널티)를 사용한다.
  • 대규모 데이터를 효율적으로 처리하기 위해 희소 행렬 표현과 병렬 컴퓨팅을 통합한다.
  • 더 나은 일반화 성능을 갖는 단순한 모델을 선호하도록 펜라이즈드 로그우도 목표함수를 최적화한다.
  • 각 선수의 부분 효과를 추정하여 팀 맥락과 무관한 골 기여도를 고립된 형태로 표현한다.
  • 정규화와 고성능 컴퓨팅을 지원하는 현대 통계 소프트웨어 패키지를 활용하여 모델 피팅을 수행한다.

실험 결과

연구 질문

  • RQ1아이스하키에서 팀 및 상대팀 효과로부터 개인 선수의 기여도를 어떻게 고립시킬 수 있는가?
  • RQ2로지스틱 회귀를 활용한 공동 모델링 접근법이 플러스마이너스와 같은 단일 지표보다 선수 영향력을 더 잘 추정할 수 있는가?
  • RQ3정규화가 고차원적이고 희소한 아이스하키 데이터에서 추정의 안정성을 어떻게 향상시키는가?
  • RQ4경기 상황(예: 파워플레이, 수적상황 등)을 선수 성과 모델에 의미 있게 통합할 수 있는 정도는 어느 정도인가?
  • RQ5확장 가능한 계산 방법을 통해 고성능 리소스가 없는 분석가들도 고급 선수 평가 모델을 접근 가능하게 만들 수 있는가?

주요 결과

  • 제안된 모델은 팀메이트와 상대팀의 영향을 고려함으로써 개인 선수의 영향력을 성공적으로 고립시켜, 기존의 플러스마이너스보다 더 정확한 경기상 영향도 측정법을 제공한다.
  • 정규화는 표준 최대우도 추정이 과적합 또는 식별불가 문제로 실패할 수 있는 고차원 설정에서 추정의 안정성을 높인다.
  • 이 방법은 아이스하키에서 흔한 희귀 사건(예: 수적상황 골)과 같은 불균형 데이터를 변환 없이도 효과적으로 처리한다.
  • 희소 행렬과 병렬 컴퓨팅의 활용은 대규모 데이터셋에서의 효율적 모델 피팅을 가능하게 하여 실용적인 분석에 적합한 접근법이 되었다.
  • 최종적으로 도출된 부분 효과 추정치는 해석 가능하고 강인하여 히وري스틱 성과 지표의 체계적인 대안을 제공한다.
  • 현대 소프트웨어 도구 덕분에 연구자와 분석가들이 이러한 모델을 독립적으로 구현하고 확장할 수 있게 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.