Skip to main content
QUICK REVIEW

[논문 리뷰] The Advantage of Doubling: A Deep Reinforcement Learning Approach to Studying the Double Team in the NBA

Jiaxuan Wang, Ian Fox|arXiv (Cornell University)|2018. 03. 08.
Sports Analytics and Performance참고 문헌 6인용 수 13
한 줄 요약

이 논문은 643,000개의 NBA 드라이브를 대상으로 딥 강화학습을 적용하여, 슈터를 빈자리로 둔 채로 볼 핸들러를 방해하는 것과의 리스크-보상 균형을 고려한 최적의 듀얼 태클 수비 전략을 모델링한다. 학습된 정책이 드라이브당 실점과 승률을 예측함으로써, 언제이고 어떻게 효과적으로 듀얼 태클을 해야 할지에 대한 데이터 기반 통찰을 제공한다.

ABSTRACT

During the 2017 NBA playoffs, Celtics coach Brad Stevens was faced with a difficult decision when defending against the Cavaliers: "Do you double and risk giving up easy shots, or stay at home and do the best you can?" It's a tough call, but finding a good defensive strategy that effectively incorporates doubling can make all the difference in the NBA. In this paper, we analyze double teaming in the NBA, quantifying the trade-off between risk and reward. Using player trajectory data pertaining to over 643,000 possessions, we identified when the ball handler was double teamed. Given these data and the corresponding outcome (i.e., was the defense successful), we used deep reinforcement learning to estimate the quality of the defensive actions. We present qualitative and quantitative results summarizing our learned defensive strategy for defending. We show that our policy value estimates are predictive of points per possession and win percentage. Overall, the proposed framework represents a step toward a more comprehensive understanding of defensive strategies in the NBA.

연구 동기 및 목표

  • NBA 수비에서 듀얼 태클의 리스크-보상 트레이드오프를 정량화하는 것.
  • 선수 이동 경로 데이터와 경기 결과를 기반으로 최적의 수비 전략을 모델링하는 것.
  • 실제 경기 상황을 기반으로 수비 성공 여부를 예측하는 데이터 기반 정책을 개발하는 것.
  • 학습된 수비 정책이 드라이브당 실점 및 승률과 같은 측정 가능한 경기 성과 지표와 상관관계가 있는지 평가하는 것.

제안 방법

  • 저자들은 643,000개 이상의 NBA 드라이브에서 선수 이동 경로 데이터를 수집하고 처리하여 듀얼 태클 이벤트를 식별했다.
  • 딥 Q넷워크(DQN)를 사용하여 수비 행동의 장기적 보상을 추정하는 가치 함수를 학습시켰다.
  • 상태 표현에는 선수의 공간적 위치, 볼 위치, 슛 클락 및 득점 격차와 같은 경기 맥락 정보가 포함되었다.
  • 에이전트는 기대 실점 절감량을 최대화하도록 훈련되어, 결과 피드백을 바탕으로 언제 듀얼 태클을 해야 할지 학습했다.
  • 드라이브당 실점과 팀 승률에 대한 예측 정확도를 사용하여 정책을 평가했다.
  • 수비 결정의 질을 추정하는 가치 함수를 훈련시켜 다양한 전략 간 비교를 가능하게 했다.

실험 결과

연구 질문

  • RQ1NBA 1v1 상황에서 듀얼 태클이 최적의 수비 행동인 경우는 언제인가?
  • RQ2슈터를 빈자리로 둔 채로 볼 핸들러를 방해하는 것의 리스크는, 볼 핸들러를 방해함으로써 얻는 이득과 비교해 어떻게 되는가?
  • RQ3딥 강화학습 모델이 실세계 성과 지표를 예측할 수 있는 수비 정책을 학습할 수 있는가?
  • RQ4듀얼 태클의 효과성에 영향을 미치는 주요 공간적 및 상황적 요소는 무엇인가?

주요 결과

  • 학습된 수비 정책은 드라이브당 실점을 유의미하게 예측하여 실제 경기 결과와의 강한 일치를 보였다.
  • 정책의 가치 추정치는 팀 승률과 상관관계가 있어 실제 적용 가능성에서의 타당성을 입증했다.
  • 높은 리스크 상황에서 유리한 공간적 배치를 취했을 때 듀얼 태클이 가장 효과적이었다.
  • 모델은 듀얼 태클 성공률을 높이는 특정한 선수 위치 패턴을 식별했다.
  • 이 프레임워크는 공격적인 수비와 수비 간격 유지 간의 역동적 트레이드오프를 성공적으로 포착했다.
  • 이 접근법은 농구에서 수비 전략을 평가하고 최적화하는 데 있어 확장 가능하고 데이터 기반의 방법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.