Skip to main content
QUICK REVIEW

[논문 리뷰] Judging the Judges: Evaluating the Performance of International Gymnastics Judges

Hugues Mercier, Sandro Heiniger|arXiv (Cornell University)|2018. 07. 26.
Sports Analytics and Performance참고 문헌 29인용 수 9
한 줄 요약

이 논문은 국제 체조 심판의 정확성, 편향 탐지 및 공정성 확보를 위해 이질분산 랜덤 변수를 기반으로 한 마킹 점수를 사용하는 통계 엔진인 심판 평가 프로그램(Judge Evaluation Program, JEP)을 소개한다. 이는 내재된 심판 오차 변동성을 모델링하고 객관적이고 종단적 성과 추적을 가능하게 하여 이전 시스템을 개선함으로써 국제체조연맹(FIG)에서 심판 선발 및 규정 개선에 기여한다.

ABSTRACT

Judging a gymnastics routine is a noisy process, and the performance of judges varies widely. In collaboration with the Fédération Internationale de Gymnastique (FIG) and Longines, we are designing and implementing an improved statistical engine to analyze the performance of gymnastics judges during and after major competitions like the Olympic Games and the World Championships. The engine, called the Judge Evaluation Program (JEP), has three objectives: (1) provide constructive feedback to judges, executive committees and national federations; (2) assign the best judges to the most important competitions; (3) detect bias and outright cheating. Using data from international gymnastics competitions held during the 2013-2016 Olympic cycle, we first develop a marking score evaluating the accuracy of the marks given by gymnastics judges. Judging a gymnastics routine is a random process, and we can model this process very accurately using heteroscedastic random variables. The marking score scales the difference between the mark of a judge and the theoretical performance of a gymnast as a function of the standard deviation of the judging error estimated from data for each apparatus. This dependence between judging variability and performance quality has never been properly studied. We then study ranking scores assessing to what extent judges rate gymnasts in the correct order, and explain why we ultimately chose not to implement them. We also study outlier detection to pinpoint gymnasts who were poorly evaluated by judges. Finally, we discuss interesting observations and discoveries that led to recommendations and rule changes at the FIG.

연구 동기 및 목표

  • 주요 대회 동안 국제 체조 심판의 정확성과 일관성을 객관적이고 데이터 기반의 방법으로 평가하는 데 목적이 있다.
  • 심판의 점수와 기대 성과 수준 간의 편차를 분석하여 체계적 편향이나 잠재적 부정행위를 탐지하는 데 목적이 있다.
  • 심판, 국가 연맹 및 집행위원회가 훈련 및 자격 부여 향상에 활용할 수 있는 실질적인 피드백을 제공하는 데 목적이 있다.
  • 올림픽 경기와 같은 고위험 이벤트에서 최고 성과를 낸 심판을 선발하는 데 목적이 있다.
  • 표준화된 지침을 통해 대회 후 평가에서 사용되는 제어 점수의 신뢰성을 향상시키는 데 목적이 있다.

제안 방법

  • 마킹 점수는 각 기구의 내재된 오차에 따라 변동성이 달라지는 이질분산 랜덤 과정으로 심판을 모델링하여, 기구별 정확성 평가가 가능하도록 한다.
  • 제어 점수는 라이브 대회 동안 모든 심판 점수의 중앙값을 사용하여 근사화하며, 대회 후에는 더 정확한 비디오 검토 점수를 활용해 검증한다.
  • 종단적 분석을 통해 수천 건의 평가를 거쳐 심판의 시간에 따른 일관성과 정확성을 평가한다.
  • 이상치 탐지 기법은 심판판에서 상당히 이질적이거나 정확하지 못한 점수를 받은 체조 선수를 식별한다.
  • 순위 점수는 안정성 부족과 작은 점수 차이에 대한 민감성으로 인해 최종적으로 구현되지 않았다.
  • 통계 모델은 공식 제어 점수가 확보되지 않은 경우 중앙값 점수를 대체로 사용하여 2013–2016 올림픽 시클 데이터를 기반으로 훈련된다.

실험 결과

연구 질문

  • RQ1통계 모델링을 통해 국제 체조 심판의 정확성을 객관적으로 측정할 수 있는 방법은 무엇인가?
  • RQ2내재된 심판 오차 변동성은 기구 간에 어떻게 다를 수 있으며, 점수 일관성에 어떤 영향을 미치는가?
  • RQ3통계 엔진은 실시간 및 후행 심판 평가에서 편향이나 부정행위를 탐지할 수 있는가?
  • RQ4라이브 대회 동안 중앙값 점수 등과 같은 제어 점수 근사치는 심판 평가의 신뢰성에 어떤 영향을 미치는가?
  • RQ5종단적 성과 추적은 일관되게 정확하거나 일관되지 않은 심판을 식별하는 데 어떤 역할을 하는가?

주요 결과

  • 마킹 점수는 기구별 내재된 심판 오차 변동성을 고려함으로써 심판 간 공정한 비교가 가능한 정확성 측정을 효과적으로 가능하게 한다.
  • 카테고리 1 심판들 사이에서도 뚜렷한 성과 차이가 관찰되어, 모든 정상 심판이 동일하게 정확한 것은 아님을 시사한다.
  • 이상치 탐지 기법은 잘못 평가된 체조 선수를 성공적으로 식별하여 심판판 평가의 잠재적 이질성을 드러냈다.
  • 라이브 대회 동안 중앙값 점수를 제어 점수의 대체 지표로 사용하면 합리적인 근사치를 제공하지만, 심판판이 체계적으로 정확하지 않다면 오해의 소지가 있다.
  • 대회 후 비디오 검토는 여전히 황금 표준으로 간주되지만, 그 신뢰성은 편향이 없는 구성과 일관된 집계 방법에 의존한다.
  • 본 연구는 국제체조연맹(FIG)에서 개선 지침과 규정 개선을 이끌어내었으며, 제어 점수 계산 지침 개선 및 심판 성과 모니터링 강화를 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.