Skip to main content
QUICK REVIEW

[論文レビュー] Judging the Judges: A General Framework for Evaluating the Performance of International Sports Judges

Sandro Heiniger, Hugues Mercier|arXiv (Cornell University)|Jul 26, 2018
Sports Analytics and Performance参考文献 16被引用数 5
ひとこと要約

本論文は、8つのオリンピック競技における異分散性のある審査誤差をモデル化することで、国際的スポーツ審査員の評価のための一般的なフレームワークを提案している。その結果、アスリートのパフォーマンス水準が向上するにつれて正確性が向上することが判明したが、ドレスエージュでは逆に高水準で合意が減少する傾向を示した。この手法は、内在的誤差変動の2次近似と標準化された採点スコアを用い、不規則または偏った審査を検出可能にし、異なる競技種目における審査員の客観的パフォーマンス評価を可能にした。

ABSTRACT

The monitoring of judges and referees in sports has become an important topic due to the increasing media exposure of international sporting events and the large monetary sums involved. In this article, we present a method to assess the accuracy of sports judges and estimate their bias. Our method is broadly applicable to all sports where panels of judges evaluate athletic performances on a finite scale. We analyze judging scores from eight different sports with comparable judging systems: diving, dressage, figure skating, freestyle skiing (aerials), freestyle snowboard (halfpipe, slopestyle), gymnastics, ski jumping and synchronized swimming. With the notable exception of dressage, we identify, for each aforementioned sport, a general and accurate pattern of the intrinsic judging error as a function of the performance level of the athlete. This intrinsic judging inaccuracy is heteroscedastic and can be approximated by a quadratic curve, indicating increased consensus among judges towards the best athletes. Using this observation, the framework developed to assess the performance of international gymnastics judges is applicable to all these sports: we can evaluate the performance of judges compared to their peers and distinguish cheating from unintentional misjudging. Our analysis also leads to valuable insights about the judging practices of the sports under consideration. In particular, it reveals a systemic judging problem in dressage, where judges disagree on what constitutes a good performance.

研究の動機と目的

  • 複数の競技種目にわたる国際的スポーツ審査員の正確性を評価するための一般的でスケーラブルな手法を開発すること。
  • パネル採点方式を採用する有限スケールの競技において、アスリートのパフォーマンス水準に応じた内在的審査誤差変動を定量化すること。
  • 個々の審査員のパフォーマンスを同僚のパフォーマンスと比較することで、標準化された誤差指標を用いて不規則または偏った審査を検出すること。
  • 特に主観性が強い競技(例:ドレスエージュ)において顕著な傾向を示す、審査におけるシステム的問題(例:国別バイアス、合意形成の欠如)を是正すること。
  • 匿名化や不透明なシステムに依存せず、連盟が監視および審査品質の向上を図れる透明性のあるデータドリブンなツールを提供すること。

提案手法

  • アスリートのパフォーマンス水準(c)に応じて分散が変化する異分散性のランダム変数として審査誤差をモデル化する。
  • 各競技種目について、パフォーマンス水準ごとの内在的審査誤差標準偏差 σd(c) の標準誤差を、下に凸の2次曲線でフィッティングする。
  • 各審査員の誤差を、次の式で標準化する:mp,j ≜ êp,j / σ̂(cp)。これは、各パフォーマンス水準における期待される変動と比較した偏差を表す。
  • 審査員の採点スコア Mj を、標準化誤差の平均二乗誤差の平方根として定義する:Mj ≜ √E[mp,j²]。Mj = 1 は中央値から1標準誤差のずれを意味し、Mj = 0 は同僚と完全に一貫していることを示す。
  • Mj を用いて外れ値の判断を行う(例:>2·σ̂d(cp)·Mj)。審査員固有の正確性に基づいてしきい値を調整し、不規則な行動とまれにしか起こらないが正確なバイアス行動を区別する。
  • 推定された σ̂d(cp) と Mj を統合し、国別バイアス検出などのバイアス分析に応用することで、一貫性と系統的 favouritism(好意的偏り)を分離する。

実験結果

リサーチクエスチョン

  • RQ1異なる競技種目において、アスリートのパフォーマンス水準が上昇するにつれて、審査誤差の変動性はどのように変化するか?
  • RQ2パネル採点方式を採用する競技において、内在的審査誤差変動を下に凸の2次関数としてモデル化できる程度はどの程度か?
  • RQ3なぜドレスエージュでは、パフォーマンス水準が高くなると審査員間の合意が減少する傾向を示すのか?
  • RQ4標準化された採点スコア Mj は、不規則な審査員と一貫したバイアスを持つ審査員を効果的に区別できるか?
  • RQ5連盟はこのフレームワークを用いて、匿名化や不透明なシステムに依存せずに、審査の正確性を監視および向上できるか?

主な発見

  • ドレスエージュを除く8つのオリンピック競技において、アスリートのパフォーマンス水準が向上するにつれて、審査誤差の変動性が低下し、下に凸の2次曲線に従う。これは、上位パフォーマンスのアスリートに対して審査員間で合意が高まっていることを示している。
  • ドレスエージュは顕著な例外である:パフォーマンス水準が高くなると、審査員間の合意が減少し、高品質なパフォーマンスの定義に主観的で合意が得られにくいことが示唆された。
  • 内在的審査誤差標準偏差 σd(c) は、2次関数モデルで正確に近似可能であり、各パフォーマンス水準における期待される誤差変動の推定が信頼性を持って可能となる。
  • 採点スコア Mj は審査員の正確性を効果的に定量化できる:Mj = 1 は中央値から1標準誤差のずれを意味し、Mj = 0 は同僚と完全に一貫していることを示す。
  • 外れ値検出のしきい値は、審査員の Mj に基づいて調整可能であり、極端な誤審査を検出しつつ、不規則な行動とまれにしか起こらないが正確なバイアス行動を区別できる。
  • このフレームワークは、客観的で透明性があり、スケーラブルな審査員監視を可能にし、パネル採点方式を採用する競技における能力不足や潜在的な腐敗の両方を検出するためのツールを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。