Skip to main content
QUICK REVIEW

[論文レビュー] Human Perception of Performance

Luca Pappalardo, Paolo Cintia|arXiv (Cornell University)|Dec 5, 2017
Sports Analytics and Performance参考文献 2被引用数 10
ひとこと要約

本研究では、イタリアのスポーツ新聞から得た大規模な選手評価データセットを用いて機械学習で人工レフェリーを訓練することで、サッカー選手のパフォーマンスに対する人間の知覚を調査した。その結果、人間の評価は、特に文脈的に顕著な状況下で目立つ極端な、正規分布から外れたパフォーマンス特徴(「注目性ヒューリスティック」)に依存しており、豊富な技術的データが利用可能でも、それらが評価に反映されないことが明らかになった。

ABSTRACT

Humans are routinely asked to evaluate the performance of other individuals, separating success from failure and affecting outcomes from science to education and sports. Yet, in many contexts, the metrics driving the human evaluation process remain unclear. Here we analyse a massive dataset capturing players' evaluations by human judges to explore human perception of performance in soccer, the world's most popular sport. We use machine learning to design an artificial judge which accurately reproduces human evaluation, allowing us to demonstrate how human observers are biased towards diverse contextual features. By investigating the structure of the artificial judge, we uncover the aspects of the players' behavior which attract the attention of human judges, demonstrating that human evaluation is based on a noticeability heuristic where only feature values far from the norm are considered to rate an individual's performance.

研究の動機と目的

  • 人間のスポーツパフォーマンス評価の認知的メカニズム、特にサッカーにおけるそれらを理解すること。
  • 人間のレフェリーの評価に影響を与えるパフォーマンス特徴および文脈的要因を同定すること。
  • 機械学習を用いて人間の評価プロセスをモデル化・解明し、その背後にあるヒューリスティックを明らかにすること。
  • 文脈的情報(例:予想される試合結果)と生の技術的指標の両者が評価に与える影響を評価すること。

提案手法

  • 2015/2016年から2016/2017年までの760試合分のセリエAリーグで、3つの主要なイタリアスポーツ新聞から選手の評価を収集した。
  • パス、シュート、ゴール、ベッティング会社が推定した試合結果を含む100万件の試合内イベントから、150の技術的および文脈的特徴を抽出した。
  • これらの特徴に基づいて人間の評価を予測するため、ランダムフォレスト回帰モデルを訓練し、人工レフェリーを構築した。
  • 影響力のある特徴を同定するために、複数の特徴選択手法(分散分析F検定、再帰的特徴削除(RFE)、安定性選択(SS)、平均不純度低下(MDI))を適用した。
  • モデルの解釈可能性を用いて人工レフェリーの構造を分析し、特徴の重要度と注目性の閾値(平均値から±2σ)に焦点を当てた。
  • RMSEを用いてモデルの性能を評価し、異なる評価水準における安定性と特徴の変動性を分析した。

実験結果

リサーチクエスチョン

  • RQ1サッカーにおける人間の評価者が選手のパフォーマンスに最も強く影響を受ける特徴は何か?
  • RQ2予想される試合結果などの文脈的要因が、生の技術的指標と比較して人間のパフォーマンス認識にどの程度影響を及えるか?
  • RQ3人間の評価プロセスは、すべてのパフォーマンス特徴を包括的に評価するものとどの程度乖離しているか?
  • RQ4人間のパフォーマンス評価の背後には認知的ヒューリスティックが存在するのか?もしそうなら、その構造は何か?
  • RQ5極端な値におけるパフォーマンスプロファイルに関して、人間の評価はどの程度安定的かつ一貫的か?

主な発見

  • 人間の評価は、すべてのパフォーマンス特徴を包括的に評価するのではなく、極端な値(平均値から±2σ)にのみ注目し、重み付けする『注目性ヒューリスティック』に依存している。
  • 低次元の注目性に基づくパフォーマンス表現を用いて訓練された人工レフェリーは、人間の評価と高い統計的整合性を示し、人間の評価が本質的に単純かつ選択的であることを示している。
  • モデルの性能は約20の特徴で安定化し、これはほとんどのパフォーマンス指標が人間の評価にほとんど影響を与えないことを示唆している。
  • 極端な評価(例:4.0と8.5)は、特徴間の変動性が最大(σ ≈ 0.61と0.58)であり、高評価または低評価は一貫性のない、または極めて変動の大きいパフォーマンスプロファイルに対応していることを示している。
  • 文脈的特徴、特にベッティング会社が推定した試合結果が、モデルの精度を顕著に向上させ、人間の評価者が判断に状況的文脈を統合していることを示している。
  • 均一な特徴重要度を仮定するノンパラメトリックモデル(帰無モデル)は、極端な評価における特徴変動のピークを捉えられず、人間の知覚における包括的パフォーマンス評価の限界を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。