Skip to main content
QUICK REVIEW

[논문 리뷰] Human Perception of Performance

Luca Pappalardo, Paolo Cintia|arXiv (Cornell University)|2017. 12. 05.
Sports Analytics and Performance참고 문헌 2인용 수 10
한 줄 요약

이 연구는 이탈리아 스포츠 신문에서 수집한 대규모 선수 평가 데이터를 기반으로 기계학습을 사용해 인공 심판을 훈련시켜 축구 선수 성과에 대한 인간의 인지적 인식을 조사한다. 연구 결과, 인간 평가자는 풍부한 기술적 데이터가 존재하더라도, 특히 맥락적으로 두드러지는 상황에서 두드러지게 빛나는 비정상적인 성과 특성들만 주목하여 평가에 반영하는 '주의 유도 히ュ리스틱'에 의존함을 밝혀냈다.

ABSTRACT

Humans are routinely asked to evaluate the performance of other individuals, separating success from failure and affecting outcomes from science to education and sports. Yet, in many contexts, the metrics driving the human evaluation process remain unclear. Here we analyse a massive dataset capturing players' evaluations by human judges to explore human perception of performance in soccer, the world's most popular sport. We use machine learning to design an artificial judge which accurately reproduces human evaluation, allowing us to demonstrate how human observers are biased towards diverse contextual features. By investigating the structure of the artificial judge, we uncover the aspects of the players' behavior which attract the attention of human judges, demonstrating that human evaluation is based on a noticeability heuristic where only feature values far from the norm are considered to rate an individual's performance.

연구 동기 및 목표

  • 축구와 같은 스포츠에서 인간이 운동 성과를 평가하는 데에 작용하는 인지적 메커니즘을 이해하는 것.
  • 인간 평가자가 평가에 영향을 주는 성과 특성과 맥락적 요인을 특정하는 것.
  • 기계학습을 활용해 인간 평가 과정을 모델링하고, 그 배후에 숨겨진 히ュ리스틱을 밝혀내는 것.
  • 평가에 영향을 주는 맥락 정보(예: 예상 경기 결과)와 원시 기술 지표 간의 역할을 평가하는 것.

제안 방법

  • 2015/2016~2016/2017 시즌 동안 이탈리아 세 편의 주요 스포츠 신문에서 760场 세리에A 경기의 선수 평가를 수집하였다.
  • 패assing, 슈팅, 골, 베파머크 기반 예측된 경기 결과 등 100만 건의 경기 이벤트에서 150개의 기술적 및 맥락적 특징을 추출하였다.
  • 이러한 특징을 기반으로 인간 평가를 예측하는 데 목적이 있는 기계학습 모델(랜덤 포레스트 리그레서)을 훈련시켜 인공 심판을 구축하였다.
  • 영향력 있는 특징을 식별하기 위해 다수의 특징 선택 기법(ANOVA F-검정, 순차적 특징 제거(RFE), 안정성 선택(SS), 평균 불순도 감소(MDI))을 적용하였다.
  • 모델의 해석 가능성 기법을 활용해 인공 심판의 구조를 분석하였으며, 특징 중요도와 주목도 임계값(평균에서 ±2σ)을 중심으로 분석하였다.
  • 모델 성능은 RMSE를 사용해 평가하였고, 다양한 평가 수준에서의 안정성과 특징 변동성을 분석하였다.

실험 결과

연구 질문

  • RQ1축구에서 인간 평가자가 선수 성과 평가에 가장 강하게 영향을 주는 성과 특성은 무엇인가?
  • RQ2예상 경기 결과와 같은 맥락적 요소가 원시 기술 지표에 비해 인간의 성과 인식에 얼마나 큰 영향을 미치는가?
  • RQ3인간 평가 과정은 모든 성과 특성에 대한 종합적 평가에서 얼마나 벗어나 있는가?
  • RQ4인간 성과 평가 배후에 인지적 히ュ리스틱이 존재한다면, 그 구조는 어떠한가?
  • RQ5특히 극단적 값에서, 인간 평가는 다양한 성과 프로파일에 대해 얼마나 안정적이고 일관된가?

주요 결과

  • 인간 평가는 모든 성과 특성에 대한 종합적 평가가 아니라, 극단적인 값(평균에서 ±2σ)만 주목하고 가중치를 두는 '주의 유도 히ュ리스틱'에 의해 결정된다.
  • 낮은 차원의 주목도 기반 성과 표현을 기반으로 훈련된 인공 심판은 인간 평가와 높은 통계적 일치도를 보였으며, 이는 인간 평가가 본질적으로 단순하고 선택적임을 시사한다.
  • 모델 성능은 약 20개의 특징 이후에 안정화되었으며, 이는 대부분의 성과 지표가 인간 평가에 거의 영향을 주지 못함을 의미한다.
  • 극단적 평가(예: 4.0과 8.5)는 가장 높은 상호 특징 변동성(σ ≈ 0.61 및 0.58)을 보이며, 이는 높거나 낮은 평가가 일관되지 않거나 매우 변동성이 큰 성과 프로파일을 의미한다.
  • 맥락적 특징—특히 베파머크가 예측한 경기 결과—는 모델 정확도를 크게 향상시켜, 인간 평가자가 판단 시 상황적 맥락을 통합함을 보여준다.
  • 균형 모델(모든 특징의 중요도가 동일하다는 가정)은 극단적 평가에서 특징 변동성의 피크를 포착하지 못했으며, 이는 인간 인지에서 종합적 성과 평가의 한계를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.