[논문 리뷰] Using Twitter to predict football outcomes
이 연구는 트위터 데이터가 영국 프리미어리그 축구 경기 결과를 예측하는 데 사용될 수 있는지 조사한다. 트위터 트윗에 자연어 처리(NLP)와 감성 분석을 적용하여, 무작위 예측을 뛰어넘고 역사적 통계만을 사용하는 모델과 유사한 성능을 보이는 예측 모델을 구축한다. 통합 모델은 더 높은 정확도를 보이며, 성능이 뛰어나다.
Twitter has been proven to be a notable source for predictive modelling on various domains such as the stock market, the dissemination of diseases or sports outcomes. However, such a study has not been conducted in football (soccer) so far. The purpose of this research was to study whether data mined from Twitter can be used for this purpose. We built a set of predictive models for the outcome of football games of the English Premier League for a 3 month period based on tweets and we studied whether these models can overcome predictive models which use only historical data and simple football statistics. Moreover, combined models are constructed using both Twitter and historical data. The final results indicate that data mined from Twitter can indeed be a useful source for predicting games in the Premier League. The final Twitter-based model performs significantly better than chance when measured by Cohen's kappa and is comparable to the model that uses simple statistics and historical data. Combining both models raises the performance higher than it was achieved by each individual model. Thereby, this study provides evidence that Twitter derived features can indeed provide useful information for the prediction of football (soccer) outcomes.
연구 동기 및 목표
- 트위터 데이터가 영국 프리미어리그 축구 경기 결과를 신뢰할 만한 예측 도구로 사용될 수 있는지 확인하는 것.
- 역사적 축구 통계에 기반한 모델과 비교해 트위터에서 유도된 특징의 예측 능력을 평가하는 것.
- 트위터 데이터와 전통적 통계를 결합할 경우 예측 정확도가 향상되는지 평가하는 것.
- 실시간 소셜 미디어 감성 분석을 스포츠 결과 예측에 활용하는 것이 실현 가능한지 평가하는 것.
제안 방법
- 트위터 API를 사용해 3개월 간의 프리미어리그 경기와 관련된 트윗을 수집하였다.
- 자연어 처리(NLP) 기법을 적용해 트윗에서 감성 및 주제 특징을 추출하였다.
- 트위터에서 유도된 특징을 기반으로 로지스틱 회귀 및 기타 기계학습 분류기로 예측 모델을 구축하였다.
- 팀 순위, 골 득실 차이 등 간단한 축구 통계 자료만을 사용해 기준 모델을 구축하였다.
- 트위터 특징와 역사적 통계를 융합해 성능을 향상시킨 하이브리드 모델을 구축하였다.
- Cohen의 카파 계수와 정확도 지표를 사용해 모델 성능을 평가하였으며, 무작위 예측 및 기준 모델과의 비교를 실시하였다.
실험 결과
연구 질문
- RQ1트위터 감성과 논의 빈도가 영국 프리미어리그 축구 경기 결과를 예측할 수 있는가?
- RQ2트위터 기반 모델의 예측 성능은 역사적 축구 통계만을 사용하는 모델과 비교해 어떻게 다른가?
- RQ3트위터 데이터와 전통적 통계를 융합할 경우 예측 정확도 향상 정도는 어느 정도인가?
- RQ4트위터 데이터의 예측 능력은 무작위 예측을 뛰어넘어 통계적으로 유의미한가?
주요 결과
- Cohen의 카파 계수로 측정한 결과, 트위터 기반 예측 모델은 무작위 예측을 뚜렷이 뛰어넘었다.
- 트위터 전용 모델의 성능은 역사적 축구 통계만을 사용하는 모델와 유사한 성능을 보였다.
- 트위터 데이터와 역사적 데이터를 융합한 통합 모델은 개별적으로 사용된 모델보다 더 높은 예측 정확도를 달성하였다.
- 트위터에서의 감성과 논의 빈도는 경기 결과 예측에 의미 있는 예측 변수로 확인되었다.
- 본 연구는 실시간 소셜 미디어 데이터가 스포츠 예측에 실질적인 예측 통찰을 제공할 수 있음을 입증한다.
- 결과는 소셜 미디어를 스포츠 분석에서 보조 데이터 소스로 활용할 수 있음을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.