Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting key Soccer match events to create highlights using Computer Vision

Narayana Darapaneni, Prashant Kumar|arXiv (Cornell University)|2022. 04. 06.
Video Analysis and Summarization인용 수 4
한 줄 요약

이 논문은 Faster R-CNN 및 YOLOv5 모델을 사용하여 축구 경기에서의 핵심 이벤트를 자동으로 감지하여 하이라이트를 생성하기 위한 컴퓨터 비전 기반 접근법을 제안한다. 경기 영상으로 훈련된 Faster R-CNN는 ResNet50를 사용해 95.5%의 정확도를 달성했으며, 23분 분량의 경기를 4:50분으로 압축하면서도 핵심 이벤트를 유지하였다.

ABSTRACT

The research and data science community has been fascinated with the development of automatic systems for the detection of key events in a video. Special attention in this field is given to sports video analytics which could help in identifying key events during a match and help in preparing a strategy for the games going forward. For this paper, we have chosen Football (soccer) as a sport where we would want to create highlights for a given match video, through a computer vision model that aims to identify important events in a Soccer match to create highlights of the match. We built the models based on Faster RCNN and YoloV5 architectures and noticed that for the amount of data we used for training Faster RCNN did better than YoloV5 in detecting the events in the match though it was much slower. Within Faster RCNN using ResNet50 as a base model gave a better class accuracy of 95.5% as compared to 92% with VGG16 as base model completely outperforming YoloV5 for our training dataset. We tested with an original video of size 23 minutes and our model could reduce it to 4:50 minutes of highlights capturing almost all important events in the match.

연구 동기 및 목표

  • 컴퓨터 비전을 활용해 축구 경기 영상에서 핵심 이벤트를 자동으로 식별하는 시스템을 개발하는 것.
  • Faster R-CNN 및 YOLOv5와 같은 객체 검출 모델의 성능을 축구 특화 이벤트 감지에 대해 평가하는 것.
  • 감지된 이벤트 기반으로 비핵심 영상 부분을 필터링하여 간결하고 정보적인 하이라이트를 생성하는 것.
  • 실세계 스포츠 영상 요약 작업에서 모델의 효율성과 정확도를 비교하는 것.
  • 최소한의 인간 간섭으로 딥 러닝을 활용한 스포츠 하이라이트 생성의 가능성을 입증하는 것.

제안 방법

  • 핵심 축구 이벤트인 골, 페널티, 경고 카드 등을 포함한 애너테이션 처리된 경기 프레임으로 구성된 커스텀 데이터셋을 사용해 모델을 훈련시켰다.
  • Faster R-CNN에서 특징 추출 성능에 미치는 영향을 평가하기 위해 ResNet50와 VGG16을 백본으로 사용하였다.
  • 예측된 바운딩 박스의 정밀도를 높이고 가짜 양성 결과를 줄이기 위해 비최대 억제와 신뢰도 임계값 처리를 적용하였다.
  • 검증 세트에서 평균 평균 정밀도와 분류 정확도를 사용해 모델 성능을 평가하였다.
  • 최고 성능을 보인 모델을 사용해 전체 23분 분량의 경기 영상에서 4:50분 분량의 요약 하이라이트 클립을 생성하였다.

실험 결과

연구 질문

  • RQ1Faster R-CNN와 YOLOv5는 골, 페널티, 카드와 같은 핵심 축구 경기 이벤트 감지에 얼마나 효과적인가?
  • RQ2다른 백본 네트워크(ResNet50 대비 VGG16)가 축구 영상 분석에서 검출 정확도에 어떤 영향을 미치는가?
  • RQ3컴퓨터 비전 모델은 전체 경기 영상을 핵심 이벤트를 모두 유지하면서도 간결한 하이라이트 영상으로 압축할 수 있는가?
  • RQ4실시간 또는 실시간에 가까운 하이라이트 생성 환경에서 Faster R-CNN와 YOLOv5 간의 추론 속도는 어떻게 비교되는가?
  • RQ5모델 아키텍처는 스포츠 영상 요약 작업에서 정확도와 처리 시간의 균형을 어떻게 영향을 미치는가?

주요 결과

  • 백본으로 ResNet50를 사용한 Faster R-CNN가 테스트 세트에서 가장 높은 분류 정확도 95.5%를 기록하였다.
  • 속도가 훨씬 느리지만 Faster R-CNN가 YOLOv5를 초월하는 검출 정확도를 보였으며, 이는 속도와 정밀도 사이의 상충 관계를 시사한다.
  • VGG16 기반 Faster R-CNN는 92%의 정확도를 기록했으며, ResNet50 버전에 비해 떨어져 깊이 있는 잔차 특징의 우수성을 입증한다.
  • 최종 모델은 23분 분량의 축구 경기 영상을 4:50분 분량의 하이라이트로 압축하면서 거의 모든 핵심 이벤트를 포착하였다.
  • 엔드 투 엔드 딥 러닝을 통해 골, 노란 카드, 빨간 카드, 페널티 등 다양한 이벤트를 안정적으로 식별하는 데 성공하였다.
  • 결과적으로 최신 기술 수준의 객체 검출 모델이 높은 정밀도로 스포츠 영상 요약에 효과적으로 적용될 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.