Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Video Action Recognition in Sports: Datasets, Methods and Applications

Fei Wu, Qingzhong Wang|arXiv (Cornell University)|2022. 06. 02.
Human Pose and Action Recognition인용 수 10
한 줄 요약

이 종합 검토는 12개의 스포츠에 걸쳐 데이터셋, 딥러닝 방법 및 응용 분야를 포함하여 스포츠 영상 동작 인식에 대해 포괄적인 검토를 제공한다. 장기적인 분포와 다중 시점 인식과 같은 과제를 해결하기 위해 풋볼, 농구, 테이블 테니스, 피겨 스케이팅을 지원하는 PaddlePaddle 기반 툴박스를 소개한다.

ABSTRACT

To understand human behaviors, action recognition based on videos is a common approach. Compared with image-based action recognition, videos provide much more information. Reducing the ambiguity of actions and in the last decade, many works focused on datasets, novel models and learning approaches have improved video action recognition to a higher level. However, there are challenges and unsolved problems, in particular in sports analytics where data collection and labeling are more sophisticated, requiring sport professionals to annotate data. In addition, the actions could be extremely fast and it becomes difficult to recognize them. Moreover, in team sports like football and basketball, one action could involve multiple players, and to correctly recognize them, we need to analyse all players, which is relatively complicated. In this paper, we present a survey on video action recognition for sports analytics. We introduce more than ten types of sports, including team sports, such as football, basketball, volleyball, hockey and individual sports, such as figure skating, gymnastics, table tennis, tennis, diving and badminton. Then we compare numerous existing frameworks for sports analysis to present status quo of video action recognition in both team sports and individual sports. Finally, we discuss the challenges and unsolved problems in this area and to facilitate sports analytics, we develop a toolbox using PaddlePaddle, which supports football, basketball, table tennis and figure skating action recognition.

연구 동기 및 목표

  • 스포츠 영상 동작 인식을 위한 기존 데이터셋, 모델 및 프레임워크를 체계적으로 검토하기 위해.
  • 장기적인 분포 및 다수의 플레이어 상호작용과 같은 스포츠 영상 분석의 핵심 기술적 과제를 특정하기 위해.
  • 스포츠 전용 동작 인식에서 레이블링 비용을 줄이기 위해 전이 학습, 소수 샘플 학습 및 제로샷 학습 전략을 제안하기 위해.
  • 스포츠 영상 분석 연구를 지원하기 위해 PaddlePaddle를 기반으로 한 공개 툴박스를 개발하기 위해.

제안 방법

  • 2011년에서 2023년 사이의 200개 이상의 연구 논문을 검토하여 스포츠 유형(팀 vs. 개인) 및 방법(2D/3D CNN, 뼈대 기반, 통계적 학습)으로 분류한다.
  • Kinetics-400, FSD-10, P2A, SVW 등의 벤치마크 데이터셋에서 딥러닝 모델의 성능을 분석한다.
  • 클래스 분포 시각화 및 통계 분석을 통해 스포츠 데이터셋에서의 장기적인 분포 문제를 평가한다.
  • 다양한 카메라 각도에서의 강건성을 향상시키기 위해 다중 카메라 및 다중 시점 동작 인식 전략을 제안한다.
  • 대규모 레이블링된 데이터에 대한 의존도를 줄이기 위해 전이 학습 및 소수 샘플 학습 기법을 통합한다.
  • 사전 학습된 모델과 추론 파이프라인을 지원하는 풋볼, 농구, 테이블 테니스, 피겨 스케이팅을 위한 PaddlePaddle 기반 툴박스를 공개한다.

실험 결과

연구 질문

  • RQ1팀 스포츠에서 다수의 상호작용 플레이어를 포함할 경우, 스포츠 영상 동작 인식의 핵심 과제는 무엇인가?
  • RQ2스포츠 데이터셋에서 장기적인 클래스 분포가 모델 성능에 미치는 영향은 무엇이며, 이를 완화하기 위한 전략은 무엇인가?
  • RQ3전이 학습, 소수 샘플 학습 또는 제로샷 학습이 스포츠 영상 분석에서 레이블링 비용을 얼마나 줄일 수 있는가?
  • RQ42D, 3D, 뼈대 기반 등의 다양한 딥러닝 아키텍처는 개인 스포츠와 팀 스포츠 모두에서 성능 면에서 어떻게 비교되는가?
  • RQ5실제 스포츠 영상 응용 분야에서 다중 카메라 및 다중 시점 동작 인식의 현재 한계는 무엇인가?

주요 결과

  • 스포츠 영상 동작 인식은 특히 P2A 및 SVW와 같은 데이터셋에서 일부 동작이 데이터를 지배하기 때문에 장기적인 분포 문제로 심각하게 저해된다.
  • 피겨 스케이팅 및 조정과 같은 세부 동작 인식 작업에서는 뼈대 기반 방법과 3D CNN이 2D CNN보다 성능이 뛰어나며, 이는 더 나은 시간적 모델링 덕분이다.
  • 일관되지 않은 카메라 시점과 통합된 벤치마크 부족으로 인해 다중 시점 동작 인식은 여전히 도전 과제이며, 적응형 모델 스위칭이 필요하다.
  • 다양한 스포츠 영상에서 자기지도 학습을 통한 전이 학습은 소수 샘플 일반화 성능을 향상시키고 레이블링 비용을 줄인다.
  • 공개된 PaddlePaddle 툴박스를 통해 풋볼, 농구, 테이블 테니스, 피겨 스케이팅에 대해 최신 기술 기반의 엔드 투 엔드 학습 및 추론을 지원한다.
  • 진전이 있었음에도 불구하고, 복잡한 플레이어 상호작용과 가림 현상으로 인해 풋볼과 같은 팀 스포츠에서의 동작 인식은 여전히 어려움을 겪으며, 다수의 에이전트를 함께 모델링하는 것이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.