Skip to main content
QUICK REVIEW

[논문 리뷰] FSD-10: A Dataset for Competitive Sports Content Analysis

Shenglan Liu, Xiang Liu|arXiv (Cornell University)|2020. 02. 09.
Human Pose and Action Recognition참고 문헌 45인용 수 8
한 줄 요약

이 논문은 2017–2018년 국제 챔피언십에서 촬영한 1,484개의 클립을 포함하는 대규모로 세밀한 분류가 가능한 피겨 스케이팅 영상 데이터셋인 FSD-10을 소개한다. 이 데이터셋은 10종의 고속·복잡한 경기 동작을 담고 있다. 운동 중심의 분류 과제를 해결하기 위해 저자들은 운동에 핵심적인 프레임에 집중하는 키프레임 기반의 시간 분할 네트워크(KTSN)를 제안한다. 이는 표준 TSN보다 우수한 성능을 보이며, FSD-10에서 82.12%의 정확도를 달성한다. 이는 운동의 역학적 특성이 정적인 자세나 배경보다도 더 구분력이 높다는 것을 보여주며, 경기 스포츠 분석에서 중요한 요소임을 입증한다.

ABSTRACT

Action recognition is an important and challenging problem in video analysis. Although the past decade has witnessed progress in action recognition with the development of deep learning, such process has been slow in competitive sports content analysis. To promote the research on action recognition from competitive sports video clips, we introduce a Figure Skating Dataset (FSD-10) for finegrained sports content analysis. To this end, we collect 1484 clips from the worldwide figure skating championships in 2017-2018, which consist of 10 different actions in men/ladies programs. Each clip is at a rate of 30 frames per second with resolution 1080 $ imes$ 720. These clips are then annotated by experts in type, grade of execution, skater info, .etc. To build a baseline for action recognition in figure skating, we evaluate state-of-the-art action recognition methods on FSD-10. Motivated by the idea that domain knowledge is of great concern in sports field, we propose a keyframe based temporal segment network (KTSN) for classification and achieve remarkable performance. Experimental results demonstrate that FSD-10 is an ideal dataset for benchmarking action recognition algorithms, as it requires to accurately extract action motions rather than action poses. We hope FSD-10, which is designed to have a large collection of finegrained actions, can serve as a new challenge to develop more robust and advanced action recognition models.

연구 동기 및 목표

  • 고속·복잡한 체육 경기 이벤트에서의 동작 인식에 특화된 고품질의 세밀한 분류가 가능한 경기용 스포츠 영상 데이터셋 부족 문제를 해결하기 위해.
  • 실제 경기 스포츠의 복잡성을 반영하기 위해 정적 자세나 배경 정보보다 운동 역학을 강조하는 벤치마크 데이터셋을 구축하기 위해.
  • 행동 품질 평가(AQA), 시간적 동작 분할, 다중 모odal 학습(예: 동작-음악 정렬)과 같은 고급 연구를 가능하게 하기 위해.
  • 경기 스포츠에서 도메인 지식 기반 샘플링 전략을 활용한 동작 인식에 대한 강력한 기준 모델을 수립하기 위해.

제안 방법

  • FSD-10 데이터셋은 2017–2018년 동안의 세계 피겨 스케이팅 챔피언십 영상 약 80시간에서 유래하였으며, 1,484개의 클립을 포함하고 있으며, 이는 10종의 서로 다른 동작으로 구성되며, 모두 30fps, 1080×720 해상도이다.
  • 각 클립은 전문가가 동작 유형, 실행도 평가(GOE), 기본가치(BV), 스케이터 정보를 포함하여 애너테이션 처리되어 세밀한 분석을 지원한다.
  • 운동에 핵심적인 프레임—특히 점프의 이륙 및 착지 프레임—을 선택하는 키프레임 기반의 시간 분할 네트워크(KTSN)를 제안한다. 이는 무작위 샘플링 대신 운동의 핵심 프레임을 선택한다.
  • KTSN는 공간적 특징 추출을 위해 Inception v3를 활용하며, RGB와 옵티컬 플로우 입력을 결합하여 외관과 운동 역학을 모두 모델링한다.
  • 모델는 k=9개의 세그먼트를 사용하는 시간 분할 네트워크(TSN)를 기반으로 하지만, 키프레임 인식 샘플링 전략을 적용하여 고속·복잡한 동작에 대해 더 높은 구분 능력을 확보한다.
  • 일반화 성능 평가를 위해 UCF101과 FSD-10을 사용하여 교차 데이터셋 검증을 수행하였으며, 성능은 RGB, 옵티컬 플로우, 융합 특징을 기반으로 측정되었다.

실험 결과

연구 질문

  • RQ1세밀한 경기용 스포츠 동작을 구분할 때 운동 역학이 정적 자세나 배경보다 더 유의미한가?
  • RQ2키프레임 기반 샘플링 전략이 피겨 스케이팅과 같은 고속 스포츠에서의 동작 인식 성능을 크게 향상시킬 수 있는가?
  • RQ3FSD-10은 행동 품질 평가(AQA) 및 시간적 동작 분할과 같은 고급 작업을 어느 정도 지원하는가?
  • RQ4표준 TSN 모델과 비교해 KTSN의 성능은 FSD-10에서 운동 민감도 측면에서 어떻게 다를까?
  • RQ5교차 데이터셋 평가에서 FSD-10은 UCF101과 같은 기존 데이터셋보다 더 잘 일반화되는가?

주요 결과

  • KTSN는 FSD-10에서 82.12%의 상위-1 정확도를 달성하였으며, 이는 RGB 특징을 사용할 경우 76.77%를 기록한 표준 TSN보다 뚜렷이 높은 성능이다. 융합 특징을 사용할 경우 KTSN는 동일한 82.12%의 성능을 보였다.
  • FSD-10에서 옵티컬 플로우 특징은 RGB 특징(48.94%)보다 높은 성능(82.12%)을 기록하여, 운동 역학이 정적인 외관보다 더 구분력이 높다는 것을 시사한다.
  • 3세그먼트에서 9세그먼트 샘플링으로 전환했을 때 FSD-10에서는 5.4%의 성능 향상이 있었지만, UCF101에서는 2.5%에 그쳐, FSD-10가 세밀한 시간 분할에 더 민감함을 확인한다.
  • 혼동 행렬을 분석한 결과, Lutz 점프가 24%의 경우에서 Flip 점프로 잘못 분류되는 것으로 나타나, 유사한 고속 점프 유형을 구분하는 데 어려움이 있음을 보여준다.
  • 이 데이터셋은 운동 신호에 매우 민감하다: FSD-10에서는 RGB와 옵티컬 플로우 간 성능 격차가 UCF101보다 더 크며, 이는 운동이 동작 인식에서 주요 요소임을 확인한다.
  • KTSN 모델은 특히 이륙 및 착지 프레임에 집중함으로써 분류 성능 향상이 뚜렷하게 향상됨을 입증하였으며, 이는 경기 스포츠 분석에서 도메인 지식의 중요성을 재확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.