Skip to main content
QUICK REVIEW

[논문 리뷰] MultiSports: A Multi-Person Video Dataset of Spatio-Temporally Localized Sports Actions

Yixuan Li, Lei Chen|arXiv (Cornell University)|2021. 05. 16.
Human Pose and Action Recognition참고 문헌 59인용 수 6
한 줄 요약

이 논문은 4개의 스포츠에서 66개의 세분화된 스포츠 동작에 걸쳐 37,701개의 조밀하게 애너테이션된 행동 인스턴스를 포함하는 대규모 다중 인원 영상 데이터셋인 MultiSports를 소개한다. 이 데이터셋은 현실적이고 복잡한 장면, 명확한 시간 경계선, 다중 인원 간 상호작용을 강조하여 도전적인 실세계 조건에서 최신 검출 모델의 벤치마킹을 가능하게 하며, 이는 이전 벤치마크 대비 상당히 낮은 mAP 스코어를 보여 주어 데이터셋의 곤란함을 입증한다.

ABSTRACT

Spatio-temporal action detection is an important and challenging problem in video understanding. The existing action detection benchmarks are limited in aspects of small numbers of instances in a trimmed video or low-level atomic actions. This paper aims to present a new multi-person dataset of spatio-temporal localized sports actions, coined as MultiSports. We first analyze the important ingredients of constructing a realistic and challenging dataset for spatio-temporal action detection by proposing three criteria: (1) multi-person scenes and motion dependent identification, (2) with well-defined boundaries, (3) relatively fine-grained classes of high complexity. Based on these guide-lines, we build the dataset of MultiSports v1.0 by selecting 4 sports classes, collecting 3200 video clips, and annotating 37701 action instances with 902k bounding boxes. Our datasets are characterized with important properties of high diversity, dense annotation, and high quality. Our Multi-Sports, with its realistic setting and detailed annotations, exposes the intrinsic challenges of spatio-temporal action detection. To benchmark this, we adapt several baseline methods to our dataset and give an in-depth analysis on the action detection results in our dataset. We hope our MultiSports can serve as a standard benchmark for spatio-temporal action detection in the future. Our dataset website is at https://deeperaction.github.io/multisports/.

연구 동기 및 목표

  • 시공간 행동 검출 분야의 기존 벤치마크가 단일 인원 행동, 굵은 분류, 희박한 애너테이션을 자주 포함하는 데서 비롯되는 한계를 해결하기 위해.
  • 실제적인, 고복잡도의 벤치마크를 만들기 위해 다중 인원, 동시 발생 행동, 명확한 시간 경계선, 세분화된 행동 카테고리가 포함된 환경을 반영하기 위해.
  • 조밀하고 다중 인원 행동 검출에 적합한 고품질, 다양한 데이터셋을 제공하기 위해.
  • 실제적이고 복잡한 조건에서 시공간 행동 검출 모델 평가를 위한 표준 벤치마크를 확립하기 위해.

제안 방법

  • 고행동 밀도와 복잡한 상호작용으로 유명한 4개의 스포츠—농구, 배구, 축구, 에어로빅 복싱—을 선택하여 데이터셋을 구성하였다.
  • 두 단계 애너테이션 파이프라인을 사용하였다: 첫 번째 단계에서는 전문 운동선수가 시간 경계선과 행동 카테고리를 라벨링하였고, 두 번째 단계에서는 커뮤니티 기반 애너테이터들이 FCOT 추적 방법을 사용하여 프레임 단위의 바운딩 박스를 생성하였다.
  • 모든 영상 자료는 다양한 국가와 성능 수준의 전문 대회 고해상도 녹화 영상에서 확보되어 시각적 품질과 다양성을 확보하였다.
  • 데이터셋에는 3,200개의 영상 클립과 902,000개의 바운딩 박스가 포함되어 있으며, 66개의 세분화된 행동 클래스와 각 행동 인스턴스의 정확한 시작/종료 타임스탬프가 포함되어 있다.
  • 공간적 및 시간적 애너테이션의 일관성과 노이즈 감소를 위해 철저한 품질 관리 절차를 통합하였다.
  • 기준 모델들은 MultiSports 데이터셋에 맞게 수정되어 실증적 평가와 오류 분석을 수행하였으며, 검출 성능에 있어 상당한 과제가 드러났다.

실험 결과

연구 질문

  • RQ1최신 시공간 행동 검출 모델의 성능은 MultiSports와 같은 현실적이고 다중 인원, 고복잡도 영상 데이터셋에 적용되었을 때 어떻게 저하되는가?
  • RQ2기존의 벤치마크가 행동 카테고리가 단순화되거나 애너테이션이 희박한 데서 비롯해 실제 영상 이해의 진정한 과제를 얼마나 잘못 반영하고 있는가?
  • RQ3현재 검출 모델들이 조밀하고 역동적인 장면에서 세분화된 동시 행동을 다룰 때 나타나는 주요 실패 유형은 무엇인가?
  • RQ4운동 역학, 장기적 맥락, 인간-물체-장면 상호작용은 복잡한 스포츠 영상에서 검출 정확도에 어떤 영향을 미치는가?

주요 결과

  • MultiSports 데이터셋은 3,200개의 영상 클립에 걸쳐 총 37,701개의 행동 인스턴스를 포함하며, 902,000개의 프레임 단위 바운딩 박자와 66개의 세분화된 행동 클래스를 제공하여 시공간 행동 검출 분야에서 가장 포괄적인 데이터셋 중 하나이다.
  • MultiSports에서의 프레임 mAP 및 영상 mAP 스코어는 이전 벤치마크인 J-HMDB와 UCF101-24에 비해 상당히 낮아, 데이터셋의 높은 난이도를 확인한다.
  • 오류 분석 결과, 모델들이 유사 행동(예: 패스 vs. 슛)을 구분하는 데 가장 어려움을 겪고 있으며, 특히 붐비는 장면에서 미세한 운동 신호를 가진 행동을 탐지하는 데 어려움을 겪는 것으로 나타났다.
  • 동시 발생 행동과 선수 및 물체 간의 복잡한 상호작용은 특히 빠른 속도의 시퀀스에서 허위 경고와 빠진 검출을 자주 유발한다.
  • 전문 운동선수가 시간 및 카테고리 라벨링을 수행한 후 커뮤니티 기반 애너테이터들이 바운딩 박스를 생성하는 두 단계 애너테이션 프로세스는 낮은 노이즈로 고품질이고 일관성 있는 애너테이션을 생성하였다.
  • 이 데이터셋은 현재 모델의 핵심적 한계, 특히 시간 국소화 및 운동 의존적 인식 처리에 있어 심각한 문제를 드러내며, 장기적 모델링 및 상호작용 추론 향상의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.