Skip to main content
QUICK REVIEW

[논문 리뷰] Fusing Motion Patterns and Key Visual Information for Semantic Event Recognition in Basketball Videos

Lifang Wu, Zhou Yang|arXiv (Cornell University)|2020. 07. 13.
Human Pose and Action Recognition참고 문헌 37인용 수 5
한 줄 요약

이 논문은 농구 골대에서 얻은 핵심 시각 정보(KVI)와 분리된 전반적이고 국소적인 운동 패턴을 융합하는 이중 스트림 3D CNN 프레임워크를 제안하여 농구 영상에서 의미적 이벤트를 인식한다. 카메라 운동 일관성을 활용한 전반적 운동 추정과 KVI 추출을 위한 CNN 기반 방법을 통해 스코어링 결과 예측을 수행함으로써, 이 방법은 NCAA 데이터셋에서 최신 기술 수준의 성능을 달성하고 NBA/CBA 데이터로의 일반화 능력도 뛰어나다.

ABSTRACT

Many semantic events in team sport activities e.g. basketball often involve both group activities and the outcome (score or not). Motion patterns can be an effective means to identify different activities. Global and local motions have their respective emphasis on different activities, which are difficult to capture from the optical flow due to the mixture of global and local motions. Hence it calls for a more effective way to separate the global and local motions. When it comes to the specific case for basketball game analysis, the successful score for each round can be reliably detected by the appearance variation around the basket. Based on the observations, we propose a scheme to fuse global and local motion patterns (MPs) and key visual information (KVI) for semantic event recognition in basketball videos. Firstly, an algorithm is proposed to estimate the global motions from the mixed motions based on the intrinsic property of camera adjustments. And the local motions could be obtained from the mixed and global motions. Secondly, a two-stream 3D CNN framework is utilized for group activity recognition over the separated global and local motion patterns. Thirdly, the basket is detected and its appearance features are extracted through a CNN structure. The features are utilized to predict the success or failure. Finally, the group activity recognition and success/failure prediction results are integrated using the kronecker product for event recognition. Experiments on NCAA dataset demonstrate that the proposed method obtains state-of-the-art performance.

연구 동기 및 목표

  • 외관 변화와 가림 현상으로 인해 전통적인 추적 기반 방법이 어려운 농구 영상에서 의미적 이벤트를 인식하는 데 도전한다.
  • 표준 광학 흐름을 사용할 때 분리하기 어려운 혼합된 광학 흐름에서 전반적이고 국소적인 운동 패턴을 분리하여 집단 활동 인식을 향상시킨다.
  • 골대 주변의 핵심 시각 정보(KVI)를 활용하여 스코어링 결과 예측을 향상시킨다. 예를 들어 네트의 움직임이나 공의 진입 여부 등을 포함한다.
  • 동적 운동 특징과 외관 기반 결과 예측을 통합된 의미적 이벤트 인식 시스템으로 통합한다.
  • NCAA, NBA, CBA를 포함한 다양한 데이터셋에서 우수한 성능을 내는 일반화 가능한 프레임워크를 개발한다.

제안 방법

  • 카메라 조정 패턴(예: 펜, 줌)을 활용하여 혼합 운동장면에서 전반적 운동을 분리하는 새로운 전반적 운동 추정 알고리즘을 제안한다.
  • 혼합 운동에서 추정된 전반적 운동을 빼내어 국소 운동 패턴을 유도함으로써 집단 수준의 역학을 별도로 모델링할 수 있도록 한다.
  • 이중 스트림 3D CNN 아키텍처를 사용한다: 한 스트림은 분리된 전반적 운동을 처리하고, 다른 스트림은 국소 운동을 처리하여 집단 활동 인식을 수행한다.
  • CNN 기반 객체 검출 모듈을 사용하여 농구 골대 영역을 검출하고, KVI 영역에서 외관 특징을 추출하여 성공/실패 예측을 수행한다.
  • 두 파이프라인(집단 활동 인식 및 성공/실패 예측)의 출력을 크로네커 곱을 사용하여 통합하여 최종 의미적 이벤트 예측을 생성한다.
  • 전체 프레임워크를 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련하고, 여러 데이터셋에서 평균 평균 정밀도(mAP)와 정확도를 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1카메라 운동 일관성을 활용하여 혼합 광학 흐름에서 전반적이고 국소적인 운동 패턴을 효과적으로 분리할 수 있는가?
  • RQ2분리된 운동 패턴과 핵심 시각 정보를 융합함으로써 운동 또는 외관만을 사용할 때보다 의미적 이벤트 인식 성능가 향상되는가?
  • RQ3다양한 카메라 설정과 시각 조건을 가진 농구 데이터셋(NCAA 대비 NBA/CBA) 간에 제안된 방법이 얼마나 잘 일반화되는가?
  • RQ4KVI 특징(예: 네트 움직임, 공의 진입)이 팀 스포츠에서 스코어링 결과 예측에 기여하는 정도는 어느 정도인가?
  • RQ5크로네커 곱이 운동 기반 집단 활동 인식과 외관 기반 결과 예측을 효과적으로 통합하여 공동 이벤트 분류를 수행할 수 있는가?

주요 결과

  • 제안된 방법은 NBA/CBA 데이터셋에서 평균 평균 정밀도(mAP) 0.609와 정확도 0.506을 달성하여 GCMP 방법보다 mAP에서 16.7%p, 정확도에서 8.9%p 향상되었다.
  • NCAA 데이터셋에서는 최신 기술 수준의 성능을 달성하여 평균 mAP 0.506과 정확도 0.417을 기록하였으며, 뛰어난 인식 능력을 입증하였다.
  • 도루 이벤트에서 특히 뛰어난 성능을 보였으며(mAP: 0.909), 갑작스러운 전술적 역전을 강력하게 탐지할 수 있었다.
  • 자유투와 스탠딩 덩크 이벤트의 성능은 낮았으며(mAP: 0.286 및 0.000), 주로 훈련 데이터가 부족하고 카테고리 간 운동 패턴이 유사하기 때문이다.
  • 전체 파이프라인의 런타임은 Titan X GPU에서 영상 클립당 약 41.8ms로 실시간 추론 능력을 보였다.
  • 제거 실험 결과, 운동 분리가 복잡한 장면에서 특히 높은 운동 복잡성에 기여하여 인식 성능 향상에 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.