[논문 리뷰] TrackNet: A Deep Learning Network for Tracking High-speed and Tiny Objects in Sports Applications
TrackNet는 다중 연속 프레임을 사용하여 브로드캐스트 영상에서 테니스나 배드민턴 공과 같은 고속·소형 스포츠 물체를 추적하는 딥러닝 기반 히트맵 네트워크이다. 궤도 인식 특징 학습과 복소화 업샘플링을 통해 정밀한 국소화를 실현함으로써 테니스 추적에서 98.5%의 F1 스코어, 배드민턴 추적에서 68.7%의 F1 스코어를 기록하며 기존 영상 처리 방법에 비해 크게 승리한다.
Ball trajectory data are one of the most fundamental and useful information in the evaluation of players' performance and analysis of game strategies. Although vision-based object tracking techniques have been developed to analyze sport competition videos, it is still challenging to recognize and position a high-speed and tiny ball accurately. In this paper, we develop a deep learning network, called TrackNet, to track the tennis ball from broadcast videos in which the ball images are small, blurry, and sometimes with afterimage tracks or even invisible. The proposed heatmap-based deep learning network is trained to not only recognize the ball image from a single frame but also learn flying patterns from consecutive frames. TrackNet takes images with a size of $640 imes360$ to generate a detection heatmap from either a single frame or several consecutive frames to position the ball and can achieve high precision even on public domain videos. The network is evaluated on the video of the men's singles final at the 2017 Summer Universiade, which is available on YouTube. The precision, recall, and F1-measure of TrackNet reach $99.7\%$, $97.3\%$, and $98.5\%$, respectively. To prevent overfitting, 9 additional videos are partially labeled together with a subset from the previous dataset to implement 10-fold cross-validation, and the precision, recall, and F1-measure are $95.3\%$, $75.7\%$, and $84.3\%$, respectively. A conventional image processing algorithm is also implemented to compare with TrackNet. Our experiments indicate that TrackNet outperforms conventional method by a big margin and achieves exceptional ball tracking performance. The dataset and demo video are available at https://nol.cs.nctu.edu.tw/ndo3je6av9/.
연구 동기 및 목표
- 저해상도 브로드캐스트 영상에서 고속·소형·흐린 스포츠 공을 추적하는 데 도전하는 것.
- 연속 프레임에서 시간적 맥락을 활용한 딥러닝을 통해 기존 영상 처리 방법을 초월한 추적 정확도 향상.
- 암시적·전문 스포츠 응용 분야에서 공 궤적 데이터 수집을 위한 확장 가능하고 저비용 솔루션 개발.
- 다양한 물체 속도와 시각적 품질을 가진 실제 테니스 및 배드민턴 영상에서 모델 성능 평가.
- 유사 스포츠(테니스 대비 배드민턴) 간 전이 학습 가능성 탐색 및 속도와 시각적 차이로 인한 성능 제한 요인 규명.
제안 방법
- TrackNet는 입력 이미지에서 특징을 추출하기 위해 VGG-16 백본을 사용하며, 단일 프레임 또는 다중 연속 프레임을 처리할 수 있다.
- 네트워크는 히트맵 생성을 위해 특징 맵을 업샘플링하는 디컨볼루션 레이어를 포함한 완전 컨volution 네트워크(FCN) 아키텍처를 사용한다.
- 입력 프레임은 640×360 픽셀로 리사이징되어 네트워크에 입력되며, 피크 위치가 공의 위치에 해당하는 히트맵을 예측한다.
- 예측된 좌표와 진짜 좌표 간의 거리를 최소화하기 위해 히트맵 회귀 손실을 사용해 엔드 투 엔드로 모델을 훈련시킨다.
- 시간적 모델링을 위해 연속된 다수의 프레임을 입력으로 사용하여 운동 패턴을 학습하고 블러 및 가림 현상에 대한 강건성을 향상시킨다.
- 교란 학습을 통해 테니스 데이터로 훈련된 모델을 배드민턴 데이터에 대해 미세 조정하여 교차 스포츠 일반화 능력 평가.

실험 결과
연구 질문
- RQ1고프레임레인지나 고해상도 영상이 필요 없이, 표준 브로드캐스트 영상에서 고속·소형·흐린 스포츠 공을 딥러닝 모델이 효과적으로 추적할 수 있는가?
- RQ2단일 프레임 추론 대비 다수의 연속 프레임을 사용할 경우 정밀도, 재현율, F1 스코어 측면에서 추적 성능 향상 정도는 어떠한가?
- RQ3공의 속도, 크기, 궤도 역학의 차이가 있는 상황에서 테니스 데이터로 훈련된 모델이 배드민턴 추적에 얼마나 일반화 가능한가?
- RQ4매우 빠르게 움직이는 물체인 배드민턴에 적용했을 때 모델의 성능 한계는 무엇이며, 높은 거짓 음성 비율을 유발하는 요인들은 무엇인가?
- RQ5복잡한 실제 스포츠 영상 환경에서 전통적인 룰 기반 영상 처리 기법에 비해 히트맵 기반 딥러닝 접근법이 우월한가?
주요 결과
- 10겹 교차검증을 사용한 단일 프레임 입력을 통한 테니스 영상 데이터셋 평가에서 TrackNet는 정밀도 99.7%, 재현율 97.3%, F1 측정치 98.5%를 기록한다.
- 10겹 교차검증을 통한 더 도전적인 부분 레이블링된 데이터셋 평가에서 TrackNet는 정밀도 95.3%, 재현율 75.7%, F1 측정치 84.3%를 유지한다.
- 테니스 데이터로 훈련된 모델(TrackNet-Tennis)은 배드민턴에서 높은 거짓 음성 비율로 인해 성능이 열악하여 F1 측정치 35.2%에 그친다. 이는 일반화 능력 부족을 시사한다.
- 배드민턴 데이터에 대해 미세 조정된 모델(TrackNet-Badminton)은 정밀도 85.0%, 재현율 57.7%, F1 측정치 68.7%를 기록하여 도메인 특화 훈련이 성능 향상에 크게 기여함을 보여준다.
- 테니스와 배드민턴 추적 간 성능 격차는 배드민턴의 평균 속도가 더 높기 때문이며(417 km/h 대비 253 km/h), 속도 변동성이 더 크고 이로 인해 시각 품질이 열악해지고 모델의 일반화 능력이 떨어지기 때문이다.
- TrackNet는 기존 영상 처리 알고리즘에 비해 크게 승리하며, 시간적 맥락을 활용한 딥러닝이 고속·소형 물체 추적에 있어 우월함을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.