[논문 리뷰] Sports Re-ID: Improving Re-Identification Of Players In Broadcast Videos Of Team Sports
이 논문은 팀 스포츠 방송 영상에서 유사한 유니폼을 입고, 훈련 샘플 수가 적고, 해상도가 낮은 상황에서 선수 재식별 성능을 향상시키기 위해 계층적 데이터 샘플링 전략과 단순한 유클리드 중심점 손실을 제안한다. 이 방법은 CNN과 비전 트랜스포머 모두에서 mAP를 7–11.5, R1를 8.8–14.9 향상시키며, SoccerNet Re-Identification Challenge 2022 랭킹에서 테스트 분할 기준으로 86.0 mAP와 81.5 R1를 기록하여 최신 기술 수준을 달성한다.
This work focuses on player re-identification in broadcast videos of team sports. Specifically, we focus on identifying the same player in images captured from different camera viewpoints during any given moment of a match. This task differs from traditional applications of person re-id in a few important ways. Firstly, players from the same team wear highly similar clothes, thereby making it harder to tell them apart. Secondly, there are only a few number of samples for each identity, which makes it harder to train a re-id system. Thirdly, the resolutions of the images are often quite low and vary a lot. This combined with heavy occlusions and fast movements of players greatly increase the challenges for re-id. In this paper, we propose a simple but effective hierarchical data sampling procedure and a centroid loss function that, when used together, increase the mean average precision (mAP) by 7 - 11.5 and the rank-1 (R1) by 8.8 - 14.9 without any change in the network or hyper-parameters used. Our data sampling procedure improves the similarity of the training and test distributions, and thereby aids in creating better estimates of the centroids of the embeddings (or feature vectors). Surprisingly, our study shows that in the presence of severely limited data, as is the case for our application, a simple centroid loss function based on euclidean distances significantly outperforms the popular triplet-centroid loss function. We show comparable improvements for both convolutional networks and vision transformers. Our approach is among the top ranked methods in the SoccerNet Re-Identification Challenge 2022 leaderboard (test-split) with a mAP of 86.0 and a R1 of 81.5. On the sequestered challenge split, we achieve an mAP of 84.9 and a R1 of 80.1. Research on re-id for sports-related applications is very limited and our work presents one of the first discussions in the literature on this.
연구 동기 및 목표
- 선수들이 유사한 유니폼을 입고, 훈련 데이터가 극도로 제한된 팀 스포츠 방송 영상에서 선수 재식별의 고유한 과제를 해결하기 위해.
- 기존 감시용 재식별 방법이 훈련 데이터와 테스트 데이터 간의 분포 이탈로 인해 이 분야에서는 실패하는 이유를 조사하기 위해.
- 저샷, 고유사도 환경에서 훈련 데이터와 테스트 데이터 분포 간의 도메인 갭을 줄이기 위한 데이터 샘플링 전략을 개발하기 위해.
- 낮은 데이터 환경에서 복잡한 트리플릿-센터로스와 비교해 단순한 유클리드 중심점 손실의 효과를 평가하기 위해.
- 제안된 방법이 팀 스포츠 재식별에서 합성곱 신경망과 비전 트랜스포머 모두에 일반화되는지 보여주기 위해.
제안 방법
- 개체와 카메라 시점으로 샘플을 그룹화하는 계층적 데이터 샘플링 절차를 도입하여, 훈련 중 균형 잡히고 대표적인 배치를 확보한다.
- 특징 임bedding과 그 클래스별 중심점 간의 L2(유클리드) 거리 기반 중심점 손실 함수를 사용하며, 트리플릿 마이닝을 사용하지 않는다.
- 계층적 샘플링과 유클리드 중심점 손실을 조합하여 저데이터 조건에서 임베딩의 클러스터링과 일반화 성능을 향상시킨다.
- 모든 실험에서 동일한 백본 네트워크(예: OSNet, ViT-B/16)와 하이퍼파라미터를 사용하여 제안된 구성 요소의 영향을 분리한다.
- 합성곱 네트워크와 비전 트랜스포머 모두에 이 방법을 적용하여 아키텍처 간 일관된 성능 향상을 보였다.
- 공개 및 비공개 테스트 분할을 모두 사용하여 SoccerNet Re-Identification Challenge 2022 데이터셋에서 방법을 검증하였다.
실험 결과
연구 질문
- RQ1저샷, 고유사도 스포츠 재식별 환경에서 계층적 샘플링이 훈련 데이터와 테스트 데이터 간의 분포 갭을 줄이는가?
- RQ2개체당 훈련 데이터가 극도로 제한된 상황에서 단순한 유클리드 중심점 손실이 더 복잡한 트리플릿-센터로스보다 성능이 뛰어나지 않는가?
- RQ3제안된 방법이 팀 스포츠 영상에서 합성곱 신경망과 비전 트랜스포머 모두의 재식별 성능을 향상시키는가?
- RQ4계층적 샘플링을 사용할 때 합성곱 신경망과 비전 트랜스포머가 중심점 손실 없이 다른 성능 추세를 보이는 이유는 무엇인가?
- RQ5제안된 방법이 유사한 시각적 과제를 가진 다른 팀 스포츠로 일반화되는 정도는 어느 정도인가?
주요 결과
- 제안된 계층적 샘플링과 유클리드 중심점 손실 조합은 네트워크나 하이퍼파라미터를 수정하지 않고도 mAP를 7–11.5, R1를 8.8–14.9 향상시킨다.
- SoccerNet Re-Identification Challenge 2022의 공개 테스트 분할에서 최신 기술 수준의 mAP 86.0과 R1 81.5를 달성한다.
- 비공개 챌린지 분할에서는 mAP 84.9와 R1 80.1을 기록하여 강력한 일반화 능력을 확인한다.
- 기존 최신 기술 방법의 기대와는 반대로, 저데이터 환경에서 단순한 유클리드 중심점 손실이 트리플릿-센터로스를 능가한다.
- 계층적 샘플링만으로도 비전 트랜스포머의 mAP는 5.7–7.3, R1는 6.9–9.4 향상되지만, 일부 합성곱 신경망에서는 성능이 약간 떨어진다.
- ResNet50-fc512과 OSNet_x1_0, DeiT와 ViT 아키텍처 모두에서 일관된 성능 향상을 보이며 광범위한 적용 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.