[논문 리뷰] SportsSloMo: A New Benchmark and Baselines for Human-centric Video Frame Interpolation
이 논문은 인간 중심의 비디오 프레임 보간에 적합한 고해상도(≥720p) 스포츠 영상 클립 13만 개로 구성된 새로운 벤치마크인 SportsSloMo를 소개한다. 이 벤치마크는 복잡한 인간 운동과 빈번한 가림을 특징으로 한다. 보간 정확도 향상을 위해, 파노프틱 인간 세그멘테이션과 관절점 검출을 보조 지도로 사용하는 모델에 종속되지 않는 인간 중심 손실 항목을 제안하며, 이는 일곱 가지 최신 VFI 기법에서 일관되게 성능 향상을 이끌어내며 PSNR 최대 0.69 dB 향상과 SSIM 최대 0.006 향상을 기록한다.
Human-centric video frame interpolation has great potential for improving people's entertainment experiences and finding commercial applications in the sports analysis industry, e.g., synthesizing slow-motion videos. Although there are multiple benchmark datasets available in the community, none of them is dedicated for human-centric scenarios. To bridge this gap, we introduce SportsSloMo, a benchmark consisting of more than 130K video clips and 1M video frames of high-resolution ($\geq$720p) slow-motion sports videos crawled from YouTube. We re-train several state-of-the-art methods on our benchmark, and the results show a decrease in their accuracy compared to other datasets. It highlights the difficulty of our benchmark and suggests that it poses significant challenges even for the best-performing methods, as human bodies are highly deformable and occlusions are frequent in sports videos. To improve the accuracy, we introduce two loss terms considering the human-aware priors, where we add auxiliary supervision to panoptic segmentation and human keypoints detection, respectively. The loss terms are model agnostic and can be easily plugged into any video frame interpolation approaches. Experimental results validate the effectiveness of our proposed loss terms, leading to consistent performance improvement over 5 existing models, which establish strong baseline models on our benchmark. The dataset and code can be found at: https://neu-vi.github.io/SportsSlomo/.
연구 동기 및 목표
- 복잡한 인간 운동과 가림이 빈번한 역동적인 스포츠 환경에서 인간 중심 비디오 프레임 보간을 위한 전용 벤치마크가 부족한 문제를 해결하기 위해.
- 기존 최신 VFI 기법이 인간 중심 콘텐츠에 적용되었을 때 성능 저하가 발생하는지 평가하여 실제 응용에서의 심각한 과제를 드러내기 위해.
- 파노프틱 세그멘테이션과 관절점 검출을 기반으로 한 모델에 종속되지 않는 인간 중심 손실 항목을 제안하여 운동 경계에서의 보간 정확도를 향상시키기 위해.
- 향후 인간 중심 비디오 생성 및 분석 연구를 가능하게 하기 위해, 13만 개의 고해상도 스포츠 클립으로 구성된 대규모이고 철저히 정제된 데이터셋을 공개하기 위해.
제안 방법
- 저자들은 크리에이티브 커먼즈 라이선스 하에 유튜브에서 13만 개의 고해상도(≥720p) 슬로우모션 스포츠 영상 클립을 수집하고, 슬로우모션 외, 광고, 전환 영상 등을 제거하였다.
- 각 영상은 첫 번째 및 마지막 프레임을 입력으로, 중간 7개 프레임을 정답으로 사용하여 9프레임 클립으로 분할하였다.
- 두 가지 보조 손실 항목을 도입: 파노프틱 인간 세그멘테이션을 통한 경계 정확도 향상과 가시성 감소 방지, 인간 관절점 검출을 통한 일관된 운동 궤적 강제.
- 이 손실 항목들은 훈련 중에 적용되며, 아키텍처 변경 없이도 어떤 VFI 프레임워크에나 통합 가능하여 모델에 종속되지 않는다.
- 손실 항목은 사전 훈련된 파노프틱 세그멘테이션 및 관절점 검출 모델을 사용해 예측된 중간 프레임과 정답을 비교함으로써 적용된다.
- 이 방법은 슈퍼슬로모와 EBME를 포함한 일곱 가지 최신 VFI 모델에서 평가되었으며, PSNR, SSIM, IE 등의 지표에서 일관된 성능 향상을 보였다.

실험 결과
연구 질문
- RQ1복잡한 운동과 가림이 빈번한 인간 중심 스포츠 영상에 기존 최신 VFI 기법을 적용했을 때 성능이 어떻게 저하되는가?
- RQ2인간 세그멘테이션과 관절점 검출의 보조 지도가 매우 변형이 심한 인간 운동 상황에서 보간 정확도를 향상시킬 수 있는가?
- RQ3모델에 종속되지 않는 인간 중심 손실 항목이 다양한 VFI 아키텍처에서 얼마나 성능 향상에 기여하는가?
- RQ4기존 광학 흐름 추정의 인간 중심 환경에서의 한계는 무엇이며, 사전 훈련된 모델에서의 지식 정복을 통해 흐름 정확도를 향상시킬 수 있는가?
- RQ53D 인간 신체 재구성이 가려진 영역이나 복잡한 운동 상황에서 VFI 성능 향상에 기여할 수 있는가?
주요 결과
- SportsSloMo 벤치마크는 기존 최신 VFI 모델의 성능을 크게 떨어뜨리며, EBME는 SNU-FILM에서의 36.64 PSNR가 SportsSloMo에서는 30.70으로 떨어져 난이도를 확인시킨다.
- 제안된 인간 중심 손실 항목은 일곱 가지 최신 모델에서 일관되게 PSNR 최대 0.69 dB 향상과 SSIM 최대 0.006 향상으로 성능 향상을 이끌었으며, 두 손실 항목을 병합했을 때 가장 큰 성과를 기록했다.
- 슈퍼슬로모의 경우, 세그멘테이션과 관절점 손실을 병합함으로써 PSNR는 29.77에서 30.24로, SSIM은 0.910에서 0.917로 향상되었다.
- EBME의 경우, 병합된 손실 항목으로 PSNR는 30.15에서 30.48로, SSIM은 0.941에서 0.944로 향상되었으며, 보간 오차(IE)는 5.6% 감소했다.
- 정성적 결과에서는 매우 변형이 심한 사지(예: 팔꿈치와 손) 주변의 보간 품질 향상과 가림 상황에서의 가시성 감소를 확인할 수 있었다.
- GMFlow를 사용한 광학 흐름 지도 정복 결과는 혼합되었으며, 슈퍼슬로모에는 유리했지만 EBME에는 악영향을 미쳐 도메인 이동과 모델 특화 민감도를 시사했다.
![Figure 2: Visualization of human keypoints [ 78 ] and panoptic segmentation masks [ 10 ] .](https://ar5iv.labs.arxiv.org/html/2308.16876/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.