Skip to main content
QUICK REVIEW

[논문 리뷰] Context-aware and Scale-insensitive Temporal Repetition Counting

Huaidong Zhang, Xuemiao Xu|arXiv (Cornell University)|2020. 05. 18.
Human Pose and Action Recognition참고 문헌 35인용 수 4
한 줄 요약

이 논문은 실제 반복 동작에서 변동하는 사이클 길이를 다루기 위해 맥락 인식형이고 스케일에 민감하지 않은 시간 반복 수세기 프레임워크를 제안한다. 다양한 시간 스케일에서 정확도를 향상시키기 위해 이중 사이클 입력에 대해 이중 회귀 네트워크를 사용하는 굵기에서 세밀함으로 향상시키는 전략을 적용한다. 이는 여러 벤치마크, 특히 526개의 영상으로 구성된 새로운 UCFRep 데이터셋에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Temporal repetition counting aims to estimate the number of cycles of a given repetitive action. Existing deep learning methods assume repetitive actions are performed in a fixed time-scale, which is invalid for the complex repetitive actions in real life. In this paper, we tailor a context-aware and scale-insensitive framework, to tackle the challenges in repetition counting caused by the unknown and diverse cycle-lengths. Our approach combines two key insights: (1) Cycle lengths from different actions are unpredictable that require large-scale searching, but, once a coarse cycle length is determined, the variety between repetitions can be overcome by regression. (2) Determining the cycle length cannot only rely on a short fragment of video but a contextual understanding. The first point is implemented by a coarse-to-fine cycle refinement method. It avoids the heavy computation of exhaustively searching all the cycle lengths in the video, and, instead, it propagates the coarse prediction for further refinement in a hierarchical manner. We secondly propose a bidirectional cycle length estimation method for a context-aware prediction. It is a regression network that takes two consecutive coarse cycles as input, and predicts the locations of the previous and next repetitive cycles. To benefit the training and evaluation of temporal repetition counting area, we construct a new and largest benchmark, which contains 526 videos with diverse repetitive actions. Extensive experiments show that the proposed network trained on a single dataset outperforms state-of-the-art methods on several benchmarks, indicating that the proposed framework is general enough to capture repetition patterns across domains.

연구 동기 및 목표

  • 기존 방법들이 고정된 시간 스케일 가정으로 인해 처리하지 못하는 실제 반복 동작에서의 변동적이고 예측 불가능한 사이클 길이 문제를 해결하기 위해.
  • 고립된 세그먼트에 의존하는 대신, 여러 동작 사이클에 걸친 맥락 이해를 통합하여 반복 수세기 정확도를 향상시키기 위해.
  • 전체 범위의 검색을 통해 사이클 길이 탐색의 계산 비용을 줄이기 위해, 체계적인 굵기에서 세밀함으로 향상시키는 전략을 사용함으로써.
  • 미래 연구를 지원하기 위해 새로운 대규모 벤치마크를 구축하기 위해.
  • 단일 데이터셋에서 학습한 모델이 다양한 벤치마크와 동작 클래스에 걸쳐 잘 일반화되는지 입증하기 위해.

제안 방법

  • 초기 사이클 길이 추정은 국소 영상 클립에서 이루어지고, 이후 전체 영상에 걸쳐 전파되고 정밀화되어 계산 비용을 줄이는 굵기에서 세밀함으로 향상시키는 전략을 제안한다.
  • 이중 회귀 네트워크는 두 개의 연속된 동작 사이클(이중 사이클)을 입력으로 받아 이전 및 다음 반복의 위치를 예측하여 맥락 인식형 추정을 가능하게 한다.
  • 다양한 시간 스케일 범위에서 사이클 길이를 예측하기 위해 다중 앵커 회귀 헤드를 사용하여 다양한 사이클 변동성에 대한 강건성을 향상시킨다.
  • 과거와 미래의 반복에서 온 맥락 특징을 통합하여, 예를 들어 번갈아 가며 움직이는 팔 움직임과 유사한 부분 운동을 가진 동작에서의 잘못된 수세기 방지를 가능하게 한다.
  • UCF101에서 526개의 영상에 대한 레이블링을 통해 반복 수세기 학습 및 평가를 지원하는 새로운 벤치마크인 UCFRep을 구축한다.
  • 모델은 엔드 투 엔드로 학습되며, QUVA Repetition 및 YTsegments를 포함한 여러 데이터셋에서 MAE 및 OBOA 지표를 사용해 평가된다.

실험 결과

연구 질문

  • RQ1변동적인 반복 동작의 사이클 길이 추정에서 정확도를 유지하면서도 계산 비용을 효과적으로 줄일 수 있는 굵기에서 세밀함으로 향상시키는 전략이 유용한가?
  • RQ2단일 시퀀스 모델링과 비교했을 때, 두 개의 연속된 반복에서 이중 맥락을 통합하면 사이클 길이 예측 성능가 향상되는가?
  • RQ3다중 앵커 회귀는 다양한 예측 불가능한 사이클 길이에 대해 얼마나 강건성을 향상시키는가?
  • RQ4단일 데이터셋에서 학습한 모델이 다양한 벤치마크와 동작 클래스에 걸쳐 잘 일반화되는가?
  • RQ51x, 2x, 4x 사이클 길이 변화와 같은 다양한 시간 스케일에서 제안된 프레임워크의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 UCFRep 검증 세트에서 평균 절대 오차(MAE) 0.147 ± 0.243을 달성하여 이전 최신 기술(SOTA) 방법을 능가한다.
  • 제거 실험 결과, 다중 앵커(mAnchor)와 함께 이중 시간 스케일(Free)을 사용할 경우 최고의 성능(MAE: 0.147 ± 0.243, OBOA: 0.79)을 기록하여 맥락과 다중 스케일 예측의 효과를 확인한다.
  • 굵기에서 세밀함으로 향상 프로세스는 각 단계에서 정확도가 향상되며, 단계 5(74회 반복)가 속도와 성능 사이의 최적 균형으로 선택되었다.
  • 모델은 동작 클래스 간에 잘 일반화되며, MAE의 표준편차가 낮다(전체 평균 0.243, Biking의 경우 0.062), 이는 클래스 특화 변동성에 대한 강건성을 시사한다.
  • 4x 사이클 길이 변화에서 8.0%의 OBOA 성능을 기록하여 다양한 시간 스케일에서 강력한 스케일에 민감하지 않은 성능을 입증한다.
  • QUVA Repetition 및 YTsegments를 포함한 세 개의 벤치마크에서 최신 기술(SOTA) 방법을 능가하여 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.