Skip to main content
QUICK REVIEW

[논문 리뷰] TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting

Huazhang Hu, Sixun Dong|arXiv (Cornell University)|2022. 04. 03.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 반복 동작 수를 세는 데 있어 장기적이고 현실적인 영상에서 끊김이나 일관되지 않은 사이클이 있는 상황에서도 성능을 향상시키기 위해 다중 척도 시간적 상관관계를 인코딩하는 트랜스포머 기반 방법인 TransRAC을 제안한다. 새로운 대규모 데이터셋인 RepCount를 도입하여 세분화된 사이클 주석을 제공하고, 해석 가능한 주기 예측을 위해 밀도 맵 회귀를 사용하여 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 예측되지 않은 데이터에 대한 제로샷 일반화도 가능하다.

ABSTRACT

Counting repetitive actions are widely seen in human activities such as physical exercise. Existing methods focus on performing repetitive action counting in short videos, which is tough for dealing with longer videos in more realistic scenarios. In the data-driven era, the degradation of such generalization capability is mainly attributed to the lack of long video datasets. To complement this margin, we introduce a new large-scale repetitive action counting dataset covering a wide variety of video lengths, along with more realistic situations where action interruption or action inconsistencies occur in the video. Besides, we also provide a fine-grained annotation of the action cycles instead of just counting annotation along with a numerical value. Such a dataset contains 1,451 videos with about 20,000 annotations, which is more challenging. For repetitive action counting towards more realistic scenarios, we further propose encoding multi-scale temporal correlation with transformers that can take into account both performance and efficiency. Furthermore, with the help of fine-grained annotation of action cycles, we propose a density map regression-based method to predict the action period, which yields better performance with sufficient interpretability. Our proposed method outperforms state-of-the-art methods on all datasets and also achieves better performance on the unseen dataset without fine-tuning. The dataset and code are available.

연구 동기 및 목표

  • 긴, 현실적인 영상에서 끊김이나 일관되지 않은 동작 사이클이 있는 상황에서 기존 반복 동작 수 세기 방법의 한계를 해결하기 위해.
  • 단순한 수치적 카운트 외에 세분화된 사이클 수준의 주석을 도입함으로써 더 해석 가능하고 정확한 모델을 개발하기 위해.
  • 다양한 영상 길이와 이상치를 포함한 현실적인 대규모 데이터셋(RepCount)을 구축하여 모델의 평가 및 훈련을 더 잘 할 수 있도록 하기 위해.
  • 트랜스포머를 활용한 다중 척도 시간적 상관관계를 통해 성능과 효율성의 균형을 이루기 위해.
  • 향후 미리 훈련되지 않은 데이터셋에 대해서도 피팅 없이 일반화할 수 있도록, 향상된 시간적 모델링과 아키텍처 설계를 통해 제로샷 일반화를 가능하게 하기 위해.

제안 방법

  • 자기주의 어텐션 메커니즘을 사용한 다중 척도 시간적 상관관계 인코더를 적용하여 다양한 시간 척도에서 장거리 의존성을 모델링한다.
  • 행동 주기 예측을 위해 밀도 맵 회귀 헤드를 도입하여 기존의 표준 분류 헤드에 비해 더 해석 가능하고 정확한 반복 사이클 국소화를 가능하게 한다.
  • 다양한 수신장(Receptive Field)을 가진 다중 컬럼 아키텍처를 사용하여 다양한 척도의 시간 패턴을 포착하고, 특징을 융합하여 강건성을 향상시킨다.
  • 자기주의 어텐션 메커니즘은 상관행렬을 동적으로 계산하여 TSM(시간 자기유사성 행렬)와 같은 고정된 유사도 함수보다 성능이 뛰어나다.
  • 1,451개의 영상과 약 20,000개의 세분화된 사이클 주석을 포함한 RepCount 데이터셋에서 엔드 투 엔드로 모델을 훈련한다.
  • 모델 성능 평가에 MAE(Mean Absolute Error)와 OBO(Overall Best Overlap) 지표를 사용하여 뛰어난 성능과 제로샷 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 모델은 반복 동작 수 세기 작업에서 장기적이고 현실적인 영상에서 다중 척도 시간적 상관관계를 효과적으로 포착할 수 있는가?
  • RQ2단순한 수치적 카운트 외에 세분화된 사이클 수준의 주석을 도입함으로써 모델의 해석 가능성과 성능이 향상되는가?
  • RQ3밀도 맵 회귀 헤드가 반복 동작의 행동 주기를 예측하는 데 있어 표준 분류 헤드보다 우수한 성능을 보이는가?
  • RQ4다중 척도 모델링은 행동이 끊기거나 일관되지 않은 사이클이 있는 상황에서 성능과 강건성을 어떻게 향상시키는가?
  • RQ5제안된 방법은 미리 훈련되지 않은 데이터셋에 대해 피팅 없이 일반화할 수 있는가? 이는 향상된 일반화 능력을 의미하는가?

주요 결과

  • TransRAC는 RepCount part-A 테스트 세트에서 MAE 0.4431과 OBO 0.2913을 기록하여 최신 기술 수준의 방법들을 초월한다.
  • 상관행렬 계산에 자기주의 어텐션을 사용함으로써 TSM 기반 유사도에 비해 성능 향상이 이루어졌으며, MAE가 0.1247 감소했다.
  • 분류 헤드를 밀도 맵 회귀기로 교체함으로써 성능이 크게 향상되었으며, MAE는 ResNet+CLS의 0.9950에서 ResNet+DM로 0.6905로 감소했다.
  • 다중 척도 모델링(Ours (Multi))가 가장 뛰어난 성능(MAE: 0.4431)을 기록하여 단일 척도 변형보다 뛰어난 성능을 보였다.
  • 피팅 없이도 예측되지 않은 데이터셋에 대해 잘 일반화되어, 강력한 제로샷 일반화 능력을 입증했다.
  • 제안된 RepCount 데이터셋은 1,451개의 영상과 약 20,000개의 세분화된 사이클 주석을 포함하여 반복 동작 수 세기 작업에 더 현실적이고 도전적인 벤치마크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.