Skip to main content
QUICK REVIEW

[논문 리뷰] FineDiving: A Fine-grained Dataset for Procedure-aware Action Quality Assessment

Jinglin Xu, Yongming Rao|arXiv (Cornell University)|2022. 04. 07.
Human Pose and Action Recognition인용 수 5
한 줄 요약

FineDiving는 계단형 의미적 및 시간적 구조로 주석이 달린 세분화된 동작 품질 평가를 위한 새로운 세분화된 데이터셋을 소개한다. 이는 질의 및 예시 동작 단계 간의 교차 어텐션을 가능하게 하는 시간적 분할 어텐션 모듈(Temporal Segmentation Attention module)을 제안하여 세분화되고 해석 가능한 품질 비교를 학습하며, 영상 수준의 회귀 기반 보다 더 투명하고 정확한 성능을 달성한다.

ABSTRACT

Most existing action quality assessment methods rely on the deep features of an entire video to predict the score, which is less reliable due to the non-transparent inference process and poor interpretability. We argue that understanding both high-level semantics and internal temporal structures of actions in competitive sports videos is the key to making predictions accurate and interpretable. Towards this goal, we construct a new fine-grained dataset, called FineDiving, developed on diverse diving events with detailed annotations on action procedures. We also propose a procedure-aware approach for action quality assessment, learned by a new Temporal Segmentation Attention module. Specifically, we propose to parse pairwise query and exemplar action instances into consecutive steps with diverse semantic and temporal correspondences. The procedure-aware cross-attention is proposed to learn embeddings between query and exemplar steps to discover their semantic, spatial, and temporal correspondences, and further serve for fine-grained contrastive regression to derive a reliable scoring mechanism. Extensive experiments demonstrate that our approach achieves substantial improvements over state-of-the-art methods with better interpretability. The dataset and code are available at \url{https://github.com/xujinglin/FineDiving}.

연구 동기 및 목표

  • 기존의 동작 품질 평가(AQA) 데이터셋에서 세분화되고 절차 수준의 주석이 부족한 문제를 해결함으로써, 설명 가능성과 신뢰성 향상을 도모한다.
  • 취득, 비행, 착수 단계 등 여러 단계에서 동작의 의미적 및 시간적 구조를 모델링함으로써 정확하고 투명한 AQA를 실현한다.
  • 질의 및 예시 인스턴스 간의 동작 단계를 비교하여 숄러플, 트위스트 및 실행의 미세한 품질 차이를 정량화하는 방법을 개발한다.
  • 종합적인 영상 수준의 회귀 대신 단계별로 대비되는 품질 비교를 통해 점수 부여의 설명 가능성을 향상시킨다.
  • 향후 AQA 연구를 위한 공식 점수, 어려움 계수 및 세부 주석이 포함된 벤치마크 데이터셋을 구축한다.

제안 방법

  • 제안된 시간적 분할 어텐션(TSA) 모듈은 사전 정의된 하위동작 유형 어휘를 기반으로 질의 및 예시 동작 인스턴스를 연속적이고 의미적으로 레이블이 부여된 단계로 분할한다.
  • TSA는 변환기 기반의 교차 어텐션 메커니즘을 사용하여 질의 단계와 예시 단계 간의 의미적, 공간적, 시간적 대응 관계를 학습한다.
  • 결과적으로 절차 인식 기반 임베딩에 대해 세분화된 대비 회귀를 수행하여 단계 수준에서의 품질 차이를 예측한다.
  • 프레임 단위 주석은 전용 주석 도구를 사용하여 다양한 해역 동작에 걸쳐 일관성과 정확성을 확보한다.
  • 모델은 대비 비교에서 유도된 단계별 품질 예측을 집계하여 동작 점수를 예측하기 위해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1절차 인식 기반 접근 방식이 경쟁적 뛰기에서 동작 품질 평가의 정확성과 해석 가능성 향상에 기여할 수 있는가?
  • RQ2질의 및 예시 동작 단계 간의 교차 어텐션은 숄러플과 트위스트의 미세한 품질 차이를 얼마나 잘 포착하는가?
  • RQ3세분화된 단계 수준 비교는 영상 수준의 특징 회귀보다 AQA 과제에서 얼마나 더 뛰어난 성능을 보이는가?
  • RQ4계층적 의미적 및 시간적 주석이 포함된 새로운 데이터셋은 더 신뢰성 있고 투명한 AQA 모델을 가능하게 하는가?
  • RQ5어려움 계수와 공식 점수는 제안된 프레임워크에서 학습된 품질 임베딩와 얼마나 관련이 있는가?

주요 결과

  • 제안된 절차 인식 기반 방법은 최신 기술 대비 상당한 향상을 보이며, 더 높은 정확성과 해석 가능성 확보를 입증한다.
  • 모델의 예측은 특정 동작 단계와 그 품질 차이로 추적 가능하므로 더 투명하다.
  • FineDiving는 하위동작 유형의 일관된 프레임 단위 주석을 제공함으로써 질의 및 예시 동작 간 신뢰할 수 있는 비교를 가능하게 한다.
  • 시간적 분할 어텐션 모듈은 동작 단계 간 의미적, 공간적, 시간적 대응 관계를 의미 있는 방식으로 학습한다.
  • 이 데이터셋은 1,000개 이상의 뛰기 영상과 120개 이상의 동작 유형, 150개 이상의 하위동작 유형을 포함하며, 다양한 루틴과 난이도 수준을 커버한다.
  • 특히 트위스트 및 숄러플 실행의 미세한 차이를 구분하는 데서 영상 수준의 회귀 기반 보다 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.