Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty-aware Score Distribution Learning for Action Quality Assessment

Yansong Tang, Zanlin Ni|arXiv (Cornell University)|2020. 06. 13.
Human Pose and Action Recognition참고 문헌 31인용 수 8
한 줄 요약

이 논문은 행동 품질 평가를 위한 불확실성 인식 점수 분포 학습(USDL)과 다중경로 USDL(MUSDL)을 제안한다. 점수를 확률 분포로 모델링하여 다수의 심사위원이나 난이도 수준으로 인한 레이블의 모호성을 다룬다. 진정된 점수 분포와 예측된 점수 분포 간의 KL 발산을 최적화함으로써, 세 가지 AQA 데이터셋에서 최신 기준 성능을 달성하며, MUSDL은 JIGSAWS에서 평균 스피어만 상관계수 0.70, AQA-7에서 0.81을 기록한다.

ABSTRACT

Assessing action quality from videos has attracted growing attention in recent years. Most existing approaches usually tackle this problem based on regression algorithms, which ignore the intrinsic ambiguity in the score labels caused by multiple judges or their subjective appraisals. To address this issue, we propose an uncertainty-aware score distribution learning (USDL) approach for action quality assessment (AQA). Specifically, we regard an action as an instance associated with a score distribution, which describes the probability of different evaluated scores. Moreover, under the circumstance where fine-grained score labels are available (e.g., difficulty degree of an action or multiple scores from different judges), we further devise a multi-path uncertainty-aware score distributions learning (MUSDL) method to explore the disentangled components of a score. We conduct experiments on three AQA datasets containing various Olympic actions and surgical activities, where our approaches set new state-of-the-arts under the Spearman's Rank Correlation.

연구 동기 및 목표

  • 주관적인 심사위원 평가 또는 다중 점수 구성 요소로 인해 발생하는 행동 점수 레이블의 본질적 모호성을 해결하기 위해.
  • 점수를 단일 값이 아닌 확률 분포로 모델링하여 행동 품질 평가 성능을 향상시키기 위해.
  • 개별 심사위원 점수나 난이도 수준과 같은 세분화된 레이블을 활용하여 모델 성능을 향상시키기 위해.
  • 다양한 점수 구성 요소를 분리하고 융합할 수 있는 다중경로 학습 프레임워크를 개발하여 정확도를 높이기 위해.
  • 감독 정보 내의 불확실성을 명시적으로 모델링하여 기존의 회귀 기반 방법보다 벤치마크 AQA 데이터셋에서 뛰어난 성능을 내기 위해.

제안 방법

  • 최종 행동 점수를 진정된 레이블 중심의 가우시안 분포로 모델링하여 불확실성 인식 감독을 가능하게 한다.
  • 3D 컨볼루션 네트워크 기반 모델을 학습시켜 점수 분포를 예측하고, 예측된 분포와 진정된 분포 간의 킬블레르-라이블러(KL) 발산을 최적화한다.
  • 개별 심사위원 점수나 난이도 배수와 같은 다중 세분화된 점수 신호를 처리하기 위해, 각 구성 요소별 별도의 경로를 사용하는 MUSDL을 도입한다.
  • 추론 시 다수의 경로에서 예측된 결과를 동일한 게임 규칙(예: 최고/최저 점수 제거 및 난이도 배수 적용)을 사용해 융합하여 최종 점수를 산출한다.
  • 비디오당 160프레임을 균일하게 샘플링하고, 이를 10개의 세그먼트로 나누어 입력으로 사용하며, 세그먼트 전략은 분석을 통해 최적화된다.
  • 백본 네트워크로 I3D를 사용하고, KL 발산 손실을 통해 엔드 투 엔드로 훈련하여 불확실성 인식 표현을 학습한다.

실험 결과

연구 질문

  • RQ1행동 점수를 확률 분포로 모델링하는 것이 단일 값 회귀 대비 행동 품질 평가 성능 향상에 기여하는가?
  • RQ2개별 심사위원 점수나 난이도 수준과 같은 세분화된 점수 애너테이션을 통합할 경우 모델 성능에 어떤 영향을 미치는가?
  • RQ3다양한 비디오 세그먼트 전략이 행동 품질의 시간적 모델링에 어떤 영향을 미치는가?
  • RQ4다중경로 학습 프레임워크가 서로 다른 점수 구성 요소를 효과적으로 분리하고 융합하여 정확도 향상에 기여하는가?
  • RQ5불확실성 인식 분포 학습이 다양한 AQA 데이터셋에서 더 강건하고 일반화 능력이 뛰어난 모델을 만들어내는가?

주요 결과

  • MUSDL은 JIGSAWS 데이터셋에서 평균 스피어만 상관계수 0.70을 기록하며 이전 최신 기준 방법들을 초월한다.
  • AQA-7 데이터셋에서는 MUSDL이 스피어만 상관계수 0.81을 기록하여 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 스트라이드 10인 10세그먼트 전략(10-seg-s1)이 세그먼트 전략 중에서 가장 높은 성능을 보였으며, 6-seg 및 10-seg-s2 전략을 모두 앞섰다.
  • 가우시안 분포 모델링을 통한 USDL은 레이블의 불확실성을 반영함으로써 표준 회귀 방법보다 성능 향상을 이룬다.
  • 시각화 결과, 행동의 최종 단계(예: 물속에 들어가는 순간)가 점수 분포에 가장 큰 영향을 미치며, 물결이 많은 세그먼트에서는 낮은 점수가 피크를 이룬다.
  • 희박한 극단적 점수 샘플이 존재하는 경우에도 모델은 강건성을 유지하지만, 이러한 케이스에 대한 성능 향상은 여전히 도전 과제이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.