[논문 리뷰] What and How Well You Performed? A Multitask Learning Approach to Action Quality Assessment
이 논문은 새로운 대규모 스키표 데이터셋을 기반으로 3D CNN을 사용하여 동작 품질 평가(AQA), 세분화된 동작 분류, 언어적 코멘터리 생성을 동시에 최적화하는 다중작업 학습 접근법을 제안한다. 이 방법은 AQA에서 90.44%의 상위 순서 상관관계를 기록하며 단일작업 학습을 뛰어넘고, 동작 인식 기준보다 더 나은 일반화 능력과 AQA에 특화된 특징 학습 능력을 보여준다.
Can performance on the task of action quality assessment (AQA) be improved by exploiting a description of the action and its quality? Current AQA and skills assessment approaches propose to learn features that serve only one task - estimating the final score. In this paper, we propose to learn spatio-temporal features that explain three related tasks - fine-grained action recognition, commentary generation, and estimating the AQA score. A new multitask-AQA dataset, the largest to date, comprising of 1412 diving samples was collected to evaluate our approach (https://github.com/ParitoshParmar/MTL-AQA). We show that our MTL approach outperforms STL approach using two different kinds of architectures: C3D-AVG and MSCADC. The C3D-AVG-MTL approach achieves the new state-of-the-art performance with a rank correlation of 90.44%. Detailed experiments were performed to show that MTL offers better generalization than STL, and representations from action recognition models are not sufficient for the AQA task and instead should be learned.
연구 동기 및 목표
- 단순 점수 부여 외에도 관련된 여러 작업의 표현을 동시에 학습하여 동작 품질 평가(AQA) 성능을 향상시키기 위해.
- 단일작업 학습의 한계를 해결하기 위해, 최종 점수에만 의존하여 세밀한 성과 세부 정보를 포착하지 못하는 문제를 해결하기 위해.
- 요소화된 동작 클래스와 AQA 중심의 코멘터리가 포함된 대규모, 풍부하게 애너테이션된 데이터셋을 구축하여 학습 및 평가를 위해.
- 다중작업 학습이 단일작업 학습보다 더 나은 일반화 능력과 AQA에 더 유용한 특징 표현을 제공함을 입증하기 위해.
- 다양한 아키텍처에서와 새로운 동작에 대해 검증하여 이식 가능성과 강건성을 입증하기 위해.
제안 방법
- 비디오 클립에서 AQA 점수, 세분화된 동작 클래스, 자연어 코멘터리 예측을 동시에 수행할 수 있도록 3D CNN을 학습하는 다중작업 학습 프레임워크를 제안한다.
- 스페이스타임 특징을 추출하기 위해 C3D-AVG 및 MSCADC 아키텍처를 백본으로 사용한다.
- 세 가지 별도의 손실 함수를 적용: AQA 회귀를 위한 손실, 요소화된 동작 분류를 위한 손실, 순서 기반 시퀀스 생성을 위한 손실.
- 세 가지 작업별 손실의 가중 합을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련함으로써 동시에 모든 목표를 최적화한다.
- 기존 브로드캐스트 영상 자료를 활용해 동작 분류 및 코멘터리 레이블을 추출함으로써 추가 애너테이션 비용을 최소화한다.
- 새로운 동작에 대해 제로샷 AQA를 수행하기 위해 중간 합성곱층 활성화값에 선형 회귀기를 훈련시켜 특징 표현을 평가한다.

실험 결과
연구 질문
- RQ1동작 기술, 코멘터리, 품질 점수 예측을 동시에 학습하는 것이 단일작업 학습보다 AQA 성능 향상에 기여하는가?
- RQ2다중작업 표현은 단일 동작 인식 학습에 비해, 특히 새로운 동작에 대해 더 나은 일반화 능력을 보이는가?
- RQ3다양한 네트워크 아키텍처에서 다중작업 학습의 성능 향상이 일관되게 유지되는가?
- RQ4다중작업 학습을 통해 학습된 AQA에 특화된 특징은 제로샷 AQA 평가에서 동작 인식 사전학습 특징보다 더 뛰어나게 성능을 발휘하는가?
- RQ5세부적인 동작 및 코멘터리 감독 정보를 포함함으로써 더 해석 가능하고 정확한 품질 평가가 가능해지는가?
주요 결과
- C3D-AVG-MTL 모델은 인간 애너테이션 기반 AQA 점수와 90.44%의 순서 상관관계를 기록하며 새로운 SOTA 성능을 확립했다.
- 모든 훈련 세트 크기에서 다중작업 학습이 단일작업 학습을 일관되게 능가하며, 더 나은 일반화 능력을 보였다.
- 다중작업 학습을 통해 학습된 AQA 전용 특징은 동작 인식 모델의 특징보다 새로운 동작(예: 예술성 뛰기)에 대해 더 잘 일반화되었다.
- 데이터셋 외부 평가에서 C3D-AVG-MTL 모델은 동작 인식 기준 모델과 비교해 뛰어난 성능을 유지했으며, 특히 도메인 이탈 상황에서도 유사한 성능을 보였다.
- MTL 모델의 중간 레이어 활성화값에 기반한 선형 회귀기는 동작 인식 모델에 비해 더 높은 AQA 상관관계를 기록했으며, 더 나은 특징 학습 능력을 확인했다.
- 새로운 MTL-AQA 데이터셋(1412개의 스키표 영상 샘플)을 기반으로 훈련된 모델는 다른 동작으로의 이식성이 뛰어나, 광범위한 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.