Skip to main content
QUICK REVIEW

[논문 리뷰] Class-attention Video Transformer for Engagement Intensity Prediction

Xusheng Ai, Victor S. Sheng|arXiv (Cornell University)|2022. 08. 12.
Online Learning and Analytics인용 수 4
한 줄 요약

이 논문은 클래스 주의 메커니즘을 사용하여 영상 프레임에서 참여도 강도를 예측하는 엔드 투 엔드 영상 트랜스포머 모델인 Class-attention Video Transformer (CavT)를 제안한다. 이 모델은 최신 기술 수준의 성능을 달성한다. 또한 훈련 데이터의 다양성과 프레임 활용도를 향상시켜 EmotiW-EP에서 MSE 0.0495, DAiSEE에서 MSE 0.0377로 오차를 감소시키는 Binary Order Representatives Sampling (BorS)를 추가로 도입한다.

ABSTRACT

In order to deal with variant-length long videos, prior works extract multi-modal features and fuse them to predict students' engagement intensity. In this paper, we present a new end-to-end method Class Attention in Video Transformer (CavT), which involves a single vector to process class embedding and to uniformly perform end-to-end learning on variant-length long videos and fixed-length short videos. Furthermore, to address the lack of sufficient samples, we propose a binary-order representatives sampling method (BorS) to add multiple video sequences of each video to augment the training set. BorS+CavT not only achieves the state-of-the-art MSE (0.0495) on the EmotiW-EP dataset, but also obtains the state-of-the-art MSE (0.0377) on the DAiSEE dataset. The code and models have been made publicly available at https://github.com/mountainai/cavt.

연구 동기 및 목표

  • 장시간이고 길이가 다양한 온라인 영상에서 엔드 투 엔드 모델을 사용하여 참여도 강도를 예측하는 데 도전한다.
  • 기존의 영상 기반 참여도 예측 방법에서 낮은 프레임 활용도와 열악한 일반화 능력을 해결한다.
  • 효과적인 데이터 증강을 통해 참여도 예측 데이터셋에서의 데이터 부족과 클래스 불균형 문제를 완화한다.
  • 특히 자기주의 주의와 클래스 주의 메커니즘을 활용하여 트랜스포머 아키텍처를 영상 내에서 세밀한 참여도 강도 회귀에 적합하도록 조정한다.
  • 다양한 영상 길이와 콘텐츠에 걸쳐 모델의 강건성과 성능을 향상시키는 샘플링 전략을 개발한다.

제안 방법

  • 학습 가능한 클래스 토큰과 시각적 패치 간의 클래스 주의를 사용하여 시공간적 특징을 집계하여 회귀를 수행하는 Class-attention Video Transformer (CavT)를 제안한다.
  • 학습 가능한 위치 임베딩과 평탄화된 영상 프레임에 대한 멀티헤드 자기주의 주의를 사용하는 표준 ViT 스타일 아키텍처를 구현한다.
  • 영상 시퀀스를 슬라이딩 윈도우로 나누고 이진 순서 논리를 사용해 대표 프레임을 선택하는 데이터 증강 방법인 Binary Order Representatives Sampling (BorS)를 도입한다.
  • BorS는 이진 순서 방식으로 중간 또는 하위 윈도우에서 프레임을 선택하여 입력 영상당 다수의 영상 시퀀스를 적응적으로 생성함으로써 균일한 분포를 확보한다.
  • CavT와 BorS를 결합하여 다양한 길이의 영상에 잘 일반화되는 단일 엔드 투 엔드 모델을 훈련시켜 장시간 시퀀스에서의 성능을 향상시킨다.
  • 평가 지표로 평균 제곱 오차(MSE)와 평균 절대 오차(MAE)를 사용하며, 얼굴 추출, 클래스 가중치, 샘플링 초모수에 대한 분석 실험을 수행한다.

실험 결과

연구 질문

  • RQ1손으로 설계한 특징 없이 원시 영상 프레임에서 연속적인 참여도 강도를 효과적으로 예측할 수 있는 트랜스포머 기반 아키텍처에 클래스 주의 메커니즘이 적용 가능한가?
  • RQ2제안된 BorS 샘플링 전략은 참여도 예측 작업에서 모델의 일반화 능력과 성능 향상에 있어 무작위 샘플링보다 어떻게 우월한가?
  • RQ3데이터가 제한되거나 불균형한 경우 BorS는 모델 성능 향상에 어느 정도 기여하는가?
  • RQ4CavT 아키텍처 내에서 얼굴 추출이 참여도 강도 예측 성능 향상에 기여하는가?
  • RQ5EmotiW-EP 및 DAiSEE와 같은 다양한 벤치마크 데이터셋에서 BorS의 최적의 샘플링 횟수(r)는 얼마인가?

주요 결과

  • BorS+CavT는 EmotiW-EP 데이터셋에서 최신 기술 수준의 MSE 0.0495를 달성하여 이전 방법들을 능가한다.
  • DAiSEE 데이터셋에서는 BorS+CavT가 새로운 최신 기술 수준의 MSE 0.0377을 기록하여 다양한 영상 길이에 걸쳐 강력한 일반화 능력을 보여준다.
  • 분석 실험을 통해 얼굴 추출이 CavT 성능 향상에 기여하며, EmotiW-EP에서 MSE를 0.0759에서 0.0667로 감소시킨다.
  • 가중치 손실는 CavT 성능 향상에 기여하지 않았고 오히려 MMSE를 증가시켜 클래스 불균형 문제가 손실 가중치만으로 효과적으로 해결되지 않음을 시사한다.
  • BorS의 최적 샘플링 횟수는 EmotiW-EP에서 r=4, DAiSEE에서 r=3이며, 이 값 이상일 경우 과적합으로 인해 성능 저하가 발생한다.
  • BorS는 무작위 샘플링보다 MSE 0.0157 향상(0.0495 vs. 0.0652)을 기록하여 구조적이고 이진 순서 기반의 프레임 선택의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.