Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-task Mean Teacher for Semi-supervised Facial Affective Behavior Analysis

Lingfeng Wang, Shisen Wang|arXiv (Cornell University)|2021. 07. 09.
Emotion and Mood Recognition참고 문헌 16인용 수 4
한 줄 요약

이 논문은 다중 작업 평균 트레이너 프레임워크를 제안하여, 세 가지 정서 표현(편도, 각성도, 동작 단위)을 동시에 학습하는 다중 작업 학습을 통해 레이블이 없는 데이터를 활용하여 반감독 학습 기반 얼굴 정서 행동 분석을 수행한다. 이 방법은 ABAW3 경연 대회에서 두 개의 트랙에서 4위, 한 개의 트랙에서 6위를 기록하여 레이블이 불완전한 데이터셋에서도 뛰어난 성능과 안정성을 입증한다.

ABSTRACT

Affective Behavior Analysis is an important part in human-computer interaction. Existing multi-task affective behavior recognition methods suffer from the problem of incomplete labeled datasets. To tackle this problem, this paper presents a semi-supervised model with a mean teacher framework to leverage additional unlabeled data. To be specific, a multi-task model is proposed to learn three different kinds of facial affective representations simultaneously. After that, the proposed model is assigned to be student and teacher networks. When training with unlabeled data, the teacher network is employed to predict pseudo labels for student network training, which allows it to learn from unlabeled data. Experimental results showed that our proposed method achieved much better performance than baseline model and ranked 4th in both competition track 1 and track 2, and 6th in track 3, which verifies that the proposed network can effectively learn from incomplete datasets.

연구 동기 및 목표

  • 얼굴 정서 행동 분석에서 레이블이 제한된 데이터 문제를 해결하기 위해.
  • 풍부한 레이블이 없는 얼굴 데이터를 활용하여 모델의 일반화 능력을 향상시키기 위해.
  • 편도, 각성도, 동작 단위를 동시에 예측하는 다중 작업 학습 프레임워크를 개발하기 위해.
  • 학습 안정성과 강건성을 향상시키기 위해 평균 트레이너 학습 철학을 통합하기 위해.
  • 기본 정서 행동 데이터셋에서 반감독 설정에서 높은 성능을 달성하기 위해.

제안 방법

  • 세 가지 정서 표현(편도, 각성도, 동작 단위)을 동시에 예측할 수 있도록 다중 작업 딥 네ural 네트워크를 설계한다.
  • 학생-선생 지식 정제 프레임워크를 활용하여, 선생 네트워크가 레이블이 없는 데이터에 대해 의사 레이블을 생성한다.
  • 선생 네트워크는 학생의 가중치에 대한 지수 이동 평균으로 구성되어 있어 학습 중 안정적인 예측을 보장한다.
  • 학습 과정에서 학생 네트워크는 레이블이 있는 데이터와 의사 레이블이 부여된 레이블이 없는 데이터를 모두 활용하여 최적화된다.
  • 손실 함수는 레이블이 있는 데이터에 대한 감독형 교차 엔트로피 손실과 레이블이 없는 데이터에 대한 일致성 정규화 손실을 조합한다.
  • 이 프레임워크는 선생에서 학생으로의 지식 전이를 효과적으로 가능하게 하여, 제한된 레이블에 기반한 표현 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1다중 작업 학습 프레임워크가 얼굴 정서 행동 분석의 표현 학습을 향상시킬 수 있는가?
  • RQ2반감독 설정에서 레이블이 없는 얼굴 데이터는 얼마나 효과적으로 활용될 수 있는가?
  • RQ3평균 트레이너를 통한 지식 정제가 제한된 레이블이 있는 데이터에서 성능을 향상시키는가?
  • RQ4편도, 각성도, 동작 단위를 동시에 예측하는 것이 모델의 일반화 능력을 향상시키는가?
  • RQ5제안된 방법은 기준 정서 행동 데이터셋에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 ABAW3 경연 대회에서 트랙 1과 트랙 2에서 각각 4위를 기록했다.
  • 트랙 3에서 6위를 기록하여 다양한 평가 환경에서 뛰어난 일반화 능력을 입증했다.
  • 특히 낮은 감독 신호 환경에서 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 선생 네트워크에서 유도된 의사 레이블의 사용이 레이블이 없는 데이터에서의 성능 향상에 기여하여 평균 트레이너 전략의 효과성을 확인했다.
  • 다중 작업 학습 설정이 특징 표현 학습을 향상시켜 모든 정서 행동 예측 작업에서 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.