[논문 리뷰] Multi-modal Facial Action Unit Detection with Large Pre-trained Models for the 5th Competition on Affective Behavior Analysis in-the-wild
이 논문은 대규모 사전 훈련된 모델(Swin Transformer, GH-Feat, HuBERT, RoBERTa)에서 추출한 시각적, 청각적, 어휘적 특징을 사용하여 다중 모odal 얼굴 동작 단위(AU) 검출 프레임워크를 제안한다. 초해상도 및 얼굴 정렬을 통해 시각적 특징 품질을 향상시켜, Aff-Wild2 검증 세트에서 52.3%의 F1 스코어를 달성하며, 실제 환경에서의 강건한 AU 검출을 위한 다중 모달 융합 및 데이터 전처리의 효과를 입증한다.
Facial action unit detection has emerged as an important task within facial expression analysis, aimed at detecting specific pre-defined, objective facial expressions, such as lip tightening and cheek raising. This paper presents our submission to the Affective Behavior Analysis in-the-wild (ABAW) 2023 Competition for AU detection. We propose a multi-modal method for facial action unit detection with visual, acoustic, and lexical features extracted from the large pre-trained models. To provide high-quality details for visual feature extraction, we apply super-resolution and face alignment to the training data and show potential performance gain. Our approach achieves the F1 score of 52.3% on the official validation set of the 5th ABAW Challenge.
연구 동기 및 목표
- 다양한 실외 조건에서 AU 검출의 강건성을 향상시키기 위해 다중 모달 신호가 기여하는지 조사하기 위해.
- 초해상도 및 얼굴 정렬이 시각적 특징 품질 향상에 기여하는지 평가하기 위해.
- 대규모 사전 훈련된 모델이 제약 없는 환경에서 AU 검출을 위한 일반화 가능하고 구분력 있는 특징을 생성하는지 평가하기 위해.
- 청각 및 텍스트 모달 특징이 AU 검출 성능에 기여하는 정도를 탐색하기 위해.
제안 방법
- 시각적 특징은 Swin Transformer와 GH-Feat 인코더를 사용해 추출되며, 훈련 데이터에 초해상도 및 얼굴 정렬을 적용하여 사전 훈련 분포와의 도메인 시프트를 줄인다.
- 청각적 특징은 HuBERT를 통해 추출되며, 어휘적 특징은 RoBERTa를 통해 확보되며, 모두 고수준의 의미적 및 프로소딕 표현을 제공한다.
- 다중 모달 특징은 파ip라인의 초기 단계에서 융합되며, 이후 GRU를 사용한 시계열 모델링과 선형 투영을 통해 순차적 패턴을 포착한다.
- 결합된 처리된 특징에서 AU 레이블을 예측하기 위해 다층퍼셉트론(MLP)을 훈련한다.
- 모델은 채굴된 쌍별 AU 상관관계를 활용하여 예측 확률의 평균을 내어 검출 성능을 향상시키는 AUcorr를 적용한다.
- 각 모달 및 구성 요소의 기여도를 평가하기 위해 추상화 실험(ablation studies)를 실시한다. 이는 시각, 청각, 텍스트, 시계열 특징을 포함한다.
![Figure 1 : Multi-modal method for facial action unit detection. The inputs from different modalities are passed through different large pre-trained models to extract high-level representations, in this case, Swin Transformer [ 23 ] and GH-Feat encoder [ 31 ] for vision, HuBERT [ 8 ] for audio, and R](https://ar5iv.labs.arxiv.org/html/2303.10590/assets/x1.png)
실험 결과
연구 질문
- RQ1다양한 실외 조건에서 사전 훈련된 모델의 AU 검출에 다중 모달 신호가 강건성을 향상시키는가?
- RQ2초해상도 및 얼굴 정렬이 저품질 비디오 프레임으로 인한 성능 저하를 줄이는 데 효과적인가?
- RQ3대규모 사전 훈련된 모델이 제약 없는 설정에서 AU 검출을 위한 신뢰할 수 있고 일반화 가능한 특징 표현을 생성하는가?
- RQ4청각 및 텍스트 특징이 AU 검출 성능에 어느 정도 기여하는가?
- RQ5채굴된 AU 상관관계는 후처리 또는 특징 융합을 통해 성능 향상에 기여하는가?
주요 결과
- 제안된 다중 모달 프레임워크는 공식 Aff-Wild2 검증 세트에서 52.3%의 F1 스코어를 기록하여 기준 모델을 초월한다.
- 초해상도 및 얼굴 정렬은 시각적 특징 품질 향상에 뚜렷한 기여를 하며, 검증 세트에서 제거 시 F1 스코어가 2.5% 감소한다.
- 청각 모달이 테스트 세트 성능 향상에 가장 두드러진 기여를 하며, 제외 시 F1 스코어가 2.1% 감소하여 일반화에 기여하는 역할을 확인한다.
- GRU를 통한 시계열 모델링은 테스트 세트에서 성능을 0.7% 향상시켜, AU 검출에서 순차적 맥락의 가치를 확인한다.
- AUcorr는 검증 세트에서 AU24에 대해 13%, AU26에 대해 5.2% 성능 향상을 기록하여 상관관계 기반 후처리의 유용성을 입증한다.
- 텍스트 모달은 다소 미약하지만 일관되게 기여하며, 테스트 세트에서 F1 스코어를 0.8% 향상시켜 시각 및 청각 정보와의 보완적 기여를 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.