[논문 리뷰] Spatio-Temporal AU Relational Graph Representation Learning For Facial Action Units Detection
이 논문은 얼굴 동작 단위(AU) 검출을 위한 시공간 그래프 학습 프레임워크를 제안한다. 이는 마스킹된 오토인코더(MAE)로 사전 훈련된 얼굴 표현 인코더, AU 전용 특징 생성기, 시공간 그래프 학습 모듈을 활용하여 AU 간의 공간적 관계와 프레임 간 시간적 동적 변화를 모두 모델링한다. 이 방법은 테스트 세트에서 평균 F1 스코어 51.3%를 기록하여 제5회 ABAW 경연에서 4위를 차지했다.
This paper presents our Facial Action Units (AUs) detection submission to the fifth Affective Behavior Analysis in-the-wild Competition (ABAW). Our approach consists of three main modules: (i) a pre-trained facial representation encoder which produce a strong facial representation from each input face image in the input sequence; (ii) an AU-specific feature generator that specifically learns a set of AU features from each facial representation; and (iii) a spatio-temporal graph learning module that constructs a spatio-temporal graph representation. This graph representation describes AUs contained in all frames and predicts the occurrence of each AU based on both the modeled spatial information within the corresponding face and the learned temporal dynamics among frames. The experimental results show that our approach outperformed the baseline and the spatio-temporal graph representation learning allows our model to generate the best results among all ablated systems. Our model ranks at the 4th place in the AU recognition track at the 5th ABAW Competition. Our code is publicly available at https://github.com/wzh125/ABAW-5.
연구 동기 및 목표
- 실세계 영상에서 미묘한 AU 검출의 과제, 즉 데이터 불균형과 복잡한 시공간 의존성 문제를 해결하기 위해.
- 다른 AU 간의 공간적 관계와 연속된 영상 프레임 간 시간적 동적 변화를 동시에 모델링하여 AU 인식 성능을 향상시키기 위해.
- Aff-Wild2 데이터셋에서 AU 애너테이션의 불균형으로 인한 모델 편향을 사전 훈련된 얼굴 표현 인코더를 통해 완화하기 위해.
- AU 간 관계와 얼굴 시퀀스에서의 시간적 진화를 명시적으로 모델링하는 그래프 기반 표현 학습 프레임워크를 개발하기 위해.
- 제5회 감정 행동 분석 실외(Aff-Wild) 경연에서 AU 검출 분야에서 최고 성능을 달성하기 위해.
제안 방법
- 인간 얼굴 데이터베이스에서 사전 훈련된 마스킹 오토인코더(MAE)를 사용하여 입력 얼굴 이미지에서 강력하고 일반화 가능한 얼굴 표현을 추출한다.
- AU 전용 특징 생성기가 얼굴 표현에서 작업에 특화된 특징을 추출하며, 이는 시공간 그래프의 노드 특징으로 기능한다.
- 시공간 그래프 학습(STGL) 모듈은 노드가 프레임을 가로질러 AU를 나타내는 그래프를 구성하며, 간선은 AU 간의 공간적 관계와 프레임 간 시간적 의존성을 코딩한다.
- STGL 모듈은 동일 프레임 내의 공간 이웃(스페이셜 네이버)과 동일 AU 시퀀스에서의 시간 이웃(타임리얼 네이버)을 모두 사용하여 각 AU 노드를 업데이트함으로써 공간적 및 시간적 동적 변화를 동시에 모델링한다.
- 공간적 및 시간적 그래프 연결을 정의하기 위해 K-최근접 이웃 전략(K=4)을 사용하며, 메시지 전파를 통해 그래프 전역에서 특징을 집계한다.
- 훈련은 AdamW(가중치 감쇠 5e-4), 코즈인 감쇠 학습률 스케줄러를 사용하며, 짧은 클립의 경우 빈 프레임 패딩을 포함한 랜덤 16프레임 클립 샘플링을 통한 데이터 증강 기법을 적용한다.
실험 결과
연구 질문
- RQ1사전 훈련된 마스킹 오토인코더가 데이터 불균형 설정에서 AU 검출을 위한 얼굴 표현 학습에 기여하는가?
- RQ2시공간 그래프 학습 모듈이 AU 간의 공간적 관계와 영상 프레임 간 시간적 의존성을 얼마나 효과적으로 모델링하는가?
- RQ3공간적 및 시간적 그래프 구조를 동시에 모델링할 경우, 각각을 별도로 모델링하는 것보다 AU 검출 성능 향상에 얼마나 기여하는가?
- RQ4MAE 사전 훈련에 하이브리드 얼굴 데이터셋을 사용할 경우, ImageNet 기반 사전 훈련보다 AU 검출 작업에서 성능이 뛰어나지는가?
- RQ5실세계 AU 검출 벤치마크에서 제안된 방법은 최신 기술 대비 어떻게 비교되는가?
주요 결과
- 제안된 방법은 테스트 세트에서 평균 F1 스코어 51.3%를 기록하여 제5회 ABAW 경연에서 4위를 차지했으며, 베이스라인(36.5%)과 ME-Graph 방법(51.0%)을 모두 능가했다.
- 제거 실험을 통해 공간 그래프 학습과 시간 그래프 학습 모두 성능 향상에 기여함을 확인했으며, 전체 모델은 검증 세트에서 F1 스코어 54.3%를 달성했다.
- 하이브리드 얼굴 데이터셋에서 사전 훈련한 결과(ImageNet 기반 사전 훈련 대비 52.6% F1) 성능 향상(54.3% F1)을 보였으며, 일반화된 사전 훈련에서의 도메인 이격 문제를 시사했다.
- 전반적인 성능는 약간 낮지만 일부 AU 카테고리에서 1위 팀(Netease Fuxi)을 능가하여 희귀 AU 검출에서의 강건성을 입증했다.
- 공간적 및 시간적 그래프 학습의 조합이 가장 큰 성능 향상을 가져왔으며, 이는 두 유형의 관계를 동시에 모델링하는 것이 중요함을 시사한다.
- 검증 세트에서 기존 베이스라인 대비 평균 F1 스코어가 15.3포인트 향상(39.0에서 54.3)되었으며, 제안된 프레임워크의 유효성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.