[논문 리뷰] Multi-label Transformer for Action Unit Detection
이 논문은 얼굴 패치에 대한 자기주의(self-attention)와 학습된 AU 토큰 및 이미지 특징 간의 교차주의(cross-attention)를 활용하여 각 AU에 대해 관련 얼굴 영역을 국소화하는 다중 레이블 Transformer 아키텍처를 제안한다. 이 방법은 ABAW3 챌린지에서 테스트 평균 F1 스코어 53.8을 달성하여 주목적 기반 특징 선택과 빈도 가중치 및 딱딱한 손실(Dice loss)을 통한 클래스 불균형 처리를 통해 성능 향상을 보였다.
Action Unit (AU) Detection is the branch of affective computing that aims at recognizing unitary facial muscular movements. It is key to unlock unbiased computational face representations and has therefore aroused great interest in the past few years. One of the main obstacles toward building efficient deep learning based AU detection system is the lack of wide facial image databases annotated by AU experts. In that extent the ABAW challenge paves the way toward better AU detection as it involves a 2M frames AU annotated dataset. In this paper, we present our submission to the ABAW3 challenge. In a nutshell, we applied a multi-label detection transformer that leverage multi-head attention to learn which part of the face image is the most relevant to predict each AU.
연구 동기 및 목표
- 국소적인 근육 운동과 높은 AU 간 상호의존성을 포함하는 얼굴 영상에서 다중 레이블 Action Unit(AU) 검출의 과제를 해결하기 위해.
- 각 AU를 예측하기 위해 가장 관련성이 높은 얼굴 영역을 주목적 기반 메커니즘을 통해 학습함으로써 AU 검출을 향상시키기 위해.
- 대부분의 프레임에서 AU 활성화가 없는 경우가 많기 때문에 클래스 불균형 문제를 해결하기 위해 빈도 기반 손실 가중치와 딱딱한 손실을 사용하기 위해.
- 마스크된 AU 레이블이 있는 관련 데이터셋(DISFA, BP4D)에서 미리 훈련하고 데이터 증강을 통해 성능을 향상시키기 위해.
- 대규모이고 실세계 기반의 AU 검출 기준인 ABAW3 챌린지에서 제안된 아키텍처의 효과성을 검증하기 위해.
제안 방법
- 이미지 패치 임bedding과 위치 인코딩을 사용하여 얼굴 영상을 처리하는 비전 트랜스포머 기반 아키텍처를 사용한다.
- 이미지 패치 간 자기주의를 적용하여 얼굴 전반에 걸쳐 국소적이고 맥락 인식 특징을 학습한다.
- 학습된 AU 토큰이 교차주의를 통해 이미지 특징에 주목함으로써, 각 AU에 대해 동적으로 관련 얼굴 영역을 선택할 수 있도록 한다.
- 스택된 트랜스포머 블록 내에서 다중 헤드 주목적, 레이어 정규화 및 피드포워드 네트워크를 통합한다.
- 최종 투사 헤드는 시그모이드 활성화를 사용하여 각 AU의 확률을 출력하며, 예측은 20프레임 윈도우에 걸쳐 스무딩되어 세그먼트 수준의 AU 이벤트를 모델링한다.
- 훈련은 빈도 기반 클래스 가중치가 적용된 이진 교차 엔트로피와 딱딱한 손실을 조합한 하이브리드 손실을 사용하여 장꼬리 클래스 분포 문제를 해결한다.
실험 결과
연구 질문
- RQ1AU 토큰과 이미지 특징 간의 교차주의를 갖춘 다중 레이블 트랜스포머가 개별 AU에 대해 관련 얼굴 영역을 보다 잘 국소화할 수 있는가?
- RQ2주목적 기반 특징 선택은 매우 국소적이고 일시적인 Action Unit 활성화의 특성을 얼마나 잘 포착할 수 있는가?
- RQ3마스크된 레이블이 있는 관련 AU 데이터셋(DISFA, BP4D)에서의 미리 훈련이 ABAW3 벤치마크에서 성능 향상에 얼마나 기여하는가?
- RQ4빈도 기반 손실 가중치와 딱딱한 손실을 조합하면 불균형한 AU 검출에서 F1 성능을 크게 향상시킬 수 있는가?
- RQ5시간 평균을 사용하여 프레임 수준의 예측을 효과적으로 세그먼트 수준의 AU 검출로 스무딩할 수 있는가?
주요 결과
- 모델은 ABAW3 챌린지에서 테스트 평균 F1 스코어 53.8을 기록하여 보고된 구성 중에서 가장 높은 성능을 보였다.
- 20프레임 윈도우에 걸쳐 예측을 스무딩하는 이동 평균을 사용함으로써 시간적 일관성과 성능이 크게 향상되었다.
- DISFA 및 BP4D 데이터셋에서 마스크된 AU 레이블을 사용한 미리 훈련이 성능 향상에 기여했지만, 표에선 정확한 성과 향상 수치는 기재되지 않았다.
- 빈도 기반 손실 가중치와 딱딱한 손실의 조합이 장꼬리 AU 분포를 더 잘 다루는 데 기여하여 F1 스코어 향상을 이끌었다.
- 믹스업 및 기하학적/색상 변형 등의 데이터 증강 기법이 일반화 능력과 강인성을 향상시켰다.
- 제거 실험 결과, 이동 평균 또는 빈도 가중치를 제거할 경우 성능이 떨어졌으며(각각 52.7% 및 50.3%), 이는 이 요소들이 중요하다는 것을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.