[논문 리뷰] AU-Guided Unsupervised Domain Adaptive Facial Expression Recognition
이 논문은 얼굴 동작 단위(AUs)를 활용하여 데이터셋 간의 표준화 편향을 줄이고, 얼굴 표정 인식을 위한 AU 유도 비지도 도메인 적응 프레임워크인 AdaFER를 제안한다. AU 기반 소프트 레이블 할당과 AU 유도 트리플릿 손실을 통해, CK+에서 81.40%의 정확도와 ExpW에서 70.86%의 정확도를 기록하며 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
The domain diversities including inconsistent annotation and varied image collection conditions inevitably exist among different facial expression recognition (FER) datasets, which pose an evident challenge for adapting the FER model trained on one dataset to another one. Recent works mainly focus on domain-invariant deep feature learning with adversarial learning mechanism, ignoring the sibling facial action unit (AU) detection task which has obtained great progress. Considering AUs objectively determine facial expressions, this paper proposes an AU-guided unsupervised Domain Adaptive FER (AdaFER) framework to relieve the annotation bias between different FER datasets. In AdaFER, we first leverage an advanced model for AU detection on both source and target domain. Then, we compare the AU results to perform AU-guided annotating, i.e., target faces that own the same AUs with source faces would inherit the labels from source domain. Meanwhile, to achieve domain-invariant compact features, we utilize an AU-guided triplet training which randomly collects anchor-positive-negative triplets on both domains with AUs. We conduct extensive experiments on several popular benchmarks and show that AdaFER achieves state-of-the-art results on all these benchmarks.
연구 동기 및 목표
- 다양한 데이터셋 간의 일관성 없는 표준화와 이미지 수집 조건의 다양성으로 인한 얼굴 표정 인식의 도메인 시프트 문제를 해결한다.
- 얼굴 동작 단위(AUs)의 객관적이고 편향이 적은 특성 덕분에 원천 및 타겟 FER 데이터셋 간의 표준화 편향을 줄인다.
- 학습 과정에 AU 기반 감독을 통합하여 특징의 밀도 향상과 도메인 불변성 향상을 도모한다.
- 추론 비용 증가 없이 다양한 교차 데이터셋 FER 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 사전 학습된 AU 검출 모델을 사용해 원천 및 타겟 도메인 이미지에서 동작 단위 코드를 추출한다.
- 유사한 AU 코드를 가진 원천 도메인 이미지를 검색하여 타겟 도메인 이미지에 소프트 레이블을 할당함으로써 AU 기반의 어노테이션을 수행한다.
- 원천 도메인 이미지(앵커)를 타겟 도메인 이미지와 쌍지어, 동일하거나 다른 AU 코드를 가진 이미지(양성/음성 샘플)를 구성함으로써 AU 기반 트리플릿 샘플을 생성한다.
- AU 유사성 기반으로 내부 클래스 간 거리 최소화와 외부 클래스 간 거리 최대화를 유도하는 트리플릿 손실을 사용하여 특징의 밀도 향상과 도메인 불변성을 향상시킨다.
- pseudo 소프트 레이블과 AU 기반 트리플릿 손실을 모두 활용하여 원천 데이터로 사전 학습된 FER 모델을 타겟 도메인에서 피지컬러닝한다.
- 샘플링 임계값을 최적화하여 난이도와 학습 안정성의 균형을 이루며, 분석 결과 최적의 성능는 0.5에서 달성된다.
실험 결과
연구 질문
- RQ1얼굴 동작 단위(AUs)는 교차 도메인 얼굴 표정 인식에서 표준화 편향을 완화하는 신뢰할 수 있는 보조 신호로 기능할 수 있는가?
- RQ2타겟 도메인에 진정한 레이블이 없을 경우 AU 기반 소프트 레이블링은 일반화 성능 향상에 얼마나 효과적인가?
- RQ3AU 기반 트리플릿 학습은 비지도 도메인 적응에서 특징의 밀도 향상과 도메인 불변성 향상에 어느 정도 기여하는가?
- RQ4AU 기반 감독을 통합하면 다양한 FER 벤치마크에서 최신 기술 수준의 성능 달성이 가능한가?
주요 결과
- AdaFER는 교차 데이터셋 얼굴 표정 인식에서 CK+ 데이터셋에서 81.40%의 새로운 최신 기술 수준 정확도를 달성한다.
- ExpW 벤치마크에서 AdaFER는 70.86%의 정확도를 기록하여 이전 방법들을 크게 앞서며 새로운 SOTA를 수립한다.
- RAF-DB를 원천으로 사용할 경우, 모든 타겟 데이터셋에서 평균 정확도가 기준 모델 대비 8.94% 향상된다.
- T-SNE를 통한 특징 시각화 결과, 특히 중립 표정에서 기준 모델보다 AdaFER가 더 밀도 있고 잘 분리된 특징을 학습하는 것으로 확인된다.
- 절단 분석 결과, 트리플릿 샘플링 임계값을 0.5로 설정할 경우 최적의 성능를 달성하며, 샘플 난이도와 학습 안정성의 균형이 잘 맞아떨어진다.
- AdaFER는 추론 비용 증가 없이 이러한 성과를 달성한다. 복잡한 추론 시점 특징 융합이나 노드 초기화가 필요한 기존 방법들과는 달리, 이는 추론 효율성 유지에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.