[논문 리뷰] Adversarial Graph Representation Adaptation for Cross-Domain Facial Expression Recognition
이 논문은 교차 도메인 얼굴 표정 인식을 위한 새로운 프레임워크인 적대적 그래프 표현 적응(AGRA)을 제안한다. 이는 그래프 신경망과 적대적 학습을 융합하여 도메인 간에 전체적이고 국소적인 얼굴 특징을 동시에 적응시키는 방식이다. 구조적 그래프를 통해 내부 및 외부 도메인 간의 관계를 모델링하고 메시지 전파를 통해 도메인 불변 표현을 정교화함으로써, AGRA는 다섯 개인 벤치마크 데이터셋에서 평균 정확도 66.13%의 최신 기술 수준(SOTA) 성능을 달성한다.
Data inconsistency and bias are inevitable among different facial expression recognition (FER) datasets due to subjective annotating process and different collecting conditions. Recent works resort to adversarial mechanisms that learn domain-invariant features to mitigate domain shift. However, most of these works focus on holistic feature adaptation, and they ignore local features that are more transferable across different datasets. Moreover, local features carry more detailed and discriminative content for expression recognition, and thus integrating local features may enable fine-grained adaptation. In this work, we propose a novel Adversarial Graph Representation Adaptation (AGRA) framework that unifies graph representation propagation with adversarial learning for cross-domain holistic-local feature co-adaptation. To achieve this, we first build a graph to correlate holistic and local regions within each domain and another graph to correlate these regions across different domains. Then, we learn the per-class statistical distribution of each domain and extract holistic-local features from the input image to initialize the corresponding graph nodes. Finally, we introduce two stacked graph convolution networks to propagate holistic-local feature within each domain to explore their interaction and across different domains for holistic-local feature co-adaptation. In this way, the AGRA framework can adaptively learn fine-grained domain-invariant features and thus facilitate cross-domain expression recognition. We conduct extensive and fair experiments on several popular benchmarks and show that the proposed AGRA framework achieves superior performance over previous state-of-the-art methods.
연구 동기 및 목표
- 데이터의 비일관성과 데이터셋 간 주관적 애너테이션 편향으로 인해 발생하는 얼굴 표정 인식의 도메인 이동 문제를 해결한다.
- 기존의 적대적 방법이 전체적 특징에만 초점을 맞추며 더 이식 가능한 국소적 특징를 忽略하는 한계를 극복한다.
- 도메인 내 및 도메인 간에 전체적 특징와 국소적 특징의 상호작용을 모델링하여 교차 도메인 FER 성능을 향상시킨다.
- 그래프 기반 메시지 전파와 적대적 적응을 통해 세밀한 도메인 불변 특징 학습을 가능하게 하는 통합 프레임워크를 개발한다.
- 구조적 그래프 초기화와 인접 행렬의 공동 최적화가 더 나은 특징 적응에 기여하는지 실험한다.
제안 방법
- 내부 도메인 연결(한 도메인 내 전체적 및 국소 영역 간 연결)과 외부 도메인 연결(원천 도메인과 타겟 도메인 간 대응 영역 간 연결)을 위한 두 개의 그래프를 구성한다.
- 얼굴 랜드마크를 통해 추출한 전체 이미지 특징와 국소 영역 특징, 그리고 각 도메인에서 학습된 클래스별 통계 분포를 사용해 그래프 노드를 초기화한다.
- 두 개의 스택된 그래프 컬러네이션 네트워크(GCNs)를 활용한다: 하나는 내부 도메인 메시지 전파를 통해 전체-국소 상호작용을 모델링하고, 다른 하나는 외부 도메인 메시지 전파를 통해 도메인 간 특징을 정렬한다.
- 도메인 구분자(discriminator)를 통해 도메인 간 불일치를 최소화하고 도메인 불변 특징 표현을 유도함으로써 적대적 학습을 통합한다.
- 학습 중에 그래프의 인접 행렬을 공동 최적화하여 데이터에 특화된 구조적 사전 지식을 학습하고 효과적인 메시지 전파를 이끌어내도록 한다.
- 매 10 에포크마다 반복적인 정밀화와 특징 클러스터의 재군집화를 수행하여 학습 안정성과 표현 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1전체적 특징와 국소적 특징 간 상관관계를 모델링하면 교차 도메인 얼굴 표정 인식에서 도메인 불변 표현 학습에 기여하는가?
- RQ2내부 및 외부 도메인 특징 관계에 대해 구조적 그래프 표현을 도입할 경우, 전체적 특징만을 고려한 방법과 비교해 성능에 어떤 영향을 미치는가?
- RQ3인접 행렬에 사전 지식(예: 수동으로 정의된 vs. 학습된)이 모델의 강건성과 정확도에 미치는 영향은 무엇인가?
- RQ4GCN의 층 수와 메시지 전파 반복 횟수는 특징 정밀화에 어떻게 영향을 미치며, 과도한 스무딩을 방지하는 데 어떤 역할을 하는가?
- RQ5학습 중에 인접 행렬을 공동 최적화하면 도메인 정렬 및 다양한 데이터셋 간 일반화 성능 향상에 기여하는가?
주요 결과
- AGRA는 다섯 개의 벤치마크 데이터셋(CK+, JAFFE, SFEW2.0, FER2013, ExpW)에서 평균 정확도 66.13%를 달성하여 최신 기술 수준(SOTA) 방법을 초월한다.
- 무작위로 초기화된 인접 행렬을 사용한 경우(Ours RM) 평균 정확도가 6.65% 감소하여, 구조적 사전 지식의 중요성을 입증한다.
- 학습 중에 인접 행렬을 고정할 경우 평균 정확도가 66.13%에서 56.01%로 감소하여, 그래프 구조의 공동 학습이 적응 성능 향상에 기여함을 보여준다.
- 내부 도메인 GCN은 2층, 외부 도메인 GCN은 1층으로 설정할 경우 최적의 성능을 달성하며, 더 깊은 네트워크에서는 특징 과도 스무딩과 성능 저하가 발생한다.
- 인접 행렬을 전부 1로 설정한 경우(Ours OM) 평균 정확도가 3.32% 감소하여, 단순한 사전 지식조차 균일한 연결보다 효과적임을 시사한다.
- 절단 분석 결과, 반복적 업데이트와 주기적 재군집화 모두 필수적임을 확인하였으며, 단독으로 사용할 경우 각각 2.50%와 3.48%의 성능 저하가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.