[논문 리뷰] Pose-adaptive Hierarchical Attention Network for Facial Expression Recognition
이 논문은 제약 조건이 없고 다중 시점 환경에서 얼굴 표정과 머리 자세를 동시에 인식하는 포즈 적응형 계층적 어텐션 네트워크인 PhaNet을 제안한다. 계층적 픽셀 및 스케일 어텐션 메커니즘을 활용하여 포즈에 영향을 받지 않는 표현 구분 능력을 지닌 영역을 적응적으로 선택하고, 동적으로 가중된 다중 작업 학습을 통해 엔드 투 엔드 학습을 최적화하여, 다중 시점 데이터셋에서 평균 정확도 84.92%와 실외 환경 SFEW에서 31.25%의 최신 기술 수준(SOTA) 성능을 달성한다.
Multi-view facial expression recognition (FER) is a challenging task because the appearance of an expression varies in poses. To alleviate the influences of poses, recent methods either perform pose normalization or learn separate FER classifiers for each pose. However, these methods usually have two stages and rely on good performance of pose estimators. Different from existing methods, we propose a pose-adaptive hierarchical attention network (PhaNet) that can jointly recognize the facial expressions and poses in unconstrained environment. Specifically, PhaNet discovers the most relevant regions to the facial expression by an attention mechanism in hierarchical scales, and the most informative scales are then selected to learn the pose-invariant and expression-discriminative representations. PhaNet is end-to-end trainable by minimizing the hierarchical attention losses, the FER loss and pose loss with dynamically learned loss weights. We validate the effectiveness of the proposed PhaNet on three multi-view datasets (BU-3DFE, Multi-pie, and KDEF) and two in-the-wild FER datasets (AffectNet and SFEW). Extensive experiments demonstrate that our framework outperforms the state-of-the-arts under both within-dataset and cross-dataset settings, achieving the average accuracies of 84.92\%, 93.53\%, 88.5\%, 54.82\% and 31.25\% respectively.
연구 동기 및 목표
- 제약 조건이 없는 환경에서 포즈 변동으로 인해 성능이 저하되는 다중 시점 얼굴 표정 인식(FER) 문제를 해결한다.
- 포즈 추정기 의존도가 높은 이중 단계 방법의 한계를 극복하기 위해 엔드 투 엔드로 훈련 가능한 프레임워크를 제안한다.
- 계층적 어텐션을 사용해 표현과 포즈 표현을 함께 학습함으로써 강건성과 일반화 능력을 향상시킨다.
- 재학습 없이도 실외 데이터셋, 특히 도메인 이탈이 높은 데이터셋에 효과적으로 적용 가능한 교차 데이터셋 FER을 가능하게 한다.
- 학습 가능한 손실 가중치를 통해 표현과 포즈 학습을 적응적으로 균형 잡는 동적 다중 작업 학습 기법을 개발한다.
제안 방법
- 다중 스케일에서 표현 관련 영역을 탐지하기 위해 두 개의 연결된 약한 지도 학습 기반 픽셀 어텐션 네트워크를 사용하는 계층적 픽셀 어텐션 학습(HPAL)을 도입한다.
- 포즈에 영향을 받지 않는 표현 구분 능력을 지닌 표현 학습에 기여하는 스케일을 선택하기 위해 공동 스케일 어テン션 학습(SAL)을 활용한다.
- 계층적 어텐션 손실, FER 손실, 포즈 손실을 적응적이고 대칭적인 손실 가중치로 최소화하는 동적으로 제약된 다중 작업 학습(DCML) 프레임워크를 적용한다.
- 특성 기반 제약 인자를 손실 가중치 메커니즘에 통합하여 기울기 소실을 방지하고 특히 표현 작업에서의 훈련 안정성을 향상시킨다.
- 어 attention, 표현, 포즈 감독을 모두 포함하는 다중 손실 목표 함수를 사용해 전체 네트워크를 엔드 투 엔드로 훈련한다.
- 전역 특징가 손상되거나 가로막힐 경우 국소 특징에 집중하는 인간 시각 시스템의 직관을 반영하기 위해 계층적 특징 추상화를 모델링한다.
실험 결과
연구 질문
- RQ1포즈 정규화나 각 포즈별 별도의 분류기 없이도 단일 딥 네트워크가 포즈에 영향을 받지 않는 표현 구분 능력을 지닌 표현을 동시에 학습할 수 있는가?
- RQ2포즈 변화 상황에서 계층적 어텐션은 표현 인식에 가장 관련성이 높은 얼굴 영역을 얼마나 효과적으로 식별하는가?
- RQ3고정 또는 비가중 손실 조합에 비해 동적으로 가중된 다중 작업 학습이 수렴성과 성능 향상에 얼마나 기여하는가?
- RQ4제약 조건이 있는 다중 시점 데이터셋에서 훈련된 모델이 도메인 이탈이 높은 실외 환경 데이터셋에 대해 도메인 적응 없이 얼마나 잘 일반화되는가?
- RQ5제안된 어텐션 메커니즘이 정확한 포즈 추정기 의존도를 줄이면서도 높은 FER 정확도를 유지할 수 있는가?
주요 결과
- PhaNet은 BU-3DFE, Multi-Pie, KDEF 다중 시점 데이터셋에서 평균 정확도 84.92%를 달성하여, 내부 데이터셋 및 교차 데이터셋 설정 모두에서 최신 기술 수준의 방법들을 능가한다.
- 실외 환경 SFEW 데이터셋에서는 재학습 없이도 31.25%의 정확도를 기록하여 GAN 기반(26.58%) 및 DenseNet 기반(26.16%) 방법들을 능가한다.
- 제거 실험 결과, 계층적 어텐션 손실과 포즈 및 표현 손실을 결합할 경우 가장 높은 성능(84.92% on BU-3DFE)을 기록하여 다중 손실 설계의 효과를 확인한다.
- 동적 손실 가중치에 제약 인자를 포함시킴으로써 기울기 소실을 방지하고 특히 표현 작업에서의 훈련 안정성을 향상시킨다.
- 동적 손실 가중치는 훈련 중 변화한다: 표현 가중치는 낮은 초기값에서 약 0.6으로 증가하고, 포즈 가중치는 약 0.4로 감소하여 작업별 기여도를 반영하고 수렴성을 향상시킨다.
- BU-3DFE에서 포즈 추정 정확도가 100%에 도달하여, 어려운 조건에서도 머리 자세를 식별할 수 있는 공동 학습 프레임워크의 강건성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.