[논문 리뷰] POSTER: A Pyramid Cross-Fusion Transformer Network for Facial Expression Recognition
이 논문은 얼굴 랜드마크 및 이미지 특징을 트랜스포머 기반의 교차 융합 메커니즘을 통해 공동으로 활용함으로써 얼굴 표정 인식에서의 클래스 간 유사성, 클래스 내 이질성, 척도 민감성 문제를 해결하기 위한 두 개의 스트림으로 구성된 피라미드 교차 융합 트랜스포머 네트워크 POSTER를 제안한다. 이 방법은 주의 지도형 특징 상호작용과 다중 척도 특징 피라미드를 통해 강화된 내성적 특징을 통해 최신 기술 수준의 성능을 달성하며, RAF-DB에서 92.05%의 정확도와 AffectNet 7클래스에서 67.31%의 정확도를 기록한다.
Facial expression recognition (FER) is an important task in computer vision, having practical applications in areas such as human-computer interaction, education, healthcare, and online monitoring. In this challenging FER task, there are three key issues especially prevalent: inter-class similarity, intra-class discrepancy, and scale sensitivity. While existing works typically address some of these issues, none have fully addressed all three challenges in a unified framework. In this paper, we propose a two-stream Pyramid crOss-fuSion TransformER network (POSTER), that aims to holistically solve all three issues. Specifically, we design a transformer-based cross-fusion method that enables effective collaboration of facial landmark features and image features to maximize proper attention to salient facial regions. Furthermore, POSTER employs a pyramid structure to promote scale invariance. Extensive experimental results demonstrate that our POSTER achieves new state-of-the-art results on RAF-DB (92.05%), FERPlus (91.62%), as well as AffectNet 7 class (67.31%) and 8 class (63.34%). The code is available at https://github.com/zczcwh/POSTER.
연구 동기 및 목표
- 얼굴 표정 인식에서의 세 가지 주요 과제인 클래스 간 유사성, 클래스 내 이질성, 척도 민감성을 해결하기 위해.
- 기존 방법들이 완전히 달성하지 못한 바, 이러한 과제들을 하나의 딥 러닝 프레임워크 내에서 통합적으로 다루기 위해.
- 미세한 표정 신호에 대한 주의를 향상시키기 위해 얼굴 랜드마크를 희박하고 주목할 만한 영역 가이드로 활용하기 위해.
- 다양한 이미지 해상도에서의 척도 불변성을 향상시키기 위해 특징 피라미드 구조를 통합하기 위해.
- 이미지 및 랜드마크 특징 간의 전역적이고 이중 방향 주의를 가능하게 하는 교차 융합 트랜스포머 메커니즘을 개발하기 위해.
제안 방법
- POSTER는 이미지 스트림에 ResNet-50 백본을, 랜드마크 스트림에 MobileFaceNet을 사용하여 특징을 추출하는 두 개의 스트림 아키텍처를 채택한다.
- 새로운 교차 융합 트랜스포머 블록이 도입되며, 한 스트림의 쿼리가 다른 스트림의 키와 값에 주의를 기울여 이중 방향 특징 상호작용을 가능하게 한다.
- 교차 융합 메커니즘은 이미지 및 랜드마크 특징에서 유도된 Q, K, V 투영을 사용하며, 한 스트림의 Q와 다른 스트림의 K, V를 조합하여 전역적 상관관계와 맥락 인식 특징 정제를 가능하게 한다.
- 네트워크는 다중 척도 특징을 추출하기 위해 특징 피라미드 구조를 통합하여 입력 이미지의 척도 변동에 대한 강건성을 향상시킨다.
- 최종 분류 헤드는 융합된 표현에서 유도된 특징을 사용하며, 전체 네트워크는 표준 FER 벤치마크에서 엔드 투 엔드로 훈련된다.
- 성능와 효율성의 균형을 맞추기 위해 깊이가 증가하는 세 가지 변종—POSTER-T, POSTER-S, POSTER—을 구현하였으며, 교차 융합 블록 수가 각각 4개, 6개, 8개이다.
실험 결과
연구 질문
- RQ1통합된 딥 러닝 프레임워크가 얼굴 표정 인식에서의 클래스 간 유사성, 클래스 내 이질성, 척도 민감성 문제를 효과적으로 해결할 수 있는가?
- RQ2이미지 및 랜드마크 특징 간의 교차 주의가 미세한 표정 차이에 대한 모델의 강건성 향상에 어떻게 기여하는가?
- RQ3특징 피라미드의 통합이 FER 모델의 척도 불변성 향상에 어느 정도 기여하는가?
- RQ4제안된 교차 융합 트랜스포머 메커니즘이 랜드마크 및 이미지 특징의 단순 연결 또는 조기 융합 방식을 능가하는가?
- RQ5교차 융합 트랜스포머 블록의 수를 변화시킬 경우, 모델 복잡성과 성능 간의 상호 교환 관계는 어떻게 되는가?
주요 결과
- POSTER는 RAF-DB 데이터셋에서 기존 최고 기록을 초월하는 새로운 최신 기술 수준의 정확도 92.05%를 달성한다.
- 7클래스 AffectNet에서 POSTER는 이전 최고 기록을 상회하는 67.31%의 정확도를 기록한다.
- 혼동 행렬 분석 결과, POSTER는 모든 표정 카테고리에서 오분류율을 감소시키고 대각선 정확도를 향상시켜 클래스 내 이질성이 감소한 것을 확인할 수 있다.
- 이미지에서 Q를, 랜드마크에서 K/V를 사용하는 교환된 Q 및 K/V 투영 방식이 가장 높은 성능을 보이며, 주의 방향의 중요성을 확인한다.
- 52.2M개의 파라미터를 가진 POSTER-T는 DMUE와 유사한 FLOPs를 가지나 RAF-DB에서 2.55% 높고 AffectNet에서 4.19% 높은 성능을 기록한다.
- 8개의 교차 융합 블록을 가진 전체 POSTER 모델이 가장 높은 정확도를 달성하여, 합리적인 계산 예산 내에서 더 깊은 융합이 성능 향상에 기여함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.