[논문 리뷰] POSTER++: A simpler and stronger facial expression recognition network
POSTER++는 image-to-landmark 분기를 제거하고, window-based cross-attention을 적용하며, 작은 ViT로 직접 다중 스케일 특징 추출을 통해 POSTER를 개선하여, 더 낮은 연산으로 최첨단 FER 성능을 달성합니다(8.4G FLOPs, 43.7M 파라미터).
Facial expression recognition (FER) plays an important role in a variety of real-world applications such as human-computer interaction. POSTER achieves the state-of-the-art (SOTA) performance in FER by effectively combining facial landmark and image features through two-stream pyramid cross-fusion design. However, the architecture of POSTER is undoubtedly complex. It causes expensive computational costs. In order to relieve the computational pressure of POSTER, in this paper, we propose POSTER++. It improves POSTER in three directions: cross-fusion, two-stream, and multi-scale feature extraction. In cross-fusion, we use window-based cross-attention mechanism replacing vanilla cross-attention mechanism. We remove the image-to-landmark branch in the two-stream design. For multi-scale feature extraction, POSTER++ combines images with landmark's multi-scale features to replace POSTER's pyramid design. Extensive experiments on several standard datasets show that our POSTER++ achieves the SOTA FER performance with the minimum computational cost. For example, POSTER++ reached 92.21% on RAF-DB, 67.49% on AffectNet (7 cls) and 63.77% on AffectNet (8 cls), respectively, using only 8.4G floating point operations (FLOPs) and 43.7M parameters (Param). This demonstrates the effectiveness of our improvements.
연구 동기 및 목표
- POSTER의 계산 비효율성을 해소하면서 FER 정확도를 유지하거나 향상시키는 것.
- FLOPs와 파라미터를 줄이기 위해 중복 분기를 제거.
- 효율적인 크로스 퓨전과 다중 스케일 특징 통합을 도입.
- 자원 효율적이면서 표준 FER 벤치마크에서 최첨단 성능을 입증.
제안 방법
- POSTER에서 얼굴 랜드마크 탐지기와 이미지 백본을 유지.
- 두 스트림 설계에서 이미지->랜드마크 분기를 제거.
- 일반 교차 주의를 윈도우 기반 교차 주의(W-MCSA)로 대체하여 선형 복잡도를 달성.
- 피라미드 다중 스케일 특징 추출을 제거하고, 백본과 랜드마크 탐지기로부터 다중 스케일 특징을 직접 융합하기 위해 두-layer Vision Transformer (ViT)을 사용.
- 다중 스케일 특징을 통합하기 위해 작은 ViT를 도입.
- 로컬 모델링을 향상시키고 계산량을 줄이기 위해 윈도우 기반 교차 퓨전을 사용.
실험 결과
연구 질문
- RQ1POSTER++가 POSTER에 비해 매개변수와 FLOPs를 크게 줄이면서 FER 정확도를 유지하거나 향상시킬 수 있는가?
- RQ2각 설계 변경(두 스트림 제거, 윈도우 기반 주의의 크로스 퓨전, 직접적인 다중 스케일 추출)이 전체 성능에 기여하는 바는 무엇인가?
- RQ3윈도우 기반 교차 주의가 두 스트림 FER 아키텍처에서 일반 교차 주의를 대체하기에 충분한가?
- RQ4가벼운 ViT로 통합된 다중 스케일 특징이 POSTER의 피라미드 설계와 비교해 유사하거나 더 나은 결과를 제공하는가?
주요 결과
- POSTER++는 RAF-DB(92.21%), AffectNet(7 cls: 67.49%), AffectNet(8 cls: 63.77%)에서 SOTA FER 성능을 달성합니다.
- CAER-S에서 POSTER++는 93.00%에 도달하여 POSTER(92.73%)를 능가합니다.
- POSTER++는 8.4G FLOPs와 43.7M 파라미터를 사용하여 POSTER에 비해 FLOPs와 파라미터를 모두 줄였습니다(8.4G 대 15.7G; 43.7M 대 71.8M).
- Ablation 연구는 랜드마크-대-이미지 크로스퓨전이 결정적이며, 이미지-대-랜드마크 분기를 제거하는 것은 비용을 감소시키고 정확도 손실은 제한적임을 보인다.
- 윈도우 기반 교차 주의(W-MCSA)는 선형 계산복잡도를 제공하고 일반 교차 주의에 비해 FER 정확도를 향상시킵니다.
- 두 계층 ViT로의 직접적인 다중 스케일 특징 추출은 다중 스케일 정보를 효과적으로 통합하기에 충분합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.