Skip to main content
QUICK REVIEW

[논문 리뷰] Affect Expression Behaviour Analysis in the Wild using Spatio-Channel Attention and Complementary Context Information

Darshan Gera, S. Balasubramanian|arXiv (Cornell University)|2020. 09. 29.
Emotion and Mood Recognition참고 문헌 22인용 수 7
한 줄 요약

이 논문은 얼굴 표정 인식을 위한 이중 경로 주의 프레임워크를 제안하며, 국소적 및 전역적 특징 주의를 위해 공간-채널 주의( SCAN )를 사용하고, 효율적 채널 주의( ECA )를 사용한 보완적 맥락 정보( CCI ) 브랜치를 결합한다. 이 방법은 Aff-Wild2 검증 세트에서 전체 점수 0.465를 기록하여, Landmark나 오디오에 의존하지 않고도 고정되지 않은 환경에서의 표정 인식에 있어 우수한 정확도와 강인성을 입증한다.

ABSTRACT

Facial expression recognition(FER) in the wild is crucial for building reliable human-computer interactive systems. However, current FER systems fail to perform well under various natural and un-controlled conditions. This report presents attention based framework used in our submission to expression recognition track of the Affective Behaviour Analysis in-the-wild (ABAW) 2020 competition. Spatial-channel attention net(SCAN) is used to extract local and global attentive features without seeking any information from landmark detectors. SCAN is complemented by a complementary context information(CCI) branch which uses efficient channel attention(ECA) to enhance the relevance of features. The performance of the model is validated on challenging Aff-Wild2 dataset for categorical expression classification.

연구 동기 및 목표

  • 자세 변화, 가림, 조명 변화와 같은 통제되지 않은 실생활 조건에서의 얼굴 표정 인식 과제를 해결한다.
  • 얼굴 랜드마크 검출이나 오디오 모odal리티에 의존하지 않고도 특징의 구분 능력을 향상시키는 딥 러닝 프레임워크를 개발한다.
  • 범주형 표정 분류를 위한 매우 불균형하고 복잡한 Aff-Wild2 데이터셋에서 성능을 향상시킨다.
  • 공간-채널 주의와 보완적 맥락 학습을 통합하여, 실제 환경에서의 모델 강인성과 일반화 능력을 향상시킨다.

제안 방법

  • 학습 가능한 비선형 변환을 사용하여 채널 및 공간 위치별 주의 가중치를 계산하는 공간-채널 주의 네트워크( SCAN )를 적용: $ W = \sigma(\text{BN}(\text{PReLU}(\text{Conv}(I)))) $, 이어서 입력 특징 맵 $ I $ 와의 원소별 곱셈을 통해 주의가 반영된 출력 $ O = I \odot W $ 를 생성한다.
  • SCAN 을 이중 경로 방식으로 적용: 특징 맵의 25개 겹치지 않는 국소 패치와 전체 맵을 각각 처리하여, 전역 맥락을 확보하고, 전역 평균 풀링과 최대 풀링을 통해 각각 512차원의 벡터를 생성한다.
  • 보완적 맥락 정보( CCI ) 브랜치를 구현하여, 사전 학습된 ResNet-50 의 중간 레이어에서 특징를 추출하고, ECA 를 사용해 구분 능력 있는 채널에 주의를 집중시킨다.
  • ECA 처리된 특징 맵을 4개의 겹치지 않는 블록으로 분할하고, 각 블록에 대해 전역 평균 풀링을 적용하여 4개의 맥락 벡터를 생성하고, 이를 연결하여 최종 CCI 출력을 형성한다.
  • 224×224 RGB 이미지 입력을 사용하여 엔드 투 엔드로 모델을 훈련시키며, ResNet-50 Conv_3x 블록의 특징 맵을 SCAN 과 CCI 브랜치의 입력으로 사용한다.
  • VGGFace2, AffectNet, ExpW, RAF-DB 를 활용한 전이 학습을 수행하고, 훈련 데이터의 클래스 불균형 문제를 해결하기 위해 오버샘플링 기법을 적용한다.

실험 결과

연구 질문

  • RQ1공간-채널 주의와 보완적 맥락 학습을 결합한 이중 경로 주의 메커니즘이 통제되지 않은 실생활 환경에서의 얼굴 표정 인식 성능을 향상시킬 수 있는가?
  • RQ2제안된 방법이 Aff-Wild2 데이터셋에서 높은 정확도를 유지하면서 얼굴 랜드마크나 오디오 신호에 얼마나 의존하는가?
  • RQ3CCI 브랜치에 ECA 를 통합함으로써 SCAN 만을 사용하는 것에 비해 특징의 구분 능력이 얼마나 향상되는가?
  • RQ4대규모 얼굴 인식 데이터셋에서의 사전 학습과 데이터 양이 모델의 일반화 능력과 Aff-Wild2 에서의 성능에 어떤 영향을 미치는가?
  • RQ5Grad-CAM 를 통해 시각화한 결과, 모델이 가림이나 극단적인 자세 변화 상황에서도 주목할 만한 얼굴 영역(예: 눈, 입, 코)에 효과적으로 집중하는가?

주요 결과

  • 제안된 방법은 Aff-Wild2 검증 세트에서 전체 점수 0.465를 기록하여, ResNet-50 기준선(0.422)을 뛰어넘으며, 더 높은 강인성과 정확도를 입증한다.
  • Aff-Wild2 데이터셋에서 50,000개의 샘플만을 사용하고 AffectNet 및 ExpW 데이터를 추가로 활용함으로써, 전체 데이터를 사용한 훈련 성능과 유사한 결과를 달성하여 강력한 데이터 효율성을 보였다.
  • VGGFace2 에서의 사전 학습이 가장 우수한 성능( F1: 0.37, 정확도: 0.649, 전체: 0.465 )을 기록했으며, AffectNet, RAF-DB 또는 ExpW 단독 사전 학습 모델보다 뛰어났다.
  • 검증 세트에서 F1 점수 0.37과 정확도 0.649를 기록하여, ResNet-50 기준선 대비 F1 점수에서 10.4% 상대적 향상을 달성했다.
  • Grad-CAM 시각화 결과, 모델이 가림이나 극단적인 자세 변화 상황에서도 눈, 입, 코와 같은 핵심 얼굴 영역에 효과적으로 주의를 집중하는 것으로 확인되었다.
  • 제거 실험 결과, ECA 주의를 적용한 CCI 브랜치가 SCAN 만으로 구성된 경우보다 성능 향상이 뚜렷했으며, 높은 성능을 달성하기 위해 사전 학습이 필수적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.