[논문 리뷰] E2-Capsule Neural Networks for Facial Expression Recognition Using AU-Aware Attention
이 논문은 얼굴 표정 인식(FER)을 위한 AU 인식 주의 기반의 종단간 캡슐 네트워크인 E2-Capsnet을 제안한다. 이는 (1) 행동 단위(AU) 영역에 초점을 맞추기 위해 초기 합성곱 레이어에서 AU 인식 주의를 도입하고, (2) 동적 라우팅을 통해 공간적 관계를 모델링하는 깊이 있는 캡슐 레이어를 포함하는 이중 모듈 설계를 통해 특징 학습을 향상시킨다. RAF-DB와 EmotioNet에서 E2-Capsnet은 각각 85.24% 및 55.91%의 정확도를 기록하여 최신 기술을 초월한다.
Capsule neural network is a new and popular technique in deep learning. However, the traditional capsule neural network does not extract features sufficiently before the dynamic routing between the capsules. In this paper, the one Double Enhanced Capsule Neural Network (E2-Capsnet) that uses AU-aware attention for facial expression recognition (FER) is proposed. The E2-Capsnet takes advantage of dynamic routing between the capsules, and has two enhancement modules which are beneficial for FER. The first enhancement module is the convolutional neural network with AU-aware attention, which can help focus on the active areas of the expression. The second enhancement module is the capsule neural network with multiple convolutional layers, which enhances the ability of the feature representation. Finally, squashing function is used to classify the facial expression. We demonstrate the effectiveness of E2-Capsnet on the two public benchmark datasets, RAF-DB and EmotioNet. The experimental results show that our E2-Capsnet is superior to the state-of-the-art methods. Our implementation will be publicly available online.
연구 동기 및 목표
- 행동 단위(AU) 영역을 대상으로 하는 주의 메커니즘을 통합하여 얼굴 표정 인식(FER)의 성능을 향상시키기.
- 동적 라우팅을 사용하여 합성곱 네트워크와 캡슐 네트워크를 결합함으로써 FER에서의 특징 표현을 향상시키기.
- 기존의 CNN과 비교해 얼굴 구성 요소 간의 공간적 관계를 보다 효과적으로 모델링하기.
- 기준 FER 데이터셋인 RAF-DB와 EmotioNet에서 최신 기술 수준의 성능을 달성하기.
제안 방법
- 모델은 VGG16을 백본으로 사용하며, 최종 완전 연결 레이어를 캡슐 레이어로 대체하여 특징 인코딩을 수행한다.
- 얼굴 키포인트 랜드마크를 사용하여 행동 단위(AU) 중심으로부터의 맨하탄 거리 기반 가중치를 활용해 AU 인식 주의 맵을 생성한다.
- 주의 맵은 스테이지 2 풀링 후 특징 맵과 요소별 곱셈을 적용한 후, 스테이지 3 합성곱 출력에 더해진다.
- 기본 캡슐(PrimaryCaps)과 얼굴 캡슐(FaceCaps) 레이어 간에 동적 라우팅을 적용하여 국소적 특징 간의 계층적 관계를 학습한다.
- 스quashing 함수는 캡슐 출력을 정규화하여 표현 클래스의 확률을 나타낸다.
- 마진 손실과 재구성 손실을 최소화하여 GPU에서 종단간으로 훈련한다.
실험 결과
연구 질문
- RQ1AU 인식 주의 기반의 특징 학습 방식이 활성 얼굴 영역에 집중함으로써 얼굴 표정 인식에서 성능 향상에 기여할 수 있는가?
- RQ2여러 합성곱 레이어와 캡슐 네트워크를 결합함으로써 FER에서의 특징 표현이 향상되는가?
- RQ3캡슐 간의 동적 라우팅 방식이 기존의 표준 CNN보다 얼굴 표정의 공간적 관계를 더 효과적으로 모델링할 수 있는가?
- RQ4주의 기반과 캡슐 네트워크의 통합이 기준 FER 데이터셋에서 뛰어난 성능을 내는가?
주요 결과
- E2-Capsnet은 RAF-DB 데이터셋에서 85.24%의 정확도를 기록하여, 이어지는 최고 성능 기법(RCCnet)보다 0.46% 높은 성능을 보였다.
- EmotioNet에서 E2-Capsnet은 55.91%의 정확도를 기록하여 비교한 모든 최신 기술 기법을 앞서갔다.
- 제거 실험 결과, 주의 기반과 동적 라우팅을 모두 적용한 모델은 단지 주의 기반만 사용하는 AVGGnet 대비 성능이 5.95% 향상되었다.
- 동적 라우팅과 풍부한 합성곱 레이어를 갖춘 모델(RCCnet)은 84.78%의 정확도를 기록하여 계층적 특징 학습의 유용성을 입증했다.
- T-SNE를 활용한 시각화 결과, E2-Capsnet은 Capsnet, VGG16, FERAtt보다 더 구분력 있는 특징 표현을 생성하는 것으로 확인되었다.
- 주의 메커니즘이 실제로 AU 활성 영역, 즉 눈썹과 입꼬리 부위를 효과적으로 강조하여 얼굴 행동 단위 패tern과 일치하는 결과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.