[논문 리뷰] Visual Saliency Maps Can Apply to Facial Expression Recognition
이 논문은 사전 훈련된 일반 목적의 딥러닝 시각적 주목도 모델이 생성한 주목도 맵만을 사용하여 7개의 감정으로 얼굴 표정을 분류하는 새로운 준지도 학습 방법을 제안한다. 얼굴 이미지를 직접 훈련에 사용하지 않았음에도 불구하고, CK+ 데이터셋에서 63%의 정확도와 FER-2013에서 50%의 정확도를 기록하였으며, 이는 1/7의 우연 수준(약 14.3%)보다 뚜렷하게 높다. 주목도 기반 분류 정확도와 이미지 기반 분류 정확도 간에 상관계수가 매우 높았고(r > 0.8), 이는 인간이 특정 얼굴 부위에 시선을 집중하여 감정을 인식할 수 있음을 시사한다.
Human eyes concentrate different facial regions during distinct cognitive activities. We study utilising facial visual saliency maps to classify different facial expressions into different emotions. Our results show that our novel method of merely using facial saliency maps can achieve a descent accuracy of 65\%, much higher than the chance level of $1/7$. Furthermore, our approach is of semi-supervision, i.e., our facial saliency maps are generated from a general saliency prediction algorithm that is not explicitly designed for face images. We also discovered that the classification accuracies of each emotional class using saliency maps demonstrate a strong positive correlation with the accuracies produced by face images. Our work implies that humans may look at different facial areas in order to perceive different emotions.
연구 동기 및 목표
- 시각적 주목도 맵만으로 원본 얼굴 이미지를 직접 사용하지 않고도 효과적으로 얼굴 표정을 분류할 수 있는지 조사하기 위해.
- 주목도 기반 분류를 통해 인간의 눈동자 움직임 패턴과 감정 인식 간의 관계를 탐색하기 위해.
- 사전 훈련된 주목도 모델을 활용한 준지도 학습 접근법의 감정 인식 성능을 평가하기 위해.
- 주목도 맵 기반 분류 정확도와 전통적인 이미지 기반 방법 간에 강한 상관관계가 있는지 확인하기 위해.
- 인간이 서로 다른 얼굴 부위에 집중하여 구별되는 감정을 인식하는 방식에 대한 통찰을 제공하기 위해.
제안 방법
- SALICON, MIT1003, CAT2000 데이터셋에서 사전 훈련된 딥러닝 주목도 탐지 모델을 사용하여 얼굴 이미지에서 주목도 맵을 생성하였으며, 얼굴 전용 작업에 대해 미세조정하지 않았다.
- 주목도 맵을 7개의 얼굴 감정을 인식하도록 훈련된 완전 연결 신경망 분류기의 입력 특징으로 사용하였다.
- FER-2013 및 CK+ 데이터셋에서 학습을 수행하였으며, 학습률은 각각 0.01과 250/60 에포크로 설정하였고, CK+에서는 10겹 교차검증을 적용하였다.
- 공개 및 비공개 테스트 분할에 대해 FER-2013과 CK+에서 정확도와 혼동 행렬을 사용하여 분류 성능을 평가하였다.
- 주목도 맵 기반 및 원본 이미지 기반 분류 결과의 대각선 정확도 값 간 피어슨 상관계수를 계산하였다.
- 이 접근법은 준지도 학습 방식이며, 주목도 모델이 얼굴 표정 데이터에 대해 명시적으로 훈련된 것은 아니지만 다양한 이미지 카테고리에 대해 훈련된 것이다.
실험 결과
연구 질문
- RQ1일반 목적의 주목도 예측 모델이 생성한 주목도 맵만으로도 효과적으로 얼굴 표정 인식을 수행할 수 있는가?
- RQ2주목도 맵 기반 분류 정확도와 원본 얼굴 이미지 기반 분류 정확도 간에 강한 상관관계가 있는가?
- RQ3다른 감정 표현이 인간의 눈동자 움직임 행동과 대응하는 고유한 주목도 패턴을 유도하는가?
- RQ4주목도 맵이 인간 감정 인식 메커니즘을 이해하는 데 유용한 대체 표현으로 기능할 수 있는가?
- RQ5주목도 기반 분류 성능은 감정 클래스에 따라 달라지며, 만약 그렇다면 그 이유는 무엇인가?
주요 결과
- 제안된 방법은 FER-2013 비공개 테스트 세트에서 50%의 정확도, CK+ 데이터셋에서 63%의 정확도를 기록하였으며, 이는 1/7의 우연 수준(약 14.3%)보다 뚜렷하게 높았다.
- FER-2013 비공개 테스트 세트에서 주목도 맵 기반 분류 결과와 이미지 기반 분류 결과 간 강한 정적 상관관계(r = 0.9450)를 보였다.
- FER-2013 공개 테스트 세트에서는 주목도 및 이미지 기반 정확도 간 피어슨 상관계수는 0.9277, CK+에서는 0.8080로 나타나 분류 성능의 높은 일관성을 보였다.
- 혼동 행렬 분석 결과, 행복과 놀람은 주목도 맵을 사용할 때 가장 잘 구별되는 감정이었으며, 경멸은 유사한 주의 패턴으로 인해 혐오와 행복과 유사하여 잘 인식되지 않았다.
- 결과는 인간이 서로 다른 감정을 인식할 때 특정 얼굴 부위에 집중한다는 점에서 주목도 패턴과 감정 인식 간의 일치를 뒷받침하며, 이는 인간이 특정 얼굴 영역에 집중하여 감정을 인식할 수 있음을 시사한다.
- 본 연구는 주목도 맵이 원본 얼굴 이미지 데이터를 직접 사용하지 않더라도 감정 인식에 유효하고 해석 가능한 표현으로 기능할 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.