Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-stream Convolutional Neural Network for Micro-expression Recognition Using Optical Flow and EVM

Jinming Liu, Ke Li|arXiv (Cornell University)|2020. 11. 07.
Anomaly Detection Techniques and Applications참고 문헌 14인용 수 8
한 줄 요약

이 논문은 미세표정 인식을 위해 광학 흐름, 유도리안 비디오 확대(EVM)로 강화된 얼굴 운동, 그리고 마스킹된 회색조 이미지를 융합하는 다중 스트림 컨volution 신경망(MSCNN)을 제안한다. EVM을 통한 운동 강화, 광학 흐름을 통한 동적 운동 패턴 추출, 마스킹 기반 국소 특징 추출을 결합함으로써 CASME-II(43.04% 정확도, F1-스코어 0.3569)와 SAMM(40.71% 정확도, F1-스코어 0.3173)에서 최신 기술 수준의 정확도를 달성하였으며, 클래스 불균형 문제를 완화하기 위해 무작위 오버샘플러를 적용하였다.

ABSTRACT

Micro-expression (ME) recognition plays a crucial role in a wide range of applications, particularly in public security and psychotherapy. Recently, traditional methods rely excessively on machine learning design and the recognition rate is not high enough for its practical application because of its short duration and low intensity. On the other hand, some methods based on deep learning also cannot get high accuracy due to problems such as the imbalance of databases. To address these problems, we design a multi-stream convolutional neural network (MSCNN) for ME recognition in this paper. Specifically, we employ EVM and optical flow to magnify and visualize subtle movement changes in MEs and extract the masks from the optical flow images. And then, we add the masks, optical flow images, and grayscale images into the MSCNN. After that, in order to overcome the imbalance of databases, we added a random over-sampler after the Dense Layer of the neural network. Finally, extensive experiments are conducted on two public ME databases: CASME II and SAMM. Compared with many recent state-of-the-art approaches, our method achieves more promising recognition results.

연구 동기 및 목표

  • 미세표정의 짧은 지속 시간, 낮은 강도, 미세한 얼굴 운동으로 인한 낮은 인식 정확도 문제를 해결하기 위해.
  • 딥 러닝 모델의 미세표정 인식 한계, 즉 특징 표현 부족과 데이터셋의 클래스 불균형 문제를 해결하기 위해.
  • 운동 강화를 위한 EVM과 동적 운동 패턴을 위한 광학 흐름을 융합하여 특징 추출을 향상시키기 위해.
  • 다중 스트림 CNN 아키텍처를 통해 정적, 동적, 국소적 얼굴 특징를 통합함으로써 모델의 일반화 능력을 향상시키기 위해.
  • CASME-II 및 SAMM 데이터베이스의 클래스 불균형 문제를 해결하기 위해 네트워크의 최종 완전 연결 층 이후에 무작위 오버샘플러를 삽입하기 위해.

제안 방법

  • 미세표정에서 미세한 얼굴 운동을 강화하기 위해 최적의 증폭 인자 α = 8을 사용하여 에일러리안 비디오 확대(EVM)를 적용한다.
  • 류 등[9]의 방법을 사용하여 광학 흐름을 계산하여 얼굴 근육 변화의 운동 패턴을 캡처한다.
  • 광학 흐름 이미지에서 임계값 50를 사용하여 이진 마스크를 생성하여 상당한 운동이 있는 영역을 분리한다.
  • MSCNN에 세 개의 입력 스트림을 제공한다: 원본 회색조 이미지(정적), 광학 흐름 이미지(동적), 마스킹된 회색조 이미지(국소 운동 영역).
  • CASME-II 및 SAMM 데이터베이스의 클래스 불균형 문제를 해결하기 위해 최종 완전 연결 층 이후에 무작위 오버샘플러를 삽입한다.
  • 다중 스트림 CNN 아키텍처는 정적, 동적, 국소 운동 표현 간의 특징 융합을 가능하게 하여 분류 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1EVM과 광학 흐름을 융합함으로써 미세한 미세표정 운동의 탐지 가능성을 향상시킬 수 있는가?
  • RQ2전체 프레임 입력과 비교해 볼 때, 마스킹된 국소 운동 특징의 통합이 인식 성능 향상에 기여하는가?
  • RQ3딥 뉴럴 네트워크 아키텍처 내부에 삽입된 무작위 오버샘플러가 미세표정 데이터베이스의 클래스 불균형 문제를 얼마나 효과적으로 완화하는가?
  • RQ4제안된 다중 스트림 CNN이 CASME-II 및 SAMM에서 단일 스트림 및 이중 스트림 베이스라인을 초월하는가?
  • RQ5미세표정 데이터셋에서 인식 정확도를 최대화하는 데 최적의 EVM 증폭 인자 α는 얼마인가?

주요 결과

  • 제안된 MSCNN은 SAMM 데이터베이스에서 43.04% 정확도와 F1-스코어 0.3569를 달성하여 기존 방법들인 HOOF(42.17% 정확도) 및 HOG3D(34.16% 정확도)를 능가하였다.
  • CASME-II에서 본 방법은 40.71% 정확도와 F1-스코어 0.3173를 기록하여 LBP-TOP(35.56% 정확도) 및 기타 최신 기술 수준의 접근법보다 뛰어난 성능을 보였다.
  • 최적의 EVM 증폭 인자는 α = 8로 확인되었으며, 이는 CASME-II 및 SAMM 데이터셋에서 모두 최고의 인식 성능를 제공하였다.
  • 무작위 오버샘플러의 추가로 CASME-II에서 성능 향상이 관찰되었지만, SAMM에서는 덜 유리한 영향을 미쳤다. 이는 해당 데이터셋의 크기가 작고 노이즈가 많기 때문일 것이다.
  • 정적, 동적, 국소 운동 특징를 융합한 다중 스트림 아키텍처는 두 데이터베이스에서 단일 스트림 또는 이중 스트림 베이스라인보다 더 우수한 결과를 도출하였다.
  • 혼동 행렬 분석을 통해 모델이 CASME-II 및 SAMM의 다섯 가지 주요 감정 클래스(혐오, 기쁨, 억압, 놀람, 기타)를 효과적으로 구분하고 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.