Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of the Spatio-Temporal features and GAN for Micro-expression Recognition System

Sze‐Teng Liong, Y.S. Gan|arXiv (Cornell University)|2019. 04. 03.
Face and Expression Recognition참고 문헌 78인용 수 6
한 줄 요약

이 논문은 미세표정 인식을 위해 수정된 세 스트림 CNN 아키텍처와 시공간 광학 흐름 특징, 그리고 GAN 기반 데이터 증강 기법을 결합한다. 다섯 가지 광학 흐름 방법(RLOF, TVL1, Farneback, Lucas-Kanade, Horn-Schunck)과 두 가지 GAN 변종(AC-GAN, SAGAN)을 평가하여 특징 표현을 향상시키고 데이터 부족 문제를 해결하며, p&q&ε 입력 구성에서 SMIC 데이터셋 기준으로 최대 71.20%의 정확도와 68.31%의 F1 스코어를 달성한다.

ABSTRACT

Owing to the development and advancement of artificial intelligence, numerous works were established in the human facial expression recognition system. Meanwhile, the detection and classification of micro-expressions are attracting attentions from various research communities in the recent few years. In this paper, we first review the processes of a conventional optical-flow-based recognition system, which comprised of facial landmarks annotations, optical flow guided images computation, features extraction and emotion class categorization. Secondly, a few approaches have been proposed to improve the feature extraction part, such as exploiting GAN to generate more image samples. Particularly, several variations of optical flow are computed in order to generate optimal images to lead to high recognition accuracy. Next, GAN, a combination of Generator and Discriminator, is utilized to generate new "fake" images to increase the sample size. Thirdly, a modified state-of-the-art Convolutional neural networks is proposed. To verify the effectiveness of the the proposed method, the results are evaluated on spontaneous micro-expression databases, namely SMIC, CASME II and SAMM. Both the F1-score and accuracy performance metrics are reported in this paper.

연구 동기 및 목표

  • 다양한 광학 흐름 방법을 활용한 시공간 특징 추출을 통해 미세표정 인식 정확도를 향상시키기 위해 노력한다.
  • AC-GAN과 SAGAN을 활용한 GAN 기반 데이터 증강을 통해 미세표정 데이터셋의 데이터 부족과 클래스 불균형 문제를 해결한다.
  • 광학 흐름 구성 요소를 융합하는 데 목적이 있는 수정된 세 스트림 CNN 아키텍처(OFF-ApexNet)를 개발하여 특징 학습과 분류 성능을 향상시킨다.
  • 표준 미세표정 데이터베이스(SMIC, CASME II, SAMM)에서 다양한 광학 흐름 입력과 GAN으로 생성된 데이터의 효과를 평가한다.
  • 학습 에포크 동안 특징 임bedding의 주성분 분석(PCA)을 통해 모델의 학습 역동성을 분석한다.

제안 방법

  • 시공간 특징을 추출하기 위해 얼굴 영상 시퀀스에서 다섯 가지 광학 흐름 방법(RLOF, TVL1, Farneback, Lucas-Kanade, Horn-Schunck)을 계산한다.
  • 세 입력이 광학 흐름 구성 요소(p, q, ρ, θ, ε, εux, εuy)의 조합인 수정된 세 스트림 CNN 아키텍처를 제안하며, 특징 맵을 연결하는 대신 곱하기 방식을 사용한다.
  • AC-GAN과 SAGAN을 활용해 합성된 미세표정 이미지를 생성하여 학습 데이터 크기를 늘리고 클래스 분포의 균형을 개선한다.
  • 수정된 OFF-ApexNet는 교차 엔트로피 손실과 Adam 최적화를 사용하여 SMIC, CASME II, SAMM 데이터셋에서 엔드 투 엔드로 학습된다.
  • 다양한 학습 에포크에서 주성분 분석(PCA)을 적용하여 특징 군집화와 학습 진행 상황을 시각화한다.
  • 다양한 입력 구성과 GAN 증강 조건에서 SMIC, CASME II, SAMM 데이터셋 전반에 걸쳐 정확도와 F1 스코어를 사용해 인식 성능을 평가한다.

실험 결과

연구 질문

  • RQ1RLOF, TVL1, Farneback, Lucas-Kanade, Horn-Schunck 중 어느 광학 흐름 방법이 미세표정 분류에서 가장 높은 정확도를 달성하는가?
  • RQ2ρ, θ, εux, εuy 등의 추가 광학 흐름 구성 요소의 포함이 세 스트림 CNN 아키텍처 성능에 어떤 영향을 미치는가?
  • RQ3AC-GAN과 SAGAN이 소규모이고 불균형한 미세표정 데이터셋에서 인식 성능을 얼마나 향상시키는가?
  • RQ4주성분 분석(PCA)을 통해 학습된 임베딩에 대한 시각화를 통해 특징 공간은 학습 과정에서 어떻게 변화하는가?
  • RQ5특징 곱하기 방식을 사용한 수정된 세 스트림 CNN이 표준 연결 기반 융합 방식보다 미세표정 인식에서 더 나은 성능을 내는가?

주요 결과

  • p&q&ε 구성에서 SMIC 데이터셋에서 최고의 정확도 71.20%와 F1 스코어 68.31%를 기록하여 다른 입력 조합보다 뛰어난 성능을 보였다.
  • 다섯 가지 광학 흐름 방법 중에서 TVL1과 RLOF가 가장 일관된 성능을 보였으며, 대부분의 구성에서 TVL1이 가장 우수한 결과를 얻었다.
  • AC-GAN과 SAGAN은 학습 샘플 수를 효과적으로 증가시켜 데이터 불균형 문제를 완화하고 일반화 성능을 향상시켰다.
  • 에포크 600에서의 PCA 시각화 결과, 감정 클래스별로 특징이 명확하게 군집되어 있어 효과적인 특징 학습과 분리가 이루어졌음을 시사했다.
  • 특징 곱하기 방식을 사용한 수정된 OFF-ApexNet는 표준 연결 기반 융합 방식보다 더 뛰어난 성능을 보였으며, 특히 크기와 방향 구성 요소를 사용할 경우 두드러진 성능 향상을 보였다.
  • 모든 데이터셋에서 기록된 최고의 정확도는 SMIC에서의 71.20%였으며, CASME II와 SAMM은 각각 최적 구성에서 68.71%와 68.48%의 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.