Skip to main content
QUICK REVIEW

[논문 리뷰] WiFE: WiFi and Vision based Intelligent Facial-Gesture Emotion Recognition

Yu Gu, Xiang Zhang|arXiv (Cornell University)|2020. 04. 21.
Speech and Audio Processing참고 문헌 16인용 수 9
한 줄 요약

이 논문은 WiFi 채널 상태 정보(CSI)를 활용한 제스처 감지와 시각 기반 얼굴 표정 분석을 융합하는 비접촉식, 장치 불필요한 정서 인식 시스템인 WiFE를 제안한다. Rician K 계수 이론을 활용해 WiFi 신호 민감도를 향상시키고, CNN-RNN를 사용한 점수 수준 융합 기반의 다중모odal 데이터 융합을 통해 WiFE는 일곱 가지 정서를 83.24%의 정확도로 인식하며, 단모달 접근 방식보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

Emotion is an essential part of Artificial Intelligence (AI) and human mental health. Current emotion recognition research mainly focuses on single modality (e.g., facial expression), while human emotion expressions are multi-modal in nature. In this paper, we propose a hybrid emotion recognition system leveraging two emotion-rich and tightly-coupled modalities, i.e., facial expression and body gesture. However, unbiased and fine-grained facial expression and gesture recognition remain a major problem. To this end, unlike our rivals relying on contact or even invasive sensors, we explore the commodity WiFi signal for device-free and contactless gesture recognition, while adopting a vision-based facial expression. However, there exist two design challenges, i.e., how to improve the sensitivity of WiFi signals and how to process the large-volume, heterogeneous, and non-synchronous data contributed by the two-modalities. For the former, we propose a signal sensitivity enhancement method based on the Rician K factor theory; for the latter, we combine CNN and RNN to mine the high-level features of bi-modal data, and perform a score-level fusion for fine-grained recognition. To evaluate the proposed method, we build a first-of-its-kind Vision-CSI Emotion Database (VCED) and conduct extensive experiments. Empirical results show the superiority of the bi-modality by achieving 83.24\% recognition accuracy for seven emotions, as compared with 66.48% and 66.67% recognition accuracy by gesture-only based solution and facial-only based solution, respectively. The VCED database download link is https://github.com/purpleleaves007/WIFE-Dataset.

연구 동기 및 목표

  • 단일 모달 정서 인식의 한계를 해결하기 위해 얼굴 표정과 신체 제스처를 융합하여 보다 정확한 다중모달 정서 감지를 위한 접근을 제안한다.
  • 비접촉식, 장치 불필요한 환경에서 일반 소비자용 WiFi 신호의 저민감도 문제를 극복하여 제스처 감지의 신뢰성을 향상시키기 위한 도전 과제를 해결한다.
  • 비동기적이고 이질적인 이중모달 데이터( WiFi CSI 및 영상 프레임)를 효과적으로 융합하여 세분화된 정서 인식을 가능하게 하는 융합 전략을 개발한다.
  • 시각 및 CSI 기반 정서 인식을 위한 기준 데이터셋을 구축하기 위해 최초로 '비전-CSI 정서 데이터베이스(VCED)'를 제작한다.

제안 방법

  • Rician K 계수 이론을 기반으로 한 신호 민감도 향상 방법을 제안하여 WiFi CSI 신호에서 미세한 인간의 제스처를 더 잘 감지할 수 있도록 한다.
  • 얼굴 영상에서 공간적 특징을 추출하기 위해 합성곱 신경망(CNN)을 활용하고, CSI 데이터에서의 제스처 시퀀스의 시간적 동역학을 모델링하기 위해 순환 신경망(RNN)을 적용한다.
  • 얼굴 및 제스처 인식 브랜치에서 도출된 신뢰도 점수를 융합하여 전체 인식 성능을 향상시키기 위해 점수 수준 융합을 적용한다.
  • 비시각적 및 비동기적 데이터 입력에도 불구하고 강력한 표현 학습을 가능하게 하기 위해 시각 및 CSI 모달리티에서 동시에 학습하는 하이브리드 딥 러닝 아키텍처를 사용한다.
  • 시각 및 CSI 소스로부터 유입되는 고용량의 비동기적 입력을 정규화하고 정렬하기 위한 데이터 전처리 파이프라인을 설계한다.

실험 결과

연구 질문

  • RQ1WiFi CSI와 시각 기반 영상의 하이브리드 시스템이 단모달 접근 방식보다 정서 인식 정확도를 향상시킬 수 있는가?
  • RQ2실생활 환경에서 비접촉식 제스처 감지를 위한 일반 소비자용 WiFi 신호의 민감도를 어떻게 향상시킬 수 있는가?
  • RQ3세분화된 정서 인식을 위해 이질적이고 비동기적인 시각 및 CSI 모달리티 데이터를 융합하는 최적의 융합 전략은 무엇인가?
  • RQ4다중모달 융합은 정서 인식 시스템의 편향을 어느 정도 줄이고 일반화 능력을 향상시키는가?

주요 결과

  • 제안된 WiFE 시스템은 일곱 가지 정서를 83.24%의 정확도로 인식하며, 제스처 전용 기준 모델(66.48%)과 얼굴 전용 기준 모델(66.67%)보다 뚜렷이 높은 성능을 보였다.
  • 시각과 WiFi CSI 모달리티의 융합은 단모달 솔루션 대비 16.76%p의 정확도 향상을 이끌어내어 다중모달 융합의 효과성을 입증하였다.
  • Rician K 계수 이론 기반의 신호 민감도 향상 전략은 WiFi CSI 트레이스에서 미세한 인간의 제스처 감지를 향상시켜 더 신뢰할 수 있는 운동 추적을 가능하게 하였다.
  • 양 모달리티에서의 CNN-RNN 출력을 점수 수준에서 융합한 전략은 초기 융합 또는 후기 융합 전략보다 뛰어난 성능을 보였으며, 데이터 비동기성에 대한 강건성을 확인하였다.
  • 최근 제작된 비전-CSI 정서 데이터베이스(VCED)는 향후 연구를 위한 유의미한 기준 데이터셋을 제공하며, 해당 데이터셋은 https://github.com/purpleleaves007/WIFE-Dataset 에 공개되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.