Skip to main content
QUICK REVIEW

[논문 리뷰] Eyemotion: Classifying facial expressions in VR using eye-tracking cameras

Steven Hickson, Nick Dufour|arXiv (Cornell University)|2017. 07. 22.
Gaze Tracking and Assistive Technology인용 수 9
한 줄 요약

이 논문은 HMD의 내장형 적외선 눈 추적 카메라에서 촬영한 적외선 눈 이미지만을 사용하여 VR에서 얼굴 표정과 얼굴 운동 단위(AU)를 분류하는 방법 Eyemotion을 제안한다. 깊이 신경망(CNN)에 새로운 개인화 기법을 적용하여 실시간 동적 아바타 애니메이션을 가능하게 하며, 외부 카메라 없이도 5가지 표정 분류에서 F1 스코어 74%, 10개의 AU 분류에서 70%의 성능을 달성한다.

ABSTRACT

One of the main challenges of social interaction in virtual reality settings is that head-mounted displays occlude a large portion of the face, blocking facial expressions and thereby restricting social engagement cues among users. Hence, auxiliary means of sensing and conveying these expressions are needed. We present an algorithm to automatically infer expressions by analyzing only a partially occluded face while the user is engaged in a virtual reality experience. Specifically, we show that images of the user's eyes captured from an IR gaze-tracking camera within a VR headset are sufficient to infer a select subset of facial expressions without the use of any fixed external camera. Using these inferences, we can generate dynamic avatars in real-time which function as an expressive surrogate for the user. We propose a novel data collection pipeline as well as a novel approach for increasing CNN accuracy via personalization. Our results show a mean accuracy of 74% ($F1$ of 0.73) among 5 `emotive' expressions and a mean accuracy of 70% ($F1$ of 0.68) among 10 distinct facial action units, outperforming human raters.

연구 동기 및 목표

  • 외부 카메라 없이도 HMD에 의해 가림을 받는 얼굴 표정을 실시간으로 분류할 수 있도록 하는 것.
  • 내장된 HMD 눈 추적기에서 촬영한 적외선 눈 이미지가 얼굴 표정과 AU를 추론하는 데 충분한 정보를 포함하고 있음을 입증하는 것.
  • 재학습 없이도 새로운 사용자에 대해 CNN의 정확도를 향상시키는 개인화 기법을 개발하는 것.
  • 사용자의 추론된 얼굴 표정을 반영하는 실시간으로 표현적인 아바타를 생성하는 시스템을 구축하는 것.

제안 방법

  • 이 방법은 HMD 내장 눈 추적 카메라에서 촬영한 저해상도의 주변 눈 영역 적외선 영상을 기반으로 심층 합성곱 신경망(CNN)을 사용하여 얼굴 표정과 AU를 분류한다.
  • 사용자의 중립 상태 눈 이미지 평균을 입력에서 빼는 새로운 개인화 기법을 도입하여, 개인 간 일반화 능력과 정확도를 향상시킨다.
  • 모델은 두 대의 상용 HMD를 사용해 수집한 23명의 사용자에 대한 자체 구축 데이터셋을 기반으로 훈련되었으며, 제어된 세션 동안 자가 보고 방식으로 표정을 레이블링하였다.
  • 양쪽 눈의 영상은 CNN에 입력하기 전에 연결(concatenated)되어 양측 얼굴 운동의 통합 모델링을 가능하게 한다.
  • 시스템은 실시간으로 데이터를 처리하여 사용자의 추론된 표정을 반영하는 동적 아바타 애니메이션을 가능하게 한다.
  • 평가에서는 인간 레이블러의 레이블을 기준으로 삼지만, 학습에는 사용하지 않아 모델의 실제 세계 표정 추론에 대한 일반화 능력을 보장한다.

실험 결과

연구 질문

  • RQ1HMD 내장 눈 추적 카메라에서 촬영한 적외선 눈 영상만으로도 얼굴 표정과 얼굴 운동 단위를 정확하게 분류할 수 있는가?
  • RQ2재학습 없이도 새로운 사용자에 대해 개인화된 딥 러닝 접근법이 표정 분류 정확도를 향상시키는가?
  • RQ3유추된 표정을 사용하여 VR에서 실시간으로 표현적인 아바타를 생성할 수 있는가? 이 아바타는 사용자의 사회적 대체 수단으로 기능하는가?
  • RQ4CNN 기반 방법의 성능은 제한된 눈 영상에서 얼굴 표정을 분류하는 데 있어 인간 기준 정확도와 비교해 어떻게 되는가?

주요 결과

  • 제안된 CNN 모델은 HMD의 눈 추적 데이터만을 사용하여 5가지 표정 분류에서 평균 F1 스코어 0.73(74% 정확도)를 달성한다.
  • 10개의 얼굴 운동 단위에 대해서는 평균 F1 스코어 0.68(70% 정확도)를 기록하여 미세한 표정 인식에 대한 강건성을 입증한다.
  • 개인화 기법은 평균 정확도를 7%p 향상시키며, 표정 분류에 대해 유의미한 결과(p=0.018), AU 분류에 대해 더 유의미한 결과(p=0.001)를 보였다.
  • 왼쪽과 오른쪽 눈 영상을 네트워크 초기 단계에서 조합하는 연결된 눈 아키텍처는 보류된 참가자에 대해 다른 아키텍처보다 최소 10%p 이상 높은 성능을 보였다.
  • 시스템은 눈 영상에서 표정을 분류하는 데 있어 인간 기준 정확도를 초월하였으며, 심지어 동일한 작업을 수행하는 전문 레이블러보다도 높은 성능을 기록했다.
  • 모델은 헤어 컬러나 메이크업의 변동에 대해 강건한 편이지만, 데이터 수집 과정에서의 레이블 오류—특히 좌우 눈썹 올리기와 같은 대칭적인 동작—로 인해 정밀도와 재현율이 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.