Skip to main content
QUICK REVIEW

[论文解读] Eyemotion: Classifying facial expressions in VR using eye-tracking cameras

Steven Hickson, Nick Dufour|arXiv (Cornell University)|Jul 22, 2017
Gaze Tracking and Assistive Technology被引用 9
一句话总结

本文提出 Eyemotion,一种仅使用 HMD 内置红外眼动追踪图像来分类虚拟现实(VR)中的面部表情和面部动作单元(AUs)的方法,通过一种新型个性化技术增强深度卷积神经网络(CNN)。该方法在 5 种情绪表情上实现 74% 的 F1 分数,在 10 个 AUs 上实现 70% 的 F1 分数,实现了无需外部摄像头的实时动态角色动画。

ABSTRACT

One of the main challenges of social interaction in virtual reality settings is that head-mounted displays occlude a large portion of the face, blocking facial expressions and thereby restricting social engagement cues among users. Hence, auxiliary means of sensing and conveying these expressions are needed. We present an algorithm to automatically infer expressions by analyzing only a partially occluded face while the user is engaged in a virtual reality experience. Specifically, we show that images of the user's eyes captured from an IR gaze-tracking camera within a VR headset are sufficient to infer a select subset of facial expressions without the use of any fixed external camera. Using these inferences, we can generate dynamic avatars in real-time which function as an expressive surrogate for the user. We propose a novel data collection pipeline as well as a novel approach for increasing CNN accuracy via personalization. Our results show a mean accuracy of 74% ($F1$ of 0.73) among 5 `emotive' expressions and a mean accuracy of 70% ($F1$ of 0.68) among 10 distinct facial action units, outperforming human raters.

研究动机与目标

  • 在无需外部摄像头的情况下实现实时 VR 面部表情分类,解决 HMD 对面部表情造成的遮挡问题。
  • 证明内置 HMD 眼动追踪器捕获的红外眼图像中包含足够信息以推断面部表情和 AUs。
  • 开发一种个性化技术,提升新用户使用时 CNN 的准确率,而无需重新训练。
  • 构建一个实时系统,用于生成能反映用户推断面部表情的富有表现力的虚拟角色。

提出的方法

  • 该方法使用卷积神经网络(CNN)从 HMD 内部眼动追踪摄像头捕获的低分辨率、眼周红外图像中分类面部表情和 AUs。
  • 提出一种新型个性化技术,即从用户的输入图像中减去其自身中性眼图像的均值,以提升模型在不同个体间的泛化能力和准确率。
  • 模型在自建数据集上进行训练,该数据集包含 23 名用户,使用两款商用 HMD 收集,表情标签通过受控会话期间的自我报告方式标注。
  • 将左右眼的图像在输入 CNN 前进行拼接,以实现对双侧面部动态的联合建模。
  • 系统实时处理数据,支持动态角色动画,使其能够反映推断出的表情。
  • 评估采用人工标注标签作为基线,但不用于训练,以确保模型在真实世界表情推断中的泛化能力。

实验结果

研究问题

  • RQ1能否仅使用 HMD 内部眼动追踪摄像头捕获的红外眼图像,准确分类面部表情和面部动作单元?
  • RQ2个性化深度学习方法是否能在不重新训练的情况下提升新用户在表情分类任务中的准确率?
  • RQ3能否利用推断出的表情在 VR 中实现实时、富有表现力的角色动画,作为用户的社交代偿?
  • RQ4基于 CNN 的方法在从有限眼图像中分类面部表情时,其性能与人类基线准确率相比如何?

主要发现

  • 所提出的 CNN 模型仅使用 HMD 的眼动追踪数据,在分类 5 种情绪面部表情时,平均 F1 分数达到 0.73(74% 准确率)。
  • 在 10 个面部动作单元上,模型的平均 F1 分数达到 0.68(70% 准确率),表明其在细粒度表情识别任务中具有鲁棒性。
  • 个性化技术使平均准确率提升 7 个百分点,且具有统计显著性(情绪表情 p=0.018,AUs p=0.001)。
  • 拼接眼图像架构(在网络早期阶段合并左右眼图像)在保留测试参与者上的表现优于其他架构至少 10 个百分点。
  • 该系统在从眼图像中分类表情的性能上超过人类基线准确率,甚至超越了经过训练的人类评分员在相同任务上的表现。
  • 该方法对发色和化妆变化具有鲁棒性,但数据采集期间的标注错误——尤其是对对称动作(如左右侧眉毛抬升)——会降低精确率和召回率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。