[论文解读] Gaze Gestures and Their Applications in human-computer interaction with a head-mounted display
本文提出 UEGazeNet 和 UEGazeNet* 两种深度学习模型,利用单个 RGB 摄像头实现实时头戴式显示器(HMD)上的注视追踪。通过检测眼部关键点并分类注视轨迹,该方法在一项包含 10,200 个注视绘画手势的新 GTgestures 数据集上实现了 96.71% 的平均识别准确率,在不同条件下相比最先进网络提高了 52–67% 的准确率。
A head-mounted display (HMD) is a portable and interactive display device. With the development of 5G technology, it may become a general-purpose computing platform in the future. Human-computer interaction (HCI) technology for HMDs has also been of significant interest in recent years. In addition to tracking gestures and speech, tracking human eyes as a means of interaction is highly effective. In this paper, we propose two UnityEyes-based convolutional neural network models, UEGazeNet and UEGazeNet*, which can be used for input images with low resolution and high resolution, respectively. These models can perform rapid interactions by classifying gaze trajectories (GTs), and a GTgestures dataset containing data for 10,200 "eye-painting gestures" collected from 15 individuals is established with our gaze-tracking method. We evaluated the performance both indoors and outdoors and the UEGazeNet can obtaine results 52\% and 67\% better than those of state-of-the-art networks. The generalizability of our GTgestures dataset using a variety of gaze-tracking models is evaluated, and an average recognition rate of 96.71\% is obtained by our method.
研究动机与目标
- 通过低成本、单个 RGB 摄像头配置,在头戴式显示器(HMD)上实现鲁棒、实时的注视交互。
- 解决现有注视追踪方法对高质量输入、大规模数据集或专用硬件的依赖问题。
- 开发一种即使在追踪不完美或用户移动的情况下仍有效的注视手势分类系统。
- 构建一个多样化、大规模的注视轨迹数据集,用于训练和评估基于注视的人机交互系统。
提出的方法
- 提出 UEGazeNet,一种卷积神经网络,可检测眼部关键点并从中推断注视方向,即使在部分眼部遮挡或极端相机角度下也能实现鲁棒估计。
- 引入 UEGazeNet*,一种优化用于低分辨率输入的 UEGazeNet 变体,强调全局图像特征。
- 使用 UnityEyes 生成的合成数据进行模型训练,降低标注成本,并通过极端视角增强实现数据增强。
- 采用基于卷积神经网络(CNN)的注视手势分类器,从注视轨迹中检测用户意图,避免对精确光标控制的依赖。
- 通过随机图案变换从 15 名参与者收集了包含 10,200 条注视轨迹的 GTgestures 数据集,以增强多样性和真实性。
- 应用数据增强和实时追踪技术,支持用户在行走或快速眼动等动态环境下的交互。
实验结果
研究问题
- RQ1单个 RGB 摄像头是否能在无需专用硬件或高分辨率输入的情况下,实现在 HMD 上准确且鲁棒的注视追踪?
- RQ2基于深度学习的注视手势分类器在注视追踪不准确或用户移动的情况下,识别用户意图的有效性如何?
- RQ3通过 UnityEyes 生成的合成数据在多大程度上可用于训练泛化能力良好的注视估计模型,以适应真实世界条件?
- RQ4UEGazeNet 中基于关键点的方法在部分眼部遮挡或极端相机角度等挑战性条件下,如何提升注视估计性能?
- RQ5所提出系统在非受限环境(包括室内和室外)中的性能如何?
主要发现
- UEGazeNet 在室内和室外环境中分别比最先进网络高出 52% 和 67% 的准确率,证明了其卓越的鲁棒性。
- GTgestures 数据集在 17 种注视手势模式下实现了 96.71% 的平均识别率,证实了所提方法的高泛化能力和有效性。
- 用户在第二次尝试完成数据采集任务时所用时间(20–23 分钟)显著少于第一次(40–50 分钟),表明其能快速学习并适应注视手势交互。
- 由于对轨迹变化具有容忍性,注视手势分类器即使在注视追踪不准确或用户移动时也能实现有效交互。
- 通过 UnityEyes 生成的合成数据可实现高效训练,仅需极少的真实世界标注,降低训练成本并提升对极端视角的覆盖能力。
- UEGazeNet* 通过利用全局图像特征,有效处理低分辨率输入,使其适用于资源受限的 HMD 平台。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。