[论文解读] GestARLite: An On-Device Pointing Finger Based Gestural Interface for Smartphones and Video See-Through Head-Mounts
GestARLite 是一种轻量级、基于设备的手势交互界面,适用于智能手机和视频透视式头戴显示器,利用 RGB 视频和一系列深度学习模型——MobileNetV2 用于手势检测,自定义指尖回归模型,以及 Bi-LSTM 用于手势分类——在高通骁龙 845 智能手机上实现了 80% 的准确率,平均延迟仅为 0.12 秒,支持实时、离线交互,无需深度传感器或互联网依赖。
Hand gestures form an intuitive means of interaction in Mixed Reality (MR) applications. However, accurate gesture recognition can be achieved only through state-of-the-art deep learning models or with the use of expensive sensors. Despite the robustness of these deep learning models, they are generally computationally expensive and obtaining real-time performance on-device is still a challenge. To this end, we propose a novel lightweight hand gesture recognition framework that works in First Person View for wearable devices. The models are trained on a GPU machine and ported on an Android smartphone for its use with frugal wearable devices such as the Google Cardboard and VR Box. The proposed hand gesture recognition framework is driven by a cascade of state-of-the-art deep learning models: MobileNetV2 for hand localisation, our custom fingertip regression architecture followed by a Bi-LSTM model for gesture classification. We extensively evaluate the framework on our EgoGestAR dataset. The overall framework works in real-time on mobile devices and achieves a classification accuracy of 80% on EgoGestAR video dataset with an average latency of only 0.12 s.
研究动机与目标
- 为低成本、视频透视式头戴显示器(如 Google Cardboard)实现基于设备的实时手势识别。
- 克服现有深度学习模型在计算能力和硬件上的限制,避免对高端设备或深度传感器的依赖。
- 开发一种无需标记、仅使用 RGB 的手势界面,无需互联网连接,确保在偏远或离线环境中的可用性。
- 构建一个可扩展且可扩展的混合现实(MR)应用框架,如数据可视化、远程存在和工业检测。
- 证明在消费级移动硬件上部署轻量级、高精度且高效的手势识别流水线的可行性。
提出的方法
- 该框架使用 MobileNetV2 作为轻量级目标检测器,用于在第一人称视角(FPV)视频流中定位手部。
- 训练一个自定义深度神经网络,从裁剪并缩放后的手部区域回归指尖的 2D 坐标,提升定位精度。
- 使用 Bi-LSTM 网络处理跨帧的指尖位置序列,以分类动态指向手势,捕捉时间上的运动模式。
- 整个流水线通过 TensorFlow Lite 进行优化和部署,实现在移动设备上的实时推理,无需依赖远程服务器。
- 系统在 EgoGestAR 数据集上进行训练,该数据集包含 240 个第一人称视角视频序列,涵盖 10 种不同的指向手势。
- 应用模型量化和模型压缩技术,将总模型大小减少至 16.3 MB,确保在设备上部署的可行性。
实验结果
研究问题
- RQ1轻量级、基于设备的手势识别系统是否能在不依赖深度传感器或外部硬件的前提下,在消费级智能手机上实现实时性能?
- RQ2与端到端深度学习模型相比,将手势检测、指尖回归和时间分类分离的模块化流水线在第一人称视频手势识别中的有效性如何?
- RQ3当部署在 Google Cardboard 等低资源设备上时,所提出的框架在准确性和低延迟方面表现如何?
- RQ4在动态背景、手部颜色变化或轻微损伤(如涂指甲油或小伤口)等挑战性条件下,系统性能如何?
- RQ5该框架能否扩展以支持混合现实应用中更广泛的一组不同手势?
主要发现
- GestARLite 框架仅使用 RGB 输入且不依赖深度信息,在 EgoGestAR 数据集上实现了 80.00% 的手势分类准确率。
- 系统在高通骁龙 845 智能手机上以 0.12 秒的平均延迟实现实时运行,支持响应迅速的用户交互。
- MobileNetV2 检测器在 640×480 分辨率下运行速度为 9 FPS,而指尖回归器在 99×99 分辨率下最高可达 166 FPS,确保高效处理。
- 整个模型仅占用 16.3 MB 的紧凑内存空间,适合在资源受限的移动和可穿戴设备上部署。
- 该框架对肤色、手部大小和轻微遮挡(如涂指甲油或小伤口)具有鲁棒性,因为指尖回归器能持续准确地定位指尖区域。
- 模块化设计在准确率和延迟方面均优于端到端模型,如 Tsironi 等人(32.27% 准确率)、VGG16+LSTM(58.18%)和 C3D(66.36%),证明了任务特定组件设计的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。