[论文解读] Driver Gaze Region Estimation Without Using Eye Movement
该论文提出了一种仅使用面部关键点位置(无需眼动追踪)的实时驾驶员注视区域估计系统,通过将头部姿态配置分类为六个注视区域,在11 Hz的帧率下实现了91.4%的准确率。该方法利用个体特定模型和基于置信度的决策剪枝,显著提升了全局模型的性能。
Automated estimation of the allocation of a driver's visual attention may be a critical component of future Advanced Driver Assistance Systems. In theory, vision-based tracking of the eye can provide a good estimate of gaze location. In practice, eye tracking from video is challenging because of sunglasses, eyeglass reflections, lighting conditions, occlusions, motion blur, and other factors. Estimation of head pose, on the other hand, is robust to many of these effects, but cannot provide as fine-grained of a resolution in localizing the gaze. However, for the purpose of keeping the driver safe, it is sufficient to partition gaze into regions. In this effort, we propose a system that extracts facial features and classifies their spatial configuration into six regions in real-time. Our proposed method achieves an average accuracy of 91.4% at an average decision rate of 11 Hz on a dataset of 50 drivers from an on-road study.
研究动机与目标
- 开发一种鲁棒且低成本的驾驶员注视估计系统,避免依赖眼动追踪,以应对现实世界中眩光、遮挡和反光等限制。
- 探究仅通过面部关键点提取的头部姿态,是否足以准确预测注视区域,以满足驾驶员分心检测的需求。
- 评估个体特定模型和基于置信度的决策过滤在提升注视分类性能方面的有效性。
- 确定在消费级硬件上实时部署此类系统的可行性。
提出的方法
- 系统通过基于回归树的面部对齐算法进行面部特征检测,实时估计2D面部关键点。
- 利用随机森林分类器,将这些关键点的空间配置分类为六个预定义的注视区域之一。
- 针对每位驾驶员,使用每种注视类别3秒的数据训练用户特定模型,以捕捉个体在头眼协调上的差异。
- 应用基于置信度的决策剪枝:仅保留置信度高于阈值的分类结果,从而在降低决策频率的代价下提升准确率。
- 该处理流程在单核Intel i5处理器上每帧处理时间低于10ms,支持实时运行。
- 系统跳过显式的头部姿态向量估计,直接将面部几何结构映射到注视区域标签。
实验结果
研究问题
- RQ1仅依靠面部关键点配置,能否在不依赖眼动或瞳孔追踪的情况下,以高准确率预测驾驶员注视区域?
- RQ2全局模型在分类注视区域方面的性能与个体特定模型相比如何?
- RQ3基于置信度的分类决策过滤在多大程度上能提升注视区域估计的准确率?
- RQ4头部运动与注视之间的关系在不同个体之间以及同一人在不同驾驶条件下是否存在差异?
主要发现
- 所提出的系统仅使用面部关键点数据,将驾驶员注视划分为六个区域,平均准确率达到91.4%,决策频率为11 Hz。
- 用户特定模型将六分类问题的准确率从全局模型的44.1%提升至65.0%,表明头眼协调存在显著的个体差异。
- 应用基于置信度的剪枝后,六分类问题的准确率提升至91.4%,两分类问题的准确率提升至92.5%,尽管平均决策间隔略有增加。
- 两分类问题(‘驾驶相关’与‘中控台’注视)的准确率高于六分类分类,表明更简单的区分更易于可靠预测。
- 性能在不同驾驶员之间以及同一驾驶员在不同条件下存在显著差异,凸显个性化的重要性。
- 整个处理流程在消费级硬件上实现真正实时运行,每个组件(人脸检测、对齐、分类)每帧处理时间均低于10ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。