[论文解读] Do Pedestrians Pay Attention? Eye Contact Detection in the Wild
本论文提出了一种基于关键点的深度学习模型,用于真实世界自动驾驶场景中的眼神接触检测,通过使用语义人体关键点而非原始图像来提升模型的泛化能力。该方法在JAAD数据集上实现了最先进性能,并引入了LOOK数据集,这是一个大规模、多样化的基准数据集,用于评估非受限环境下的真实世界泛化能力。
In urban or crowded environments, humans rely on eye contact for fast and efficient communication with nearby people. Autonomous agents also need to detect eye contact to interact with pedestrians and safely navigate around them. In this paper, we focus on eye contact detection in the wild, i.e., real-world scenarios for autonomous vehicles with no control over the environment or the distance of pedestrians. We introduce a model that leverages semantic keypoints to detect eye contact and show that this high-level representation (i) achieves state-of-the-art results on the publicly-available dataset JAAD, and (ii) conveys better generalization properties than leveraging raw images in an end-to-end network. To study domain adaptation, we create LOOK: a large-scale dataset for eye contact detection in the wild, which focuses on diverse and unconstrained scenarios for real-world generalization. The source code and the LOOK dataset are publicly shared towards an open science mission.
研究动机与目标
- 解决在光照、距离和遮挡等因素导致性能下降的非受限真实世界环境中进行眼神接触检测的挑战。
- 通过使用高层次语义关键点而非原始图像特征,提升模型在多样化场景下的泛化能力。
- 创建一个大规模、多样化的基准数据集(LOOK),用于真实世界野生环境下的眼神接触检测,覆盖多个自动驾驶数据集。
- 评估跨数据集泛化性能,重点关注真实世界部署的鲁棒性。
- 证明基于关键点的模型在准确率和跨域泛化能力方面均优于基于图像的基线方法。
提出的方法
- 使用现成的姿态估计方法(OpenPifPaf)从输入图像中提取每个行人的17个语义关键点。
- 通过一个轻量级专用神经网络处理这些2D关键点坐标和置信度分数,完成眼神接触分类。
- 设计一种多任务学习架构,联合预测眼神接触并优化关键点特征,提升模型鲁棒性。
- 采用基于梯度的显著性分析方法解释模型决策过程,并验证关键点的重要性。
- 提出一种新颖的评估协议,基于KITTI、nuScenes和JRDB之间的跨数据集泛化能力,评估真实世界迁移性能。
- 发布LOOK数据集,该数据集在三个主要自动驾驶数据集上进行标注,重点关注多样性与域偏移问题。
实验结果
研究问题
- RQ1在真实世界多变环境下,语义关键点表征是否优于原始图像特征进行眼神接触检测?
- RQ2基于关键点的模型在KITTI、nuScenes和JRDB等多样化、非受限数据集上的泛化能力如何?
- RQ3使用高层级特征是否能降低对光照和距离等环境噪声的敏感性?
- RQ4各个关键点(如眼睛、耳朵)对最终眼神接触预测的贡献如何?
- RQ5轻量级基于关键点的模型是否能在保持低推理延迟的同时实现最先进性能?
主要发现
- 基于关键点的模型在JAAD测试集上达到85.9%的AP,优于在多数据集上训练的基于图像的最先进方法(71.0% AP)。
- 该模型在跨数据集泛化方面表现显著更优:当在KITTI、nuScenes或JRDB上训练时,其在JAAD上的性能最高,而基于图像的基线方法则不具备此优势。
- 即使对于靠近摄像头的行人(小目标框),基于关键点的检测方法仍比基于图像裁剪的方法更有效,挑战了‘图像裁剪在近距离更优’的假设。
- 显著性分析结果表明,眼睛和耳朵是影响最大的关键点,其梯度幅值较高,验证了模型对相关特征的关注。
- 使用关键点特征时,分类步骤的推理时间低于1ms,使该方法极为高效,尤其在结合ShuffleNetV2等轻量级主干网络时优势明显。
- LOOK数据集包含来自三个主要自动驾驶数据集的多样化真实世界场景,可支持对跨域泛化能力的稳健评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。