[论文解读] Object-aware Gaze Target Detection
本文提出一种基于Transformer的端到端架构,用于物体感知的眼动目标检测,通过检测场景中的所有物体并建模头部与物体之间的相互作用(通过视线圆锥),联合预测视线热力图、视线点以及被注视物体的类别和位置(包括头部)。该方法在性能上达到当前最先进水平,AUC最高提升2.91%,视线距离降低50%,帧外平均精度提升9%,同时在被注视物体分类上提升11–13%。
Gaze target detection aims to predict the image location where the person is looking and the probability that a gaze is out of the scene. Several works have tackled this task by regressing a gaze heatmap centered on the gaze location, however, they overlooked decoding the relationship between the people and the gazed objects. This paper proposes a Transformer-based architecture that automatically detects objects (including heads) in the scene to build associations between every head and the gazed-head/object, resulting in a comprehensive, explainable gaze analysis composed of: gaze target area, gaze pixel point, the class and the image location of the gazed-object. Upon evaluation of the in-the-wild benchmarks, our method achieves state-of-the-art results on all metrics (up to 2.91% gain in AUC, 50% reduction in gaze distance, and 9% gain in out-of-frame average precision) for gaze target detection and 11-13% improvement in average precision for the classification and the localization of the gazed-objects. The code of the proposed method is publicly available.
研究动机与目标
- 解决现有眼动目标检测方法在物体层面理解上的不足,这些方法仅关注视线热力图回归,而未建模头部与被注视物体之间的关系。
- 克服传统双路径方法的局限性,后者依赖人工标注的头部区域裁剪,难以高效处理多人场景。
- 通过单次前向传播联合检测头部、被注视物体与眼动目标,实现端到端、可解释的眼动分析。
- 提升对标注差异性和帧外眼动检测的鲁棒性,这对真实世界中的野外应用至关重要。
- 在推理阶段无需辅助物体检测器,即可在眼动目标检测与被注视物体识别两方面均实现卓越性能。
提出的方法
- 利用物体检测Transformer从单张图像输入中检测场景中的所有物体,包括头部。
- 针对每个检测到的头部,预测一个视线向量,以定义视线圆锥,从而过滤掉在个体视野范围之外的物体。
- 采用掩码视线物体Transformer,建模头部与其视线圆锥内物体之间的相互作用。
- 利用视线物体Transformer的注意力特征生成视线热力图与精确的视线点预测。
- 引入专用头部,用于预测眼动目标是否位于图像帧外,从而提升对场景外眼动的检测能力。
- 通过结合视线热力图回归、视线点回归、物体分类与定位的多任务损失,端到端训练整个架构。
实验结果
研究问题
- RQ1基于Transformer的端到端模型能否联合检测眼动目标,并识别被注视物体的类别与位置,从而提升眼动分析的可解释性?
- RQ2通过视线圆锥建模头部-物体相互作用,相较于传统的双路径方法或整体场景建模方法,对眼动目标检测性能有何影响?
- RQ3与先前工作相比,该方法在眼动标注的标注差异性方面,改善程度如何?
- RQ4该方法能否在实现最先进眼动目标检测性能的同时,也实现准确的被注视物体分类与定位?
- RQ5在真实世界数据集中,面对不同水平的标注不确定性,该模型的性能表现如何?
主要发现
- 与先前最先进方法[35]相比,该方法在GazeFollow基准上的AUC绝对提升2.91%,证明其在眼动目标检测性能上的优越性。
- 与[35]相比,该模型将平均视线距离降低了50%,表明视线点定位显著更准确。
- 在帧外平均精度方面,该方法实现9%的提升,表明其对图像外眼动目标的检测能力更强。
- 即使未在COCO数据集上进行微调,该方法在被注视物体分类与定位方面,平均精度也较基线模型提升11–13%。
- 在标注差异性增加的情况下,该模型保持强鲁棒性,所有差异水平下AUC均持续高于[35],表明其对噪声人类标注具有更强的鲁棒性。
- 尽管在未使用COCO物体标注的GazeFollow数据集上进行训练,该模型仍能良好泛化至COCO物体类别,在准确率与参数效率方面均优于基于DETR的基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。