Skip to main content
QUICK REVIEW

[论文解读] Object-aware Gaze Target Detection

Francesco Tonini, Nicola Dall’Asen|arXiv (Cornell University)|Jul 18, 2023
Gaze Tracking and Assistive TechnologyComputer Science被引用 3
一句话总结

本文提出一种基于Transformer的端到端架构,用于物体感知的眼动目标检测,通过检测场景中的所有物体并建模头部与物体之间的相互作用(通过视线圆锥),联合预测视线热力图、视线点以及被注视物体的类别和位置(包括头部)。该方法在性能上达到当前最先进水平,AUC最高提升2.91%,视线距离降低50%,帧外平均精度提升9%,同时在被注视物体分类上提升11–13%。

ABSTRACT

Gaze target detection aims to predict the image location where the person is looking and the probability that a gaze is out of the scene. Several works have tackled this task by regressing a gaze heatmap centered on the gaze location, however, they overlooked decoding the relationship between the people and the gazed objects. This paper proposes a Transformer-based architecture that automatically detects objects (including heads) in the scene to build associations between every head and the gazed-head/object, resulting in a comprehensive, explainable gaze analysis composed of: gaze target area, gaze pixel point, the class and the image location of the gazed-object. Upon evaluation of the in-the-wild benchmarks, our method achieves state-of-the-art results on all metrics (up to 2.91% gain in AUC, 50% reduction in gaze distance, and 9% gain in out-of-frame average precision) for gaze target detection and 11-13% improvement in average precision for the classification and the localization of the gazed-objects. The code of the proposed method is publicly available.

研究动机与目标

  • 解决现有眼动目标检测方法在物体层面理解上的不足,这些方法仅关注视线热力图回归,而未建模头部与被注视物体之间的关系。
  • 克服传统双路径方法的局限性,后者依赖人工标注的头部区域裁剪,难以高效处理多人场景。
  • 通过单次前向传播联合检测头部、被注视物体与眼动目标,实现端到端、可解释的眼动分析。
  • 提升对标注差异性和帧外眼动检测的鲁棒性,这对真实世界中的野外应用至关重要。
  • 在推理阶段无需辅助物体检测器,即可在眼动目标检测与被注视物体识别两方面均实现卓越性能。

提出的方法

  • 利用物体检测Transformer从单张图像输入中检测场景中的所有物体,包括头部。
  • 针对每个检测到的头部,预测一个视线向量,以定义视线圆锥,从而过滤掉在个体视野范围之外的物体。
  • 采用掩码视线物体Transformer,建模头部与其视线圆锥内物体之间的相互作用。
  • 利用视线物体Transformer的注意力特征生成视线热力图与精确的视线点预测。
  • 引入专用头部,用于预测眼动目标是否位于图像帧外,从而提升对场景外眼动的检测能力。
  • 通过结合视线热力图回归、视线点回归、物体分类与定位的多任务损失,端到端训练整个架构。

实验结果

研究问题

  • RQ1基于Transformer的端到端模型能否联合检测眼动目标,并识别被注视物体的类别与位置,从而提升眼动分析的可解释性?
  • RQ2通过视线圆锥建模头部-物体相互作用,相较于传统的双路径方法或整体场景建模方法,对眼动目标检测性能有何影响?
  • RQ3与先前工作相比,该方法在眼动标注的标注差异性方面,改善程度如何?
  • RQ4该方法能否在实现最先进眼动目标检测性能的同时,也实现准确的被注视物体分类与定位?
  • RQ5在真实世界数据集中,面对不同水平的标注不确定性,该模型的性能表现如何?

主要发现

  • 与先前最先进方法[35]相比,该方法在GazeFollow基准上的AUC绝对提升2.91%,证明其在眼动目标检测性能上的优越性。
  • 与[35]相比,该模型将平均视线距离降低了50%,表明视线点定位显著更准确。
  • 在帧外平均精度方面,该方法实现9%的提升,表明其对图像外眼动目标的检测能力更强。
  • 即使未在COCO数据集上进行微调,该方法在被注视物体分类与定位方面,平均精度也较基线模型提升11–13%。
  • 在标注差异性增加的情况下,该模型保持强鲁棒性,所有差异水平下AUC均持续高于[35],表明其对噪声人类标注具有更强的鲁棒性。
  • 尽管在未使用COCO物体标注的GazeFollow数据集上进行训练,该模型仍能良好泛化至COCO物体类别,在准确率与参数效率方面均优于基于DETR的基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。