[论文解读] A Ground-Truth Data Set and a Classification Algorithm for Eye Movements in 360-degree Videos
本论文提出一个公开可用的360°视频眼动追踪数据集,包含对注视、扫视、平滑追踪以及头部驱动运动(前庭眼动反射、眼球震颤、头部追踪)的手动标注。该研究设计了一种两阶段标注流程,并提出一种基于规则的分类算法,结合眼动在头部坐标系(eye-in-head)和世界坐标系(eye-in-world)中的速度度量,实验证明:将两种参考坐标系结合使用可显著提升检测精度,尤其在复杂眼动(如平滑追踪和前庭眼动反射)的识别上,优于仅依赖单帧参考系统的传统方法。
The segmentation of a gaze trace into its constituent eye movements has been actively researched since the early days of eye tracking. As we move towards more naturalistic viewing conditions, the segmentation becomes even more challenging and convoluted as more complex patterns emerge. The definitions and the well-established methods that were developed for monitor-based eye tracking experiments are often not directly applicable to unrestrained set-ups such as eye tracking in wearable contexts or with head-mounted displays. The main contributions of this work to the eye movement research for 360-degree content are threefold: First, we collect, partially annotate, and make publicly available a new eye tracking data set, which consists of 13 participants viewing 15 video clips that are recorded in 360-degree. Second, we propose a new two-stage pipeline for ground truth annotation of the traditional fixations, saccades, smooth pursuits, as well as (optokinetic) nystagmus, vestibulo-ocular reflex, and pursuit of moving objects performed exclusively via the movement of the head. A flexible user interface for this pipeline is implemented and made freely accessible for use or modification. Lastly, we develop and test a simple proof-of-concept algorithm for automatic classification of all the eye movement types in our data set based on their operational definitions that were used for manual annotation. The data set and the source code for both the annotation tool and the algorithm are publicly available at https://web.gin.g-node.org/ioannis.agtzidis/360_em_dataset.
研究动机与目标
- 为自然主义、无头部约束的360°视频观看场景中眼动分类缺乏标准化、公开可用的真实标注数据的问题提供解决方案。
- 开发一种灵活、开源的标注流程,用于标记复杂眼动类型,包括由头部运动驱动的眼动。
- 提出并评估一种基于规则的分类算法,利用眼动在头部坐标系和世界坐标系中的速度度量,以提升对主要和次要眼动类型的检测精度。
- 建立沉浸式、非受限环境中国眼动分类的基准,尤其针对可穿戴设备和头戴式显示器(HMD)的眼动追踪系统。
提出的方法
- 收集了13名参与者观看15段360°视频片段的数据,以高时间分辨率记录头部运动与注视轨迹。
- 设计并实现了一套两阶段标注流程,通过可自定义的用户界面,实现对注视、扫视、平滑追踪以及头部驱动运动(VOR、眼球震颤、头部追踪)的手动标注。
- 采用基于规则的算法,通过在眼动在头部坐标系和世界坐标系中计算速度阈值,对眼动类型进行分类。
- 在三种配置下评估该算法:仅使用眼动在世界坐标系(FOV)、仅使用眼动在头部坐标系(E+H),以及结合两种参考坐标系的联合方法。
- 采用Hooge等人(2017)的标准流程计算事件级F1分数,结果按每类眼动类型分别报告。
- 在人工标注的测试集上对算法进行测试,并分析不同参考坐标系组合下的性能表现,以评估头部运动信息整合的影响。
实验结果
研究问题
- RQ1能否创建一个全面、公开可用的360°视频眼动追踪数据集,实现对多种眼动类型(包括头部运动驱动的眼动)的准确人工标注?
- RQ2同时使用眼动在头部坐标系和世界坐标系中的速度信息,如何提升对复杂眼动(如平滑追踪和前庭眼动反射)的分类性能?
- RQ3在无约束头部运动场景下,基于单参考坐标系速度阈值的现有分类算法,在区分相似眼动类型时存在多大程度的失效?
- RQ4当基于操作定义和双参考坐标系数据引导时,基于规则的算法能否在360°视频场景中实现鲁棒且准确的眼动分类?
- RQ5在仅依赖眼动在世界坐标系(如典型VR系统中)与结合眼动和头部运动数据时,眼动分类性能有何差异?
主要发现
- 仅使用FOV(眼动在世界坐标系)的算法在扫视和尤其在平滑追踪任务上的F1分数显著偏低,表明仅依赖眼动在世界坐标系的速度会导致因头部运动补偿而产生误分类。
- 仅使用E+H(眼动在头部坐标系)的版本性能优于FOV,但仍无法检测到如VOR和头部追踪等次要眼动类型,这些类型需要同时掌握眼动与头部运动信息。
- 结合眼动在头部坐标系和世界坐标系速度度量的联合算法,在所有主要和次要眼动类别中均达到最高的F1分数,证明双参考坐标系融合的必要性。
- 联合算法成功检测到全部眼动类型谱系,包括如OKN+VOR等复杂组合,而其他两种版本则未能识别。
- 研究结果表明,固定阈值方法(如基于速度)的性能低于人工标注的上下文感知判断,尤其在区分相似眼动类型(如注视+VOR与平滑追踪)时表现更差。
- 结果提示,未来算法应不仅整合头部运动数据(如来自陀螺仪的数据),还应结合注视目标与视频中物体运动的对应关系,以提升鲁棒性与准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。