[论文解读] OpenEDS2020: Open Eyes Dataset
OpenEDS2020 是一个大规模、匿名化的数据集,包含在虚拟现实环境中通过双同步眼动追踪相机捕获的高分辨率(640×400)、100 Hz 的眼图像序列。该数据集支持时空注视预测与眼部分割研究,实现了 5.37° 的平均角度误差和 84.1% 的 mIoU,可作为实时虚拟现实应用的基准。
We present the second edition of OpenEDS dataset, OpenEDS2020, a novel dataset of eye-image sequences captured at a frame rate of 100 Hz under controlled illumination, using a virtual-reality head-mounted display mounted with two synchronized eye-facing cameras. The dataset, which is anonymized to remove any personally identifiable information on participants, consists of 80 participants of varied appearance performing several gaze-elicited tasks, and is divided in two subsets: 1) Gaze Prediction Dataset, with up to 66,560 sequences containing 550,400 eye-images and respective gaze vectors, created to foster research in spatio-temporal gaze estimation and prediction approaches; and 2) Eye Segmentation Dataset, consisting of 200 sequences sampled at 5 Hz, with up to 29,500 images, of which 5% contain a semantic segmentation label, devised to encourage the use of temporal information to propagate labels to contiguous frames. Baseline experiments have been evaluated on OpenEDS2020, one for each task, with average angular error of 5.37 degrees when performing gaze prediction on 1 to 5 frames into the future, and a mean intersection over union score of 84.1% for semantic segmentation. As its predecessor, OpenEDS dataset, we anticipate that this new dataset will continue creating opportunities to researchers in eye tracking, machine learning and computer vision communities, to advance the state of the art for virtual reality applications. The dataset is available for download upon request at http://research.fb.com/programs/openeds-2020-challenge/.
研究动机与目标
- 为解决缺乏适合实时虚拟现实/增强现实应用的高分辨率、时间密集且匿名的眼动追踪数据集的问题。
- 支持时空注视估计与预测的研究,特别是用于补偿焦外渲染中的延迟。
- 通过时间一致性和稀疏标注,支持鲁棒眼部分割模型的开发。
- 提供一个基准数据集,推动计算机视觉、机器学习以及沉浸式技术中眼动追踪领域的技术水平提升。
- 通过公开可用、保护隐私的数据集,结合受控光照条件和多样化的参与者人口统计特征,促进可复现的研究。
提出的方法
- 使用配备两个同步眼面对准摄像头的 VR 头戴显示设备,在 100 Hz 采样率下采集 80 名参与者执行注视诱导任务的数据。
- 注视预测数据集包含最多 66,560 个序列,共 550,400 张眼图像,附带对应的 3D 注视向量,用于时间建模。
- 眼部分割数据集包含 200 个序列,采样率为 5 Hz,其中 5% 的帧具有针对角膜、虹膜、瞳孔和背景的密集语义分割掩码。
- 采用带有 32 个单元全连接层和 2 个单元线性回归头的卷积神经网络(CNN)实现 3D 注视预测基线模型,使用 75% 的数据进行训练,并通过数据加权处理类别不平衡问题。
- 注视预测采用 50 帧滑动窗口,计算线性回归参数以预测未来 5 帧的注视位置。
- 语义分割基线采用轻量级编码器-解码器 CNN,结合深度可分离卷积和乘法跳跃连接,基于 1,605 张标注图像进行训练。
实验结果
研究问题
- RQ1仅使用过去 50 帧的注视估计,简单的线性回归模型能否有效预测未来的注视位置?
- RQ2在快速眼动(如扫视)期间,注视预测性能随时间推移如何退化?
- RQ3当仅 5% 的帧具有完整标注时,时间信息在眼图像语义分割中的准确率提升程度如何?
- RQ4轻量级深度学习模型能否在稀疏标注下实现高分割准确率(mIoU),同时保持低计算成本?
- RQ5眼部分割与注视估计的质量与下游虚拟现实应用(如焦外渲染)的性能之间存在何种关联?
主要发现
- 注视预测基线模型在预测未来 50ms 的注视位置时,平均角度误差为 5.37 度,且误差随时间逐渐增加。
- 注视预测的 p95 误差达到 12.48 度,表明线性模型在预测快速扫视运动时面临显著挑战。
- 在仅使用稀疏标注且不引入时间建模的情况下,语义分割基线模型在测试集上实现了 84.1% 的平均交并比(mIoU)。
- 模型在背景部分达到 97.1% 的 mIoU,角膜为 67.4%,虹膜为 88.2%,瞳孔为 83.5%,表明对多数结构具有优异性能。
- 训练后的注视估计网络在验证集上实现了 4.58° 的平均误差,与当前最先进的无主体依赖方法一致。
- 该数据集具有高时间分辨率(100 Hz)和受控环境,能够准确建模快速眼动(如扫视),这对实时虚拟现实系统至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。