[论文解读] Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning
本文提出了一种高效的自我中心视觉感知系统,利用人类眼动追踪数据引导软件视网膜模型,将输入数据量减少16.7倍,同时在9类物体识别任务中实现98.2%的测试准确率,通过定制的DCNN实现,展示了通过生物启发的灶点视觉与深度学习融合,在显著降低计算负载的同时实现高性能表现。
We present ongoing work to harness biological approaches to achieving highly efficient egocentric perception by combining the space-variant imaging architecture of the mammalian retina with Deep Learning methods. By pre-processing images collected by means of eye-tracking glasses to control the fixation locations of a software retina model, we demonstrate that we can reduce the input to a DCNN by a factor of 3, reduce the required number of training epochs and obtain over 98% classification rates when training and validating the system on a database of over 26,000 images of 9 object classes.
研究动机与目标
- 开发一种高效的自我中心感知系统,利用人类眼动追踪数据引导视觉采样。
- 将高分辨率软件视网膜模型与深度学习集成,以减少输入数据并提升计算效率。
- 通过注视引导的、空间可变的图像采样,展示最先进的分类性能。
- 通过用预测性注视建模替代刚性头部稳定装置,实现在无约束条件下的数据采集。
- 探索共形映射与皮层图像变换在尺度与旋转不变特征提取中的应用。
提出的方法
- 使用眼动追踪眼镜(Tobii Pro 2)在人类观察者注视显著物体区域时捕获图像。
- 使用K均值聚类(K = 每类注视点的1%)对注视点进行聚类,以识别具有代表性的灶点区域。
- 采用包含50K个节点的软件视网膜模型,通过复对数共形映射将完整图像转换为大小为399×752像素的空间可变皮层图像。
- 在皮层图像上训练一个定制的DCNN,包含七个3×3卷积层、最大池化层以及三个132节点的全连接层。
- 通过比较使用皮层图像与全分辨率注视区域图像的性能,评估数据效率与准确率。
- 对皮层图像应用散点网格化算法,进一步减少输入尺寸,同时保持准确率。

实验结果
研究问题
- RQ1人类眼动追踪数据能否有效用于引导软件视网膜,实现高效的自我中心物体识别?
- RQ2软件视网膜的空间可变采样在多大程度上减少了输入数据量,同时保持分类性能?
- RQ3在皮层图像上训练的DCNN与在全分辨率注视区域图像上训练的模型相比,性能如何?
- RQ4能否通过直接连接到视网膜输出的定制网络层,实现超越生成中间皮层图像的效率提升?
- RQ5辅助网络能否预测诊断性注视点,并实现在自我中心场景中无约束的数据采集?
主要发现
- 该系统在基于眼动追踪数据生成的皮层图像上,于9类物体识别任务中实现了98.2%的测试准确率。
- 通过软件视网膜的空间可变采样,视觉输入数据量减少了16.7倍,且准确率损失极小。
- 基于皮层图像的DCNN仅需6秒即可完成测试集分类,而全分辨率注视区域图像模型需12秒。
- 全分辨率注视区域图像模型实现了99.5%的测试准确率,但需要更大的批量大小和更长的训练时间。
- 通过散点网格化算法对皮层图像进行下采样,实现了10.8倍的输入数据量减少,且未造成性能损失。
- 正在开发一个辅助网络,用于预测诊断性注视点,并实现从任意部分遮挡视图中进行物体分割。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。