Skip to main content
QUICK REVIEW

[论文解读] Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

Nina Hristozova, Piotr Ozimek|ENLIGHTEN (Jurnal Bimbingan dan Konseling Islam)|Sep 5, 2018
CCD and CMOS Imaging Sensors参考文献 5被引用 4
一句话总结

本文提出了一种高效的自我中心视觉感知系统,利用人类眼动追踪数据引导软件视网膜模型,将输入数据量减少16.7倍,同时在9类物体识别任务中实现98.2%的测试准确率,通过定制的DCNN实现,展示了通过生物启发的灶点视觉与深度学习融合,在显著降低计算负载的同时实现高性能表现。

ABSTRACT

We present ongoing work to harness biological approaches to achieving highly efficient egocentric perception by combining the space-variant imaging architecture of the mammalian retina with Deep Learning methods. By pre-processing images collected by means of eye-tracking glasses to control the fixation locations of a software retina model, we demonstrate that we can reduce the input to a DCNN by a factor of 3, reduce the required number of training epochs and obtain over 98% classification rates when training and validating the system on a database of over 26,000 images of 9 object classes.

研究动机与目标

  • 开发一种高效的自我中心感知系统,利用人类眼动追踪数据引导视觉采样。
  • 将高分辨率软件视网膜模型与深度学习集成,以减少输入数据并提升计算效率。
  • 通过注视引导的、空间可变的图像采样,展示最先进的分类性能。
  • 通过用预测性注视建模替代刚性头部稳定装置,实现在无约束条件下的数据采集。
  • 探索共形映射与皮层图像变换在尺度与旋转不变特征提取中的应用。

提出的方法

  • 使用眼动追踪眼镜(Tobii Pro 2)在人类观察者注视显著物体区域时捕获图像。
  • 使用K均值聚类(K = 每类注视点的1%)对注视点进行聚类,以识别具有代表性的灶点区域。
  • 采用包含50K个节点的软件视网膜模型,通过复对数共形映射将完整图像转换为大小为399×752像素的空间可变皮层图像。
  • 在皮层图像上训练一个定制的DCNN,包含七个3×3卷积层、最大池化层以及三个132节点的全连接层。
  • 通过比较使用皮层图像与全分辨率注视区域图像的性能,评估数据效率与准确率。
  • 对皮层图像应用散点网格化算法,进一步减少输入尺寸,同时保持准确率。
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment

实验结果

研究问题

  • RQ1人类眼动追踪数据能否有效用于引导软件视网膜,实现高效的自我中心物体识别?
  • RQ2软件视网膜的空间可变采样在多大程度上减少了输入数据量,同时保持分类性能?
  • RQ3在皮层图像上训练的DCNN与在全分辨率注视区域图像上训练的模型相比,性能如何?
  • RQ4能否通过直接连接到视网膜输出的定制网络层,实现超越生成中间皮层图像的效率提升?
  • RQ5辅助网络能否预测诊断性注视点,并实现在自我中心场景中无约束的数据采集?

主要发现

  • 该系统在基于眼动追踪数据生成的皮层图像上,于9类物体识别任务中实现了98.2%的测试准确率。
  • 通过软件视网膜的空间可变采样,视觉输入数据量减少了16.7倍,且准确率损失极小。
  • 基于皮层图像的DCNN仅需6秒即可完成测试集分类,而全分辨率注视区域图像模型需12秒。
  • 全分辨率注视区域图像模型实现了99.5%的测试准确率,但需要更大的批量大小和更长的训练时间。
  • 通过散点网格化算法对皮层图像进行下采样,实现了10.8倍的输入数据量减少,且未造成性能损失。
  • 正在开发一个辅助网络,用于预测诊断性注视点,并实现从任意部分遮挡视图中进行物体分割。
Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。