[论文解读] Adaptive Feature Fusion Network for Gaze Tracking in Mobile Tablets
该论文提出了一种新型基于CNN的眼动追踪方法——自适应特征融合网络(AFF-Net),专为移动平板设备设计。该方法通过堆叠特征图与挤压-激励模块,自适应地融合左右眼特征,同时采用自适应分组归一化(AdaGN)对眼特征进行重校准,利用面部外观信息提升性能。该方法在GazeCapture和MPIIFaceGaze数据集上均达到最先进水平,分别在手机和平板图像上实现1.62 cm和2.30 cm的欧氏误差。
Recently, many multi-stream gaze estimation methods have been proposed. They estimate gaze from eye and face appearances and achieve reasonable accuracy. However, most of the methods simply concatenate the features extracted from eye and face appearance. The feature fusion process has been ignored. In this paper, we propose a novel Adaptive Feature Fusion Network (AFF-Net), which performs gaze tracking task in mobile tablets. We stack two-eye feature maps and utilize Squeeze-and-Excitation layers to adaptively fuse two-eye features according to their similarity on appearance. Meanwhile, we also propose Adaptive Group Normalization to recalibrate eye features with the guidance of facial feature. Extensive experiments on both GazeCapture and MPIIFaceGaze datasets demonstrate consistently superior performance of the proposed method.
研究动机与目标
- 通过利用左右眼之间的结构相似性,提升移动平板设备上的眼动估计精度。
- 通过引入保留特征图结构的空间感知融合机制,解决简单拼接眼特征的局限性。
- 通过自适应归一化引入面部外观特征,增强眼特征提取能力。
- 构建统一框架,联合优化眼特征与面部特征的利用,实现非约束环境下鲁棒的眼动估计。
提出的方法
- 在不同网络层堆叠左右眼的特征图,以保留空间关系并实现更有效的融合。
- 在堆叠后应用挤压-激励(SE)模块,基于双眼外观相似性自适应地重新校准通道重要性。
- 提出一种新型自适应分组归一化(AdaGN)层,利用人脸与眼区域的边界框及面部特征,动态计算缩放与偏移参数,实现对眼特征的重校准。
- 网络端到端处理眼和面部输入,面部分支为眼特征表示提供上下文引导。
- 最终的眼动预测由融合后的眼特征生成,模型通过最小化真实移动平板图像上的2D眼动位置误差进行训练。
- 该架构在两个大规模数据集上进行评估:GazeCapture(手机与平板)和MPIIFaceGaze(基于笔记本电脑的设置)。
实验结果
研究问题
- RQ1通过堆叠眼特征图而非拼接特征向量,是否能通过保留空间结构提升眼动估计精度?
- RQ2通过挤压-激励模块实现的自适应通道加权,是否能通过建模双眼外观相似性提升性能?
- RQ3能否有效利用面部外观特征(如头部姿态、光照、身份等)通过自适应归一化引导眼特征学习?
- RQ4在极端条件下(如人脸尺寸极小或眼动方向多变)下,所提出的融合与引导机制表现如何?
主要发现
- AFF-Net在GazeCapture数据集的手机图像上实现1.62 cm的欧氏误差,在平板图像上实现2.30 cm,优于当前最先进方法。
- 在MPIIFaceGaze数据集上,该方法实现3.9 cm的欧氏误差和4.4度的3D眼动方向角误差,表明其在基于笔记本电脑的设置中也具备强大的泛化能力。
- 消融实验表明,移除任意一个模块(堆叠、SE模块或AdaGN)均使误差增加约4%,证实了每个模块的贡献。
- 热力图分析显示,AFF-Net在所有眼动位置上均保持较低误差,尤其在靠近摄像头边缘时表现更优,表明其具有更强的鲁棒性。
- 在人脸尺寸极小的情况下,该模型表现优于基线方法,误差显著更低,表明其在极端情况下的强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。