Skip to main content
QUICK REVIEW

[论文解读] Gaze Estimation with an Ensemble of Four Architectures

Xin Cai, Boyu Chen|arXiv (Cornell University)|Jul 5, 2021
Gaze Tracking and Assistive Technology参考文献 23被引用 12
一句话总结

该论文提出了一种基于四种不同深度学习架构——iTracker-MHSA、BoTNet、HRNet 和 ResNeSt——的集成眼球注视估计方法,这些模型均在 ETH-XGaze 数据集上进行训练。通过使用加权线性平均方法融合六个表现最佳模型的预测结果,该方法在 ETH-XGaze 基准测试中实现了 3.11° 的平均角度误差,创下新纪录,位列榜首。

ABSTRACT

This paper presents a method for gaze estimation according to face images. We train several gaze estimators adopting four different network architectures, including an architecture designed for gaze estimation (i.e.,iTracker-MHSA) and three originally designed for general computer vision tasks(i.e., BoTNet, HRNet, ResNeSt). Then, we select the best six estimators and ensemble their predictions through a linear combination. The method ranks the first on the leader-board of ETH-XGaze Competition, achieving an average angular error of $3.11^{\circ}$ on the ETH-XGaze test set.

研究动机与目标

  • 在极端注视角度、头部姿态变化和遮挡等具有挑战性的现实条件下提升眼球注视估计的准确性。
  • 解决当前最先进的眼球注视估计方法之间缺乏统一评估指标的问题。
  • 通过利用多样化的网络架构和集成学习方法,克服单模型方法的局限性。
  • 验证多尺度、分割注意力机制以及空洞卷积技术在眼球注视估计中的有效性。
  • 在大规模、高分辨率的 ETH-XGaze 基准数据集上实现卓越性能。

提出的方法

  • 训练了四种不同的深度学习架构:iTracker-MHSA(引入多头自注意力机制)、BoTNet(瓶颈变换器)、HRNet(多尺度特征提取)以及 ResNeSt(多路径结构结合通道注意力机制)。
  • 在 iTracker-MHSA 的眼部分支中引入空洞卷积,以扩大感受野并增强特征表示能力。
  • 集成带有残差连接和层归一化的变换器编码器,用于学习人脸与眼部特征之间的跨模态注意力。
  • 使用面部关键点检测(HRNet-W18)和 RoI Align 精确裁剪人脸图像中的眼部区域。
  • 通过在线难例挖掘策略,对每批次中损失值最高的 30% 样本进行加权,以提升在困难样本上的鲁棒性。
  • 利用学习得到的线性权重对六个表现最佳模型的预测结果进行集成,以最小化整体角度误差。

实验结果

研究问题

  • RQ1将多个多样化深度学习架构进行集成,是否能够使眼球注视估计的准确性超越单模型性能?
  • RQ2注意力机制(如多头自注意力)以及多尺度特征学习在复杂现实场景下的眼球注视估计中起到何种作用?
  • RQ3空洞卷积与残差连接在极端头部姿态和光照变化条件下对眼球注视估计的提升作用如何?
  • RQ4对不同输入分辨率和架构的模型进行加权平均的集成学习方法,是否能实现比单个模型更好的泛化能力?
  • RQ5诸如通道注意力(ResNeSt)和多分辨率特征融合(HRNet)等架构创新,在 ETH-XGaze 基准测试中对眼球注视估计的提升程度如何?

主要发现

  • 集成模型在 ETH-XGaze 测试集上实现了 3.11° 的平均角度误差,位列官方排行榜首位。
  • 表现最佳的单模型 HRNet(输入尺寸 640×640)达到 3.22° 的误差,表明更大的输入分辨率具有优势。
  • iTracker-MHSA(输入尺寸 448×448)达到 3.37° 的误差,相比基线 iTracker(4.02°)和采用空洞卷积的 iTracker(3.80°)均有提升。
  • 六个模型的集成(见表 3)优于表现最佳的单模型,证实了使用学习权重进行模型平均的有效性。
  • 在多种分辨率下训练的 HRNet 模型表现稳定,其中 640×640 尺寸的输入误差最低(3.22°)。
  • ResNeSt(输入尺寸 448×448)达到 3.34° 的误差,表明多路径结构与通道注意力机制具有强大性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。