[论文解读] Domain Adaptation Gaze Estimation by Embedding with Prediction Consistency
本文提出一种基于嵌入预测一致性的无监督域自适应方法(EPC),以减少眼球追踪中的个体间偏差。通过在眼球方向空间与嵌入空间中强制保持线性关系,该方法利用EPC损失最小化域间差异,仅使用眼区输入即在MPIIGaze上实现9.66%的误差降低(4.14°降至3.74°),在EYEDIAP上实现18.9%的误差降低(5.3°降至4.3°),达到当前最优性能。
Gaze is the essential manifestation of human attention. In recent years, a series of work has achieved high accuracy in gaze estimation. However, the inter-personal difference limits the reduction of the subject-independent gaze estimation error. This paper proposes an unsupervised method for domain adaptation gaze estimation to eliminate the impact of inter-personal diversity. In domain adaption, we design an embedding representation with prediction consistency to ensure that the linear relationship between gaze directions in different domains remains consistent on gaze space and embedding space. Specifically, we employ source gaze to form a locally linear representation in the gaze space for each target domain prediction. Then the same linear combinations are applied in the embedding space to generate hypothesis embedding for the target domain sample, remaining prediction consistency. The deviation between the target and source domain is reduced by approximating the predicted and hypothesis embedding for the target domain sample. Guided by the proposed strategy, we design Domain Adaptation Gaze Estimation Network(DAGEN), which learns embedding with prediction consistency and achieves state-of-the-art results on both the MPIIGaze and the EYEDIAP datasets.
研究动机与目标
- 为解决眼球追踪中个体间差异带来的挑战,该挑战限制了无特定受试者依赖的准确性。
- 在无需目标域标注数据的前提下,减少源域(训练域)与目标域(评估域)之间的域偏移。
- 通过无监督域自适应提升跨多样化受试者的瞳孔追踪鲁棒性。
- 构建一种表示方法,保持眼球空间与嵌入空间之间的线性一致性,以提升泛化能力。
- 仅使用眼区输入,在标准眼球追踪基准测试上实现当前最优性能。
提出的方法
- 该方法通过将每个目标样本的眼球方向建模为眼球空间中源域邻居的局部线性组合,设计出具有预测一致性的嵌入表示(EPC)。
- 将源眼球空间中的相同线性权重应用于源嵌入,以在嵌入空间中生成假设嵌入,从而保持局部结构。
- 引入EPC损失,通过最小化每个目标样本的预测嵌入与假设嵌入之间的L2距离,减少域间差异。
- 采用两阶段训练策略训练域自适应眼球追踪网络(DAGEN):先在源域上进行预训练,再通过EPC损失进行域自适应。
- 该方法利用在ImageNet上预训练的ResNet-18主干网络,并在源数据上进行微调,以提升特征表示并避免陷入局部最优。
- 选择区间参数μ控制用于局部线性逼近的源样本范围,μ = 0.15时性能最优。
实验结果
研究问题
- RQ1眼球空间与嵌入空间之间的预测一致性是否能有效减少无监督眼球追踪中的域偏移?
- RQ2在无标签条件下,利用源域邻居进行局部线性嵌入在提升目标域眼球追踪性能方面效果如何?
- RQ3嵌入维度和选择区间μ等超参数对模型性能有何影响?
- RQ4在ImageNet和源域上进行预训练是否能提升域自适应中眼球追踪的收敛速度与准确性?
- RQ5所提出的EPC损失是否能有效最小化个体间偏差,并在基准数据集上实现当前最优结果?
主要发现
- 所提出的DAGEN方法在MPIIGaze数据集上实现了9.66%的平均绝对误差(MAE)降低,从4.14°降至3.74°。
- 在EYEDIAP数据集上,该方法实现了18.9%的MAE提升,误差从5.3°降至4.3°。
- 该方法对嵌入维度Fg的变化具有鲁棒性,在Fg = {8, 16, 32, 64}范围内均无显著性能下降,表明其泛化能力强。
- 在ImageNet和源域上联合预训练可获得最佳性能(MAE为3.74°),表明二者具有互补优势。
- 选择区间μ = 0.15时性能最优,而更小的μ值因训练样本不足导致过拟合,误差升高。
- 可视化结果表明,DAGEN显著减少了预测结果与真实值之间的固定偏差,尤其在光照和姿态条件复杂的情况下效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。