[论文解读] Improving Few-Shot User-Specific Gaze Adaptation via Gaze Redirection Synthesis
本文提出了一种新颖的少样本用户特定眼动适应方法,通过眼动重定向合成技术从有限的参考眼图像中生成多样化、逼真的训练样本。通过在合成数据上预训练眼动重定向网络,并应用自监督域自适应方法,该方法即使仅使用9个特定用户的样本,也能显著提升眼动估计精度,在ColumbiaGaze和MPIIGaze数据集上优于标准微调和域自适应基线方法。
As an indicator of human attention gaze is a subtle behavioral cue which can be exploited in many applications. However, inferring 3D gaze direction is challenging even for deep neural networks given the lack of large amount of data (groundtruthing gaze is expensive and existing datasets use different setups) and the inherent presence of gaze biases due to person-specific difference. In this work, we address the problem of person-specific gaze model adaptation from only a few reference training samples. The main and novel idea is to improve gaze adaptation by generating additional training samples through the synthesis of gaze-redirected eye images from existing reference samples. In doing so, our contributions are threefold: (i) we design our gaze redirection framework from synthetic data, allowing us to benefit from aligned training sample pairs to predict accurate inverse mapping fields; (ii) we proposed a self-supervised approach for domain adaptation; (iii) we exploit the gaze redirection to improve the performance of person-specific gaze estimation. Extensive experiments on two public datasets demonstrate the validity of our gaze retargeting and gaze estimation framework.
研究动机与目标
- 为解决因标注成本高昂,仅凭少量标注眼图像实现准确用户特定眼动估计的挑战。
- 减少眼动估计中合成与真实眼图像之间的人体特定眼动偏差和域差异。
- 从少量参考样本生成多样化、逼真且标注准确的眼动指向眼图像,以提升适应性能。
- 开发一种无需真实与合成图像配对数据的自监督域自适应方法用于眼动重定向。
- 证明眼动重定向合成可使少样本眼动适应性能超越简单微调。
提出的方法
- 在大规模合成眼图像对上预训练眼动重定向网络,这些图像对具有对齐的身份、眼位、头部姿态和光照条件,以预测准确的逆向变形场。
- 在训练过程中使用合成图像的语义分割图作为正则化,以提升空间一致性。
- 引入一种自监督域自适应策略,利用循环一致性损失和眼动重定向损失,将合成重定向图像与真实数据对齐,而无需真实图像配对。
- 将重定向图像用作增强训练数据,对通用眼动估计算法进行微调以实现用户特定适应。
- 该方法利用重定向样本保留真实外观和准确眼动真实值的特性,从而减少个体特定偏差。
- 曾探索光照校正优化模块,但因颜色/光照失真导致性能下降而被弃用。
实验结果
研究问题
- RQ1能否通过少量参考眼图像的眼动重定向合成技术提升少样本用户特定眼动适应性能?
- RQ2在具有对齐对的合成数据上预训练是否可实现无需眼点关键点的准确眼动重定向?
- RQ3当真实与合成数据分布存在差异时,自监督域自适应能否提升眼动重定向质量?
- RQ4在眼动估计精度方面,眼动重定向合成与标准微调和域自适应相比表现如何?
- RQ5重定向样本在外观和眼动一致性方面与真实眼图像的相似程度如何?
主要发现
- 仅使用9个特定用户的样本对通用眼动估计算法进行微调,已显著提升眼动估计精度,优于仅使用通用模型的情况。
- 所提出的眼动重定向合成方法进一步提升了适应性能,在ColumbiaGaze和MPIIGaze数据集上均优于标准微调和域自适应基线方法。
- 使用循环一致性损失和眼动重定向损失的自监督域自适应策略提升了性能,尤其在合成与真实数据域差异较大的ColumbiaGaze数据集中表现更优。
- 主观评估显示,66%的参与者无法可靠区分真实与重定向眼图像,表明生成样本具有高度逼真性。
- 区分真实与重定向图像的决策时间随重定向角度减小而增加,证实细微变化更难察觉。
- 该方法在生成大角度重定向样本方面存在局限,限制了对完整眼动方向空间的覆盖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。