[论文解读] Optimization-Based Eye Tracking using Deflectometric Information
该论文提出了一种基于优化的瞳孔追踪方法,利用屏幕照射下眼睛的像素级密集形变测量数据,实现高精度视线估计。通过在PyTorch3D中使用可微分渲染流程模拟镜面反射,并联合优化眼睛旋转、平移和形状参数,采用梯度下降法,该方法在模拟中实现了低于0.45°的平均相对视线误差,相较于最先进基于反射的方法提升了6倍。
Eye tracking is an important tool with a wide range of applications in Virtual, Augmented, and Mixed Reality (VR/AR/MR) technologies. State-of-the-art eye tracking methods are either reflection-based and track reflections of sparse point light sources, or image-based and exploit 2D features of the acquired eye image. In this work, we attempt to significantly improve reflection-based methods by utilizing pixel-dense deflectometric surface measurements in combination with optimization-based inverse rendering algorithms. Utilizing the known geometry of our deflectometric setup, we develop a differentiable rendering pipeline based on PyTorch3D that simulates a virtual eye under screen illumination. Eventually, we exploit the image-screen-correspondence information from the captured measurements to find the eye's rotation, translation, and shape parameters with our renderer via gradient descent. In general, our method does not require a specific pattern and can work with ordinary video frames of the main VR/AR/MR screen itself. We demonstrate real-world experiments with evaluated mean relative gaze errors below 0.45 degrees at a precision better than 0.11 degrees. Moreover, we show an improvement of 6X over a representative reflection-based state-of-the-art method in simulation.
研究动机与目标
- 解决依赖仅约12个光点的稀疏反射式瞳孔追踪方法的局限性。
- 通过利用屏幕照射下眼睛的密集像素级表面对应关系,提升视线追踪精度。
- 开发一种可微分渲染流程,模拟镜面反射,并实现眼睛姿态与形状的联合优化。
- 证明扩展的屏幕照明相比稀疏点光源,能提供显著更密集且更鲁棒的表面信息。
- 在真实世界实验中验证该方法的高精度与低误差表现。
提出的方法
- 该方法将稀疏点光源替换为显示已知高频正弦图案的自发光屏幕。
- 通过相位剪切技术捕获形变测量数据,提取包裹相位图与解包裹相位图,从而获得密集的图像-屏幕对应关系。
- 基于PyTorch3D构建可微分渲染流程,模拟屏幕照明下的虚拟眼睛,建模镜面反射与光传输。
- 通过梯度下降法联合优化眼睛旋转、平移和形状参数,最小化光度损失与相关性损失。
- 优化过程利用已知的形变测量装置几何结构与捕获的对应信息,以精炼3D眼睛模型。
- 该方法无需外部标记或专用硬件,仅需标准相机与屏幕即可运行。
实验结果
研究问题
- RQ1与基于稀疏光点的方法相比,屏幕照明提供的密集表面对应关系是否能显著提升视线追踪精度?
- RQ2能够建模镜面反射的可微分渲染流程是否能实现对眼睛姿态与形状估计的准确逆向渲染?
- RQ3对应点的密度如何影响视线估计的精度与误差?
- RQ4该方法是否仅通过单个相机视角与VR/AR/MR屏幕的标准视频帧即可实现高精度追踪?
- RQ5照明图案的选择(如高频与低频)如何影响对应质量与追踪性能?
主要发现
- 在真实世界实验中,该方法实现了0.42°的平均相对视线误差与0.19°的精度,对应关系完整度为1/500时最大误差为1.52°。
- 在模拟中,该方法将视线误差降低至0.03°(相关性损失)与0.07°(光度损失),相比代表性光点追踪基线方法提升6倍。
- 对应关系越稀疏,性能越差,完整度为1/500时平均误差上升至1.52°,精度升至4.52°,表明密集数据的重要性。
- 高频正弦图案相比低频图案能提供更鲁棒、更精确的对应关系,符合相位剪切计量原理。
- 该方法不仅在模拟中优于光点追踪,在真实世界测试中也表现更优,使用SIFT特征时平均误差为0.15°,而光点追踪为0.20°。
- 光度损失函数相比相关性损失具有更好的泛化能力,表明其在真实环境条件下具备更强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。