[论文解读] Real-time Pupil Tracking from Monocular Video for Digital Puppetry
本文提出了一种基于单目视频的实时瞳孔追踪系统,用于移动设备上的数字木偶戏,采用轻量级神经网络检测5个关键眼点(瞳孔中心和外虹膜点),并使用基于位移的启发式方法估算瞳孔混合形状系数。该方法在现代手机上实现超过50 FPS的性能,无需校准或外部传感器,即可在虚拟角色中实现逼真、响应迅速的眼部动画。
We present a simple, real-time approach for pupil tracking from live video on mobile devices. Our method extends a state-of-the-art face mesh detector with two new components: a tiny neural network that predicts positions of the pupils in 2D, and a displacement-based estimation of the pupil blend shape coefficients. Our technique can be used to accurately control the pupil movements of a virtual puppet, and lends liveliness and energy to it. The proposed approach runs at over 50 FPS on modern phones, and enables its usage in any real-time puppeteering pipeline.
研究动机与目标
- 在移动设备上实现从单目视频中实时、准确地追踪瞳孔。
- 解决因瞳孔运动静态或缺失而导致的虚拟角色表现力不足的问题。
- 开发一种免校准的端到端流程,可与现有面部网格模型集成。
- 在消费级移动硬件上使用轻量级模型实现50 FPS以上的实时性能。
- 通过从检测到的特征点估算混合形状,实现自然、动态的虚拟木偶眼部运动。
提出的方法
- 一个小型高效神经网络处理来自面部网格预测的裁剪后64×64眼区图像,以检测5个关键2D眼点:瞳孔中心和4个外虹膜点。
- 通过替换x,y坐标(同时保留z深度)将检测到的特征点与原始面部网格融合,将网格扩展至478个顶点。
- 基于位移的方法通过比较当前顶点距离与经验得出的中性状态和激活状态(对应四个瞳孔方向:内、外、上、下),计算混合形状系数。
- 使用循环缓冲区中的可信测量值动态校准位移阈值,实时标准分数滤波器可适应个体用户差异。
- 后处理包括平滑处理和双眼耦合,以减少抖动并确保视觉上令人愉悦且稳定的眼部动画。
- 该流程通过使用TensorFlow Lite并借助MediaPipe实现GPU加速,在移动设备上高效运行。
实验结果
研究问题
- RQ1是否可以在不使用外部传感器或校准的情况下,仅通过单目视频在移动设备上实现实时、准确的瞳孔追踪?
- RQ2如何将瞳孔运动映射为可用于虚拟木偶动画的有意义的混合形状系数?
- RQ3在移动设备上部署时,模型精度、推理速度和内存占用之间应如何实现最佳平衡?
- RQ4如何在不预先校准的情况下,实时补偿个体用户眼部几何结构的差异?
- RQ5能否构建一个轻量级、端到端的系统,无缝集成到现有的面部网格处理流程中,以实现实时木偶操控?
主要发现
- 在保留测试集上,模型的平均绝对距离归一化为瞳孔间距(MAD IED)为7.16%,优于基线人工标注误差(困难情况为7.04%)。
- 该系统在现代智能手机上运行速度超过50 FPS,iPhone X上眼区精化网络的推理时间最低可达2.6ms。
- 实时标准分数滤波器成功适应了个体用户差异,如图3所示,随时间推移稳定了位移阈值。
- 通过后处理和双眼耦合,该方法实现了平滑、无抖动的眼部动画,显著提升了视觉真实感。
- 该方法可泛化至任意面部网格处理流程,无需个体校准或深度传感器。
- 最终流程支持实时木偶操控,实现逼真的瞳孔动态效果,如图1所示的虚拟角色渲染结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。