[论文解读] GazeDirector: Fully Articulated Eye Gaze Redirection in Video
GazeDirector 提出了一种基于 3D 模型的方法,用于在视频中实现与个体无关的眼部注视重定向,通过分析-合成方法拟合多部件眼区模型,并实现注视目标的完整 3D 重构。该方法通过模型导出的光流场对上眼睑进行形变,再与合成的 3D 眼球图像进行合成,从而实现逼真的视觉效果,在准确性和视觉质量方面优于以往仅使用形变的方法,尤其在大角度注视重定向时表现更优。
Abstract We present GazeDirector, a new approach for eye gaze redirection that uses model‐fitting. Our method first tracks the eyes by fitting a multi‐part eye region model to video frames using analysis‐by‐synthesis, thereby recovering eye region shape, texture, pose, and gaze simultaneously. It then redirects gaze by 1) warping the eyelids from the original image using a model‐derived flow field, and 2) rendering and compositing synthesized 3D eyeballs onto the output image in a photorealistic manner. GazeDirector allows us to change where people are looking without person‐specific training data, and with full articulation, i.e. we can precisely specify new gaze directions in 3D. Quantitatively, we evaluate both model‐fitting and gaze synthesis, with experiments for gaze estimation and redirection on the Columbia gaze dataset. Qualitatively, we compare GazeDirector against recent work on gaze redirection, showing better results especially for large redirection angles. Finally, we demonstrate gaze redirection on YouTube videos by introducing new 3D gaze targets and by manipulating visual behavior.
研究动机与目标
- 在无需用户校准或用户特定训练数据的前提下,实现视频中与个体无关的注视重定向。
- 允许精确指定新的 3D 注视方向,克服以往基于光流方法存在的角度偏移限制。
- 提升注视重定向的视觉质量并减少伪影,尤其在大角度重定向时表现更优。
- 在包含不同光照、姿态和眼部外观的现实世界 YouTube 视频中展示实际应用潜力。
提出的方法
- 通过分析-合成方法拟合 3D 可变形眼区模型,从视频帧中联合恢复形状、纹理、姿态、注视方向与光照信息。
- 利用 GPU 加速的光栅化技术,从稀疏的顶点位移中计算密集的光流场,以建模眼睑形变。
- 将光流场应用于输入图像中的眼睑形变,确保在注视重定向过程中保持面部结构完整性。
- 利用拟合后的 3D 眼部模型,合成并合成逼真的 3D 眼球图像,叠加至输出图像中。
- 采用二阶优化策略加速模型拟合过程中的收敛,提升效率与精度。
- 在 Unity 中使用物理仿真与程序化编程定义 3D 注视目标,以支持现实世界视频应用。
实验结果
研究问题
- RQ1基于 3D 模型的方法是否能在无需个体特定训练数据的前提下,实现准确且逼真的注视重定向?
- RQ2与基于光流场的方法相比,基于模型的注视重定向在视觉质量与伪影抑制方面表现如何,尤其是在大角度注视重定向时?
- RQ3所提出的方法是否能在多样的现实世界视频条件下(包括不同头部姿态与光照)实现鲁棒的注视估计与重定向?
- RQ4与仅使用单一组件相比,同时引入眼睑形变与眼球图像合成在整体重定向质量提升方面有多大贡献?
主要发现
- 在哥伦比亚注视数据集上,GazeDirector 的注视估计误差为:偏航方向 3.13°,俯仰方向 6.92°,在偏航方向上优于以往方法,同时保持了数据集无关的性能。
- 由于采用二阶优化,尽管每次迭代的计算量相似,模型拟合过程收敛更快且误差更低,优于一阶方法。
- 随着模型拟合迭代次数的增加,图像重建误差与注视估计误差均持续下降,证实了分析-合成策略的有效性。
- 与无重定向相比,同时加入眼球与眼睑重定向可使图像差异误差降低 20%,完整处理流程达到最低误差(见图 13)。
- GazeDirector 在包含多样眼部外观、头部姿态与光照条件的 YouTube 视频中成功实现了注视重定向,展示了在真实环境中的鲁棒性。
- 在消费级台式机上,模型拟合的运行速度为 11.6–12.5 fps,注视重定向速度达 80 fps,实现了接近实时的处理性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。