[论文解读] FAB: A Robust Facial Landmark Detection Framework for Motion-Blurred Videos
本文提出FAB,一种针对运动模糊视频的鲁棒人脸关键点检测框架,通过利用时间结构一致性来迭代提升去模糊和关键点检测效果。通过使用结构预测器从先前帧中估计人脸边缘,FAB实现了良性循环:去模糊图像产生更优的关键点,而关键点又进一步优化未来的结构预测,从而在Blurred-300VW和RWMB数据集上达到最先进性能。
Recently, facial landmark detection algorithms have achieved remarkable performance on static images. However, these algorithms are neither accurate nor stable in motion-blurred videos. The missing of structure information makes it difficult for state-of-the-art facial landmark detection algorithms to yield good results. In this paper, we propose a framework named FAB that takes advantage of structure consistency in the temporal dimension for facial landmark detection in motion-blurred videos. A structure predictor is proposed to predict the missing face structural information temporally, which serves as a geometry prior. This allows our framework to work as a virtuous circle. On one hand, the geometry prior helps our structure-aware deblurring network generates high quality deblurred images which lead to better landmark detection results. On the other hand, better landmark detection results help structure predictor generate better geometry prior for the next frame. Moreover, it is a flexible video-based framework that can incorporate any static image-based methods to provide a performance boost on video datasets. Extensive experiments on Blurred-300VW, the proposed Real-world Motion Blur (RWMB) datasets and 300VW demonstrate the superior performance to the state-of-the-art methods. Datasets and models will be publicly available at https://keqiangsun.github.io/projects/FAB/FAB.html.
研究动机与目标
- 解决在运动模糊视频中因结构细节缺失而导致的人脸关键点检测不准确问题。
- 通过利用人脸结构的时间一致性,克服去模糊与关键点检测之间的'先有鸡还是先有蛋'困境。
- 开发一种灵活的基于视频的框架,将任何静态图像关键点检测器增强为具备去模糊和结构预测能力。
- 提出两个新的基准数据集——Blurred-300VW和真实世界运动模糊(RWMB),以更有效地评估运动模糊视频数据上的性能。
- 通过交替微调策略实现端到端训练,以优化框架中相互依赖的各个组件。
提出的方法
- 提出一种结构预测器,利用从前两帧的边界图进行光流外推,来估计当前帧的人脸边缘。
- 使用边界感知的去模糊网络,将预测的人脸边缘与输入的模糊帧融合,生成清晰图像。
- 集成一个可替换的人脸关键点检测网络,作用于去模糊后的输出,支持与最先进模型的即插即用兼容。
- 建立反馈回路:当前帧的关键点预测结果用于优化下一帧的结构预测器。
- 采用变形块对先前帧进行基于预测光流的对齐,以实现结构估计的时间一致性。
- 应用交替微调策略,在各自预训练后联合优化结构预测器、去模糊网络和关键点检测器。
实验结果
研究问题
- RQ1能否利用人脸结构的时间一致性来提升运动模糊视频中关键点检测的性能?
- RQ2基于前一帧光流外推的结构预测器,在为去模糊提供几何先验方面有多有效?
- RQ3与独立方法相比,去模糊与关键点检测之间的反馈回路是否能显著提升性能?
- RQ4FAB框架在应用于视频数据时,能多大程度上增强现有最先进静态图像关键点检测器的性能?
- RQ5所提出的Blurred-300VW和RWMB数据集与现有基准相比,在评估人脸关键点检测对运动模糊的鲁棒性方面有何优势?
主要发现
- FAB框架在Blurred-300VW挑战性子集上实现了7.54%的归一化平均误差(NME),显著优于基线方法(14.91%)和最先进去模糊+检测流水线。
- 基于时间光流外推的结构预测器,相较于使用预训练关键点检测器作为结构源,将NME降低了49.43%(以ResNet-18为骨干网络时)。
- 该框架显著提升了多种最先进关键点检测器的性能:FAN、SAN、RFLD和LAB的NME均有显著改善,其中RFLD的NME从41.24%降至20.07%。
- 结构感知的去模糊网络在PSNR和SSIM指标上均优于最先进去模糊方法,证明了所提几何先验的有效性。
- 交替微调策略带来了持续的性能提升,证实了对三个组件进行联合优化的优势。
- 所提出的RWMB和Blurred-300VW数据集为评估人脸关键点检测在运动模糊下的鲁棒性提供了更真实、更具挑战性的基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。