Skip to main content
QUICK REVIEW

[论文解读] Temporally coherent video anonymization through GAN inpainting

Thangapavithraa Balaji, Patrick Blies|arXiv (Cornell University)|Jun 4, 2021
Digital Media Forensic Detection参考文献 38被引用 4
一句话总结

本文提出 JaGAN,一种基于两阶段 GAN 的方法,用于实现时序一致的视频人脸匿名化,将检测到的人脸替换为人工生成的、身份不变的人脸。通过利用一个新型视频数据集并引入身份不变性(IdI)评分,该方法在无关键点人脸修复任务中实现了卓越的时序一致性和最先进的 FID 得分 1.97,显著减少了与基于图像的基线方法相比的闪烁和身份漂移现象。

ABSTRACT

This work tackles the problem of temporally coherent face anonymization in natural video streams.We propose JaGAN, a two-stage system starting with detecting and masking out faces with black image patches in all individual frames of the video. The second stage leverages a privacy-preserving Video Generative Adversarial Network designed to inpaint the missing image patches with artificially generated faces. Our initial experiments reveal that image based generative models are not capable of inpainting patches showing temporal coherent appearance across neighboring video frames. To address this issue we introduce a newly curated video collection, which is made publicly available for the research community along with this paper. We also introduce the Identity Invariance Score IdI as a means to quantify temporal coherency between neighboring frames.

研究动机与目标

  • 解决由于逐帧人脸修复导致的时序一致视频匿名化中的闪烁和身份不一致问题。
  • 开发一种隐私保护型视频 GAN,能够在不依赖面部关键点的情况下生成逼真且一致的人脸。
  • 引入一种新的评估指标——身份不变性(IdI)评分,以定量衡量生成人脸的时序一致性。
  • 发布一个大规模、公开可用的视频数据集,包含 400,000 个 30 帧序列,用于训练和评估基于视频的人脸匿名化模型。

提出的方法

  • 该方法首先使用人脸检测器在每一帧视频中检测并遮蔽人脸,用黑色方块替代。
  • 训练一种面向视频的 GAN,以在遮蔽区域生成保持帧间时序一致性的合成人脸。
  • 生成器以遮蔽输入为条件,并使用时空对抗损失,以确保相邻帧之间的一致性。
  • 通过计算连续帧之间 Facenet 嵌入的 L2 距离,并以真实帧间距离进行归一化,来计算身份不变性(IdI)评分,以考虑自然运动的影响。
  • 该模型在新整理的 400,000 个基于 YouTube 的视频序列数据集上进行训练和评估,所有数据均采用知识共享许可。
  • 该方法避免使用面部关键点,从而通过不保留任何原始面部特征或几何结构来确保隐私。

实验结果

研究问题

  • RQ1基于 GAN 的视频修复模型是否能够在不依赖面部关键点的情况下,生成跨视频序列的时序一致人脸?
  • RQ2如何以一种与人类感知相关联的方式,定量衡量生成人脸的时序一致性?
  • RQ3基于视频的 GAN 是否在保持身份不变性和视觉质量方面优于基于图像的 GAN?
  • RQ4所提出的 IdI 评分在多大程度上与生成视频帧的感知时序一致性相关?

主要发现

  • 所提出的 JaGAN 模型在无关键点人脸修复的 FDF 验证集上实现了最先进的 FID 得分 1.97,优于此前的 SOTA 得分 3.36。
  • 基于视频的模型减少了帧间身份漂移,IdI 得分为 0.48,优于基于图像的模型的 0.42。
  • 视频模型的 FVD 得分为 59,低于图像模型的 110,表明其在感知质量和时序一致性方面均有提升。
  • IdI 评分有效量化了时序一致性,真实人脸的 IdI 得分为 1.00,且视频模型在身份稳定性方面相比图像模型提升了 48%。
  • 新发布的 400,000 个视频序列数据集为训练和评估视频匿名化模型提供了多样化且公开可用的基准。
  • 视觉检查确认,该视频模型消除了基于图像的基线方法中存在的闪烁和形变现象,实现了更自然、更一致的人脸生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。