Skip to main content
QUICK REVIEW

[论文解读] Live Face De-Identification in Video

Oran Gafni, Lior Wolf|arXiv (Cornell University)|Nov 19, 2019
Face recognition and analysis参考文献 48被引用 4
一句话总结

本文提出了一种新颖的前馈编码器-解码器网络,用于实时视频去标识化,可在完全解耦身份的同时保留姿态、表情、光照和与身份无关的外观特征。通过基于预训练人脸识别网络特征的条件控制,结合一种新颖的吸引子-排斥子感知损失,该方法实现了高保真、无伪影的视频修改,支持实时、无需微调的身份破坏性人脸转换。

ABSTRACT

We propose a method for face de-identification that enables fully automatic video modification at high frame rates. The goal is to maximally decorrelate the identity, while having the perception (pose, illumination and expression) fixed. We achieve this by a novel feed-forward encoder-decoder network architecture that is conditioned on the high-level representation of a person's facial image. The network is global, in the sense that it does not need to be retrained for a given video or for a given identity, and it creates natural looking image sequences with little distortion in time.

研究动机与目标

  • 实现完全自动、实时的视频去标识化,同时保留姿态、表情和光照等非身份属性。
  • 解决缺乏能够保持帧间感知一致性的视频去标识化方法的问题。
  • 从零生成全新、自然的人脸,而非替换为数据集中已有的人脸。
  • 确保最先进的人脸识别模型无法识别去标识化后的目标。
  • 开发一种无需微调即可鲁棒应对多样化姿态、光照、遮挡和面部结构的方法。

提出的方法

  • 一种前馈编码器-解码器架构,基于预训练人脸识别网络的高层特征进行条件控制。
  • 将人脸识别网络特征注入潜在空间,以引导与身份无关的生成,且无需微调。
  • 一种新颖的吸引子-排斥子感知损失,用于区分低/中层特征(以保持帧间一致性)与高层特征(以实现身份分离)。
  • 同时输出人脸图像和语义分割掩码,以实现精确的融合与重建。
  • 通过重建损失、边缘损失、对抗性损失以及一种语义数据增强技术进行训练,以保持结构语义。
  • 通过超参数 λ 控制身份分离强度,同时保持感知保真度。

实验结果

研究问题

  • RQ1单一模型是否能在不微调的情况下实现实时视频中高质量、身份破坏性人脸的生成,同时保留姿态、表情和光照?
  • RQ2在去标识化过程中,如何保持视频帧之间的感知一致性?
  • RQ3预训练人脸识别分类器的可学习表征在引导身份破坏性生成方面能发挥多大作用?
  • RQ4所提出的吸引子-排斥子感知损失在实现身份分离的同时,如何减少视觉伪影?
  • RQ5该方法是否能在无需微调的情况下泛化至多样化身份、姿态和光照条件?

主要发现

  • 该方法生成的视频序列具有极少的时间闪烁和失真,帧间姿态、表情和光照保持一致。
  • 最先进的人脸识别模型无法识别去标识化后的目标,证实了有效的身份去标识化。
  • 即使经过长时间观察,人类观察者也无法识别去标识化后的人脸,表明具有强大的感知匿名性。
  • 与先前方法相比,该方法在保留低级和中级特征(如嘴部表情和面部毛发)方面表现更优,这些特征在以往方法中常被扭曲。
  • 使用可学习的掩码实现了高分辨率人脸生成,实现精确融合,避免了全图生成方法中常见的伪影。
  • 消融实验表明,若移除关键组件(如吸引子-排斥子损失或掩码输出),将导致明显伪影并降低身份分离效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。