Skip to main content
QUICK REVIEW

[논문 리뷰] Live Face De-Identification in Video

Oran Gafni, Lior Wolf|arXiv (Cornell University)|2019. 11. 19.
Face recognition and analysis참고 문헌 48인용 수 4
한 줄 요약

이 논문은 사전 훈련된 얼굴 인식 네트워크의 특징을 조건으로 삼고, 새로운 유도-반발(perceptual loss)을 사용하여 정신적 일관성을 유지하면서도 정체성을 완전히 분리하는, 실시간 라이브 비디오 탈식별을 위한 새로운 피드포워드 인코더-디코더 네트워크를 제안한다. 이는 재학습 없이도 고해상도, 잡음 없는 비디오 수정을 가능하게 하며, 정체성에 관계없이 자세, 표정, 조명 및 외형을 유지한다. 이는 실시간으로 정체성을 파괴하는 얼굴 변환을 가능하게 하며, 재학습 없이도 성능을 확보한다.

ABSTRACT

We propose a method for face de-identification that enables fully automatic video modification at high frame rates. The goal is to maximally decorrelate the identity, while having the perception (pose, illumination and expression) fixed. We achieve this by a novel feed-forward encoder-decoder network architecture that is conditioned on the high-level representation of a person's facial image. The network is global, in the sense that it does not need to be retrained for a given video or for a given identity, and it creates natural looking image sequences with little distortion in time.

연구 동기 및 목표

  • 자기주도적이고 실시간으로 비디오 탈식별을 가능하게 하여 자세, 표정, 조명과 같은 정체성 외 속성을 유지한다.
  • 프레임 간 인지 일관성을 유지하는 비디오 기반 탈식별 방법의 부족을 해결한다.
  • 기존 데이터셋의 얼굴로 교체하는 것이 아니라, 새로운 자연스러운 얼굴을 새로 생성한다.
  • 최신 기술의 얼굴 인식 모델이 탈식별된 주체를 식별하지 못하도록 보장한다.
  • 재학습 없이 다양한 자세, 조명, 가림, 얼굴 구조에 대해 강건한 방법을 개발한다.

제안 방법

  • 사전 훈련된 얼굴 인식 네트워크의 고수준 표현을 조건으로 삼는 피드포워드 인코더-디코더 아키텍처.
  • 정체성에 관계없이 생성을 유도하기 위해 얼굴 인식 네트워크의 특징를 잠재공간에 통합함으로써 재학습 없이도 성능을 유지.
  • 낮은/중간 수준의 특징(프레임 일관성 유지용)과 높은 수준의 특징(정체성 거리 유도용)을 구분하는 새로운 유도-반발 인지 손실.
  • 정확한 혼합 및 재구성 가능성을 위해 동시에 얼굴 이미지와 세그멘테이션 마스크를 출력.
  • 재구성 손실, 에지 손실, adversarial 손실 및 의미적 데이터 증강 기법을 사용하여 구조적 의미를 유지하면서 훈련.
  • λ를 통해 정체성 거리 유도 강도를 조절함으로써 인지 일관성 유지와 동시에 최적화 가능.

실험 결과

연구 질문

  • RQ1재학습 없이도 실시간 비디오에서 높은 품질의 정체성 파괴 얼굴을 생성하면서 자세, 표정, 조명을 유지할 수 있는가?
  • RQ2정체성 탈식별 과정에서 비디오 프레임 간 인지 일관성을 어떻게 유지할 수 있는가?
  • RQ3사전 훈련된 얼굴 분류기의 학습된 표현을 얼마나 효과적으로 정체성 파괴 생성을 유도하는 데 사용할 수 있는가?
  • RQ4제안된 유도-반발 인지 손실은 정체성 거리 유도를 향상시키면서도 시각적 잡음을 최소화하는 데 어떤 기여를 하는가?
  • RQ5모델은 미세조정 없이 다양한 정체성, 자세, 조명 조건에 대해 일반화 가능한가?

주요 결과

  • 모델은 프레임 간 시간적 번짐과 왜곡을 최소화하여 일관된 자세, 표정, 조명을 유지하는 비디오 시퀀스를 생성한다.
  • 최신 기술의 얼굴 인식 모델이 탈식별된 주체를 식별하지 못함으로써 효과적인 정체성 탈식별이 이루어졌음을 확인한다.
  • 인간 관찰자조차도 장시간 관찰해도 탈식별된 얼굴을 식별하지 못함으로써 강력한 인지 익명성이 입증된다.
  • 이전 방법에서 자주 손상되는 입술 표정, 얼굴 털과 같은 저수준 및 중간 수준의 특징을 효과적으로 유지함으로써 이전 연구들보다 뛰어난 성능을 보인다.
  • 학습된 마스크의 사용으로 고해상도 얼굴 생성이 가능하며 정밀한 혼합이 가능하여 전체 신체 생성 방식에서 흔히 발생하는 잡음과의 갈등을 방지한다.
  • 제거 실험(ablation study) 결과, 유도-반발 손실이나 마스크 출력을 제거할 경우 눈에 띄는 잡음과 정체성 거리 유도가 떨어지는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.