Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Face Forgery Detection

Nika Dogonadze, Jana Obernosterer|arXiv (Cornell University)|2020. 04. 06.
Digital Media Forensic Detection참고 문헌 9인용 수 8
한 줄 요약

이 논문은 얼굴 인식에서의 전이 학습과 다중 프레임 분석을 통한 시간적 모델링을 활용하여 얼굴 영상 위조를 탐지하기 위한 딥러닝 접근법을 제안한다. VGGFace2에서 사전 훈련된 Inception ResNet V1 모델을 미세조정하고, 3D-CNN 및 Bi-LSTM 아키텍처를 통해 인접 프레임을 활용함으로써, FaceForensics++ 벤치마크에서 최신 기술 수준의 정확도를 달성하며, 특히 압축된 NeuralTextures 위조 영상에 대해 뛰어난 성능을 발휘한다.

ABSTRACT

Rapid progress in deep learning is continuously making it easier and cheaper to generate video forgeries. Hence, it becomes very important to have a reliable way of detecting these forgeries. This paper describes such an approach for various tampering scenarios. The problem is modelled as a per-frame binary classification task. We propose to use transfer learning from face recognition task to improve tampering detection on many different facial manipulation scenarios. Furthermore, in low resolution settings, where single frame detection performs poorly, we try to make use of neighboring frames for middle frame classification. We evaluate both approaches on the public FaceForensics benchmark, achieving state of the art accuracy.

연구 동기 및 목표

  • FaceSwap, DeepFakes, Face2Face, NeuralTextures를 포함한 다양한 위조 방법에 대해 얼굴 영상 위조 탐지 정확도를 향상시키는 것.
  • 특히 NeuralTextures에 의해 생성된 영상처럼 인간과 모델 모두가 탐지하기 어려운 고압축 영상에서의 위조 탐지 과제를 해결하는 것.
  • 저데이터 또는 새로운 위조 방법에 대해 일반화 능력과 성능을 향상시키기 위해 얼굴 인식에서의 전이 학습을 활용하는 것.
  • 연속된 다수의 프레임을 모델링하여 영상 시퀀스의 시간적 일관성을 활용함으로써, 단일 프레임 분석을 초월한 프레임별 분류 성능을 향상시키는 것.

제안 방법

  • VGGFace2 얼굴 인식 데이터셋에서 사전 훈련된 Inception ResNet V1 모델을 사용하여, 위조 탐지에 적합한 특징 학습을 향상시키기 위해 미세조정을 적용한다.
  • 단일 프레임 분류에는 MTCNN를 사용해 얼굴를 잘라낸 프레임를 활용한 수정된 Inception ResNet V1 아키텍처를 사용하며, 원래의 dlib 기반 얼굴 검출기 대신 사용한다.
  • 시간적 모델링을 위해 3D-컨volutional 신경망(3D-CNN)을 사용하며, 공유된 가중치를 가진 2D CNN 인코더에서 유도된 특징 맵을 연속된 프레임의 스택으로 3D 입력을 구성한다.
  • 3D-CNN의 대안으로 2D CNN 인코더를 갖춘 Bi-LSTM 모델도 평가하였으며, 더 적은 파라미터로 유사한 성능을 달성하였다.
  • 다중 프레임 분류에는 7개 프레임(중간 프레임 이전 3개, 이후 3개, 중간 프레임)의 윈도우를 사용하며, 중간 프레임은 앙상블 또는 시퀀스 모델링을 통해 분류한다.
  • 모델은 Tesla V100 GPU에서 Adam 옵timizer를 사용해 훈련하였으며, 훈련 중 데이터 증강 및 클래스 균형 조정을 적용하였다.

실험 결과

연구 질문

  • RQ1얼굴 인식 사전 훈련 작업에서의 전이 학습이 다양한 위조 방법에 걸쳐 얼굴 위조 탐지 성능을 크게 향상시키는가?
  • RQ2인접 프레임에서의 시간적 맥락을 통합함으로써, 저해상도 또는 고압축 영상 환경에서의 탐지 정확도가 향상되는가?
  • RQ33D-CNN과 Bi-LSTM 아키텍처가 위조 탐지에 있어 순차적 프레임 의존성을 모델링할 때 성능가 비교해보면 어떻게 되는가?
  • RQ4단지 NeuralTextures로만 훈련된 모델이 다른 위조 방법과 압축 수준으로 일반화되는 정도는 어느 정도인가?
  • RQ5시간적 모델링이 고압축(예: c40) 상태의 NeuralTextures와 같은 어려운 케이스에서 미세한 잔여 무결성의 존재를 탐지하는 데 도움이 되는가?

주요 결과

  • 제안된 방법은 FaceForensics++ 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 전체 정확도와 어려운 NeuralTextures 위조 영상 탐지에서 이전 방법들을 능가하였다.
  • VGGFace2에서 미세조정한 Inception ResNet V1 모델은 NeuralTextures 대 비정상 영상 시퀀스에 대해 c40 압축 수준에서 테스트 정확도 77.7%를 기록하였으며, 베이스라인 및 3D-CNN 모델을 모두 초월하였다.
  • 2D CNN 인코더를 갖춘 Bi-LSTM를 사용할 경우, 3D-CNN 모델과 동일한 평균 정확도 77.7%를 달성하였지만, 훨씬 적은 파라미터를 사용하여 효율성 향상을 보였다.
  • c40에서 NeuralTextures 전용으로 훈련된 모델는 동일한 압축 수준에서 75.3%의 정확도를 기록하였지만, 다른 위조 방법, 특히 FaceSwap과 DeepFakes에 대해 일반화 성능이 떨어졌다.
  • c40에서의 성능은 c23 또는 원본 압축 수준보다 열 劣하였으며, 고압축이 탐지 성능을 떨어뜨리는 것으로 나타났지만, 여전히 이 범주에서 베이스라인을 능가하였다.
  • 3D-CNN 및 Bi-LSTM 모델 모두 다수 투표 기반 베이스라인을 초월하였으며, 이는 시간적 모델링이 독립된 프레임 분류를 초월한 유용한 패턴을 포착하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.