Skip to main content
QUICK REVIEW

[논문 리뷰] MINTIME: Multi-Identity Size-Invariant Video Deepfake Detection

Davide Alessandro Coccomini, Giorgos Kordopatis Zilos|arXiv (Cornell University)|2022. 11. 20.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

MINTIME는 개별 얼굴 시퀀스를 별도로 처리하는 정체성 인식 주의 메커니즘과 새로운 임bedding을 활용한 수정된 TimeSformer을 기반으로, 단일 순방향 전파 내에서 다수의 정체성과 다양한 얼굴 크기를 포함한 비디오에서 공간-시간 이상 징후를 탐지하는 딥페이크 검출 모델을 제안한다. 이는 다수의 정체성이 포함된 비디오에서 ForgeryNet에서 최고 성능을 기록하며, 최대 14% 향상된 AUC를 달성하고, 교차-파라지어 및 교차-데이터셋 설정에서 강력한 일반화 성능을 보여준다.

ABSTRACT

In this paper, we introduce MINTIME, a video deepfake detection approach that captures spatial and temporal anomalies and handles instances of multiple people in the same video and variations in face sizes. Previous approaches disregard such information either by using simple a-posteriori aggregation schemes, i.e., average or max operation, or using only one identity for the inference, i.e., the largest one. On the contrary, the proposed approach builds on a Spatio-Temporal TimeSformer combined with a Convolutional Neural Network backbone to capture spatio-temporal anomalies from the face sequences of multiple identities depicted in a video. This is achieved through an Identity-aware Attention mechanism that attends to each face sequence independently based on a masking operation and facilitates video-level aggregation. In addition, two novel embeddings are employed: (i) the Temporal Coherent Positional Embedding that encodes each face sequence's temporal information and (ii) the Size Embedding that encodes the size of the faces as a ratio to the video frame size. These extensions allow our system to adapt particularly well in the wild by learning how to aggregate information of multiple identities, which is usually disregarded by other methods in the literature. It achieves state-of-the-art results on the ForgeryNet dataset with an improvement of up to 14% AUC in videos containing multiple people and demonstrates ample generalization capabilities in cross-forgery and cross-dataset settings. The code is publicly available at https://github.com/davide-coccomini/MINTIME-Multi-Identity-size-iNvariant-TIMEsformer-for-Video-Deepfake-Detection.

연구 동기 및 목표

  • 다수의 정체성과 변동하는 얼굴 크기를 효과적으로 다룰 수 있는 딥페이크 검출 방법의 부족을 해결한다.
  • 프레임 단위 분류 및 단순 평균 또는 최대값 집계와 같은 비효율적인 집계 방식(예: 평균 또는 최대값)의 한계를 극복하여, 다수의 사람을 포함한 시나리오에서 성능 저하를 방지한다.
  • 공간적 및 시간적 맥락을 정체성 간 유지함으로써 실생활 '야외' 조건에서의 탐지 강건성을 향상시킨다.
  • 주의 기반 국소화를 통해 조작된 얼굴과 타임스탬프를 정밀하게 식별함으로써 세밀한 탐지 기능을 가능하게 한다.
  • 다양한 데이터에서의 엔드 투 엔드 훈련을 통해, 예측 불가능한 파라지어 기법과 데이터셋에 대한 모델 일반화 능력을 향상시킨다.

제안 방법

  • 정체성 인식 자기주의 주의를 갖춘 수정된 TimeSformer 백본을 도입하여, 교차 정체성 주의를 방지하기 위해 마스킹을 사용해 각 얼굴 시퀀스를 별도로 처리한다.
  • 각 얼굴 시퀀스 내의 시간 역동성을 인코딩하기 위해 시간에 따라 일관된 위치 임베딩을 적용하여 시간적 일관성을 유지한다.
  • 얼굴 영역의 비디오 프레임 크기 대비 비율을 인코딩하는 크기 임베딩을 통합하여 크기 불변 표현 학습을 가능하게 한다.
  • 모든 정체성을 동시에 처리하기 위해 단일 순방향 전파를 사용하여 후처리 집계가 필요 없고, 추론 오버헤드를 감소시킨다.
  • 집계된 시퀀스 표현에 대해 학습 가능한 비디오 수준의 분류 헤드를 적용하여 엔드 투 엔드 예측을 생성한다.
  • ForgeryNet 데이터셋에서 엔드 투 엔드 훈련을 수행하여 다양한 파라지어 기법과 데이터셋에 대한 일반화 능력을 확보한다.

실험 결과

연구 질문

  • RQ1후처리 집계에 의존하지 않고도, 다수의 정체성이 포함된 비디오에서 이상 징후를 효과적으로 탐지할 수 있는 딥페이크 검출 모델은 가능한가?
  • RQ2프레임 크기 대비 얼굴 크기를 상대적 비율로 인코딩함으로써 실생활 시나리오에서 탐지 강건성이 어떻게 향상되는가?
  • RQ3한 파라지어 데이터셋에서 훈련된 모델이 예측 불가능한 파라지어 기법과 데이터셋으로의 일반화 능력은 어느 정도인가?
  • RQ4주의 메커니즘을 활용하여 비디오 내 조작된 얼굴과 타임스탬프를 국소화할 수 있는가? 이는 설명 가능한 예측을 가능하게 하는가?
  • RQ5통합 아키텍처를 통해 시간적 및 공간적 이상 탐지 기능을 통합하면, 단순 집계 방식을 사용하는 프레임 단위 분류 방식보다 성능이 뛰어나지 않는가?

주요 결과

  • MINTIME는 다수의 정체성이 포함된 비디오에서 ForgeryNet 데이터셋에서 기존 최고 성능 모델 대비 최대 14% 향상된 AUC 성능을 기록한다.
  • 모델는 교차-파라지어 일반화 능력이 뛰어나, DFDC 데이터셋의 예측 불가능한 파라지어 기법에 대해 높은 성능을 유지한다.
  • DFDC 프리뷰 테스트 세트에서 MINTIME-XC는 FaceForensics++에서 훈련된 모델들보다도 뛰어난 AUC 77.92%를 기록한다.
  • 정성적 분석 결과, 주의 맵이 조작된 얼굴과 이상 징후가 있는 시간 간격을 성공적으로 국소화함을 확인하였으며, 이는 설명 가능한 탐지 기능을 제공한다.
  • 모델는 군중 장면이나 의류에서 유래한 잘못된 얼굴 검출과 같은 복잡한 시나리오를 효과적으로 처리하며, 조작된 개별 개인을 정확히 식별한다.
  • 정체성 인식 주의와 크기 인식 임베딩의 통합은 얼굴 크기와 정체성 수가 다양하게 변하는 야외 환경에서 성능 향상에 크게 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.