Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Spatial-Temporal Features for Deepfake Detection and Localization

Wu Haiwei, Jiantao Zhou|arXiv (Cornell University)|2022. 10. 28.
Digital Media Forensic Detection인용 수 7
한 줄 요약

이 논문은 공간-시간 특징을 활용하는 ST-DDL를 제안하며, 새로운 앵커 메시 운동(AMM) 알고리즘을 통해 정밀한 얼굴 미세표정 운동 특징을 추출하고, 트랜스포머 기반 융합 주의(FA) 모듈을 통해 공간 특징과 융합한다. 이는 비디오 수준 및 픽셀 수준 검출에서 최신 기술 수준(SOTA) 성능을 달성하며, 새로운 공개 데이터셋에서 97.7% AUC를 기록하고, OSN 전송 영향에 대해 뛰어난 내성성을 보여준다.

ABSTRACT

With the continuous research on Deepfake forensics, recent studies have attempted to provide the fine-grained localization of forgeries, in addition to the coarse classification at the video-level. However, the detection and localization performance of existing Deepfake forensic methods still have plenty of room for further improvement. In this work, we propose a Spatial-Temporal Deepfake Detection and Localization (ST-DDL) network that simultaneously explores spatial and temporal features for detecting and localizing forged regions. Specifically, we design a new Anchor-Mesh Motion (AMM) algorithm to extract temporal (motion) features by modeling the precise geometric movements of the facial micro-expression. Compared with traditional motion extraction methods (e.g., optical flow) designed to simulate large-moving objects, our proposed AMM could better capture the small-displacement facial features. The temporal features and the spatial features are then fused in a Fusion Attention (FA) module based on a Transformer architecture for the eventual Deepfake forensic tasks. The superiority of our ST-DDL network is verified by experimental comparisons with several state-of-the-art competitors, in terms of both video- and pixel-level detection and localization performance. Furthermore, to impel the future development of Deepfake forensics, we build a public forgery dataset consisting of 6000 videos, with many new features such as using widely-used commercial software (e.g., After Effects) for the production, providing online social networks transmitted versions, and splicing multi-source videos. The source code and dataset are available at https://github.com/HighwayWu/ST-DDL.

연구 동기 및 목표

  • 공간 및 시간 특징을 공동으로 모델링하여 딥페이크 검출 및 국소화 성능을 향상시키기 위해.
  • 기존 운동 추정 방법이 딥페이크 영상에서 미세한 얼굴 미세표정을 포착하는 데 한계를 가진 문제를 해결하기 위해.
  • 실제 OSN 전송 조건에서 성능이 유지되는 강력한 포렌식 시스템을 개발하기 위해.
  • 실제로 사회적 방식으로 확산되는 딥페이크 영상이 포함된 새로운 다양성 있는 공개 위조 데이터셋을 공개하여 분야 발전을 이끌기 위해.

제안 방법

  • 얼굴 랜드마크를 앵커로 삼고 인접 프레임 간 기하학적 매핑을 추정함으로써 얼굴 운동을 모델링하는 새로운 앵커 메시 운동(AMM) 알고리즘을 제안한다.
  • 기존의 옵티컬 플로우나 RAFT와 같은 딥러닝 기반 운동 추정기보다 작은 이동량의 얼굴 운동을 더 정확하게 캡처하기 위해 메시 기반 격자 시스템을 사용한다.
  • 공간적 및 시간적 특징을 동적으로 주의하고 융합하기 위해 트랜스포머 아키텍처 기반의 융합 주의(FA) 모듈을 도입한다.
  • RGB 공간적 특징을 위한 브랜치와 AMM에서 유도된 운동 특징을 위한 브랜치를 갖춘 이중 브랜치 인코더를 사용하며, FA 모듈을 통해 특징 융합을 수행한다.
  • 분류 및 국소화 작업을 위한 교차 엔트로피 및 IoU 기반 손실 함수를 사용하여 ST-DDL 네트워크를 엔드 투 엔드로 훈련한다.
  • 상용 도구(예: After Effects)를 사용해 생성한 6,000개의 영상, OSN 전송된 버전, 다중 소스가 혼합된 콘텐츠를 포함하는 새로운 공개 데이터셋인 ManualFake를 구축한다.

실험 결과

연구 질문

  • RQ1특히 얼굴 미세표정에 최적화된 운동 추정 방법이 일반 목적의 옵티컬 플로우보다 딥페이크 포렌식에서 성능이 뛰어나게 되는가?
  • RQ2자기 주의 메커니즘을 통해 공간적 및 시간적 특징을 융합하는 것이 미세한 위조 국소화에 얼마나 효과적인가?
  • RQ3딥페이크 영상이 Facebook, WhatsApp 등의 손실성 OSN을 통해 전송될 경우, 제안된 방법이 성능을 얼마나 유지하는가?
  • RQ4사회적 방식으로 확산되고 다중 소스가 혼합된 위조 영상이 포함된 새로운 현실적인 데이터셋이 포렌식 모델의 내성성 평가에 더 효과적인가?

주요 결과

  • ST-DDL 모델은 새로운 ManualFake 데이터셋에서 픽셀 수준 국소화에서 97.7% AUC를 달성하며, 기존 최신 기술 수준 방법들을 크게 능가한다.
  • AMM 알고리즘은 RAFT나 Farneback보다 더 구분력 있는 운동 특징을 제공하며, RAFT 대비 6.8% AUC 향상과 단순 연결 기반 기준 대비 평균 3.1% 향상을 기록한다.
  • 융합 주의(FA) 모듈은 단순 컨볼루션 연결 대비 평균 3.1% 향상으로 특징 상호작용에서의 효과성을 입증한다.
  • 모델은 OSN 전송 영상에서도 뛰어난 내성성을 유지하며, 더 높은 비트레이트와 적은 손실 연산을 가지는 WhatsApp에서 가장 높은 성능을 기록한다.
  • 제거 분석 결과 FA를 통한 공간적 및 시간적 특징 융합이 최고의 성능을 내며, RGB 전용 및 운동 전용 변형은 성능이 열 劣하다.
  • 상용 소프트웨어로 제작되고 OSN 전송된 영상이 포함된 새로운 ManualFake 데이터셋은 포렌식 모델의 현실적 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.