Skip to main content
QUICK REVIEW

[논문 리뷰] Deepfake Video Detection with Spatiotemporal Dropout Transformer

Daichi Zhang, Fanzhao Lin|arXiv (Cornell University)|2022. 07. 14.
Digital Media Forensic Detection인용 수 4
한 줄 요약

이 논문은 얼굴 영상 프레임을 겹치지 않는 패치의 집합으로 재구성하고, 이를 Vision Transformer (ViT)에 입력하여 강력한 표현 학습을 수행하는 패치 수준의 딥페이크 영상 검출 프레임워크인 Spatiotemporal Dropout Transformer (STD-Former)를 제안한다. 랜덤 프레임 및 패치 제거를 적용하는 새로운 스파atiotemporal 드롭아웃 연산을 통해 가짜 영상의 동적 스파atiotemporal 불일치를 활용함으로써 모델의 일반화 능력과 강건성을 향상시켜, 다양한 벤치마크에서 기존 ViT 기반 모델 대비 평균 정확도 11.15% 향상된 최신 기술 수준의 성능을 달성한다.

ABSTRACT

While the abuse of deepfake technology has caused serious concerns recently, how to detect deepfake videos is still a challenge due to the high photo-realistic synthesis of each frame. Existing image-level approaches often focus on single frame and ignore the spatiotemporal cues hidden in deepfake videos, resulting in poor generalization and robustness. The key of a video-level detector is to fully exploit the spatiotemporal inconsistency distributed in local facial regions across different frames in deepfake videos. Inspired by that, this paper proposes a simple yet effective patch-level approach to facilitate deepfake video detection via spatiotemporal dropout transformer. The approach reorganizes each input video into bag of patches that is then fed into a vision transformer to achieve robust representation. Specifically, a spatiotemporal dropout operation is proposed to fully explore patch-level spatiotemporal cues and serve as effective data augmentation to further enhance model's robustness and generalization ability. The operation is flexible and can be easily plugged into existing vision transformers. Extensive experiments demonstrate the effectiveness of our approach against 25 state-of-the-arts with impressive robustness, generalizability, and representation ability.

연구 동기 및 목표

  • 시간적 정보를 忽略하고 다양한 딥페이크 생성 기법에 대해 일반화 실패를 보이는 이미지 수준의 딥페이크 검출 방법의 한계를 해결하기 위해.
  • 가짜 영상에서 나타나는 국소적인 얼굴 영역의 스파atiotemporal 불일치를 활용하여, 영상 입력을 패치 수준의 표현으로 재구성함으로써 이들의 특징을 탐지하기 위해.
  • ViT 기반 모델의 효과적인 데이터 증강과 특징 학습 향상을 위해 유연하고 플러그인 방식의 스파atiotemporal 드롭아웃 (STD) 메커니즘을 설계하기 위해.
  • 다양한 딥페이크 데이터셋과 생성 기법에 걸쳐 뛰어난 검출 성능를 달성하고, 미리 보지 못한 생성 방법에 대해 강건성과 일반화 능력을 확보하기 위해.

제안 방법

  • 입력 영상에서 먼저 얼굴 프레임 시퀀스를 추출하고, 각 프레임을 겹치지 않는 격자 기반의 얼굴 패치로 분할하여 패치의 집합을 구성한다.
  • 패치의 집합을 Vision Transformer (ViT)에 입력하여 프레임과 패치 간의 스파atiotemporal 신호를 구분 가능한 강력한 표현으로 학습한다.
  • 스파atiotemporal 드롭아웃 (STD) 연산을 도입한다: 먼저 시간적 드롭아웃이 프레임 시퀀스에서 랜덤으로 프레임을 제거하고, 이후 공간적 드롭아웃이 남은 프레임의 패치를 랜덤으로 제거한다.
  • 결과적으로 축소된 패치의 집합은 전체 얼굴 영역을 유지하면서도 시간에 따라 국소 영역의 불일치를 드러내어 딥페이크 아티팩트에 대한 모델의 민감도를 향상시킨다.
  • STD의 랜덤성은 각 영상에 대해 다양한 훈련 인스턴스를 생성하여 효과적인 데이터 증강 기법이 되어 일반화 능력과 강건성을 향상시킨다.
  • STD 연산은 아키텍처에 종속되지 않으며 기존의 Vision Transformer 모델에 원활하게 통합될 수 있다.

실험 결과

연구 질문

  • RQ1프레임 수준 분석을 초월하여 프레임 간 패치 수준의 스파atiotemporal 불일치를 모델링하는 것이 딥페이크 영상 검출 성능 향상에 기여하는가?
  • RQ2스파atiotemporal 드롭아웃 메커니즘이 딥페이크 검출에서 모델의 강건성과 일반화 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3제안된 STD-Former 프레임워크는 다양한 딥페이크 데이터셋과 생성 기법에서 최신 기술 수준의 방법들을 초월하는가?
  • RQ4시간적 및 공간적 드롭아웃 비율과 같은 하이퍼파라미터가 검출 성능에 미치는 영향은 어떠한가?
  • RQ5STD 연산은 다양한 ViT 아키텍처에 걸쳐 얼마나 일반화 가능한가?

주요 결과

  • 제안된 스파atiotemporal 드롭아웃 (S+T) 변형이 가장 높은 성능를 기록하였으며, 공간 또는 시간 드롭아웃만을 적용한 변형 대비 정확도와 AUC가 향상되어 복합적인 스파atiotemporal 모델링의 必要성을 입증하였다.
  • 최적의 드롭아웃 비율은 α = 1/4 (시간적 드롭아웃 비율) 및 β′ = 1/18 (공간적 드롭아웃 비율)로 확인되었으며, 비율이 너무 높거나 너무 낮을 경우 성능 저하가 발생하였다.
  • Celeb-DF(v2) 데이터셋에서 STD-Former는 ViT-B16, ViT-B32, ViT-L16, ViT-L32의 네 가지 ViT 백본에 대해 기준 모델 대비 평균 정확도 11.15% 향상되고 AUC는 7.76% 향상되었다.
  • 25개의 벤치마크에서 최신 기술 수준의 성능를 달성하여 다양한 딥페이크 생성 방법에 대해 강력한 일반화 및 강건성을 입증하였다.
  • 제거 실험을 통해 STD 연산이 모델의 강건성과 일반화 능력을 크게 향상시키며, 다양한 ViT 아키텍처와 네트워크 설계에서 일관된 성능 향상을 확인하였다.
  • 동일한 드롭아웃 변형을 사용할 때도 강력한 베이스라인(TD-3DCNN)을 능가하는 성능를 기록하여 제안된 STD 메커니즘의 효과성을 추가로 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.