Skip to main content
QUICK REVIEW

[논문 리뷰] An Audio-Visual Attention Based Multimodal Network for Fake Talking Face Videos Detection

Ganglai Wang, Peng Zhang|arXiv (Cornell University)|2022. 03. 10.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 가짜 말하는 얼굴 영상 감지를 위해 음성과 시각적 특징을 융합하는 새로운 음성-시각 주의 메커니즘(AVAM)을 사용하는 다중모달 딥러닝 프레임워크인 FTFDNet을 제안한다. 인간의 다감각 인지에서 영감을 얻어 AVAM은 입술과 볼 부위에 주의를 집중함으로써 구분 능력 있는 특징 학습을 향상시키며, FTFDD 데이터셋에서 97.00%의 검출 정확도를 달성한다.

ABSTRACT

DeepFake based digital facial forgery is threatening the public media security, especially when lip manipulation has been used in talking face generation, the difficulty of fake video detection is further improved. By only changing lip shape to match the given speech, the facial features of identity is hard to be discriminated in such fake talking face videos. Together with the lack of attention on audio stream as the prior knowledge, the detection failure of fake talking face generation also becomes inevitable. Inspired by the decision-making mechanism of human multisensory perception system, which enables the auditory information to enhance post-sensory visual evidence for informed decisions output, in this study, a fake talking face detection framework FTFDNet is proposed by incorporating audio and visual representation to achieve more accurate fake talking face videos detection. Furthermore, an audio-visual attention mechanism (AVAM) is proposed to discover more informative features, which can be seamlessly integrated into any audio-visual CNN architectures by modularization. With the additional AVAM, the proposed FTFDNet is able to achieve a better detection performance on the established dataset (FTFDD). The evaluation of the proposed work has shown an excellent performance on the detection of fake talking face videos, which is able to arrive at a detection rate above 97%.

연구 동기 및 목표

  • 오직 입술 움직임만 조작된 가짜 말하는 얼굴 영상 탐지의 과제를 해결한다. 이 경우 신원 특징을 구분하기 어려워진다.
  • 기존 방법들이 입술 동기화 위변조에 관련성이 있음에도 불구하고 음성 스트림을 간과하는 한계를 극복한다.
  • 인간의 다감각 인지에서 영감을 얻어 음성과 시각 모odal을 효과적으로 융합함으로써 탐지 성능을 향상시킨다.
  • 백본 아키텍처를 수정하지 않고도 통합 가능한 모듈식, 플러그인형 음성-시각 주의 메커니즘(AVAM)을 개발한다.
  • 가짜 말하는 얼굴 영상 감지의 새로운 기준 데이터셋(FTFDD)에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 비디오 프레임과 오디오 클립에서 시각적 및 음성적 특징을 동시에 인코딩하는 딥 네ural 네트워크인 FTFDNet을 제안한다.
  • 시각적 특징 간 상호 공간적 관계를 모델링하면서도 음성 모달리티를 통합해 주의를 이끄는 새로운 주의 메커니즘인 AVAM을 설계한다.
  • AVAM은 조작이 가장 자주 발생할 가능성이 있는 주요 얼굴 부위—특히 입술과 볼—을 선택적으로 강조한다.
  • 이 주의 메커니즘은 모듈식 구성 요소로 구현되어 어떤 CNN 기반 음성-시각 아키텍처에도 원활하게 통합될 수 있다.
  • 시간적 맥락은 T=3 크기의 프레임 버퍼를 통해 모델링하고, FTFDD 데이터셋에서 이진 교차 엔트로피 손실을 사용해 모델을 엔드 투 엔드로 훈련시킨다.
  • AVAM의 효과를 검증하기 위해 아웃라이어 연구를 수행하여 기존 주의 모듈(CBAM 등)과의 비교 및 최적의 프레임 버퍼 크기의 탐색을 수행한다.

실험 결과

연구 질문

  • RQ1오디오-시각 융합이 오직 입술 움직임만 조작된 가짜 말하는 얼굴 영상 탐지에 향상 효과를 줄 수 있는가?
  • RQ2음성을 사전 지식로 통합함으로써 모델이 입술 동기화 영상에서 미세한 얼굴 조작을 탐지하는 능력이 향상되는가?
  • RQ3제안된 AVAM 메커니즘은 기존의 주의 모듈(CBAM 등)과 비교해 가짜 말하는 얼굴 영상 프레임 탐지에서 어떻게 성능을 냈는가?
  • RQ4프레임 버퍼를 사용한 효과적인 가짜 영상 탐지에 적합한 최적의 시간적 맥락 길이(T)는 얼마인가?
  • RQ5음성 유도 주의는 입술과 볼과 같은 조작된 얼굴 부위의 국소화에 얼마나 기여하는가?

주요 결과

  • 제안된 FTFDNet-AVAM은 FTFDD 데이터셋에서 97.00%의 검출 정확도를 달성하여, 시각 전용 FTFDNet(96.30%) 및 FTFDNet-CBAM(96.73%)를 모두 초월한다.
  • AVAM은 입술과 볼 부위에 주의를 집중시음으로써 조작에 가장 취약한 영역을 효과적으로 강조함으로써 검출 성능을 크게 향상시킨다.
  • 아웃라이어 연구를 통해 T=3이 시간적 맥락과 모델 복잡성 사이의 최적 균형을 이룬다는 것이 확인되었으며, T=5는 T=3보다 낮은 정확도(95.59% vs 96.30%)를 기록한다.
  • AVAM을 통한 오디오-시각 융합은 이진 교차 엔트로피 손실을 0.0865로 감소시켜 FTFDNet(0.0933) 및 FTFDNet-CBAM(0.099)에 비해 더 나은 최적화와 일반화 능력을 보여준다.
  • 주의 맵의 시각화 결과 AVAM이 조작된 얼굴 부위에 집중하는 경향을 보이며, 이는 특징 구분 능력 향상에 기여한다는 것을 검증한다.
  • CBAM의 채널 주의 구성 요소는 성능 향상에 거의 기여하지 않으며, 이는 이 작업에서 음성 유도 공간 주의가 채널 기반 조절보다 더 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.