[논문 리뷰] AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
이 논문은 시각적, 청각적, 시각-청각적 신호를 동시에 분석하여 딥페이크 영상을 탐지하는 새로운 오디오-시각적 트랜스포머 기반 앙상블 네트워크인 AVTENet을 제안한다. 이는 순수한 트랜스포머 모델을 다수 활용하여, FakeAVCeleb Testset-II에서 99%의 정확도로 최신 기술 수준(SOTA) 성능을 달성하며, 앙상블 학습을 통해 모odal별 표현을 효과적으로 융합함으로써 기존의 단모달, 다모달, 앙상블 방법들을 능가한다.
The recent proliferation of hyper-realistic deepfake videos has drawn attention to the threat of audio and visual forgeries. Most previous studies on detecting artificial intelligence-generated fake videos only utilize visual modality or audio modality. While some methods exploit audio and visual modalities to detect forged videos, they have not been comprehensively evaluated on multimodal datasets of deepfake videos involving acoustic and visual manipulations, and are mostly based on convolutional neural networks with low detection accuracy. Considering that human cognition instinctively integrates multisensory information including audio and visual cues to perceive and interpret content and the success of transformer in various fields, this study introduces the audio-visual transformer-based ensemble network (AVTENet). This innovative framework tackles the complexities of deepfake technology by integrating both acoustic and visual manipulations to enhance the accuracy of video forgery detection. Specifically, the proposed model integrates several purely transformer-based variants that capture video, audio, and audio-visual salient cues to reach a consensus in prediction. For evaluation, we use the recently released benchmark multimodal audio-video FakeAVCeleb dataset. For a detailed analysis, we evaluate AVTENet, its variants, and several existing methods on multiple test sets of the FakeAVCeleb dataset. Experimental results show that the proposed model outperforms all existing methods and achieves state-of-the-art performance on Testset-I and Testset-II of the FakeAVCeleb dataset. We also compare AVTENet against humans in detecting video forgery. The results show that AVTENet significantly outperforms humans.
연구 동기 및 목표
- 영상에서 음성과 얼굴을 동시에 조작하는 초현실적인 오디오-시각적 딥페이크의 증가하는 위협에 대응하기 위해.
- 기존의 단모달 딥페이크 탐지 방법이 교차 모달 조작을 탐지하지 못하는 한계를 극복하기 위해.
- 시각적 및 청각적 위조물을 동시에 탐지할 수 있는 다모달, 트랜스포머 기반 앙상블 프레임워크를 개발하기 위해.
- 오디오 및 영상 스트림에서 다양한 조작 기법을 포함한 종합적인 벤치마크 데이터셋에서 모델을 평가하기 위해.
- 미래의 딥페이크 탐지 연구를 위한 확장 가능하고, 자기지도 학습과 호환되는 아키텍처를 구축하기 위해.
제안 방법
- 세 가지 서로 다른 트랜스포머 기반 모델을 통합한다: 오디오 전용 모델(ASP 기반 AN), 영상 전용 모델(ViViT 기반 VN), 오디오-시각 융합 모델(AV-HuBERT 기반 AVN)을 통해 모달별 표현을 추출한다.
- 각 구성 모델은 시공간적 및 스펙트럼적 특징을 추출할 수 있도록 대규모 자기지도 학습 데이터셋에서 사전 훈련된다.
- 앙상블 전략은 초기 융합과 공명 투표를 통해 세 모델의 예측을 통합하여 정밀도와 탐지 정확도를 향상시킨다.
- AVN 구성 요소는 AV-HuBERT를 사용하여 통합 오디오-시각 임베딩을 추출하지만, 저자들은 이 모델이 입술 영역 외부의 시각적 맥락을 제대로 포착하지 못해 성능이 열 劣하다고 지적한다.
- 모델은 얼굴 교체, fsgan, RTVC 등을 포함한 다양한 딥페이크 조작 기법을 수반하는 FakeAVCeleb 데이터셋에서 훈련 및 평가된다.
- 하이퍼파rameter 튜닝과 아블레이션 연구를 수행하여 각 구성 요소의 기여도를 분석하고 앙상블 성능를 최적화한다.

실험 결과
연구 질문
- RQ1다모달 트랜스포머 기반 앙상블 모델은 복잡한 실세계 오디오-시각 딥페이크 데이터셋에서 기존의 단모달 및 다모달 탐지 방법보다 뛰어난 성능을 보일 수 있는가?
- RQ2오디오, 영상, 오디오-시각 융합을 위한 순수 트랜스포머 기반 모델을 통합할 경우, CNN 기반 기준 모델 대비 탐지 정확도는 얼마나 향상되는가?
- RQ3다양한 오디오-시각 조작 기법(예: 얼굴 교체, 음성 클로닝)을 탐지하는 데 있어, 다양한 사전 훈련된 모델들(예: AST, ViViT, AV-HuBERT)이 얼마나 기여하는가?
- RQ4왜 AV-HuBERT 기반 AVN 구성 요소는 시각적으로 조작된 가짜 영상에서 성능이 열 劣하는가? 이 문제는 어떻게 완화될 수 있는가?
- RQ5전문적인 트랜스포머 모델의 앙상블는 다양한 딥페이크 생성 기법에 걸쳐 뛰어난 일반화 능력과 강건성을 달성할 수 있는가?
주요 결과
- AVTENet는 FakeAVCeleb 데이터셋의 Testset-II에서 최신 기술 수준(SOTA)의 탐지 정확도 99%를 달성하며, 기존의 방법들을 크게 앞서간다.
- 동일한 벤치마크에서 VGG16(81%), Xception(76%), Lip Forensics(76%)와 같은 모든 기준 단모달 및 다모달 접근 방식보다 뛰어난 성능을 보였다.
- AST, ViViT, AV-HuBERT 구성 요소를 포함한 앙상블 모델(AVTENet_ff)이 가장 높은 성능을 기록하여, 다전문제 학습의 효과성을 입증하였다.
- AV-HuBERT 기반 AVN 구성 요소는 시각적으로 조작된 영상(예: faceswap)에서 성능이 열 劣하는데, 이는 입술 영역 외부의 시각적 신호를 포착하지 못하기 때문이다.
- AVN 구성 요소에서 AV-HuBERT를 AST 및 ViViT로 대체하면 성능이 악화되며, 이는 융합된 모델 내에서 정보의 중복성과 상호 보완성 부족을 시사한다.
- 아블레이션 연구는 앙상블 전략이 얼굴만 조작된 경우, 음성만 조작된 경우를 포함한 다양한 조작 유형에 걸쳐 강건성과 일반화 능력을 향상시킨다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.