Skip to main content
QUICK REVIEW

[논문 리뷰] How Deep Are the Fakes? Focusing on Audio Deepfake: A Survey

Zahra Khanjani, Gabrielle Watson|arXiv (Cornell University)|2021. 11. 28.
Digital Media Forensic Detection참고 문헌 50인용 수 6
한 줄 요약

이 종합적 서베이는 2016년에서 2020년까지 음성 딥페이크에 대한 첫 번째 종합적이고 영문으로 작성된 분석을 제공하며, 생성 및 탐지 기법에 중점을 둔다. GAN, CNN, DNN이 核심 기술로 규명되었고, 증가하는 위협에도 불구하고 음성 딥페이크 탐지에 대한 임파워링된 연구 격차가 존재하며, 사기 및 오인정보 유포 증가에 대비해 강력한 탐지 시스템 개발이 시급하다고 주장한다.

ABSTRACT

Deepfake is content or material that is synthetically generated or manipulated using artificial intelligence (AI) methods, to be passed off as real and can include audio, video, image, and text synthesis. This survey has been conducted with a different perspective compared to existing survey papers, that mostly focus on just video and image deepfakes. This survey not only evaluates generation and detection methods in the different deepfake categories, but mainly focuses on audio deepfakes that are overlooked in most of the existing surveys. This paper critically analyzes and provides a unique source of audio deepfake research, mostly ranging from 2016 to 2020. To the best of our knowledge, this is the first survey focusing on audio deepfakes in English. This survey provides readers with a summary of 1) different deepfake categories 2) how they could be created and detected 3) the most recent trends in this domain and shortcomings in detection methods 4) audio deepfakes, how they are created and detected in more detail which is the main focus of this paper. We found that Generative Adversarial Networks(GAN), Convolutional Neural Networks (CNN), and Deep Neural Networks (DNN) are common ways of creating and detecting deepfakes. In our evaluation of over 140 methods we found that the majority of the focus is on video deepfakes and in particular in the generation of video deepfakes. We found that for text deepfakes there are more generation methods but very few robust methods for detection, including fake news detection, which has become a controversial area of research because of the potential of heavy overlaps with human generation of fake content. This paper is an abbreviated version of the full survey and reveals a clear need to research audio deepfakes and particularly detection of audio deepfakes.

연구 동기 및 목표

  • 기존 서베이가 주로 영상 및 이미지 딥페이크에 집중하는 데 비해 음성 딥페이크에 대한 상당한 무시 현상이 존재하므로 이를 보완하고자 한다.
  • 음성 딥페이크에 특화된 생성 및 탐지 기법을 체계적으로 분석하여 핵심 연구 격차를 메우고자 한다.
  • 음성 딥페이크 탐지 분야의 최신 기술 수준을 평가하여 부족점과 연구 필요성을 부각하고자 한다.
  • 재생 공격, 음성 합성, 음성 변환을 포함한 음성 딥페이크 방법의 상세한 프레임워크 및 분류 체계를 제공하고자 한다.
  • 실제 사례에서의 오용 증가와 탐지 기술의 부족함을 고려해 음성 딥페이크 탐지 분야에 대한 연구 투자 증대를 주장하고자 한다.

제안 방법

  • 2016년에서 2020년까지 음성에 특화된 기법을 중심으로 140篇 이상의 딥페이크 관련 논문을 체계적으로 검토하였다.
  • 음성 딥페이크 기법을 세 가지 하위 범주로 분류: 재생 공격, 음성 합성, 음성 변환.
  • Equal Error Rate (EER), FID, PPL, 청각적 품질 점수 등의 지표를 사용해 탐지 프레임워크를 평가하였다.
  • 생성 및 탐지 작업 모두에 적용되는 딥러닝 아키텍처인 GAN, CNN, DNN, RNN을 분석하였다.
  • 주요 프레임워크, 데이터셋, 목적, 성능 지표를 요약한 비교 표(표 1, 2, 3)를 제공하였다.
  • 재생 공격 탐지 성능 평가에 ASVspoof2017을 벤치마크 데이터셋으로 사용하여 딥 컨volution 네트워크로 0%의 EER을 달성하였다.

실험 결과

연구 질문

  • RQ1음성 딥페이크의 주요 기술 범주와 하위 범주는 무엇이며, 생성 메커니즘에서 어떻게 상이한가?
  • RQ2음성 딥페이크를 탐지하는 데 가장 효과적인 딥러닝 아키텍처는 무엇이며, 성능 비교는 어떻게 이루어지는가?
  • RQ3왜 영상 및 이미지 딥페이크 탐지에 비해 음성 딥페이크 탐지는 상당히 연구가 부족한가?
  • RQ4현행 음성 딥페이크 탐지 방법의 주요 제한점과 부족점은 무엇이며, 특히 실세계 구현에서 나타나는가?
  • RQ5최근의 프레임워크인 메타러닝 GAN이나 신경 렌더링은 음성 및 영상 딥페이크 합성 및 탐지 기술 발전에 어떻게 기여하는가?

주요 결과

  • 생성적 적대적 네트워크(GAN), 컨볼루션 신경망(CNN), 딥 신경망(DNN)은 음성 딥페이크의 생성 및 탐지 모두에서 주요 아키텍처로 자리 잡았다.
  • 증가하는 위협에도 불구하고 딥페이크 연구의 소수만이 음성에 집중되어 있으며, 탐지 기법은 생성 기법에 비해 크게 뒤처져 있다.
  • 딥 컨volution 네트워크는 ASVspoof2017 데이터셋에서 재생 공격 탐지에 대해 완벽한 0% Equal Error Rate(EER)를 기록하여 이전 방법들을 압도적으로 뛰어넘었다.
  • 음성 합성(TTS)과 음성 변환은 음성 딥페이크의 주요 하위 범주로, 최근의 프레임워크는 고해상도, 입술 동기화된 음성-영상 합성을 가능하게 하였다.
  • 본 연구는 텍스트 기반 및 음성 기반 딥페이크에 대해 강력하고 일반화 가능한 탐지 방법의 부족함을 규명하였으며, 특히 AI 생성 콘텐츠와 인간이 만든 오인정보를 구분하는 데 어려움이 있음을 지적하였다.
  • 서베이 결과, 영상 딥페이크 생성 기술은 매우 발달해 있으나, 음성 딥페이크 탐지 기술은 여전히 뒤처져 있어 위험한 보안 및 사회적 위험을 초래하고 있음을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.