Skip to main content
QUICK REVIEW

[논문 리뷰] Warning: Humans Cannot Reliably Detect Speech Deepfakes

Kimberly T. Mai, Sergi D. Bray|arXiv (Cornell University)|2023. 01. 19.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 연구는 영어 및 중국어를 구사하는 참가자 529명을 대상으로 한 통제된 온라인 실험을 통해 인간이 음성 딥페이크를 탐지하는 능력을 평가한다. 인식과 예시 노출에도 불구하고 청취자는 딥페이크를 73%의 정확도로만 탐지했으며, 언어 간 유의미한 차이는 없었고, 익숙함이 성능 향상에 약간만 기여했다—이는 인간 의존보다 자동 탐지 시스템이 절실하게 필요하다는 것을 시사한다.

ABSTRACT

Speech deepfakes are artificial voices generated by machine learning models. Previous literature has highlighted deepfakes as one of the biggest security threats arising from progress in artificial intelligence due to their potential for misuse. However, studies investigating human detection capabilities are limited. We presented genuine and deepfake audio to n = 529 individuals and asked them to identify the deepfakes. We ran our experiments in English and Mandarin to understand if language affects detection performance and decision-making rationale. We found that detection capability is unreliable. Listeners only correctly spotted the deepfakes 73% of the time, and there was no difference in detectability between the two languages. Increasing listener awareness by providing examples of speech deepfakes only improves results slightly. As speech synthesis algorithms improve and become more realistic, we can expect the detection task to become harder. The difficulty of detecting speech deepfakes confirms their potential for misuse and signals that defenses against this threat are needed.

연구 동기 및 목표

  • 영어 및 중국어에서 음성 딥페이크의 인간 탐지 정확도를 평가하여 언어에 따른 탐지 성능을 평가한다.
  • 딥페이크 예시에 노출된 청취자가 탐지 능력 향상에 기여하는지 조사한다.
  • 맥락적 단서 또는 오디오 쌍(이원 대비 대비 단일)이 탐지 성능에 영향을 주는지 조사한다.
  • 비정상성 같은 청각적 단서가 인간의 딥페이크 탐지에 어떤 역할을 하는지 이해한다.
  • 합성 음성 탐지에서 인간 인지의 한계를 규명하여 강력한 방어 체계 개발에 기여한다.

제안 방법

  • 영어 및 중국어 사용자로 구성된 529명의 참가자를 대상으로 온라인 실험을 수행했다.
  • 오디오 클립을 두 가지 구성으로 제시: 단일 클립(한 번의 시험에 하나의 클립) 및 이원 클립(한 개의 진짜, 한 개의 위조 클립 쌍으로 제시).
  • 자료를 생성하기 위해 이전의 더 낮은 수준의 기술을 기반으로 한 딥페이크 음성 합성 모델을 사용했다.
  • 탐지 성능에 미치는 영향을 평가하기 위해 랜덤으로 배치된 예시 딥페이크를 활용한 익숙해짐 간 interventions을 제공했다.
  • 결정의 신뢰도를 분석하기 위해 신뢰도 조정된 정확도 점수를 수집했다.
  • 통계 모델링을 사용하여 언어, 구성, 익숙함 조건 간 탐지 성능을 분석했다.
Fig 1: Diagram of a typical generative speech synthesis model.
Fig 1: Diagram of a typical generative speech synthesis model.

실험 결과

연구 질문

  • RQ1사람들은 영어 및 중국어에서 진짜 음성과 음성 딥페이크를 신뢰성 있게 구별할 수 있는가?
  • RQ2딥페이크 예시에 사전 노출된 후 인간의 탐지 정확도가 향상되는가?
  • RQ3이원 및 단일 오디오 제시 방식 간 탐지 성능에 유의미한 차이가 있는가?
  • RQ4청취자는 딥페이크 탐지 시 언어에 특화된 청각적 단서를 활용하는가?
  • RQ5음성의 자연스러움에 대한 인식이 인간의 탐지 결정에 어떤 영향을 미치는가?

주요 결과

  • 사람들은 음성 딥페이크를 오직 73%의 정확도로 탐지했으며, 이는 통제된 조건에서도 신뢰할 수 없는 탐지 능력을 보여준다.
  • 영어 및 중국어 청취자 간 탐지 성능에 유의미한 차이가 없었으며, 이는 언어가 탐지 가능성에 영향을 주지 않음을 시사한다.
  • 참가자들에게 딥페이크 예시를 익숙하게 한 것이 탐지 정확도 향상에 약간만 기여했으며, 이는 인식 캠페인의 효과가 제한적임을 시사한다.
  • 청취자들은 언어에 관계없이 주로 비정상성의 느낌을 주요 단서로 활용했으며, 이는 공통된 청각적 힌트를 의미한다.
  • 더 긴 청취 시간이나 이원 비교 조건에서도 성능 향상이 없었으며, 이는 인지 부하와 작업 설계가 탐지에 크게 기여하지 않는다는 것을 시사한다.
  • 결과적으로 인간 기반 탐지는 실세계 방어에 부적합하며, 자동 탐지 시스템의 필요성이 명백히 드러난다.
Fig 2: Screenshots of the task interface.
Fig 2: Screenshots of the task interface.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.