Skip to main content
QUICK REVIEW

[논문 리뷰] Detection of AI-Synthesized Speech Using Cepstral & Bispectral Statistics

Arun Kumar Singh, Priyanka Singh|arXiv (Cornell University)|2020. 09. 03.
Digital Media Forensic Detection참고 문헌 11인용 수 5
한 줄 요약

이 논문은 높은 차수의 스펙트럼 상관관계와 메르-주파수 피크스트럼 계수(MFCC)에 더해진 델타 및 델타-스quared 성분을 활용하여 체프스트럼 및 비스펙트럼 특징을 조합함으로써 AI에 의해 생성된 음성 탐지를 위한 기계학습 접근법을 제안한다. 이 방법은 실제 테스트 데이터에서 인간 대 AI 생성 음성 간의 이진 분류에서 97.56%의 정확도를 달성하며, 이는 이차 SVM의 강건성과 비스펙트럼 및 체프스트럼 통계의 분류 능력 덕분에 다른 분류기들보다 뛰어나다.

ABSTRACT

Digital technology has made possible unimaginable applications come true. It seems exciting to have a handful of tools for easy editing and manipulation, but it raises alarming concerns that can propagate as speech clones, duplicates, or maybe deep fakes. Validating the authenticity of a speech is one of the primary problems of digital audio forensics. We propose an approach to distinguish human speech from AI synthesized speech exploiting the Bi-spectral and Cepstral analysis. Higher-order statistics have less correlation for human speech in comparison to a synthesized speech. Also, Cepstral analysis revealed a durable power component in human speech that is missing for a synthesized speech. We integrate both these analyses and propose a machine learning model to detect AI synthesized speech.

연구 동기 및 목표

  • 디지털 증거 분석 분야에서 증가하는 AI 생성 음성 딤크피크스 및 위조 음성의 위협을 해결하기 위해.
  • 고차수 통계적 특징을 활용하여 인간의 음성과 AI에 의해 생성된 음성을 구분할 수 있는 강건한 방법을 개발하기 위해.
  • 체프스트럼 및 비스펙트럼 분석을 통합하여 실제 음성과 합성 음성 간의 스펙트럼 상관관계 및 파wer 성분의 본질적 차이를 활용하기 위해.
  • 모델의 실용성 확보를 위해 정제되지 않은 노이즈 있는 음성 데이터를 대상으로 평가하기 위해.

제안 방법

  • 이 방법은 정규화된 비스펙트럼(bicoherence)를 통해 제3차 상관관계를 추출하는 비스펙트럼 분석을 사용하며, 인간의 음성에 존재하지 않는 비정규성 및 비랜덤 상관관계를 탐지하기 위해 크기와 위상을 중시한다.
  • 메르-주파수 피크스트럼 분석을 통해 MFCC, 델타-피크스트럼(∆-Cepstrum), 및 델타-스quared 피크스트럼(∆²-Cepstrum)을 추출하여 인간의 음성 연쇄 특성을 추출하며, 이는 AI에 의해 생성된 음성에서는 존재하지 않는다.
  • 비스펙트럼 분석과 피크스트럼 분석에서 유도된 특징들을 통합하여 하나의 특징 벡터로 조합한다.
  • 분류기로는 이차 서포트 벡터 머신(Q-SVM)을 사용하였으며, 이는 5겹 교차검증에서 뛰어난 성능과 커널 기반 일반화 능력으로 인해 선택되었다.
  • 모델은 다양한 원천(예: Google AI, Siri, NaturalReader, Spik.AI, Replica)으로부터의 인간 음성과 AI에 의해 생성된 음성의 다양성 있는 데이터셋을 사용하여 훈련 및 테스트하였다. 이 데이터셋에는 노이즈가 포함된 정제되지 않은 음성도 포함되어 있다.
  • 성능 평가는 이진 분류(인간 대 AI) 및 다중 분류(원천 특정) 설정 모두에서 혼동 행렬과 정확도 지표를 사용하여 평가되었다.

실험 결과

연구 질문

  • RQ1비스펙트럼 분석으로 캡처된 고차수 스펙트럼 상관관계는 인간의 음성과 AI에 의해 생성된 음성을 효과적으로 구분하는 데 유용한가?
  • RQ2MFCC, ∆-피크스트럼, ∆²-피크스트럼를 포함한 피크스트럼 특징들은 합성 음성을 탐지하는 데 분류 능력을 제공하는가?
  • RQ3비스펙트럼 및 피크스트럼 특징을 통합하면 단독으로 사용할 경우보다 탐지 정확도가 향상되는가?
  • RQ4정제되지 않은 실생활 노이즈 있는 음성 데이터에 대해 이 모델은 사전 처리 없이도 잘 작동하는가?
  • RQ5이진 분류(인간 대 AI)가 다중 분류(원천 특정 AI 모델)보다 합성 음성을 탐지하는 데 더 정확한가?

주요 결과

  • 제안된 방법은 테스트 세트에서 인간 대 AI 생성 음성 간의 이진 분류에서 97.56%의 정확도를 달성하였으며, 오분류율은 2.43%였다.
  • 이차 SVM 분류기는 모든 다른 모델보다 뛰어난 성능을 보였으며, 이진 분류에서 96.3%의 정확도, 다중 분류에서 96.1%의 정확도를 달성하였다.
  • 비스펙트럼 분석은 인간의 음성에 존재하지 않는 AI 생성 음성에서의 제3차 상관관계를 성공적으로 탐지하여 핵심 분류 특징을 제공하였다.
  • 피크스트럼 분석은 AI 생성 음성에서 결여되어 있는 인간 음성의 내구성 있는 파wer 성분을 드러내어 추가로 분류 능력을 향상시켰다.
  • 이진 분류의 혼동 행렬은 최소한의 오분류를 보였으며, 인간 샘플 중 오직 1개만 AI로 잘못 분류되어 강력한 일반화 능력을 보였다.
  • 다중 분류에서는 93.9%의 정확도를 달성하였으며, 유사한 AI 모델 간(예: NaturalReader와 Spik.AI) 오진 양성률이 높아 이진 분류가 실용적 탐지에 더 강건함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.