Skip to main content
QUICK REVIEW

[논문 리뷰] Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks

Zhenzong Wu, Rohan Kumar Das|arXiv (Cornell University)|2020. 09. 21.
Speech Recognition and Synthesis참고 문헌 31인용 수 13
한 줄 요약

이 논문은 자동 발화자 검증에서 합성 음성 공격을 탐지하기 위해 특징 진실성 복원 기반 경량 합성곱 신경망(LCNN)을 제안한다. 진실된 음성 특징의 분포를 유지하면서 가짜 음성은 왜곡시키는 트랜스포머를 훈련시켜 분류 성능를 향상시키며, ASVspoof 2019 논리적 액세스 코퍼스에서 4.07%의 EER을 달성하여 최신 단일 시스템을 초월한다.

ABSTRACT

Modern text-to-speech (TTS) and voice conversion (VC) systems produce natural sounding speech that questions the security of automatic speaker verification (ASV). This makes detection of such synthetic speech very important to safeguard ASV systems from unauthorized access. Most of the existing spoofing countermeasures perform well when the nature of the attacks is made known to the system during training. However, their performance degrades in face of unseen nature of attacks. In comparison to the synthetic speech created by a wide range of TTS and VC methods, genuine speech has a more consistent distribution. We believe that the difference between the distribution of synthetic and genuine speech is an important discriminative feature between the two classes. In this regard, we propose a novel method referred to as feature genuinization that learns a transformer with convolutional neural network (CNN) using the characteristics of only genuine speech. We then use this genuinization transformer with a light CNN classifier. The ASVspoof 2019 logical access corpus is used to evaluate the proposed method. The studies show that the proposed feature genuinization based LCNN system outperforms other state-of-the-art spoofing countermeasures, depicting its effectiveness for detection of synthetic speech attacks.

연구 동기 및 목표

  • 다양하고 알려지지 않은 TTS 및 VC 시스템에 의해 생성된 합성 음성 공격을 탐지하는 과제를 해결하기 위해.
  • 기존 공격 유형 외의 일반화 능력을 향상시키기 위해 진실된 음성과 합성 음성 간의 분포 차이를 활용하여 가짜 공격 대응 기술의 일반화 성능을 향상시키기 위해.
  • 실제 애플리케이션에서 ASV 시스템에 적용 가능한 강건하고 가벼운 탐지 시스템을 개발하기 위해.
  • 특징 진실성 복원을 통한 진실된 음성 분포 모델링이 가짜 음성 탐지 성능 향상에 기여함을 입증하기 위해.

제안 방법

  • 진실된 음성 특징만을 사용하여 진정한 음성의 내재된 분포를 학습하는 특징 진실성 복원 트랜스포머를 훈련시킨다.
  • 진실성 복원 트랜스포머는 진실된 특징을 통계적 특성을 유지하는 도메인으로 매핑하면서, 가짜 특징은 왜곡시켜 그 이질성을 극대화한다.
  • 변환된 특징은 가짜 음성 탐지용 경량 CNN(LCNN) 분류기로 입력된다.
  • 이 방법은 t-DCF와 EER을 평가 지표로 사용하여 ASVspoof 2019 논리적 액세스 코퍼스에서 평가된다.
  • 가짜 음성 데이터로 훈련된 가짜 공격 트랜스포머를 사용한 대조 실험을 실시하였으며, 제안된 방법에 비해 성능 저하가 발생하였다.
  • 다양한 프론트엔드 특징과 분류기들을 사용한 여러 최신 단일 시스템과의 비교를 실시하였다.

실험 결과

연구 질문

  • RQ1진실된 음성의 분포를 모델링하면 알려지지 않은 합성 음성 공격 탐지에 도움이 될 수 있는가?
  • RQ2진실된 특징을 유지하면서 가짜 특징을 왜곡시키는 특징 진실성 복원—이러한 변환을 학습하는 것이 가짜 공격 대응 성능 향상에 기여하는가?
  • RQ3ASVspoof 2019 논리적 액세스 벤치마크에서 제안된 FG-LCNN 시스템은 기존 최신 단일 시스템과 비교해 어떻게 성능을 내는가?
  • RQ4가벼운 CNN 분류기인 LCNN가 특징 진실성 복원 기반 특징 변환을 통해 가짜 음성 탐지에서 상당한 성능 향상을 얻을 수 있는가?

주요 결과

  • 제안된 FG-LCNN 시스템은 ASVspoof 2019 논리적 액세스 평가 세트에서 4.07%의 동일 오류율(EER)을 달성하여 도전 대회에서 보고된 모든 단일 시스템을 능가한다.
  • t-DCF 값이 0.102로, 비교된 모든 단일 시스템 중에서 가장 낮아, 잘못된 경고와 빠짐을 최소화하는 데 뛰어난 성능을 보였다.
  • 가짜 공격 트랜스포머(FS-LCNN)를 사용한 대조 실험에서, 기준 LCNN 및 제안된 FG-LCNN에 비해 성능 저하가 발생하여 진실된 음성 모델링의 유효성을 입증하였다.
  • 진실된 샘플의 일관된 분포를 활용함으로써 특징 진실성 복원 방법이 진실된 음성과 합성 음성 간의 분류 갭을 효과적으로 증폭시켰다.
  • 특징 진실성 복원을 적용한 LCNN 기반 시스템은 프론트엔드 기반 방법과 ResNet 및 DNN 변종과 같은 다른 딥러닝 분류기들보다 더 강건한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.