Skip to main content
QUICK REVIEW

[논문 리뷰] Can we steal your vocal identity from the Internet?: Initial investigation of cloning Obama's voice using GAN, WaveNet and low-quality found data

Jaime Lorenzo-Trueba, Fuming Fang|arXiv (Cornell University)|2018. 03. 02.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 인터넷에서 공개된 저품질 음성 자료를 활용해 버락 오바마의 목소리를 클로닝하는 것의 가능성을 조사한다. 음성 품질 향상 모델(가짜 생성 대립 네트워크 기반)을 사용해 음성 품질을 향상시킨 후 최신 텍스트-음성 합성 및 목소리 변환 시스템을 훈련시킨다. 결과적으로 음성 품질과 화자 유사도가 크게 향상되었지만, 청각적 오류와 낮은 화자 유사도 점수는 현재 시스템이 인간처럼 자연스럽고 정확한 신원 복제를 아직 달성하지 못하고 있음을 시사한다.

ABSTRACT

Thanks to the growing availability of spoofing databases and rapid advances in using them, systems for detecting voice spoofing attacks are becoming more and more capable, and error rates close to zero are being reached for the ASVspoof2015 database. However, speech synthesis and voice conversion paradigms that are not considered in the ASVspoof2015 database are appearing. Such examples include direct waveform modelling and generative adversarial networks. We also need to investigate the feasibility of training spoofing systems using only low-quality found data. For that purpose, we developed a generative adversarial network-based speech enhancement system that improves the quality of speech data found in publicly available sources. Using the enhanced data, we trained state-of-the-art text-to-speech and voice conversion models and evaluated them in terms of perceptual speech quality and speaker similarity. The results show that the enhancement models significantly improved the SNR of low-quality degraded data found in publicly available sources and that they significantly improved the perceptual cleanliness of the source speech without significantly degrading the naturalness of the voice. However, the results also show limitations when generating speech with the low-quality found data.

연구 동기 및 목표

  • 인터넷에서 공개된 저품질 음성 자료를 활용해 효과적인 목소리 클로닝 시스템을 훈련시킬 수 있는지 평가하는 것.
  • 비제어 환경에서 기인한 열악한 조건의 음성을 향상시킬 수 있는 강력한 GAN 기반 음성 향상 모델을 개발하는 것.
  • 향상된 저품질 데이터에서 생성된 합성 음성의 청각적 품질과 화자 유사도를 평가하는 것.
  • 이러한 합성 음성이 기존의 위조 방지 대응 조치를 우회하는 데 효과적인지 테스트하는 것.
  • 차세대 ASVspoof 데이터셋에 공개된 저품질 자료를 포함시켜야 하는지 여부를 판단하는 것.

제안 방법

  • 저품질이고 노이즈가 많은 공개 자료에서 유래한 음성의 신호 대 잡음비(SNR)와 청각적 품질을 향상시키기 위해 수정된 SEGAN 기반 음성 향상 모델을 훈련시킨다.
  • 생성자 모델은 잔여 향상(residual enhancement)을 학습하기 위해 스킵 커넥션을 사용하여 청소된 음성을 처음부터 생성하는 부담을 줄인다.
  • 기본 향상 모델로 사전 훈련된 생성자 모델은 초기 훈련 단계에서 정상 음성 대비가 아닌 기본 모델 출력 대비 손실를 계산한다.
  • 텍스트-음성 합성(TTS) 및 목소리 변환(VC) 모델은 향상된 음성 자료를 사용해 훈련시키며, 단일어 및 이중어 구성 모두 포함된다.
  • 합성 음성의 탐지 가능성을 평가하기 위해 CQCC-GMM 위조 방지 분류기 모델을 사용하며, 이는 ASVspoof2015 및 VCC2016 데이터셋 기반으로 훈련된다.
  • 청각 평가를 위해 MOS(평균 평가 점수) 청취 테스트를 실시하여 합성 음성과 복사 합성, 자연어 음성 간을 비교한다.

실험 결과

연구 질문

  • RQ1GAN 기반 음성 향상 시스템은 비제어 환경에서 기인한 저품질 공개 음성 자료의 품질을 효과적으로 향상시킬 수 있는가?
  • RQ2향상된 저품질 데이터에서 생성된 합성 음성이 얼마나 높은 청각적 품질과 목표 화자와의 유사도를 달성할 수 있는가?
  • RQ3향상된 발견 자료를 기반으로 훈련된 현대적 TTS 및 목소리 변환 시스템은 기존의 위조 방지 대응 조치에 얼마나 효과적인가?
  • RQ4데이터 품질과 훈련 데이터 선택이 목소리 클로닝 시스템의 성능에 어떤 영향을 미치는가?
  • RQ5다양한 기록 조건을 고려할 때, 대규모이고 다양한 데이터셋으로 훈련된 음성 향상 모델은 일반화 성능을 보일 수 있는가?

주요 결과

  • GAN 기반 음성 향상 모델은 저품질의 발견 음성 자료의 SNR를 크게 향상시키며, 자연스러움을 해치지 않은 채 청각적 청결도를 향상시켰다.
  • 청각 평가 결과, 향상된 음성 자료는 처리되지 않은 저품질 데이터 대비 품질과 자연스러움에 대해 높은 MOS 점수를 기록했다.
  • 향상된 자료를 기반으로 훈련된 TTS 및 VC 시스템은 원시 저품질 자료를 기반으로 훈련된 경우보다 높은 청각적 품질을 달성했지만, 화자 유사도는 여전히 낮았다 (예: 복사 합성 기반 2.63점 대비 WaveNet 기반 TTS 2.45점).
  • 리버버브레이션 추가로 WaveNet 기반 음성의 청각적 품질은 향상되었지만, 화자 유사도는 유의미하게 향상되지 않았다.
  • CQCC-GMM 기반 위조 방지 조치는 높은 EER(예: VCC2016 세트에서 TT3 기준 0.79%)를 기록하여, 고도로 향상된 음성과 합성 기술에도 불구하고 합성 음성이 여전히 탐지 가능하다는 것을 시사한다.
  • VC 시스템은 품질과 유사도 모두에서 TTS를 능가했으며, VC2(단일어)는 VCC2016 기반 위조 방지 조치에서 EER 0.00%를 기록하여 합성 음성의 강력한 탐지 가능성은 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.