Skip to main content
QUICK REVIEW

[논문 리뷰] NWPU-ASLP System for the VoicePrivacy 2022 Challenge

Jixun Yao, Qing Wang|arXiv (Cornell University)|2022. 09. 24.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 VoicePrivacy 2022 챌린지용 발화자 익명화 시스템을 제시하며, 외부 ASV 모델이나 x-vector 풀에 의존하지 않는다. 가짜 발화자 임베딩을 생성하고, 이를 평균화된 실제 발화자 임베딩과 가중치가 부여된 연결을 통해 조합함으로써, 높은 비밀성과 이해 가능성으로 익명화된 음성 생성을 구현한다. 평균 EER 30.15%와 WER 5.82%를 달성하여, 비밀성과 유티리티 측면에서 기준 시스템을 초월한다.

ABSTRACT

This paper presents the NWPU-ASLP speaker anonymization system for VoicePrivacy 2022 Challenge. Our submission does not involve additional Automatic Speaker Verification (ASV) model or x-vector pool. Our system consists of four modules, including feature extractor, acoustic model, anonymization module, and neural vocoder. First, the feature extractor extracts the Phonetic Posteriorgram (PPG) and pitch from the input speech signal. Then, we reserve a pseudo speaker ID from a speaker look-up table (LUT), which is subsequently fed into a speaker encoder to generate the pseudo speaker embedding that is not corresponding to any real speaker. To ensure the pseudo speaker is distinguishable, we further average the randomly selected speaker embedding and weighted concatenate it with the pseudo speaker embedding to generate the anonymized speaker embedding. Finally, the acoustic model outputs the anonymized mel-spectrogram from the anonymized speaker embedding and a modified version of HifiGAN transforms the mel-spectrogram into the anonymized speech waveform. Experimental results demonstrate the effectiveness of our proposed anonymization system.

연구 동기 및 목표

  • 추가적인 ASV 모델이나 x-vector 풀이 필요로 하지 않는 발화자 익명화 시스템을 개발함으로써 복잡성을 감소시키고 일반화 리스크를 줄이는 것.
  • 발화자 정체성 정보를 효과적으로 억제하면서 언어적 내용과 음성 이해 가능성은 유지하는 것.
  • 어느 실제 발화자와도 관련이 없는 익명화된 음성을 생성함으로써 비밀 보호를 강화하는 것.
  • 새로운 임베딩 조합 전략을 통해 익명화의 강건성과 효과성을 향상시키는 것.

제안 방법

  • 시스템은 입력 음성에서 음소 후행도(PPG)와 기본 주파수(F0)를 추출하기 위해 특징 추출기를 사용한다.
  • 가짜 발화자 ID는 룩업 테이블에 할당되어 비실제 발화자 임베딩을 생성함으로써, 익명화된 출력이 어떤 실제 발화자와도 연결되지 않도록 보장한다.
  • 무작위로 선택된 실제 발화자 임베딩을 평균화하고, 평균화된 임베딩과 가짜 발화자 임베딩을 가중치가 부여된 연결 방식으로 조합하여 익명화된 임베딩을 형성한다.
  • 음성 모델은 익명화된 임베딩과 언어적 특징(PPG, F0)을 조건으로 하여 멜스펙트로그램을 생성한다.
  • 재학습된 HifiGAN 기반 신경 음성 합성기(Neural Vocoder)가 익명화된 멜스펙트로그램을 자연스러운 음성 웨이브폼으로 변환한다.
  • 시스템은 외부 ASV 모델이나 x-vector 풀에 의존하지 않아 일반화 능력을 향상시키고 계산 오버헤드를 감소시킨다.

실험 결과

연구 질문

  • RQ1외부 ASV 모델이나 x-vector 풀에 의존하지 않고도 발화자 익명화를 효과적으로 달성할 수 있는가?
  • RQ2가짜 발화자 임베딩과 평균화된 실제 발화자 임베딩을 조합할 경우 익명화 성능에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 발화자 정체성을 어느 정도 억제하면서도 음성 이해 가능성을 유지하는가?
  • RQ4비밀성 지표(EER)와 유티리티(WER) 측면에서 기준 방법과 비교해 시스템은 어떻게 성능을 내는가?

주요 결과

  • 제안된 시스템은 평균 EER 30.15%를 달성하여 B1.b 기준 대비 20.97% 향상되었으며, 강력한 비밀 보호 성능을 입증했다.
  • 시스템은 WER 5.82%를 기록하여 B1.b 기준 대비 1.74% 향상되었으며, 뛰어난 음성 이해 가능성의 가능성을 시사한다.
  • LibriSpeech와 VCTK를 포함한 모든 테스트 세트에서 두 기준 시스템을 모두 초월했으며, EER와 WER 모두 일관된 향상이 관찰되었다.
  • 음성 특성도 지표 $G_{VD}$ 가 크게 감소하여 익명화된 음성이 발화자 고유의 특징을 상실했지만 언어적 내용은 유지됨을 확인했다.
  • 모든 조건에서 피치 상관관계가 0.7 이상 유지되어 기본 주파수가 유지되어 자연스러운 음성 품질을 지원함을 나타냈다.
  • 가짜 발화자 임베딩의 유사도 행렬에 주대각선이 존재하지 않아 가짜 발화자가 어느 실제 발화자와도 대응하지 않음을 확인하였으며, 이는 비밀 보호를 더욱 강화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.