Skip to main content
QUICK REVIEW

[论文解读] NWPU-ASLP System for the VoicePrivacy 2022 Challenge

Jixun Yao, Qing Wang|arXiv (Cornell University)|Sep 24, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本论文提出了一套针对 VoicePrivacy 2022 挑战赛的说话人匿名化系统,该系统无需依赖外部 ASV 模型或 x-vector 池。通过生成一个伪说话人嵌入,并将其与平均化的实际说话人嵌入通过加权拼接相结合,系统生成了具有高隐私性和可懂度的匿名语音,在平均 EER 达到 30.15%、WER 为 5.82% 的情况下,优于基线系统在隐私性和实用性方面的表现。

ABSTRACT

This paper presents the NWPU-ASLP speaker anonymization system for VoicePrivacy 2022 Challenge. Our submission does not involve additional Automatic Speaker Verification (ASV) model or x-vector pool. Our system consists of four modules, including feature extractor, acoustic model, anonymization module, and neural vocoder. First, the feature extractor extracts the Phonetic Posteriorgram (PPG) and pitch from the input speech signal. Then, we reserve a pseudo speaker ID from a speaker look-up table (LUT), which is subsequently fed into a speaker encoder to generate the pseudo speaker embedding that is not corresponding to any real speaker. To ensure the pseudo speaker is distinguishable, we further average the randomly selected speaker embedding and weighted concatenate it with the pseudo speaker embedding to generate the anonymized speaker embedding. Finally, the acoustic model outputs the anonymized mel-spectrogram from the anonymized speaker embedding and a modified version of HifiGAN transforms the mel-spectrogram into the anonymized speech waveform. Experimental results demonstrate the effectiveness of our proposed anonymization system.

研究动机与目标

  • 开发一种无需额外 ASV 模型或 x-vector 池的说话人匿名化系统,以降低复杂度并减少泛化风险。
  • 在有效抑制说话人身份信息的同时,保留语言内容和语音可懂度。
  • 生成与任何真实说话人均无关联的匿名语音,以增强隐私保护。
  • 通过一种新颖的嵌入组合策略,提升匿名化的鲁棒性与有效性。

提出的方法

  • 系统使用特征提取器从输入语音中获取音素后验图(PPG)和基频(F0)。
  • 在查找表中预留一个伪说话人 ID,以生成非真实说话人的嵌入,确保匿名输出不与任何实际说话人关联。
  • 随机选取一个真实说话人嵌入并进行平均,通过加权拼接平均嵌入与伪说话人嵌入形成匿名嵌入。
  • 声学模型基于匿名嵌入和语言特征(PPG、F0)生成梅尔频谱图。
  • 使用微调后的 HifiGAN 基神经声码器将匿名梅尔频谱图转换为自然语音波形。
  • 系统避免依赖外部 ASV 模型或 x-vector 池,提升了泛化能力并降低了计算开销。

实验结果

研究问题

  • RQ1是否可以在不依赖外部 ASV 模型或 x-vector 池的情况下实现有效的说话人匿名化?
  • RQ2将伪说话人嵌入与平均化的真实说话人嵌入结合,对匿名化性能有何影响?
  • RQ3所提出方法在多大程度上抑制了说话人身份信息,同时保持了语音可懂度?
  • RQ4在隐私度量(EER)和实用性(WER)方面,该系统与基线方法相比表现如何?

主要发现

  • 所提系统实现了 30.15% 的平均等错误率(EER),相比 B1.b 基线系统提升了 20.97%,表明具有强大的隐私保护能力。
  • 系统实现了 5.82% 的词错误率(WER),比 B1.b 基线系统低 1.74%,表明语音可懂度更优。
  • 该系统在所有测试集(包括 LibriSpeech 和 VCTK)中均优于两个基线系统,EER 和 WER 均保持一致的性能提升。
  • 语音独特性度量 $G_{VD}$ 显著下降,证实匿名语音已失去说话人特异性特征,同时保持了语言内容。
  • 在所有条件下,基频相关性均保持在 0.7 以上,表明基频得到良好保留,支持自然语音质量。
  • 伪说话人嵌入的相似性矩阵中无明显主对角线,证实伪说话人未与任何真实说话人对齐,进一步增强了隐私性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。