Skip to main content
QUICK REVIEW

[论文解读] A Study of F0 Modification for X-Vector Based Speech Pseudonymization Across Gender

Pierre Champion, Denis Jouvet|arXiv (Cornell University)|Jan 21, 2021
Speech and Audio Processing被引用 11
一句话总结

本文提出在基于x-vector的语音假名化中修改基频(F0),以在保持语音可懂度的同时增强隐私保护。通过结合选择相反性别目标说话人的方法修改F0,该方法显著提升了不可链接性性能,尤其对女性说话人效果更明显,且未降低语音识别准确率,表明F0修改是实现鲁棒、性别感知假名化的关键因素。

ABSTRACT

Speech pseudonymization aims at altering a speech signal to map the identifiable personal characteristics of a given speaker to another identity. In other words, it aims to hide the source speaker identity while preserving the intelligibility of the spoken content. This study takes place in the VoicePrivacy 2020 challenge framework, where the baseline system performs pseudonymization by modifying x-vector information to match a target speaker while keeping the fundamental frequency (F0) unchanged. We propose to alter other paralin-guistic features, here F0, and analyze the impact of this modification across gender. We found that the proposed F0 modification always improves pseudonymization We observed that both source and target speaker genders affect the performance gain when modifying the F0.

研究动机与目标

  • 通过修改如F0等副语言特征,提升语音数据中的说话人假名化性能,这些特征保留了说话人身份线索。
  • 评估F0修改对男性和女性说话人不可链接性性能的影响。
  • 研究将F0修改与相反性别x-vector选择相结合,是否能增强隐私保护。
  • 在去标识化语音信号的同时,保持高语音可懂度(以WER衡量)。
  • 评估F0修改在假名化流程中对性别的依赖性效果。

提出的方法

  • 本研究在VoicePrivacy 2020 Baseline-1系统的基础上,于x-vector匿名化与语音合成阶段之间增加了一个F0修改模块。
  • F0值被修改为与目标说话人性别一致,以确保合成语音的语调一致性。
  • 匿名化流程将说话人身份(通过x-vector)、语言内容(通过PPGs)和语调(通过F0)解耦,仅对x-vector和F0进行修改以实现假名化。
  • 使用神经声学模型和神经波形模型,从修改后的特征合成最终的匿名化语音波形。
  • 系统强制实现从真实说话人到伪说话人的单对一双射映射,确保身份混淆的一致性。
  • 实验在男性和女性源说话人中,对比了F0修改与不修改、以及是否结合相反性别x-vector选择的情况。

实验结果

研究问题

  • RQ1修改基频(F0)是否能提升基于x-vector系统的假名化性能?
  • RQ2源说话人与目标说话人的性别如何影响F0修改的有效性?
  • RQ3F0修改与相反性别x-vector选择相结合,能否增强对原始到匿名化及匿名化到匿名化攻击的不可链接性?
  • RQ4F0修改在多大程度上影响语音可懂度,以LibriSpeech上的WER衡量?
  • RQ5F0修改带来的性能提升是否具有性别依赖性?

主要发现

  • F0修改在男性和女性说话人中均一致提升了假名化性能,降低了不可链接性任务中的等错误率(EER)。
  • 对于女性说话人,无论目标x-vector来自同性别或相反性别,F0修改均能提升不可链接性,且当结合F0修改与相反性别选择时提升最大。
  • 对于男性说话人,仅F0修改可维持或略微提升性能,但结合相反性别x-vector选择时,在匿名化到匿名化攻击场景中表现最佳。
  • LibriSpeech测试集上的WER在所有配置中保持稳定,当使用相反性别x-vector但不进行F0修改时,WER最高(7.24%),表明F0对齐能提升信号一致性。
  • 女性说话人对F0修改的敏感度高于男性说话人,提示最优假名化可能需要性别特定调优。
  • 结果表明,F0修改对于实现鲁棒假名化至关重要,尤其当目标说话人为相反性别时,可防止语调不一致导致的隐私下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。