Skip to main content
QUICK REVIEW

[论文解读] Voice-Indistinguishability: Protecting Voiceprint in Privacy-Preserving Speech Data Release

Yaowei Han, Sheng Li|arXiv (Cornell University)|Apr 16, 2020
Speech Recognition and Synthesis参考文献 25被引用 6
一句话总结

本文提出了一种基于差分隐私的新型度量方法——语音不可区分性(voice-indistinguishability),用于在语音数据发布中保护语音特征。该方法提出了两种框架——特征级与模型级框架,利用x向量表示和噪声注入技术,在隐私与效用之间实现强平衡,通过在公开数据集上获得更低的CER和更高的MOS评分得到验证。

ABSTRACT

With the development of smart devices, such as the Amazon Echo and Apple's HomePod, speech data have become a new dimension of big data. However, privacy and security concerns may hinder the collection and sharing of real-world speech data, which contain the speaker's identifiable information, i.e., voiceprint, which is considered a type of biometric identifier. Current studies on voiceprint privacy protection do not provide either a meaningful privacy-utility trade-off or a formal and rigorous definition of privacy. In this study, we design a novel and rigorous privacy metric for voiceprint privacy, which is referred to as voice-indistinguishability, by extending differential privacy. We also propose mechanisms and frameworks for privacy-preserving speech data release satisfying voice-indistinguishability. Experiments on public datasets verify the effectiveness and efficiency of the proposed methods.

研究动机与目标

  • 解决语音数据发布中语音特征保护缺乏正式隐私定义的问题。
  • 开发一种独立于攻击者背景知识的隐私度量,确保强隐私保障。
  • 在保留语言内容的同时模糊说话人身份,实现语音数据发布中隐私与效用的平衡。
  • 设计基于不同扰动层级(特征级与模型级)的实用化语音特征匿名化框架。
  • 通过在公开语音数据集上的客观与主观评估,实证验证所提方法的有效性。

提出的方法

  • 将度量隐私扩展至定义语音不可区分性,一种基于表示语音特征的x向量之间距离的正式隐私概念。
  • 应用差分隐私原则,根据x向量之间的成对距离向x向量注入噪声,确保隐私保护程度与相似性成比例。
  • 提出两种框架:特征级框架直接扰动x向量,而模型级框架在端到端语音识别训练过程中注入噪声。
  • 使用x向量作为语音特征表示,并根据机制敏感性调整噪声尺度,以确保满足隐私预算(ε)要求。
  • 采用连接时序分类(CTC)结合字符级标签与批量归一化,训练在扰动数据上表现鲁棒的自动语音识别(ASR)模型。
  • 通过字符错误率(CER)评估效用,通过平均意见得分(MOS)评估自然度,主观听音测试由15名听者参与。

实验结果

研究问题

  • RQ1能否为语音特征保护定义一种正式的隐私度量,且不依赖于对攻击者背景知识的假设?
  • RQ2如何在语音数据发布中对语音特征隐私进行定量测量并确保其保障?
  • RQ3在语音特征匿名化语音数据中,隐私与效用之间的权衡关系如何?
  • RQ4不同实现层级(特征级与模型级)对时间复杂度与性能有何影响?
  • RQ5所提方法在匿名化后在多大程度上保持了语音识别的实用性?

主要发现

  • 所提出的语音不可区分性度量提供了严谨、数学基础坚实的隐私保障,且独立于攻击者知识。
  • 更大的隐私预算ε导致更低的字符错误率(CER),证实了更高的噪声容忍度可提升实用性。
  • 主观评估显示自然度MOS得分高,且语音间差异显著,表明在不牺牲音频质量的前提下实现了有效的隐私保护。
  • 模型级框架相比特征级框架将时间复杂度降低了O(n²),尤其在大规模数据集上更具优势。
  • 两种框架均实现了隐私与效用的平衡,CER随ε增大而降低,证明了噪声注入机制的有效性。
  • 该方法成功抵御了说话人验证攻击,同时在自动语音识别任务中保持了高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。