[论文解读] Voice-Indistinguishability: Protecting Voiceprint in Privacy-Preserving Speech Data Release
本文提出了一种基于差分隐私的新型度量方法——语音不可区分性(voice-indistinguishability),用于在语音数据发布中保护语音特征。该方法提出了两种框架——特征级与模型级框架,利用x向量表示和噪声注入技术,在隐私与效用之间实现强平衡,通过在公开数据集上获得更低的CER和更高的MOS评分得到验证。
With the development of smart devices, such as the Amazon Echo and Apple's HomePod, speech data have become a new dimension of big data. However, privacy and security concerns may hinder the collection and sharing of real-world speech data, which contain the speaker's identifiable information, i.e., voiceprint, which is considered a type of biometric identifier. Current studies on voiceprint privacy protection do not provide either a meaningful privacy-utility trade-off or a formal and rigorous definition of privacy. In this study, we design a novel and rigorous privacy metric for voiceprint privacy, which is referred to as voice-indistinguishability, by extending differential privacy. We also propose mechanisms and frameworks for privacy-preserving speech data release satisfying voice-indistinguishability. Experiments on public datasets verify the effectiveness and efficiency of the proposed methods.
研究动机与目标
- 解决语音数据发布中语音特征保护缺乏正式隐私定义的问题。
- 开发一种独立于攻击者背景知识的隐私度量,确保强隐私保障。
- 在保留语言内容的同时模糊说话人身份,实现语音数据发布中隐私与效用的平衡。
- 设计基于不同扰动层级(特征级与模型级)的实用化语音特征匿名化框架。
- 通过在公开语音数据集上的客观与主观评估,实证验证所提方法的有效性。
提出的方法
- 将度量隐私扩展至定义语音不可区分性,一种基于表示语音特征的x向量之间距离的正式隐私概念。
- 应用差分隐私原则,根据x向量之间的成对距离向x向量注入噪声,确保隐私保护程度与相似性成比例。
- 提出两种框架:特征级框架直接扰动x向量,而模型级框架在端到端语音识别训练过程中注入噪声。
- 使用x向量作为语音特征表示,并根据机制敏感性调整噪声尺度,以确保满足隐私预算(ε)要求。
- 采用连接时序分类(CTC)结合字符级标签与批量归一化,训练在扰动数据上表现鲁棒的自动语音识别(ASR)模型。
- 通过字符错误率(CER)评估效用,通过平均意见得分(MOS)评估自然度,主观听音测试由15名听者参与。
实验结果
研究问题
- RQ1能否为语音特征保护定义一种正式的隐私度量,且不依赖于对攻击者背景知识的假设?
- RQ2如何在语音数据发布中对语音特征隐私进行定量测量并确保其保障?
- RQ3在语音特征匿名化语音数据中,隐私与效用之间的权衡关系如何?
- RQ4不同实现层级(特征级与模型级)对时间复杂度与性能有何影响?
- RQ5所提方法在匿名化后在多大程度上保持了语音识别的实用性?
主要发现
- 所提出的语音不可区分性度量提供了严谨、数学基础坚实的隐私保障,且独立于攻击者知识。
- 更大的隐私预算ε导致更低的字符错误率(CER),证实了更高的噪声容忍度可提升实用性。
- 主观评估显示自然度MOS得分高,且语音间差异显著,表明在不牺牲音频质量的前提下实现了有效的隐私保护。
- 模型级框架相比特征级框架将时间复杂度降低了O(n²),尤其在大规模数据集上更具优势。
- 两种框架均实现了隐私与效用的平衡,CER随ε增大而降低,证明了噪声注入机制的有效性。
- 该方法成功抵御了说话人验证攻击,同时在自动语音识别任务中保持了高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。