[论文解读] Latent Dirichlet Allocation Model Training with Differential Privacy
本文提出了首个支持差分隐私的LDA训练框架,包含三种新颖算法:HDP-LDA用于集中式数据,LP-LDA用于众包数据中的本地差分隐私,OLP-LDA用于在线流式数据。该工作首次建立了折叠Gibbs采样与差分隐私之间的理论联系,证明了主题采样本身通过指数机制天然具备隐私保护能力,并验证了所提方法在强隐私保障下仍能保持高模型效用。
Latent Dirichlet Allocation (LDA) is a popular topic modeling technique for hidden semantic discovery of text data and serves as a fundamental tool for text analysis in various applications. However, the LDA model as well as the training process of LDA may expose the text information in the training data, thus bringing significant privacy concerns. To address the privacy issue in LDA, we systematically investigate the privacy protection of the main-stream LDA training algorithm based on Collapsed Gibbs Sampling (CGS) and propose several differentially private LDA algorithms for typical training scenarios. In particular, we present the first theoretical analysis on the inherent differential privacy guarantee of CGS based LDA training and further propose a centralized privacy-preserving algorithm (HDP-LDA) that can prevent data inference from the intermediate statistics in the CGS training. Also, we propose a locally private LDA training algorithm (LP-LDA) on crowdsourced data to provide local differential privacy for individual data contributors. Furthermore, we extend LP-LDA to an online version as OLP-LDA to achieve LDA training on locally private mini-batches in a streaming setting. Extensive analysis and experiment results validate both the effectiveness and efficiency of our proposed privacy-preserving LDA training algorithms.
研究动机与目标
- 解决LDA训练中的隐私风险,其中中间统计量和模型参数可能泄露训练数据中的敏感信息。
- 为集中式与去中心化LDA训练场景(包括流式数据)提供全面的隐私保护。
- 正式分析LDA中折叠Gibbs采样(CGS)的内在差分隐私性质,揭示其与指数机制的关联。
- 设计实用、高效且具备隐私保护能力的LDA算法,在强隐私预算下仍保持高模型效用。
- 将本地差分隐私扩展至在线LDA训练,实现实时、隐私保护的流式主题建模。
提出的方法
- 提出HDP-LDA,一种集中式差分隐私LDA训练算法,通过指数机制利用主题采样本身的隐私特性,保护CGS中的中间统计量。
- 设计LP-LDA,一种本地差分隐私LDA框架,其中客户端在上传前对单个文档进行本地差分隐私清洗。
- 提出OLP-LDA,一种在线LDA算法,利用先验知识对局部差分隐私化的小批量数据进行增量式模型优化。
- 在OLP-LDA中采用混合损失函数,结合重建损失与相关性损失,以提升在扰动数据流上的模型保真度。
- 在OLP-LDA中利用先验数据集初始化模型参数,降低噪声影响,提升收敛速度与性能。
- 对CGS中的词频统计量与主题分配应用差分隐私,确保在(ε, δ)-DP下的端到端隐私保障。
实验结果
研究问题
- RQ1LDA中的折叠Gibbs采样过程是否能天然提供差分隐私?若可以,其适用条件是什么?
- RQ2在可信但好奇的服务器环境下,如何保护基于CGS的集中式LDA训练中中间统计量免受推理攻击?
- RQ3在众包文本数据上,能否有效应用本地差分隐私进行LDA训练而不造成显著的效用损失?
- RQ4当数据以小批量形式到达且每份文档必须本地清洗时,如何实现在线LDA训练的隐私保护?
- RQ5隐私预算(ε)、模型效用(如困惑度、F1分数)与系统参数(如小批量大小、先验数据集大小)之间存在何种权衡?
主要发现
- HDP-LDA通过保护基于CGS的LDA训练中的中间统计量,实现了强隐私保障,且模型效用无显著下降。
- 在弱隐私环境(如ε = 3.0)下,LP-LDA的模型效用优于CDP-LDA,且随着ε增大,性能趋近于普通CGS。
- 当使用足够大的先验数据集时,OLP-LDA的困惑度接近非私有的O-LDA基线,表明其在在线场景中具有高度有效性。
- OLP-LDA的困惑度随小批量编号单调递减,表明其随时间推移实现稳定且迭代的模型优化。
- OLP-LDA的模型性能随先验数据集规模增大而提升,证实先验知识可增强本地隐私下的模型准确性。
- OLP-LDA对小批量大小相对不敏感,表明其在实际部署中具备鲁棒性与稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。