[论文解读] Privacy-preserving Active Learning on Sensitive Data for User Intent Classification
本文提出了一种用于用户意图分类的隐私保护主动学习框架,通过将差分隐私(DP)与主动学习相结合,在众包标注过程中保护敏感用户数据。通过受控采样和k-匿名化实现差分隐私,该方法实现了可量化的隐私保障——以(ε, δ)-DP衡量——同时减少标注预算并保持具有竞争力的模型准确率,展示了隐私、效用与成本之间的可调和权衡。
Active learning holds promise of significantly reducing data annotation costs while maintaining reasonable model performance. However, it requires sending data to annotators for labeling. This presents a possible privacy leak when the training set includes sensitive user data. In this paper, we describe an approach for carrying out privacy preserving active learning with quantifiable guarantees. We evaluate our approach by showing the tradeoff between privacy, utility and annotation budget on a binary classification task in a active learning setting.
研究动机与目标
- 解决在将敏感用户数据发送给外部标注者时主动学习中的隐私风险。
- 在主动学习管道的数据标注过程中量化并强制执行隐私保障。
- 评估在二元用户意图分类任务中,隐私(通过(ε, δ)-差分隐私衡量)、模型效用与标注预算之间的权衡。
- 证明差分隐私可有效应用于主动学习中的文本数据,克服k-匿名化的局限性。
- 为在现实世界NLP应用中部署隐私保护的主动学习提供框架,实现可测量的隐私与性能权衡。
提出的方法
- 在将未标注数据发送给标注者之前应用(ε, δ)-差分隐私,确保单个数据点无法被唯一识别。
- 使用参数β的采样机制,随机选择一部分数据点进行标注,降低重新识别的风险。
- 通过将相似查询分组来强制实现k-匿名化,确保每个查询在批次中至少出现k次,防止通过频率分析实现重新识别。
- 将不确定性采样用于主动学习,并结合DP约束,选择最具信息量的样本同时保持隐私。
- 利用文献中现有的DP算法实例化隐私机制,通过调节参数β(采样率)和k(匿名化因子)以实现所需的(ε, δ)水平。
- 在二元用户意图分类任务上评估该方法,测量不同(ε, δ)以及k/β配置下的隐私、准确率与预算。
实验结果
研究问题
- RQ1差分隐私能否有效应用于基于文本的主动学习,以在众包标注过程中保护敏感用户查询?
- RQ2在敏感数据的主动学习中,隐私(以(ε, δ)衡量)、模型效用(准确率)与标注预算之间的权衡如何?
- RQ3k-匿名化与采样率β如何共同影响NLP主动学习中的隐私-效用权衡?
- RQ4所提出的方法能否在保持可接受模型性能的前提下,提供强于仅使用k-匿名化时的隐私保障?
- RQ5任务复杂度如何影响在NLP主动学习中应用DP时的准确率损失?
主要发现
- 通过调节采样率β和匿名化因子k,该方法实现了(ε, δ)-差分隐私保障,更强的隐私(更小的ε, δ)需要更高的k和更低的β。
- 当δ = 1×10⁻⁶且ε = 1.0时,模型在β = 0.1和k = 20下达到68.7%的准确率,表明隐私与效用之间具有良好的平衡。
- 将β从0.9降低到0.1可增强隐私保障,但略微降低准确率,表明存在清晰的隐私-成本权衡。
- 当δ降低至1×10⁻¹⁵时,在β = 0.1和k = 20下准确率下降至64.7%,表明更强的隐私约束会带来更高的效用成本。
- 该方法优于仅使用k-匿名化,后者在k较小时或数据高度唯一时无法提供足够的隐私保障。
- 该框架表明,隐私可在主动学习中被量化和控制,从而实现在敏感NLP应用中可测量风险降低的部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。