[论文解读] Threshold KNN-Shapley: A Linear-Time and Privacy-Friendly Approach to Data Valuation
本文提出阈值K近邻Shapley(TKNN-Shapley),一种线性时间、隐私友好的数据价值评估方法,通过使用基于阈值的邻居选择替代固定K个最近邻,取代了标准的K近邻Shapley。该方法在保持与真实世界数据集上K近邻Shapley相当性能的同时,实现了高效的差分隐私数据价值评估,并展现出更优的隐私-效用权衡。
Data valuation aims to quantify the usefulness of individual data sources in training machine learning (ML) models, and is a critical aspect of data-centric ML research. However, data valuation faces significant yet frequently overlooked privacy challenges despite its importance. This paper studies these challenges with a focus on KNN-Shapley, one of the most practical data valuation methods nowadays. We first emphasize the inherent privacy risks of KNN-Shapley, and demonstrate the significant technical difficulties in adapting KNN-Shapley to accommodate differential privacy (DP). To overcome these challenges, we introduce TKNN-Shapley, a refined variant of KNN-Shapley that is privacy-friendly, allowing for straightforward modifications to incorporate DP guarantee (DP-TKNN-Shapley). We show that DP-TKNN-Shapley has several advantages and offers a superior privacy-utility tradeoff compared to naively privatized KNN-Shapley in discerning data quality. Moreover, even non-private TKNN-Shapley achieves comparable performance as KNN-Shapley. Overall, our findings suggest that TKNN-Shapley is a promising alternative to KNN-Shapley, particularly for real-world applications involving sensitive data.
研究动机与目标
- 解决数据价值评估中被忽视的隐私风险,特别是K近邻Shapley可能通过价值评分泄露训练数据点信息的问题。
- 识别出K近邻Shapley的高全局敏感性使其在不造成显著效用损失的情况下无法与差分隐私(DP)兼容。
- 开发一种新的数据价值评估框架,兼具计算效率和原生差分隐私保证。
- 证明TKNN-Shapley在实现与K近邻Shapley相当性能的同时,可通过简单的计数查询实现有效的差分隐私。
- 在非私有和差分隐私设置下,通过实证验证TKNN-Shapley在多样化数据集上的鲁棒性和效用。
提出的方法
- 提出阈值-K近邻(TKNN),即一种K近邻的变体,其包含所有在固定距离阈值内与测试点相邻的训练点,而非恰好K个最近邻。
- 推导出在TKNN分类器下数据Shapley值的闭式表达式,实现线性时间内的精确计算。
- 证明TKNN-Shapley仅依赖于三个计数查询(例如,阈值内邻居数量),这些查询可通过拉普拉斯或高斯机制自然地适用于差分隐私。
- 通过向这些计数查询添加校准噪声,构建DP-TKNN-Shapley,确保正式的差分隐私保证。
- 利用TKNN-Shapley的结构简单性,实现在无需模型微调的情况下高效、可扩展且私密的数据价值评估。
- 采用与K近邻Shapley相同的基于嵌入的框架,将TKNN-Shapley应用于高维数据的深层神经网络表示。
实验结果
研究问题
- RQ1K近邻Shapley在多大程度上通过其价值评分暴露了训练数据点的私密信息?
- RQ2将差分隐私应用于K近邻Shapley的技术障碍是什么?为何其高全局敏感性使其对DP而言具有不可行性?
- RQ3能否设计一种改进的基于K近邻的数据价值评估方法,使其在计算效率和原生差分隐私方面均具备优势?
- RQ4DP-TKNN-Shapley的隐私-效用权衡与朴素的K近邻Shapley差分隐私化方法相比如何,特别是在检测误标或噪声数据方面?
- RQ5在非私有设置下,TKNN-Shapley在数据质量评估任务中是否能保持与K近邻Shapley相当的性能?
主要发现
- K近邻Shapley存在显著的隐私风险,通过一种类似成员推断的攻击,可利用价值评分的变化推断出数据点的是否存在。
- K近邻Shapley具有高全局敏感性,使其在不造成显著效用损失的情况下无法与差分隐私兼容。
- TKNN-Shapley在多个数据集(包括2dPlanes、CPU和Fraud)中,检测误标和噪声数据的性能与K近邻Shapley相当。
- 与朴素的K近邻Shapley差分隐私化方法相比,DP-TKNN-Shapley在隐私-效用权衡上表现更优,尤其在识别低质量数据点方面。
- 该方法计算效率高,支持线性时间内的精确计算,并可通过简单的计数查询实现端到端的差分隐私数据价值评估。
- 实证结果表明,TKNN-Shapley对超参数选择(如τ和K)具有鲁棒性,在不同阈值和邻居数量下均保持稳定性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。