[论文解读] Conditional Analysis for Key-Value Data with Local Differential Privacy
本文提出适用于键值数据的局部差分隐私(LDP)机制,引入新颖的编码与解码方法,在强隐私保障下实现准确的频率与均值估计。此外,通过引入条件分析以建模键与值之间的相关性,显著降低估计误差,尤其在低均值场景下优于以往方法。
Local differential privacy (LDP) has been deemed as the de facto measure for privacy-preserving distributed data collection and analysis. Recently, researchers have extended LDP to the basic data type in NoSQL systems: the key-value data, and show its feasibilities in mean estimation and frequency estimation. In this paper, we develop a set of new perturbation mechanisms for key-value data collection and analysis under the strong model of local differential privacy. Since many modern machine learning tasks rely on the availability of conditional probability or the marginal statistics, we then propose the conditional frequency estimation method for key analysis and the conditional mean estimation for value analysis in key-value data. The released statistics with conditions can further be used in learning tasks. Extensive experiments of frequency and mean estimation on both synthetic and real-world datasets validate the effectiveness and accuracy of the proposed key-value perturbation mechanisms against the state-of-art competitors.
研究动机与目标
- 解决现有LDP方法在键值数据上的局限性,特别是低均值情况下的性能不佳问题。
- 设计高效、非交互式的编码与解码机制,确保ε-差分隐私的同时通信成本最低。
- 在键值数据中实现条件分析,以建模键与其对应值之间的依赖关系,支持高级分析。
- 通过结合最先进的LDP技术与优化的离散化及噪声注入方法,提升频率与均值估计的准确性。
- 提供理论与实证验证,特别关注不同数据分布与隐私预算下的性能表现。
提出的方法
- 提出KVUE机制,一种新型键值数据扰动方法,通过优化噪声注入的随机响应技术提升估计准确性。
- 引入F2M(频率转均值)与KVOH(键值最优哈希)机制,通过默认值编码与方差缩减技术提升均值估计性能。
- 设计一种独热编码方案用于条件分析,使聚合器能够估计多键的联合频率与条件均值。
- 通过理论分析表明估计误差随迭代累积,提出迭代优化方法以实现无偏均值估计。
- 将哈达玛变换作为未来优化路径,以降低高维条件分析中的通信与计算成本。
- 将现有LDP技术——如随机响应与基于直方图的估计——整合进统一的键值数据框架中。
实验结果
研究问题
- RQ1在局部差分隐私下,如何提升键值数据中频率与均值估计的准确性,特别是在均值较低的情况下?
- RQ2何种编码与解码机制可在最小通信与计算开销下实现强隐私保障?
- RQ3如何形式化并实现键值数据中的条件分析,以建模键与其关联值之间的相关性?
- RQ4在F2M等均值估计机制中,默认值的选择有何影响?是否会影响估计准确性?
- RQ5在条件分析中,估计误差如何随维度增加而变化?该方法的实际适用极限是什么?
主要发现
- KVUE机制在所有测试数据集与隐私预算下,均实现最低的频率与均值估计误差。
- F2M与KVOH机制表现出可接受的准确性,在低均值场景下优于PrivKVM与PrivKV。
- 随着键频率提高,估计误差降低,因更多数据使估计更稳定。
- F2M中的默认值对均值估计准确性影响可忽略,表明离散化噪声主要受随机响应噪声主导。
- 由于编码空间呈指数级增长(O(d³)),条件频率与均值估计误差随维度增加而上升。
- 条件均值估计误差始终低于条件频率估计误差,因频率误差会传播至均值估计中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。