Skip to main content
QUICK REVIEW

[论文解读] Optimal and Differentially Private Data Acquisition: Central and Local Mechanisms

Alireza Fallah, Ali Makhdoumi|arXiv (Cornell University)|Jan 10, 2022
Privacy-Preserving Technologies in Data被引用 9
一句话总结

本文将从隐私敏感用户处获取最优数据的问题形式化为在中心化和本地化差分隐私下的贝叶斯机制设计问题。它推导出异质隐私损失水平下的极小化极大最优估计器,并设计了高效的机制以真实地获取隐私敏感度,实现了中心化设置下的 O(n log n) 时间复杂度和本地化设置下的多项式时间近似方案(PTAS)。

ABSTRACT

We consider a platform's problem of collecting data from privacy sensitive users to estimate an underlying parameter of interest. We formulate this question as a Bayesian-optimal mechanism design problem, in which an individual can share her (verifiable) data in exchange for a monetary reward or services, but at the same time has a (private) heterogeneous privacy cost which we quantify using differential privacy. We consider two popular differential privacy settings for providing privacy guarantees for the users: central and local. In both settings, we establish minimax lower bounds for the estimation error and derive (near) optimal estimators for given heterogeneous privacy loss levels for users. Building on this characterization, we pose the mechanism design problem as the optimal selection of an estimator and payments that will elicit truthful reporting of users' privacy sensitivities. Under a regularity condition on the distribution of privacy sensitivities we develop efficient algorithmic mechanisms to solve this problem in both privacy settings. Our mechanism in the central setting can be implemented in time $\mathcal{O}(n \log n)$ where $n$ is the number of users and our mechanism in the local setting admits a Polynomial Time Approximation Scheme (PTAS).

研究动机与目标

  • 设计最优机制,以在确保差分隐私保证的前提下从隐私敏感用户处获取数据。
  • 解决数据获取平台中用户间异质隐私成本的挑战。
  • 在中心化和本地化隐私设置下,开发高效算法机制,真实获取用户报告的隐私敏感度。
  • 在贝叶斯最优机制设计框架下,最小化估计误差与总支付之和。
  • 建立差分隐私下估计误差的极小化极大下界,并推导出近似最优估计器。

提出的方法

  • 将数据获取问题形式化为具有私有隐私敏感度的贝叶斯最优机制设计问题。
  • 推导出在中心化和本地化差分隐私设置下估计误差的极小化极大下界。
  • 在中心化设置中提出一种加权数据与拉普拉斯噪声结合的线性估计器,作为近似最优解。
  • 引入一种本地机制,其中每个用户在报告前添加拉普拉斯噪声,随后使用加权平均估计器。
  • 采用类似于 Myerson 拍卖理论的支付恒等式,但针对用户间共享的估计误差收益进行了调整。
  • 为中心化设置开发了 O(n log n) 算法,为本地化设置开发了多项式时间近似方案(PTAS)。

实验结果

研究问题

  • RQ1平台如何在确保差分隐私的前提下,最优地从隐私敏感用户处获取数据?
  • RQ2在中心化和本地化差分隐私下,异质隐私损失水平的估计误差的极小化极大下界是什么?
  • RQ3如何设计机制以在中心化和本地化设置下真实地获取用户的私有隐私敏感度?
  • RQ4在中心化和本地化差分隐私框架下,实现最优机制的计算复杂度如何?
  • RQ5共享估计误差如何影响数据获取机制中支付与激励的设计?

主要发现

  • 在中心化设置中,结合用户数据加权平均与拉普拉斯噪声的线性估计器,可实现给定隐私损失水平下的近似最优估计误差。
  • 在本地化设置中,先对每个用户的私有数据添加拉普拉斯噪声,再进行聚合,可实现给定隐私水平下的最优估计误差。
  • 最优支付机制依赖于报告的隐私敏感度,并整合了用户间因估计误差降低而共享的收益。
  • O(n log n) 算法可解决中心化差分隐私设置下的机制设计问题。
  • 本地化差分隐私设置下的机制设计问题存在多项式时间近似方案(PTAS)。
  • 结果可扩展至多维参数估计和线性模型,前提是每种情况下极小化极大最优估计器均已明确表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。