Skip to main content
QUICK REVIEW

[论文解读] Local Differential Privacy for Bayesian Optimization

Xingyu Zhou, Jian Tan|arXiv (Cornell University)|Oct 13, 2020
Advanced Bandit Algorithms Research参考文献 24被引用 7
一句话总结

本文提出 MoMA-GP-UCB,一种新颖的贝叶斯优化算法,通过中位数-均值估计和核近似技术实现局部差分隐私(LDP),在隐私约束下实现稳健性能。该文建立了 LDP bandit 设置下的后悔下界,并证明 MoMA-GP-UCB 在减少复杂度的同时实现近乎最优的后悔表现,在合成数据与真实世界数据上的私有及非私有场景中均优于现有方法。

ABSTRACT

Motivated by the increasing concern about privacy in nowadays data-intensive online learning systems, we consider a black-box optimization in the nonparametric Gaussian process setting with local differential privacy (LDP) guarantee. Specifically, the rewards from each user are further corrupted to protect privacy and the learner only has access to the corrupted rewards to minimize the regret. We first derive the regret lower bounds for any LDP mechanism and any learning algorithm. Then, we present three almost optimal algorithms based on the GP-UCB framework and Laplace DP mechanism. In this process, we also propose a new Bayesian optimization (BO) method (called MoMA-GP-UCB) based on median-of-means techniques and kernel approximations, which complements previous BO algorithms for heavy-tailed payoffs with a reduced complexity. Further, empirical comparisons of different algorithms on both synthetic and real-world datasets highlight the superior performance of MoMA-GP-UCB in both private and non-private scenarios.

研究动机与目标

  • 为解决在奖励数据受隐私保护机制污染的背景下,缺乏本地差分隐私(LDP)贝叶斯优化方法的问题。
  • 推导任意 LDP 机制与学习算法在高斯过程 bandit 设置下的基本后悔下界。
  • 设计高效、私有的贝叶斯优化算法,在 LDP 约束下保持低后悔。
  • 提升在重尾分布与私有奖励分布下的贝叶斯优化可扩展性与鲁棒性。

提出的方法

  • 提出 MoMA-GP-UCB,一种基于 GP-UCB 的新算法,采用中位数-均值技术以在重尾奖励下稳定估计。
  • 利用核近似技术降低在 LDP 条件下高斯过程推理的计算复杂度。
  • 集成拉普拉斯机制以实现本地差分隐私,确保个体奖励在被观测前已被扰动。
  • 采用分块采样策略并结合分组观测,以提升置信区间稳定性和降低方差。
  • 利用集中不等式与矩阵扰动理论,推导估计误差的高概率置信区间。
  • 通过结合中位数-均值稳定性与核近似误差控制,建立理论后悔边界。

实验结果

研究问题

  • RQ1在奖励受污染的贝叶斯优化设置中,任意学习算法与 LDP 机制的后悔下界是什么?
  • RQ2如何设计一种在确保本地差分隐私的同时保持低后悔的贝叶斯优化算法?
  • RQ3中位数-均值与核近似技术能否有效结合,以在 LDP 与重尾奖励下降低复杂度并提升鲁棒性?
  • RQ4所提出的 MoMA-GP-UCB 算法在合成与真实世界设置中,相较于现有私有与非私有 BO 方法的性能如何?

主要发现

  • 本文为任意 LDP 机制与学习算法在 GP bandit 设置下建立了后悔下界,为隐私-效用权衡提供了理论基准。
  • MoMA-GP-UCB 实现了累积后悔上界 $ O\left(\hat{B}\sqrt{\gamma_T T \ln\frac{T}{\delta}} + Z\ln\frac{T}{\delta} c^{\frac{1}{1+\alpha}} T^{\frac{1}{1+\alpha}} \gamma_T^{\frac{3+\alpha}{2(1+\alpha)}}\right) $,其中 $ \hat{B} $ 与 $ Z $ 取决于隐私与噪声参数。
  • 该算法在多个合成与真实世界数据集(包括光照传感器与股票市场数据)上,相较于基线 LDP 方法展现出更优的实验性能。
  • 所提出的中位数-均值与核近似技术显著降低了计算复杂度,同时保持对重尾奖励分布的鲁棒性。
  • 实验结果表明,MoMA-GP-UCB 即使在非私有设置下也表现具有竞争力,表明其优势不仅限于隐私约束。
  • 该方法通过拉普拉斯机制实现强隐私保障,同时通过稳定估计维持紧密的置信区间,经大量实验验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。