Skip to main content
QUICK REVIEW

[论文解读] (Locally) Differentially Private Combinatorial Semi-Bandits

Xiaoyu Chen, Kai Zheng|arXiv (Cornell University)|Jun 1, 2020
Advanced Bandit Algorithms Research参考文献 37被引用 4
一句话总结

本文提出了在 $B_\infty$- 和 $B_1$-有界平滑性假设下,针对组合半-bandit(Combinatorial Semi-Bandits)的差分隐私算法,实现了接近最优的遗憾界,与非私有情况下的速率一致。结果表明,在这些设定下,隐私不会带来额外的遗憾成本,$\varepsilon$-LDP 下的最优遗憾界为 $\Theta(\frac{mB^{2}_{\infty}\ln T}{\varepsilon^{2}\Delta})$,$\varepsilon$-DP 下为 $\tilde{\Theta}(\frac{mB^{2}_{\infty}\ln T}{\varepsilon\Delta})$,而 $B_1$-有界平滑性下 $\varepsilon$-DP 的遗憾界为 $\tilde{\Theta}(\frac{mKB^{2}_{1}\ln T}{\varepsilon\Delta})$。

ABSTRACT

In this paper, we study Combinatorial Semi-Bandits (CSB) that is an extension of classic Multi-Armed Bandits (MAB) under Differential Privacy (DP) and stronger Local Differential Privacy (LDP) setting. Since the server receives more information from users in CSB, it usually causes additional dependence on the dimension of data, which is a notorious side-effect for privacy preserving learning. However for CSB under two common smoothness assumptions \cite{kveton2015tight,chen2016combinatorial}, we show it is possible to remove this side-effect. In detail, for $B_{\infty}$-bounded smooth CSB under either $\varepsilon$-LDP or $\varepsilon$-DP, we prove the optimal regret bound is $Θ(\frac{mB^2_{\infty}\ln T } {Δε^2})$ or $ ildeΘ(\frac{mB^2_{\infty}\ln T} { Δε})$ respectively, where $T$ is time period, $Δ$ is the gap of rewards and $m$ is the number of base arms, by proposing novel algorithms and matching lower bounds. For $B_1$-bounded smooth CSB under $\varepsilon$-DP, we also prove the optimal regret bound is $ ildeΘ(\frac{mKB^2_1\ln T} {Δε})$ with both upper bound and lower bound, where $K$ is the maximum number of feedback in each round. All above results nearly match corresponding non-private optimal rates, which imply there is no additional price for (locally) differentially private CSB in above common settings.

研究动机与目标

  • 设计组合半-bandit(CSB)在本地差分隐私(LDP)和全局差分隐私(DP)设定下的差分隐私算法。
  • 分析在常见平滑性假设下($B_\infty$-有界和平滑性与 $B_1$-有界平滑性)的私有 CSB 的遗憾界。
  • 确定隐私是否在非私有最优速率之外引入了额外的遗憾成本。
  • 在各种隐私和平滑性条件下,建立近乎匹配的遗憾上界与下界。

提出的方法

  • 针对 $\varepsilon$-LDP 和 $\varepsilon$-DP 下的 $B_\infty$-有界平滑性 CSB,提出新颖的私有算法,采用私有求和与基于树的聚合技术。
  • 提出一种针对 $\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 的新算法,实现 $\mathcal{O}(\frac{mK^{2}B^{2}_{1}\ln T}{\Delta\varepsilon^{2}})$ 的遗憾上界。
  • 基于 Karwa & Vadhan (2017) 的耦合论证,推导出次优超臂被拉动次数的下界。
  • 构建一个包含 $m$ 个基础臂的困难实例,划分为最优、公共和辅助集合,以证明 $\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 的遗憾下界为 $\Omega(\frac{mKB_{1}\ln T}{\varepsilon\Delta})$。
  • 利用稀疏向量技术与逐步淘汰的臂来减少私有 CSB 中的遗憾,灵感来自非私有的逐步淘汰算法。
  • 提出一种新颖的从私有 CSB 到具有结构化反馈的私有多臂老虎机(MAB)的约化方法,利用平滑性避免遗憾界因维度增加而爆炸。

实验结果

研究问题

  • RQ1差分隐私组合半-bandit 算法能否实现与非私有最优速率相匹配的遗憾界?
  • RQ2在 $B_\infty$-有界平滑性下,反馈的维度(即 $K$)是否在私有 CSB 中不可避免地引入额外的遗憾惩罚?
  • RQ3$\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 的最优遗憾界是什么?是否可以避免对 $K$ 的额外依赖?
  • RQ4$\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 的遗憾下界是否紧致?当前下界是否存在改进空间?

主要发现

  • 对于 $B_\infty$-有界平滑性 CSB,$\varepsilon$-LDP 下的最优遗憾为 $\Theta(\frac{mB^{2}_{\infty}\ln T}{\varepsilon^{2}\Delta})$,与非私有速率仅相差对数因子。
  • 在 $\varepsilon$-DP 下,$B_\infty$-有界平滑性 CSB 的最优遗憾为 $\tilde{\Theta}(\frac{mB^{2}_{\infty}\ln T}{\varepsilon\Delta})$,几乎与非私有边界匹配。
  • 在 $\varepsilon$-DP 下,$B_1$-有界平滑性 CSB 的最优遗憾为 $\tilde{\Theta}(\frac{mKB^{2}_{1}\ln T}{\varepsilon\Delta})$,上下界在对数因子内一致。
  • $\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 的遗憾下界为 $\Omega(\frac{mKB_{1}\ln T}{\varepsilon\Delta})$,在对数因子内是紧致的。
  • 所提出的 $\varepsilon$-DP 下 $B_1$-有界平滑性 CSB 算法实现 $\mathcal{O}(\frac{mK^{2}B^{2}_{1}\ln T}{\Delta\varepsilon^{2}})$ 的遗憾,表明在 $K$-依赖性上存在上下界之间的差距。
  • 本文推测下界偏松,而算法接近最优,但 $K$-依赖性上的差距仍为开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。