[论文解读] Differentially Private Multi-Armed Bandits in the Shuffle Model
本文提出了一种在shuffle模型下的差分隐私多臂老虎机算法,实现了近乎最优的遗憾边界,在显著优于本地模型的同时,几乎匹配集中式模型的性能。该算法采用Almost-Elimination(AE)算法的分批变体,并结合私有二元求和机制,实现了高效且差分隐私保护的臂选择,遗憾规模为 $O\left(\sum_{\Delta_a > 0} \frac{1}{\Delta_a} \log T + \frac{k\sqrt{\log(1/\delta)}\log T}{\varepsilon}\right)$。
We give an $(\varepsilon,δ)$-differentially private algorithm for the multi-armed bandit (MAB) problem in the shuffle model with a distribution-dependent regret of $O\left(\left(\sum_{a\in [k]:Δ_a>0}\frac{\log T}{Δ_a} ight)+\frac{k\sqrt{\log\frac{1}δ}\log T}{\varepsilon} ight)$, and a distribution-independent regret of $O\left(\sqrt{kT\log T}+\frac{k\sqrt{\log\frac{1}δ}\log T}{\varepsilon} ight)$, where $T$ is the number of rounds, $Δ_a$ is the suboptimality gap of the arm $a$, and $k$ is the total number of arms. Our upper bound almost matches the regret of the best known algorithms for the centralized model, and significantly outperforms the best known algorithm in the local model.
研究动机与目标
- 通过利用shuffle模型作为中间信任模型,弥合差分隐私多臂老虎机中本地模型与集中式模型之间的遗憾差距。
- 设计一种实用且高效的算法,确保 $(\varepsilon,\delta)$-差分隐私,同时在序列决策中保持较低遗憾。
- 通过使用可信的shuffle机制减少噪声放大,改进现有本地模型算法中因 $1/\varepsilon^2$ 遗憾惩罚而带来的性能瓶颈。
- 实现与集中式DP算法相媲美的分布相关与分布无关的遗憾边界,且无需集中式模型所要求的强信任假设。
提出的方法
- 提出Almost-Elimination(AE)算法的分批变体,通过逐步增加批次规模,在各阶段评估臂并尽早检测和剔除次优臂。
- 在shuffle模型中使用私有二元求和机制作为核心原 primitive,以受控误差计算臂奖励的私有估计。
- 利用shuffle机制收集并随机化用户报告后再进行聚合,相比本地模型提供更强的隐私保障,同时相比本地DP减少噪声。
- 应用浓度不等式和高概率浓度事件,限制每条臂在剔除前所需的样本数量,从而确保低遗憾。
- 引入一个清晰的事件 $C$ 以控制失败概率,推导在该事件下的遗憾边界,再结合尾部概率得到期望遗憾。
- 采用指数增长的批次规模,以减少轮次数量并改善遗憾,尤其对次优性差距较大的臂更为有效。
实验结果
研究问题
- RQ1我们能否设计一种在shuffle模型下的差分隐私多臂老虎机算法,实现接近集中式模型的遗憾,避免本地模型中 $1/\varepsilon^2$ 的惩罚?
- RQ2我们如何利用shuffle模型的中间信任模型,在保持强隐私保障的同时减少奖励估计中的噪声?
- RQ3我们能否设计一种分批算法,实现在差分隐私下对次优臂的早期剔除,且对遗憾影响最小?
- RQ4在shuffle模型中,多臂老虎机的隐私参数 $\varepsilon$、$\delta$ 与遗憾之间最优权衡为何?
- RQ5通过自适应分批和私有聚合,我们能否将私有老虎机中的加法遗憾项从 $O(k \log T / \varepsilon^2)$ 改进为 $O(k \sqrt{\log(1/\delta)} \log T / \varepsilon)$?
主要发现
- 所提算法实现了分布相关的遗憾 $O\left(\sum_{\Delta_a > 0} \frac{\log T}{\Delta_a} + \frac{k\sqrt{\log(1/\delta)}\log T}{\varepsilon}\right)$,几乎匹配集中式模型的性能。
- 分布无关的遗憾为 $O\left(\sqrt{kT\log T} + \frac{k\sqrt{\log(1/\delta)}\log T}{\varepsilon}\right)$,显著优于本地模型中 $\Omega(1/\varepsilon^2)$ 的依赖关系。
- 该算法通过指数增长的批次规模,实现对次优臂的早期检测与剔除,减少了所需样本数并改善了遗憾边界。
- shuffle模型中的私有二元求和机制确保了 $O(\sqrt{\log(1/\delta)}/\varepsilon)$ 的误差,这对控制加法遗憾项至关重要。
- 其关键创新在于结合shuffle模型的隐私强度与自适应分批机制,实现了隐私与遗憾之间的近最优权衡。
- 分析表明,清晰事件 $C$ 以高概率发生,即使在条件于罕见失败事件时,期望遗憾仍被推导出的表达式所限制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。