[论文解读] Generalized Linear Bandits with Local Differential Privacy
该论文提出了用于广义线性多臂赌博机的局部差分隐私(LDP)算法,其遗憾边界与非私有设置下的结果相同。通过利用带有隐私保护更新的随机梯度下降(SGD)和普通最小二乘法(OLS)估计器,作者在LDP下建立了最优的遗憾率,且在合成数据和真实世界汽车贷款数据上均表现出强劲的实验性能,隐私参数设置严格。
Contextual bandit algorithms are useful in personalized online decision-making. However, many applications such as personalized medicine and online advertising require the utilization of individual-specific information for effective learning, while user's data should remain private from the server due to privacy concerns. This motivates the introduction of local differential privacy (LDP), a stringent notion in privacy, to contextual bandits. In this paper, we design LDP algorithms for stochastic generalized linear bandits to achieve the same regret bound as in non-privacy settings. Our main idea is to develop a stochastic gradient-based estimator and update mechanism to ensure LDP. We then exploit the flexibility of stochastic gradient descent (SGD), whose theoretical guarantee for bandit problems is rarely explored, in dealing with generalized linear bandits. We also develop an estimator and update mechanism based on Ordinary Least Square (OLS) for linear bandits. Finally, we conduct experiments with both simulation and real-world datasets to demonstrate the consistently superb performance of our algorithms under LDP constraints with reasonably small parameters $(\varepsilon, δ)$ to ensure strong privacy protection.
研究动机与目标
- 解决个性化在线决策中用户数据必须对服务器保持私密的隐私问题。
- 弥合在局部差分隐私(LDP)下非私有与私有多臂赌博机算法之间的遗憾差距。
- 设计高效、具备隐私保护能力的广义线性多臂赌博机学习算法,使其性能与非私有设置相当。
- 在强隐私约束下,于模拟数据和真实世界数据集上验证所提出方法的有效性。
提出的方法
- 开发基于随机梯度的估计器与更新机制,以在广义线性多臂赌博机中确保局部差分隐私(LDP)。
- 将带有隐私保障的随机梯度下降(SGD)方法适配于广义线性多臂赌博机问题,利用其理论灵活性。
- 设计基于OLS的估计器与更新机制,用于在LDP下的线性多臂赌博机,确保在保护隐私的同时实现精确的参数估计。
- 将贪婪算法与私有的OLS及SGD估计器相结合,以平衡探索、利用与隐私保护。
- 利用KL散度的链式法则与集中不等式进行隐私放大,推导出理论遗憾边界。
- 采用一种私有估计框架,确保每位用户的上下文与行为在$(\varepsilon,\delta)$-LDP下受到保护。
实验结果
研究问题
- RQ1我们能否设计出在广义线性多臂赌博机中实现与非私有设置下相同遗憾率的LDP算法?
- RQ2在多臂赌博机学习中,如何在确保强局部差分隐私的同时保持估计精度?
- RQ3在随机广义线性多臂赌博机中,隐私(由$\varepsilon$控制)与遗憾性能之间的最优权衡是什么?
- RQ4私有的SGD与OLS估计器能否与贪婪探索策略有效结合,实现在LDP下的最优遗憾?
- RQ5所提出的框架在合成与真实世界场景下是否均优于现有LDP多臂赌博机算法?
主要发现
- 所提出的LDP-SGD与LDP-GLOC算法在单参数随机广义线性多臂赌博机设置下达到$\tilde{O}(T^{1/2}/\varepsilon)$的遗憾,与非私有边界一致。
- 在多参数设置下,算法在$\beta$-边界条件下达到$\tilde{O}(T^{(1-\beta)/2}/\varepsilon^{1+\beta})$的遗憾,其中$\beta \in [0,1)$。
- 在$\beta = 1$的特殊情况下,遗憾边界简化为$O((\log T / \varepsilon)^2)$,这是在LDP下多参数情况的最优结果。
- 在真实汽车贷款数据上的实验表明,LDP-SGD与LDP-GLOC在$\varepsilon = 1$条件下,其遗憾表现持续优于非私有算法与先前的LDP基线方法。
- 理论分析建立了$\Omega(\sqrt{Td}/(e^{\varepsilon}-1))$的下界,证实了所提遗憾率的最优性。
- 该框架成功处理了真实应用场景(如个性化贷款)中的非线性奖励结构(例如逻辑斯蒂需求模型)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。