Skip to main content
QUICK REVIEW

[论文解读] Federated Linear Contextual Bandits

Ruiquan Huang, Weiqiang Wu|arXiv (Cornell University)|Oct 27, 2021
Advanced Bandit Algorithms Research参考文献 58被引用 15
一句话总结

本文提出 Fed-PE,一种通信高效的联邦线性上下文Bandits算法,使客户端能够在不共享原始数据或本地特征的情况下协作学习全局参数。通过利用多客户端G-最优设计和共线依赖策略,Fed-PE在不相交和共享参数设置下均实现了近乎最优的遗憾,且通信成本为对数级。

ABSTRACT

This paper presents a novel federated linear contextual bandits model, where individual clients face different $K$-armed stochastic bandits coupled through common global parameters. By leveraging the geometric structure of the linear rewards, a collaborative algorithm called Fed-PE is proposed to cope with the heterogeneity across clients without exchanging local feature vectors or raw data. Fed-PE relies on a novel multi-client G-optimal design, and achieves near-optimal regrets for both disjoint and shared parameter cases with logarithmic communication costs. In addition, a new concept called collinearly-dependent policies is introduced, based on which a tight minimax regret lower bound for the disjoint parameter case is derived. Experiments demonstrate the effectiveness of the proposed algorithms on both synthetic and real-world datasets.

研究动机与目标

  • 解决联邦多客户端上下文Bandits中数据异构性的问题,其中每个客户端面临不同的K臂随机Bandits。
  • 设计一种通信高效的算法,避免共享本地特征向量或原始数据,同时保持学习性能。
  • 在不相交和共享参数设置下,以对数级通信成本实现近乎最优的遗憾性能。
  • 通过一种新颖的共线依赖策略概念,为不相交参数情况建立紧致的最小最大遗憾下界。

提出的方法

  • 提出 Fed-PE,一种协作算法,使客户端仅共享全局参数的本地估计,从而保护数据隐私。
  • 引入多客户端G-最优设计,协调客户端间的探索行为,最小化估计方差并提升收敛性。
  • 采用基于阶段的探索策略,并自适应调整阶段长度,以高效平衡探索与利用。
  • 应用块坐标上升(BCA)算法求解G-最优设计问题,确保每阶段仅有稀疏客户端参与。
  • 引入一种新颖的共线依赖策略概念,推导出不相交参数情况下紧致的最小最大遗憾下界。
  • 引入稀疏度指标,量化每阶段每个客户端平均探索的臂的数量,将其与通信成本关联。

实验结果

研究问题

  • RQ1联邦线性上下文Bandits框架能否在最小通信量下实现近乎最优的遗憾,同时保护客户端数据隐私?
  • RQ2在不共享原始数据的前提下,如何在协作Bandits设置中有效管理奖励分布异构的客户端?
  • RQ3在不相交参数情况下,遗憾的根本极限是什么?能否被紧密刻画?
  • RQ4阶段长度选择如何影响联邦Bandits中遗憾与通信成本之间的权衡?
  • RQ5稀疏探索策略在多大程度上可降低联邦Bandits中每客户端的通信开销?

主要发现

  • Fed-PE在不相交和共享参数情况下均实现了近乎最优的遗憾,且通信成本为对数级,显著降低了带宽使用。
  • 由于一种新颖的G-最优设计,遗憾界相比先前工作提升了√K倍,该设计降低了估计方差。
  • 所提算法通过确保每客户端每阶段平均仅探索约2个臂(由稀疏度指标体现),维持了低每客户端通信量。
  • 实验表明,均匀阶段长度选择产生最低遗憾,而指数阶段长度选择在遗憾与通信成本之间提供了最佳权衡。
  • 通过共线依赖策略概念,为不相交参数情况的最小最大遗憾下界进行了紧密推导,证实了理论最优性。
  • BCA算法的迭代次数与客户端数量M成反比,表明其在客户端数量增加时具有良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。