Skip to main content
QUICK REVIEW

[论文解读] Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee

Flint Xiaofeng Fan, Yining Ma|arXiv (Cornell University)|Oct 26, 2021
Privacy-Preserving Technologies in Data被引用 16
一句话总结

本文提出了一种容错联邦强化学习框架 FedPG-BR,可在任意系统故障或对抗性攻击(即拜占庭故障)下保证收敛性,并通过增加参与智能体数量提升样本效率。该框架结合了方差减少的策略梯度优化与基于梯度的拜占庭过滤机制,当少于一半的智能体发生故障时,其样本复杂度为 $O(1/\/epsilon^{5/3})$,并带有额外的 $O(\alpha^{4/3}/\\epsilon^{5/3})$ 损失项。

ABSTRACT

The growing literature of Federated Learning (FL) has recently inspired Federated Reinforcement Learning (FRL) to encourage multiple agents to federatively build a better decision-making policy without sharing raw trajectories. Despite its promising applications, existing works on FRL fail to I) provide theoretical analysis on its convergence, and II) account for random system failures and adversarial attacks. Towards this end, we propose the first FRL framework the convergence of which is guaranteed and tolerant to less than half of the participating agents being random system failures or adversarial attackers. We prove that the sample efficiency of the proposed framework is guaranteed to improve with the number of agents and is able to account for such potential failures or attacks. All theoretical results are empirically verified on various RL benchmark tasks.

研究动机与目标

  • 解决现有联邦强化学习(FRL)框架中缺乏理论收敛保证的问题。
  • 使 FRL 在面对随机系统故障和对抗性攻击(建模为拜占庭故障)时仍保持鲁棒性。
  • 确保在存在故障智能体的情况下,样本效率仍能随参与智能体数量的增加而提升。
  • 设计一种实用的 FRL 系统,即使在高方差梯度估计和非全知攻击下也能维持性能。
  • 提供对故障容错性和在现实故障模型下收敛性的理论分析与实证验证。

提出的方法

  • 将随机方差减少优化(SCSG)集成到联邦策略梯度框架中,以降低梯度估计的方差。
  • 设计一种基于梯度的拜占庭过滤器,用于识别并减轻故障或恶意智能体的影响。
  • 将该过滤器应用于全局策略更新步骤,确保当最多一半智能体为拜占庭故障时仍能实现收敛。
  • 理论分析表明,样本复杂度随 $O(1/\epsilon^{5/3})$ 的速率收敛至 $\epsilon$-平稳点。
  • 在 $K$ 个智能体下,框架保持改进的样本效率,其复杂度为 $O(1/K^{2/3})$,且拜占庭智能体的影响被限制在 $O(\alpha^{4/3}/\epsilon^{5/3})$ 以内。
  • 在多种故障类型和攻击方式下,于基准强化学习环境(如 CartPole、LunarLander、HalfCheetah)上对框架进行实证验证。

实验结果

研究问题

  • RQ1当最多一半智能体发生故障或为恶意时,联邦强化学习系统是否仍能保持收敛性和样本效率?
  • RQ2引入方差减少的策略梯度优化如何影响 FRL 的收敛速度与鲁棒性?
  • RQ3基于梯度的拜占庭过滤器在多大程度上能缓解非全知攻击(如方差攻击)的影响?
  • RQ4在拜占庭条件下,FRL 的样本复杂度是否仍能随参与智能体数量的增加而改善?
  • RQ5所提框架的理论收敛保证是否可在多样化的强化学习基准任务中得到实证验证?

主要发现

  • 所提出的 FedPG-BR 框架在单智能体设置下,达到 $\epsilon$-平稳点的样本复杂度为 $O(1/\epsilon^{5/3})$,与最先进的方差减少策略梯度方法一致。
  • 当有 $K$ 个智能体时,样本复杂度以 $O(1/K^{2/3})$ 的速率改善,证明更多智能体可提升样本效率。
  • 当故障智能体比例小于一半($\alpha < 0.5$)时,收敛性仅受 $O(\alpha^{4/3}/\epsilon^{5/3})$ 的加法项影响,且随着 $\alpha \to 0$ 而消失。
  • 实证结果表明,使用 10 个智能体(其中 3 个为拜占庭故障,如随机噪声或方差攻击)的 FedPG-BR 在性能上优于单智能体学习,且接近 10 个诚实智能体组成的联邦系统。
  • 该框架能有效防御方差攻击,性能接近非对抗性基线,验证了对梯度偏差的理论边界。
  • 系统在多个环境(CartPole、LunarLander、HalfCheetah)中均表现出鲁棒性,证明其在多样化故障与攻击模型下具有一致的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。