Skip to main content
QUICK REVIEW

[论文解读] Federated Reinforcement Learning with Environment Heterogeneity

Hao Jin, Peng Yang|arXiv (Cornell University)|Apr 6, 2022
Reinforcement Learning in Robotics被引用 10
一句话总结

本文提出QAvg和PAvg两种联邦强化学习算法,适用于环境异构的场景,即在不共享经验的前提下,各智能体学习共享策略。该方法引入一种基于环境嵌入的个性化启发式方法,提升了本地性能,并实现了对未见过环境的快速适应。理论收敛性分析表明,次优性程度取决于环境异构性。

ABSTRACT

We study a Federated Reinforcement Learning (FedRL) problem in which $n$ agents collaboratively learn a single policy without sharing the trajectories they collected during agent-environment interaction. We stress the constraint of environment heterogeneity, which means $n$ environments corresponding to these $n$ agents have different state transitions. To obtain a value function or a policy function which optimizes the overall performance in all environments, we propose two federated RL algorithms, exttt{QAvg} and exttt{PAvg}. We theoretically prove that these algorithms converge to suboptimal solutions, while such suboptimality depends on how heterogeneous these $n$ environments are. Moreover, we propose a heuristic that achieves personalization by embedding the $n$ environments into $n$ vectors. The personalization heuristic not only improves the training but also allows for better generalization to new environments.

研究动机与目标

  • 解决在具有不同状态转移特性的多个智能体运行于不同环境、且面临严格隐私约束时,学习单一统一有效策略的挑战。
  • 理论上分析在环境异构性存在的情况下,联邦强化学习算法的收敛性与次优性。
  • 开发一种个性化机制,使智能体能够在不共享原始经验的前提下,将全局共享策略适配至其自身环境。
  • 通过轻量级调整环境嵌入,实现对新型、此前未见过环境的模型泛化。

提出的方法

  • 提出QAvg与PAvg作为无模型联邦强化学习算法,通过本地策略更新与全局模型平均实现学习,并在环境异构性条件下提供收敛性分析。
  • 将QAvg与PAvg扩展至深度强化学习,分别采用深度Q网络(DQNAvg)与深度确定性策略梯度(DDPGAvg),以支持复杂控制任务的应用。
  • 引入环境嵌入——每个环境对应的低维向量——以捕捉独特的状态转移动态,并支持个性化。
  • 解耦模型聚合:在全局平均过程中,排除环境嵌入层,以保留环境特异性特征,同时共享核心策略网络。
  • 通过仅微调环境嵌入实现对新环境的快速适应,保持共享策略网络固定。
  • 在表格型与深度强化学习环境中进行实证评估,以验证收敛性、性能及泛化能力。

实验结果

研究问题

  • RQ1环境异构性在多大程度上影响联邦强化学习算法的收敛性与性能?
  • RQ2通过联邦学习训练的单一共享策略能否在具有不同状态转移特性的多个环境中均实现一致的良好性能?
  • RQ3在不共享原始经验的前提下,联邦强化学习中个性化能达到何种程度?其在提升本地性能方面的有效性如何?
  • RQ4所学习的联邦策略能否以最少的适应实现对新型环境的泛化?最高效的适应策略是什么?

主要发现

  • QAvg与PAvg收敛至次优解,且次优性程度随环境异构性增强而上升。
  • 所提出的DQNAvg与DDPGAvg算法在训练性能上优于独立训练基线,且在训练与泛化方面均优于非联邦变体。
  • 基于环境嵌入的个性化启发式方法显著提升了本地训练性能,如图5所示的平均回报更高。
  • 仅微调环境嵌入即可实现对未见环境的快速且稳定的泛化,优于全网络微调(图6)。
  • 该方法仅需极少更新即可良好泛化至新型环境——仅需调整嵌入层,即可保留共享策略。
  • 实证结果证实,即使不共享经验,策略通信仍能加速本地训练,验证了联邦协作的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。