Skip to main content
QUICK REVIEW

[论文解读] Decentralized Reinforcement Learning: Global Decision-Making via Local Economic Transactions

Michael Chang, Sidhant Kaushik|arXiv (Cornell University)|Jul 5, 2020
Reinforcement Learning in Robotics参考文献 29被引用 7
一句话总结

本文提出一种去中心化的强化学习框架,其中一群专业化、自利的智能体通过局部经济交易(具体为密封投标拍卖,即维克里拍卖)共同解决全局顺序决策问题。核心贡献是克隆维克里社会机制,该机制保证了优化本地拍卖效用的智能体的纳什均衡,恰好对应于全局马尔可夫决策过程的最优策略,从而实现样本高效、模块化的学习,并展现出优越的迁移性能。

ABSTRACT

This paper seeks to establish a framework for directing a society of simple, specialized, self-interested agents to solve what traditionally are posed as monolithic single-agent sequential decision problems. What makes it challenging to use a decentralized approach to collectively optimize a central objective is the difficulty in characterizing the equilibrium strategy profile of non-cooperative games. To overcome this challenge, we design a mechanism for defining the learning environment of each agent for which we know that the optimal solution for the global objective coincides with a Nash equilibrium strategy profile of the agents optimizing their own local objectives. The society functions as an economy of agents that learn the credit assignment process itself by buying and selling to each other the right to operate on the environment state. We derive a class of decentralized reinforcement learning algorithms that are broadly applicable not only to standard reinforcement learning but also for selecting options in semi-MDPs and dynamically composing computation graphs. Lastly, we demonstrate the potential advantages of a society's inherent modular structure for more efficient transfer learning.

研究动机与目标

  • 为解决去中心化、自利智能体在集体解决通常被建模为单智能体强化学习任务的单体顺序决策问题时的激励对齐挑战。
  • 通过设计一种机制,使最优全局行为作为非合作博弈中纳什均衡自然涌现,从而克服计算纳什均衡的非可计算性问题。
  • 开发一类去中心化强化学习算法,通过经济交易实现局部信用分配,从而学习全局策略,扩展至标准MDP之外的更广泛应用场景。
  • 在迁移学习中验证该框架的优势,表明其相较于单体基线模型具有更快的适应速度和更模块化的权重更新。
  • 将框架扩展至分层决策和动态计算图组合,验证其在不同学习任务中的通用性。

提出的方法

  • 在每个环境状态,智能体通过密封投标维克里拍卖进行出价,以决定由谁执行下一步动作,获胜者根据状态转移结果获得奖励。
  • 克隆维克里社会通过为每个基本智能体创建冗余副本,以稳定市场动态,防止次优均衡或投机泡沫。
  • 该机制确保诚实出价为占优策略,且局部效用最大化的纳什均衡恰好对应于MDP的最优全局策略。
  • 推导出一种去中心化强化学习算法,其中每个智能体学习其本地拍卖效用,通过交易实现的信用分配间接优化全局目标。
  • 通过将选项视为拍卖系统中的智能体,将框架扩展至半MDP;通过将函数组合建模为顺序交易,扩展至动态计算图。
  • 提出信用节约型维克里实现作为具体实例,通过最小化不必要的信用重分配,提升训练稳定性和性能。

实验结果

研究问题

  • RQ1一群自利的、专业化的智能体能否通过局部经济交易在无集中协调的情况下共同解决全局顺序决策问题?
  • RQ2在何种拍卖机制下,个体智能体的纳什均衡恰好对应于全局MDP的最优策略?
  • RQ3与单体强化学习中的全局信用分配相比,通过本地拍卖实现的去中心化信用分配在样本效率和迁移学习性能方面表现如何?
  • RQ4该框架能否推广至分层决策(如半MDP中的选项)和动态计算图组合?
  • RQ5该社会的模块化、基于交易的结构是否相比单体架构具有更强的可并行性和可迁移性?

主要发现

  • 克隆维克里社会确保了优化本地拍卖效用的智能体的纳什均衡,恰好与全局MDP的最优策略一致,这是由于维克里拍卖机制的诚实性和效率。
  • 在Two Rooms环境中,克隆维克里社会在迁移任务上的适应速度优于分层单体PPO基线,且权重调整更少、更小,表明其具有更高的模块化与并行性。
  • 在Mental Rotation环境中,该社会收敛至平均回报0.933,标准差为0.014,表明其在动态计算图组合任务中具备有效学习能力。
  • 信用节约型维克里实现版本在社会整体及个体智能体性能上均优于其他变体,表明其提升了稳定性与信用分配精度。
  • 去中心化框架在预训练阶段表现出更优的样本效率,并在迁移学习中实现更快收敛,支持了局部信用分配相比全局信用分配能实现更并行、更独立学习的假设。
  • 实证结果表明,该社会框架的模块化结构减少了参数的全局耦合,相比单体模型,其学习动态更具效率与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。