Skip to main content
QUICK REVIEW

[论文解读] Online Game with Time-Varying Coupled Inequality Constraints

Min Meng, Xiuxian Li|arXiv (Cornell University)|Jun 28, 2023
Advanced Bandit Algorithms ResearchDecision Sciences被引用 3
一句话总结

该论文提出了一种用于具有时变耦合不等式约束的博弈的去中心化在线学习算法,采用镜像下降与原始-对偶更新策略,实现了次线性遗憾和约束违反。在强单调性假设下,证明了其收敛至变分广义纳什均衡,并将框架扩展至仅观测到收益(函数值)的bandit反馈设置。

ABSTRACT

In this paper, online game is studied, where at each time, a group of players aim at selfishly minimizing their own time-varying cost function simultaneously subject to time-varying coupled constraints and local feasible set constraints. Only local cost functions and local constraints are available to individual players, who can share limited information with their neighbors through a fixed and connected graph. In addition, players have no prior knowledge of future cost functions and future local constraint functions. In this setting, a novel decentralized online learning algorithm is devised based on mirror descent and a primal-dual strategy. The proposed algorithm can achieve sublinearly bounded regrets and constraint violation by appropriately choosing decaying stepsizes. Furthermore, it is shown that the generated sequence of play by the designed algorithm can converge to the variational GNE of a strongly monotone game, to which the online game converges. Additionally, a payoff-based case, i.e., in a bandit feedback setting, is also considered and a new payoff-based learning policy is devised to generate sublinear regrets and constraint violation. Finally, the obtained theoretical results are corroborated by numerical simulations.

研究动机与目标

  • 解决在去中心化设置下,玩家缺乏对未来成本或全局约束的完整信息时,具有时变成本函数和耦合约束的在线博弈问题。
  • 设计一种仅依赖于本地成本函数、本地约束和通过固定连通图与邻居通信的去中心化在线学习算法。
  • 在时变约束和有限反馈条件下,建立关于次线性遗憾和约束违反的理论保证。
  • 将框架扩展至bandit反馈设置,其中仅可获得收益(函数值)信息,而非梯度信息。
  • 在强单调性假设下,证明所生成的策略序列收敛至变分广义纳什均衡(v-GNE)。

提出的方法

  • 设计了一种新颖的去中心化在线学习算法,结合镜像下降与原始-对偶策略,以处理时变耦合不等式约束和局部可行集。
  • 采用衰减步长以平衡遗憾与约束违反,确保随时间呈次线性增长。
  • 该方法结合局部梯度估计与对偶变量更新,以追踪时变约束,通过李雅普诺夫型函数和递推不等式分析收敛性。
  • 在bandit反馈情形下,引入一种新型基于收益的学习策略,通过单点观测推断梯度信息,实现在无梯度访问情况下的遗憾与约束违反边界。
  • 关键组件包括使用衰减序列作为步长(αₜ, βₜ, γₜ, δₜ)、对偶变量追踪,以及利用条件期望和利普希茨连续性假设进行误差分解。
  • 理论分析利用涉及条件期望的不等式,以及对梯度和约束函数估计误差的有界性,最终以调节参数表示遗憾与违反边界的上界。

实验结果

研究问题

  • RQ1在具有耦合约束和有限信息的时变在线博弈中,去中心化在线学习算法能否实现次线性遗憾与约束违反?
  • RQ2在无未来成本先验知识的去中心化在线博弈中,玩家如何收敛至变分广义纳什均衡(v-GNE)?
  • RQ3在仅观测到函数值、无梯度信息的bandit反馈设置下,该算法的性能保证如何?
  • RQ4衰减步长如何影响所提算法中遗憾与约束违反之间的权衡?
  • RQ5在何种条件下,策略序列会收敛至v-GNE?强单调性在此收敛过程中起什么作用?

主要发现

  • 在完整信息反馈下,所提算法的遗憾被界为𝒪(∑(δᵢ,ₜ + γₜ + αₜ/δᵢ,ₜ + αₜ/βₜ² + δₜ/βₜ) + 1/αₜ)。
  • 约束违反被界为𝒪(∑(δₜ/βₜ) + (𝔼[R_g(T)])²/B₃(T)),其中R_g(T)表示总约束违反。
  • 当步长选择为αₜ = 𝒪(1/√t),βₜ = 𝒪(1/t),δₜ = 𝒪(1/t)时,遗憾与约束违反均随时间T呈次线性增长。
  • 在强单调性假设下,该算法生成的策略序列收敛至底层博弈的变分广义纳什均衡(v-GNE)。
  • 在bandit反馈设置下,基于收益的学习策略即使仅观测到函数值,也能实现次线性遗憾与约束违反。
  • 数值仿真验证了理论结果,表明该算法能随时间实现低遗憾与低约束违反。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。