[论文解读] Secure Equilibria in Weighted Games
本文将安全均衡的概念——最初针对两人零和博弈中布尔型、ω-正则目标所定义——扩展至具有上确界、下确界、上极限上确界、上极限下确界、平均报酬和折扣和等度量的定量加权博弈。证明了在这些博弈中安全均衡始终存在,提供了内存复杂度较低的有限记忆策略组合,并为约束存在性问题给出了可判定算法,唯独折扣和情形还原为一个开放问题。该解决方案依赖于关于字典序目标的零和博弈的全新结果。
We consider two-player non zero-sum infinite duration games played on weighted graphs. We extend the notion of secure equilibrium introduced by Chatterjee et al., from the Boolean setting to this quantitative setting. As for the Boolean setting, our notion of secure equilibrium refines the classical notion of Nash equilibrium. We prove that secure equilibria always exist in a large class of weighted games which includes common measures like sup, inf, lim sup, lim inf, mean-payoff, and discounted sum. Moreover we show that one can synthesize finite-memory strategy profiles with few memory. We also prove that the constrained existence problem for secure equilibria is decidable for sup, inf, lim sup, lim inf and mean-payoff measures. Our solutions rely on new results for zero-sum quantitative games with lexicographic objectives that are interesting on their own right.
研究动机与目标
- 将安全均衡的概念从布尔型扩展至加权图上两人无限时长效力博弈的定量设置。
- 为常见定量度量(如上确界、下确界、上极限上确界、上极限下确界、平均报酬和折扣和)建立安全均衡的存在性。
- 开发高效算法,用于合成实现安全均衡的有限记忆策略组合。
- 证明在所有度量下(除折扣和外)安全均衡的约束存在性问题均为可判定的。
- 表明字典序零和博弈的分析是解决安全均衡问题的核心,其结果具有独立兴趣。
提出的方法
- 在加权博弈中定义安全均衡,作为纳什均衡的改进,优先最大化自身收益,再最小化对手收益。
- 将安全均衡问题约化为求解具有字典序目标的两人零和博弈,其中玩家首先优化其首要目标,然后最小化对手收益。
- 证明此类字典序博弈具有统一确定性,并为所有经典收益度量开发最坏情况最优算法。
- 构建具有线性或多项式记忆规模(取决于度量)的有限记忆策略,以证明安全均衡的存在。
- 通过将安全均衡的约束存在性问题约化为字典序博弈中获胜策略的存在性,来解决该问题。
- 利用已有成果并借鉴纳什均衡与平均报酬博弈研究中的技术,同时为字典序目标引入新颖的适应性方法。
实验结果
研究问题
- RQ1在具有上确界、下确界、上极限上确界、上极限下确界、平均报酬和折扣和等定量目标的两人加权博弈中,安全均衡是否存在?
- RQ2能否合成具有有界记忆规模的有限记忆策略,以实现这些博弈中的安全均衡?
- RQ3当结果需满足额外收益约束时,安全均衡的约束存在性问题是否可判定?
- RQ4字典序零和博弈(玩家按顺序优化)如何促进安全均衡问题的解决?
- RQ5在具有折扣和目标的博弈中,安全均衡的复杂度与结构如何?其与文献中开放问题的关系是什么?
主要发现
- 在所有具有上确界、下确界、上极限上确界、上极限下确界、平均报酬和折扣和目标的加权博弈中,安全均衡均存在。
- 对于上确界、下确界、上极限上确界、上极限下确界和平均报酬度量,线性记忆规模的有限记忆策略已足够;对于上确界与下确界,多项式记忆规模已足够。
- 针对上确界、下确界、上极限上确界、上极限下确界和平均报酬度量,存在可判定算法以合成安全均衡,其时间复杂度为多项式或伪多项式。
- 除折扣和外,所有度量下安全均衡的约束存在性问题均为可判定的;而折扣和情形还原为文献中一个具有挑战性的开放问题。
- 字典序零和博弈的分析构成核心技术贡献,为所有经典收益度量开发了新的最坏情况最优算法。
- 本研究将组合式合成框架扩展至定量设置,实现了系统与环境之间可执行合约的自动合成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。