[论文解读] Learning Cooperative Games
本文提出了一种合作博弈的PAC学习框架,表明可通过多项式数量的随机样本高效学习到稳定的收益分配。研究证明,网络流博弈、阈值任务博弈和诱导子图博弈等博弈类型均可高效PAC学习,并建立了可学习性与核心稳定性的联系,使得在最小采样和计算成本下实现高概率稳定性成为可能。
This paper explores a PAC (probably approximately correct) learning model in cooperative games. Specifically, we are given $m$ random samples of coalitions and their values, taken from some unknown cooperative game; can we predict the values of unseen coalitions? We study the PAC learnability of several well-known classes of cooperative games, such as network flow games, threshold task games, and induced subgraph games. We also establish a novel connection between PAC learnability and core stability: for games that are efficiently learnable, it is possible to find payoff divisions that are likely to be stable using a polynomial number of samples.
研究动机与目标
- 为解决合作博弈理论中的计算与信息障碍,即核心等解概念需要完全掌握联盟值知识。
- 探索是否能从多项式数量的联盟及其值的随机样本中高效学习合作博弈。
- 建立PAC可学习性与核心稳定性的联系,表明可通过少量样本以高概率找到稳定收益分配。
- 识别在PAC模型下哪些著名合作博弈类别可被高效PAC学习。
- 将学习理论的洞见拓展至合作解概念,尤其聚焦于收益分配的稳定性和可行性。
提出的方法
- 采用PAC学习模型,从m个独立同分布的联盟及其值样本中学习未知特征函数v: 2^N → R。
- 引入一种松弛的稳定性概念,称为“PAC可稳定化”,即收益分配在从分布D中抽取的联盟发生偏离时,具有高概率保持稳定。
- 设计一种多项式时间算法,输出一个可行的收益分配(不超过稳定性成本),且在未来的偏离中具有高概率保持稳定。
- 通过结构变换,将特定博弈类别(如网络流、阈值任务、诱导子图)的学习问题约化为已知可学习问题(如线性函数、XOS、DNF公式)。
- 利用已知的难解性结果(如学习DNF、超平面交集)进行约化,证明k-向量WVG和MC-nets等类别的不可学习性。
- 证明当玩家技能已知时,联盟技能博弈可被高效PAC学习,即使任务要求未知。
实验结果
研究问题
- RQ1能否从多项式数量的联盟及其值的随机样本中高效学习合作博弈?
- RQ2PAC可学习性与核心中收益分配的稳定性之间是否存在联系?
- RQ3在PAC模型下,哪些著名合作博弈类别可被高效PAC学习?
- RQ4即使核心为空,是否也能仅使用多项式数量的样本实现稳定且可行的收益分配?
- RQ5PAC学习在合作博弈中的计算极限是什么,特别是对于MC-nets和k-向量加权投票博弈等类别?
主要发现
- 网络流博弈可通过路径查询实现高效PAC学习,但若无此类查询则无法一般性地实现。
- 阈值任务博弈和诱导子图博弈可被高效PAC学习。
- k-向量加权投票博弈除非P = NP,否则无法高效PAC学习,原因在于学习k个超平面的交集是NP难问题。
- MC-nets无法高效PAC学习,因为学习MC-nets可约化为学习DNF公式,而后者是难解的。
- 当玩家技能已知时,联盟技能博弈可被高效PAC学习,即使任务要求未知。
- 本文证明了任意合作博弈都是PAC可稳定化的:可在多项式时间内使用多项式数量的样本,以高概率计算出稳定且可行的收益分配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。