Skip to main content
QUICK REVIEW

[论文解读] Operator Splitting for Learning to Predict Equilibria in Convex Games

Daniel McKenzie, Howard Heaton|arXiv (Cornell University)|Jun 2, 2021
Model Reduction and Neural Networks参考文献 50被引用 4
一句话总结

该论文提出纳什不动点网络(N-FPNs),一种深度学习框架,利用上下文相关数据预测凸博弈中的均衡。通过结合约束解耦的算子分裂与无海森矩阵反向传播,N-FPNs 无需昂贵的投影即可高效计算均衡,从而实现在交通路由等大规模问题上的可扩展训练与推理,其准确率和速度均优于先前方法。

ABSTRACT

Systems of competing agents can often be modeled as games. Assuming rationality, the most likely outcomes are given by an equilibrium (e.g. a Nash equilibrium). In many practical settings, games are influenced by context, i.e. additional data beyond the control of any agent (e.g. weather for traffic and fiscal policy for market economies). Often the exact game mechanics are unknown, yet vast amounts of historical data consisting of (context, equilibrium) pairs are available, raising the possibility of learning a solver which predicts the equilibria given only the context. We introduce Nash Fixed Point Networks (N-FPNs), a class of neural networks that naturally output equilibria. Crucially, N- FPNs employ a constraint decoupling scheme to handle complicated agent action sets while avoiding expensive projections. Empirically, we find N-FPNs are compatible with the recently developed Jacobian-Free Backpropagation technique for training implicit networks, making them significantly faster and easier to train than prior models. Our experiments show N-FPNs are capable of scaling to problems orders of magnitude larger than existing learned game solvers.

研究动机与目标

  • 开发一种可扩展的、数据驱动的框架,用于预测上下文凸博弈中的均衡,其中成本函数未知,但可获得(上下文,均衡)配对数据。
  • 通过使用三算子分裂解耦约束,解决先前学习博弈求解器中基于投影方法的计算瓶颈。
  • 实现端到端训练神经网络,使其输出满足复杂动作集约束的有效均衡。
  • 证明 N-FPNs 在具有对角严格凸性的博弈中近似纳什均衡的普遍性。
  • 通过同一框架将适用性扩展至其他均衡类型,如 Wardrop 均衡与量化响应均衡。

提出的方法

  • N-FPNs 是隐式神经网络,其定义的算子的不动点对应于纳什均衡,通过迭代应用直至收敛来计算。
  • 该方法采用源自三算子分裂的约束解耦方案,避免对参与者动作集进行昂贵的投影。
  • 算子由神经网络参数化,将上下文 $d$ 映射为博弈的梯度,从而实现均衡预测的端到端学习。
  • 前向传播利用解耦后的显式投影公式,实现无需迭代投影的高效推理。
  • 反向传播利用无海森矩阵反向传播(JFB)高效训练网络,避免显式计算海森矩阵。
  • 该框架被推广以处理变分不等式,使其适用于凸优化与物理模拟问题。

实验结果

研究问题

  • RQ1能否训练一个深度学习模型,在未知底层成本函数的情况下,预测上下文凸博弈中的均衡?
  • RQ2能否在不牺牲准确性或约束满足度的前提下,使学习博弈求解器中的约束处理更加计算高效?
  • RQ3N-FPN 架构是否具备对具有对角严格凸性的博弈类的通用逼近能力?
  • RQ4N-FPN 能否在具有高维动作集的大规模问题(如交通路由)上实现可扩展性?
  • RQ5该框架能否扩展以预测其他类型的均衡,如 Wardrop 均衡或量化响应均衡?

主要发现

  • 在 TRAFIX 基准测试中,N-FPN 对 Wardrop 均衡的预测达到近乎完美,相对均方误差与 TRAFIX 得分在训练过程中收敛。
  • N-FPN 框架可扩展至比现有学习博弈求解器大数个数量级的问题,包括包含数百个高维多面体的交通网络。
  • 约束解耦使得显式投影公式成为可能,消除了对迭代投影的依赖,显著加速了前向与反向传播。
  • 无海森矩阵反向传播使隐式 N-FPN 架构的高效训练成为可能,从而可在大规模数据上进行训练。
  • 实证结果表明,N-FPN 在大规模交通路由问题上,无论是准确率还是可扩展性,均优于传统前馈网络。
  • N-FPN 模型是对具有对角严格凸性的上下文博弈的通用逼近器,证明了其理论表达能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。