Skip to main content
QUICK REVIEW

[论文解读] R2-B2: Recursive Reasoning-Based Bayesian Optimization for No-Regret Learning in Games

Zhongxiang Dai, Yizhou Chen|arXiv (Cornell University)|Jun 30, 2020
Machine Learning and Data Classification被引用 15
一句话总结

本文提出 R2-B2,一种基于递归推理的贝叶斯优化框架,用于在具有有限理性的自利代理者重复博弈中实现无遗憾学习。通过建模代理者在 ≥2 级及高于对手一级的策略推理,R2-B2 实现了比标准贝叶斯优化更快的渐近收敛至无遗憾状态,其轻量化变体 R2-B2-Lite 在对抗性机器学习与多智能体强化学习设置中展现出强大的经验防御能力。

ABSTRACT

This paper presents a recursive reasoning formalism of Bayesian optimization (BO) to model the reasoning process in the interactions between boundedly rational, self-interested agents with unknown, complex, and costly-to-evaluate payoff functions in repeated games, which we call Recursive Reasoning-Based BO (R2-B2). Our R2-B2 algorithm is general in that it does not constrain the relationship among the payoff functions of different agents and can thus be applied to various types of games such as constant-sum, general-sum, and common-payoff games. We prove that by reasoning at level 2 or more and at one level higher than the other agents, our R2-B2 agent can achieve faster asymptotic convergence to no regret than that without utilizing recursive reasoning. We also propose a computationally cheaper variant of R2-B2 called R2-B2-Lite at the expense of a weaker convergence guarantee. The performance and generality of our R2-B2 algorithm are empirically demonstrated using synthetic games, adversarial machine learning, and multi-agent reinforcement learning.

研究动机与目标

  • 解决在代理者具有未知、复杂且计算成本高昂的收益函数的重复博弈中实现无遗憾学习的挑战。
  • 基于认知层级理论,使用递归层次结构建模有限理性代理者的策略推理。
  • 开发一种整合多级推理的贝叶斯优化框架,以加快收敛至无遗憾状态的速度。
  • 确保在各类博弈类型(包括常和博弈、一般和博弈及共同收益博弈)中的通用性。
  • 提供计算效率更高的变体(R2-B2-Lite),其收敛保证较弱但依然有效。

提出的方法

  • 使用 k 级层次结构形式化代理者的递归推理:0 级(随机化),k ≥ 1 级(对 0 到 k−1 级代理者推理的最优响应)。
  • 将贝叶斯优化与高斯过程(GP)代理模型相结合,以在代理者动作空间上预测未知的收益函数。
  • 使用 GP-UCB 获取函数以在序列黑箱优化中平衡探索与利用。
  • 在每次迭代中,R2-B2 代理基于其假设的推理等级模拟对手行为,并选择最优响应。
  • 对于 R2-B2-Lite,通过近似对手行为而非完整递归模拟来简化推理过程。
  • 将该框架应用于具有同时行动与完美监控的重复博弈,其中所有代理均可观察到完整的博弈历史。

实验结果

研究问题

  • RQ1在具有未知收益函数的重复博弈中,贝叶斯优化中的递归推理能否加速收敛至无遗憾状态?
  • RQ2在 k ≥ 2 级及高于对手一级的推理下,是否能比非递归贝叶斯优化策略实现更快的收敛速度?
  • RQ3R2-B2 在包括常和博弈、一般和博弈及共同收益博弈在内的多种博弈类型中表现如何?
  • RQ4R2-B2-Lite 是否能在降低计算成本的同时保持较强的实验性能,相较于完整版 R2-B2?
  • RQ5R2-B2 在机器学习对抗性黑盒攻击中能提供多大程度的防御?其在多智能体强化学习中的样本效率是否得到提升?

主要发现

  • 当代理者在 k ≥ 2 级及高于对手一级进行推理时,R2-B2 实现了比标准贝叶斯优化更快的渐近收敛至无遗憾状态。
  • R2-B2-Lite 变体显著降低了计算成本,同时仍能有效防御对抗性攻击,在 150 次迭代中将成功攻击次数限制在 0.8 和 0.7 之间。
  • 在对抗性机器学习中,R2-B2-Lite(1 级)防御者成功中和了基于 GP-UCB 和 Thompson 采样策略的攻击者。
  • 在多智能体强化学习中,R2-B2 实现了在 55 维参数空间中的高效策略搜索,返回值经裁剪与缩放后报告在 [0,1] 范围内。
  • 该框架在合成博弈、对抗性机器学习与多智能体强化学习环境之间均展现出强大的通用性与鲁棒性,GP 超参数每 10 次迭代优化一次。
  • 由于策略空间维度较高,采用随机搜索作为 0 级策略,以确保在复杂环境中具备基础探索能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。