[论文解读] Calibration and Internal no-Regret with Partial Monitoring
本文在部分监控重复博弈中建立了校准性与可逼近性之间的逆向关系,表明在辅助博弈中实现校准的策略可用于构造无内部后悔策略。该研究通过基于信号定义内部后悔,将布莱克韦尔的可逼近性框架扩展至部分监控情形,证明了即使玩家仅能观测到随机信号而非对手的动作,也存在内部一致的策略。
Calibrated strategies can be obtained by performing strategies that have no internal regret in some auxiliary game. Such strategies can be constructed explicitly with the use of Blackwell's approachability theorem, in an other auxiliary game. We establish the converse: a strategy that approaches a convex $B$-set can be derived from the construction of a calibrated strategy. We develop these tools in the framework of a game with partial monitoring, where players do not observe the actions of their opponents but receive random signals, to define a notion of internal regret and construct strategies that have no such regret.
研究动机与目标
- 在部分监控重复博弈中建立校准性与可逼近性之间的逆向关系。
- 当玩家仅能观测到随机信号而非对手动作时,定义并构造无内部后悔策略。
- 通过基于信号的后悔,将布莱克韦尔的可逼近性定理扩展至部分监控情形。
- 证明在部分监控下,可通过辅助博弈中的校准策略推导出内部一致策略。
- 将框架推广至无限动作空间,并在正则性假设下提供收敛条件。
提出的方法
- 在辅助博弈中,通过无内部后悔策略实现校准,利用布莱克韦尔的可逼近性定理。
- 在部分监控中,将内部后悔定义为相对于信号经验分布的后悔,而非动作经验分布。
- 采用分块策略,块长呈指数增长,以确保累积后悔随时间递减。
- 应用加倍技巧控制各块间的后悔累积,确保渐近一致性。
- 通过辅助博弈中的校准策略,构造凸 B-集的可逼近策略。
- 对收益正则性施加假设 1,以确保经验信号分布收敛及后悔界稳定。
实验结果
研究问题
- RQ1能否利用辅助博弈中的校准策略来构造部分监控博弈中的无内部后悔策略?
- RQ2当玩家无法观测对手动作,仅能接收随机信号时,如何有意义地定义内部后悔?
- RQ3是否可以通过将校准与后悔关联,将布莱克韦尔的可逼近性框架扩展至部分监控情形?
- RQ4在何种条件下,部分监控设定下的内部一致策略也具有外部一致性?
- RQ5信号对动作的依赖结构如何影响无后悔策略的构造与收敛性?
主要发现
- 在辅助博弈中实现校准的策略可用于构造任意凸 B-集的 ε-可逼近策略,建立了标准校准到可逼近链的逆向关系。
- 相对于实际收益的内部一致性,在收益函数为凸且评估映射为线性时,蕴含外部一致性。
- 所提算法确保累积后悔收敛至 ε,由于块长缩放,足够长时间后每一块的后悔均小于 ε。
- 采用指数增长的块长可确保早期后悔相对于后期较小的后悔阶段渐近可忽略。
- 在假设 1 下,该框架可扩展至无限动作空间,该假设确保收益函数与信号分布的正则性。
- 当对手动作影响信号分布时,只要信号结构满足所需正则性,构造仍有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。