[论文解读] Repeated Bilateral Trade Against a Smoothed Adversary
本文研究在σ-平滑对抗者下的重复双边交易,其中买卖双方估值自适应选择。提出一种新颖的学习算法,在可为买方和卖方设定不同价格的局部反馈下实现T^{3/4}的遗憾,通过一个出人意料的下界证明该速率最优,超越了局部反馈设置下标准的√T和T^{2/3}范式。
We study repeated bilateral trade where an adaptive $σ$-smooth adversary generates the valuations of sellers and buyers. We provide a complete characterization of the regret regimes for fixed-price mechanisms under different feedback models in the two cases where the learner can post either the same or different prices to buyers and sellers. We begin by showing that the minimax regret after $T$ rounds is of order $\sqrt{T}$ in the full-feedback scenario. Under partial feedback, any algorithm that has to post the same price to buyers and sellers suffers worst-case linear regret. However, when the learner can post two different prices at each round, we design an algorithm enjoying regret of order $T^{3/4}$ ignoring log factors. We prove that this rate is optimal by presenting a surprising $T^{3/4}$ lower bound, which is the main technical contribution of the paper.
研究动机与目标
- 研究在σ-平滑对抗者下的重复双边交易中的在线学习,该模型推广了i.i.d.和最坏情况设置。
- 刻画在不同反馈模型下固定价格机制的最小最大遗憾。
- 确定当学习者可在局部反馈下为买方和卖方设定不同价格时,是否可实现次线性遗憾。
- 在该设置下建立T^{3/4}遗憾速率的最优性。
提出的方法
- 本文引入一种平滑对抗者模型,其中买卖双方估值的联合分布具有σ-平滑性,确保随时间变化的对抗性扰动有限。
- 设计了Exp3算法的一种变体,称为Blind-Exp3,采用基于网格的探索策略,并利用加权重要性奖励来估计交易收益。
- 该算法在离散化价格网格上维护权重,并基于估计收益使用指数加权方式进行更新,探索由参数γ控制。
- 关键技术组件是使用有界奖励估计器ˆrt(i),结合利用与探索,以确保估计收益的集中性。
- 分析利用在参数约束(2ηK/γ ≤ 1)下的对数与指数不等式,推导出遗憾上界。
- 通过信息论论证,证明了一项新颖的T^{3/4}下界,确立了上界的紧致性。
实验结果
研究问题
- RQ1当学习者面对平滑对抗者且仅能获得局部反馈时,是否可在重复双边交易中实现次线性遗憾?
- RQ2当学习者可在局部反馈下为买方和卖方设定不同价格时,最优遗憾速率是多少?
- RQ3T^{3/4}遗憾速率是否紧致,或在平滑对抗者模型下可进一步改进?
- RQ4该设置下的最小最大遗憾与经典局部反馈模型(如部分监控或反馈图)相比如何?
主要发现
- 在全反馈下,固定价格机制的最小最大遗憾为Θ(√T),与标准在线学习结果一致。
- 当必须向买方和卖方发布相同价格时,任何算法在局部反馈下均面临最坏情况下的线性遗憾。
- 当可为买方和卖方设定不同价格时,所提出的Blind-Exp3算法实现T^{3/4}阶遗憾(忽略对数因子)。
- 本文建立了T^{3/4}下界,证明该速率最优且无法改进。
- 该结果揭示了一种新遗憾范式,超越了其他局部反馈模型中观察到的√T与T^{2/3}二分法。
- 分析表明,平滑对抗者模型即使在局部反馈下也能实现次线性遗憾,将可学习性扩展至i.i.d.假设之外。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。