[论文解读] No-regret Learning in Price Competitions under Consumer Reference Effects
本文研究了具有消费者参照效应的两家企业之间的重复价格竞争,其中需求取决于当前价格和基于记忆的参照价格。通过使用递减步长的在线镜像下降(OMD),作者证明了企业价格与参照价格会收敛至稳定纳什均衡(SNE),即使在信息有限且面临对抗性反馈的情况下,也能确保长期市场稳定。
We study long-run market stability for repeated price competitions between two firms, where consumer demand depends on firms' posted prices and consumers' price expectations called reference prices. Consumers' reference prices vary over time according to a memory-based dynamic, which is a weighted average of all historical prices. We focus on the setting where firms are not aware of demand functions and how reference prices are formed but have access to an oracle that provides a measure of consumers' responsiveness to the current posted prices. We show that if the firms run no-regret algorithms, in particular, online mirror descent(OMD), with decreasing step sizes, the market stabilizes in the sense that firms' prices and reference prices converge to a stable Nash Equilibrium (SNE). Interestingly, we also show that there exist constant step sizesunder which the market stabilizes. We further characterize the rate of convergence to the SNE for both decreasing and constant OMD step sizes.
研究动机与目标
- 研究使用无遗憾学习算法的企业是否能在具有消费者参照效应的重复价格竞争中实现长期市场稳定。
- 将消费者参照价格建模为过去价格的加权平均,反映基于记忆的需求动态。
- 在企业缺乏需求函数或参照价格形成机制知识的不完全信息条件下,分析市场稳定性。
- 建立企业策略与参照价格收敛至稳定纳什均衡(SNE)的条件。
- 刻画在递减和恒定 OMD 步长下价格与参照价格的收敛速率。
提出的方法
- 将市场形式化为一个动态博弈,包含两家真实企业与一家代表参照价格动态的虚拟‘自然’企业。
- 将参照价格建模为随时间变化的状态,由所有过去价格的加权平均构成,其演化依赖于企业的定价决策。
- 对每家企业的定价策略应用在线镜像下降(OMD),使用能提供实时响应反馈的预言机。
- 通过引入一家学习步长恒定的虚拟企业(自然),将具有动态状态的两家企业博弈转化为三家企业博弈。
- 利用 Bregman 散度与强凸性分析遗憾与收敛性,利用 OMD 在不同步长下的性质。
- 通过证明至均衡的距离随时间减少,实现对 SNE 的收敛,即使虚拟企业学习速度超过真实企业。
实验结果
研究问题
- RQ1在具有参照效应的重复价格竞争中,企业在何种条件下其价格与消费者参照价格会收敛至稳定纳什均衡(SNE)?
- RQ2当企业使用无遗憾学习算法(如 OMD)且缺乏对需求或参照价格动态的完整知识时,能否实现市场稳定?
- RQ3在 OMD 中使用递减步长时,SNE 的收敛是否成立?其收敛速率如何?
- RQ4当虚拟企业(用于建模参照价格动态)使用恒定步长时,即使其学习速度更快,市场稳定是否仍可实现?
- RQ5在给定模型假设下,稳定纳什均衡(SNE)具有何种结构性特征?
主要发现
- 本文在给定模型下建立了唯一稳定纳什均衡(SNE)的存在性,其特征由一阶条件决定,即边际利润为零。
- 在递减 OMD 步长下,企业价格与参照价格以线性速率收敛至 SNE,如定理 5.1 所示。
- 即使虚拟企业(自然)使用恒定步长,真实企业通过在 OMD 中使用递减步长,仍可实现市场稳定。
- 由于存在学习速度较快的虚拟企业,收敛证明具有非平凡性,这使得标准多智能体在线学习收敛结果失效。
- 分析表明,Bregman 散度与正则化项的强凸性确保了至均衡距离随时间减少,从而实现收敛。
- 推论 10.1.1 确认在 SNE 处,利润函数对每家企业价格的梯度为零,验证了均衡条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。