[论文解读] Deterministic MDPs with Adversarial Rewards and Bandit Feedback
本文提出 MarcoPolo,一种针对奖励为对抗性且仅提供部分反馈的确定性马尔可夫决策过程(MDP)的在线学习算法。该算法在不依赖严格单链假设的前提下,实现了相对于最优固定确定性策略的遗憾界 O(T^(3/4)√log T),使其适用于具有结构化动态特性的更广泛 MDP 类别。
We consider a Markov decision process with deterministic state transition dynamics, adversarially generated rewards that change arbitrarily from round to round, and a bandit feedback model in which the decision maker only observes the rewards it receives. In this setting, we present a novel and efficient online decision making algorithm named MarcoPolo. Under mild assumptions on the structure of the transition dynamics, we prove that MarcoPolo enjoys a regret of O(T^(3/4)sqrt(log(T))) against the best deterministic policy in hindsight. Specifically, our analysis does not rely on the stringent unichain assumption, which dominates much of the previous work on this topic.
研究动机与目标
- 解决奖励由对手选择且仅提供部分反馈的确定性 MDP 中的在线决策问题。
- 设计一种高效算法,以应对任意奖励序列并实现次线性遗憾。
- 消除对单链假设的需求,该假设限制了先前在对抗性 MDP 与部分反馈设置下的研究工作。
- 提供一个随时间呈次优增长的遗憾界,相较于先前结果在通用性与适用性方面均有提升。
提出的方法
- MarcoPolo 算法专为具有对抗性奖励与部分反馈的确定性 MDP 在线学习而设计。
- 其采用一种新颖的探索策略,通过结构化探索策略在遗憾与不确定性之间实现平衡。
- 该方法结合基于置信区间更新规则,能够自适应地响应观测到的奖励与转移动态。
- 采用遗憾分解技术,将策略选择与探索误差的贡献分离开来。
- 算法在转移动态上施加了温和的结构性假设,例如存在共同的状态-动作可达性结构。
- 采用指数加权算法的变体进行策略选择,专为部分反馈设置与确定性转移而定制。
实验结果
研究问题
- RQ1能否为具有对抗性奖励与部分反馈的确定性 MDP 设计一种高效的在线学习算法?
- RQ2在不假设单链结构的前提下,该设置下可实现的最优遗憾界是什么?
- RQ3当仅提供部分反馈时,如何有效平衡探索与利用?
- RQ4在缺乏强结构性假设的情况下,遗憾能否实现次线性增长并优于 O(T^(2/3))?
- RQ5在对 MDP 转移动态施加温和假设的前提下,是否可能实现 O(T^(3/4)√log T) 的遗憾界?
主要发现
- MarcoPolo 在事后与最优固定确定性策略相比,实现了 O(T^(3/4)√log T) 的遗憾界。
- 该遗憾界在 T 上为次优,但相较于先前方法在通用性方面有显著提升。
- 该算法无需单链假设,这在先前关于对抗性 MDP 的研究中是一个主要限制。
- 分析在对转移动态施加温和结构性假设(如存在共同可达性结构)的前提下依然成立。
- 该方法高效且实用,其计算复杂度随状态数与动作数的多项式增长。
- 结果表明,即使在确定性 MDP 且缺乏随机性或单链结构的情况下,部分反馈设置中仍可实现次线性遗憾。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。