Skip to main content
QUICK REVIEW

[论文解读] Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case

Liyu Chen, Haipeng Luo|arXiv (Cornell University)|Feb 10, 2021
Advanced Bandit Algorithms Research参考文献 19被引用 5
一句话总结

本论文提出了针对对抗性成本和未知转移动态的随机最短路径问题的新算法,在完整信息设置下实现了 $×{\tilde{\mathcal{O}}}(\sqrt{S^{2}ADT_{\star}K})$ 的遗憾,在贝吉特反馈设置下实现了 $\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$ 的遗憾。论文引入了偏斜的占用测量方法和乐观的成本估计器,以控制转移估计偏差,显著优于先前工作,并首次解决了最具挑战性的组合情形:贝吉特反馈、对抗性成本和未知转移动态。

ABSTRACT

We make significant progress toward the stochastic shortest path problem with adversarial costs and unknown transition. Specifically, we develop algorithms that achieve $\widetilde{O}(\sqrt{S^2ADT_\star K})$ regret for the full-information setting and $\widetilde{O}(\sqrt{S^3A^2DT_\star K})$ regret for the bandit feedback setting, where $D$ is the diameter, $T_\star$ is the expected hitting time of the optimal policy, $S$ is the number of states, $A$ is the number of actions, and $K$ is the number of episodes. Our work strictly improves (Rosenberg and Mansour, 2020) in the full information setting, extends (Chen et al., 2020) from known transition to unknown transition, and is also the first to consider the most challenging combination: bandit feedback with adversarial costs and unknown transition. To remedy the gap between our upper bounds and the current best lower bounds constructed via a stochastically oblivious adversary, we also propose algorithms with near-optimal regret for this special case.

研究动机与目标

  • 解决在对抗性成本和未知转移函数下随机最短路径(SSP)问题,其中先前工作假设了已知转移或更简单的反馈设置。
  • 弥合在对抗性成本和未知转移下SSP遗憾的现有上界与下界之间的差距。
  • 设计在完整信息和贝吉特反馈设置下均实现次线性遗憾的高效算法,且无需事先知晓最优策略的命中时间 $T_{\star}$。
  • 将先前在已知转移设置下的工作扩展到更现实且更具挑战性的未知动态情形,特别是在贝吉特反馈范式下。

提出的方法

  • 将Chen等人(2020)提出的无环归约技术适配至未知转移设置,从而在不确定性下实现遗憾分析。
  • 引入偏斜的占用测量方法,以控制完整信息设置下由转移估计误差引入的偏差。
  • 利用贝尔曼型全方差定律,将成本方差与期望命中时间 $T_{\star}$ 关联,从而实现更紧的遗憾界限。
  • 提出两种受上界占用量启发的乐观成本估计器,这对于处理贝吉特反馈并最小化遗憾至关重要。
  • 增强无环归约方法,以支持动态切换至快速策略,这在随机不变对手下实现近似最优遗憾至关重要。
  • 应用集中不等式(如Freedman不等式和Bernstein型不等式)以控制鞅差分,确保高概率遗憾保证。

实验结果

研究问题

  • RQ1在成本为对抗性且转移函数未知的情况下,能否在随机最短路径问题中实现低遗憾?
  • RQ2在未知转移下,遗憾如何随状态数 $S$、动作数 $A$、直径 $D$ 和期望命中时间 $T_{\star}$ 变化?
  • RQ3能否设计一种适用于对抗性成本和未知转移的贝吉特反馈算法,实现次线性遗憾?
  • RQ4能否弥合最困难情形(即贝吉特反馈、对抗性成本和未知转移)下上界与下界之间的遗憾差距?
  • RQ5为实现随机不变对手下的近似最优遗憾,需要进行哪些修改,其中下界是紧致的?

主要发现

  • 所提出的算法在完整信息设置下实现了 $\tilde{\mathcal{O}}(\sqrt{S^{2}ADT_{\star}K})$ 的遗憾,优于Rosenberg和Mansour(2020)提出的 $\tilde{\mathcal{O}}(\frac{1}{c_{\min}}\sqrt{S^{2}AD^{2}K})$ 的先前界限。
  • 在贝吉特反馈设置下,首次开发出实现 $\tilde{\mathcal{O}}(\sqrt{S^{3}A^{2}DT_{\star}K})$ 遗憾的算法,解决了对抗性成本与未知转移及部分反馈相结合的开放问题。
  • 当 $c_{\min} = 0$ 时,算法实现 $\tilde{\mathcal{O}}(K^{2/3})$ 的遗憾,优于Rosenberg和Mansour(2020)的 $\tilde{\mathcal{O}}(K^{3/4})$ 界限。
  • 对于随机不变对手,算法的遗憾在 $\sqrt{S}$ 因子内接近下界,这是该类对手在SSP中已知的最佳差距。
  • 该方法对未知的 $T_{\star}$ 和 $T_{\max}$ 具有鲁棒性,其遗憾界限能根据回合数和问题参数自适应地在不同模式间切换。
  • 理论分析通过高级集中不等式(包括Freedman不等式和任意时间Bernstein不等式)确认了高概率遗憾保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。