Skip to main content
QUICK REVIEW

[论文解读] Online Learning with Feedback Graphs Without the Graphs

Alon Cohen, Tamir Hazan|ArXiv.org|May 23, 2016
Advanced Bandit Algorithms Research参考文献 15被引用 7
一句话总结

本文研究了在学习者无法获知完整图结构的反馈图情形下的在线学习问题,发现当环境为对抗性设置时,与标准的bandit反馈相比,无法实现非平凡的遗憾改进。相比之下,在具有有界独立数α的随机假设下,作者提出了一种算法,实现Õ(√(αT))的遗憾,表明若环境具有足够结构,隐藏的反馈图仍可支持高效学习。

ABSTRACT

We study an online learning framework introduced by Mannor and Shamir (2011) in which the feedback is specified by a graph, in a setting where the graph may vary from round to round and is \emph{never fully revealed} to the learner. We show a large gap between the adversarial and the stochastic cases. In the adversarial case, we prove that even for dense feedback graphs, the learner cannot improve upon a trivial regret bound obtained by ignoring any additional feedback besides her own loss. In contrast, in the stochastic case we give an algorithm that achieves $\widetilde Θ(\sqrt{αT})$ regret over $T$ rounds, provided that the independence numbers of the hidden feedback graphs are at most $α$. We also extend our results to a more general feedback model, in which the learner does not necessarily observe her own loss, and show that, even in simple cases, concealing the feedback graphs might render a learnable problem unlearnable.

研究动机与目标

  • 研究当学习者从未获知完整图结构时的在线学习问题。
  • 确定在缺乏完整反馈图信息的情况下,是否可以实现非平凡的遗憾界。
  • 研究隐藏反馈图对可学习性的影响,特别是在随机环境与对抗性环境之间的差异。
  • 将结果推广至一般反馈模型,其中学习者可能无法观察到自身的损失。
  • 利用信息论和极小化极大论证,建立在反馈图隐藏时学习的根本限制。

提出的方法

  • 作者使用Yao的极小化极大原理,通过构造迫使任何确定性学习者陷入高遗憾的随机环境,来证明下界。
  • 设计了一种随机算法,通过利用隐藏反馈图的独立数α,实现Õ(√(αT))的遗憾。
  • 分析中条件化于所有反馈图的独立数不超过9的事件,以隔离结构约束的影响。
  • 证明在对抗性设置下,即使反馈图密集,也无法实现优于平凡的O(√(KT))遗憾。
  • 构建了一个两动作环境,其中反馈结构在动作间对称,使得在未观察完整图的情况下,无法区分不同分布。
  • 使用概率论论证表明,当反馈图被隐藏时,学习者无法可靠地推断真实损失分布。

实验结果

研究问题

  • RQ1当反馈图从未完全向学习者揭示时,是否可以在在线学习中实现非平凡的遗憾界?
  • RQ2隐藏反馈图结构是否从根本上限制了学习者在对抗性设置下实现次线性遗憾的能力?
  • RQ3隐藏反馈图的独立数α是否仍可用于随机环境中遗憾的有界?
  • RQ4是否可以设计一种算法,在不访问完整反馈图结构的情况下实现Õ(√(αT))的遗憾?
  • RQ5隐藏反馈图是否可能使原本可学习的问题变得不可学习,即使在简单情形下?

主要发现

  • 在对抗性设置下,任何学习者即使在拥有密集反馈图的情况下,也必须承受Ω(√(KT))的遗憾,意味着当图被隐藏时,无法实现优于标准bandit反馈的改进。
  • 在具有有界独立数α的随机设置下,所提出的算法实现了Õ(√(αT))的遗憾,与在图完全已知时的已知界限一致。
  • 在对抗性情况下,Ω(√(KT))的下界即使在隐藏图的独立数被限制为9时依然成立。
  • 本文证明,隐藏反馈图可能使一个原本可学习的问题变得不可学习,如两动作示例所示,学习者无法区分不同分布。
  • 通过Yao的极小化极大原理,在一个两动作设置中建立了Ω(T)的遗憾下界,其中反馈对称且不完整。
  • 即使在学习者不观察自身损失的简单反馈模型中,隐藏图结构也可能阻碍学习,如通过伯努利损失分布和概率性边出现的构造所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。