Skip to main content
QUICK REVIEW

[论文解读] Prediction with Advice of Unknown Number of Experts

Alexey Chernov, Vladimir Vovk|arXiv (Cornell University)|Jun 2, 2010
Advanced Bandit Algorithms Research参考文献 4被引用 4
一句话总结

本文提出了一种在线预测中专家建议的新型遗憾界,该界限仅依赖于有效专家数量,而非名义上的专家总数。通过防御性预测和一类新型多值上鞅,作者推导出界限 $ L_T \leq L_\epsilon^T + 2\sqrt{T \ln(1/\epsilon)} + 7\sqrt{T} $,该界限具有统一有效性,消除了对专家总数的依赖,优于以往包含 $ \mathcal{O}(\ln^2 N) $ 项的界限(如 NormalHedge)。

ABSTRACT

In the framework of prediction with expert advice, we consider a recently introduced kind of regret bounds: the bounds that depend on the effective instead of nominal number of experts. In contrast to the NormalHedge bound, which mainly depends on the effective number of experts and also weakly depends on the nominal one, we obtain a bound that does not contain the nominal number of experts at all. We use the defensive forecasting method and introduce an application of defensive forecasting to multivalued supermartingales.

研究动机与目标

  • 开发一种在线预测中专家建议的遗憾界,该界限仅依赖于有效专家数量,而非名义上的专家数量。
  • 消除现有界限(如 NormalHedge)中依赖于专家总数 $ N $ 的 $ \mathcal{O}(\ln^2 N) $ 项。
  • 引入并分析多值上鞅作为在线学习中防御性预测的新工具。
  • 将该界限扩展至内部遗憾和具有混合损失函数的多目标预测场景。

提出的方法

  • 引入多值上鞅的概念,作为标准上鞅的推广,用于建模多种专家类型的遗憾。
  • 将防御性预测应用于一个特别构造的上鞅,该上鞅结合了霍夫丁型集中不等式和对偏离 $ \epsilon $-分位数专家的对数惩罚。
  • 使用参数为 $ \eta \in (0, 1/e] $ 的连续上鞅族,通过对 $ \eta $ 进行积分以确保一致性和鲁棒性。
  • 通过分析上鞅的期望增长并应用多值上鞅的有界性结果(引理 2 和 3),推导出损失界限。
  • 通过修改上鞅以追踪与特定动作损失的偏差,将该框架适配于处理内部遗憾。
  • 构建一个玩具型多目标算法,通过联合上鞅同时限制 Brier 损失(平方损失)和绝对损失(分类误差)。

实验结果

研究问题

  • RQ1能否推导出一种仅依赖于有效专家数量的遗憾界,而无需依赖于专家总数?
  • RQ2如何将防御性预测扩展至多值上鞅,以处理更复杂的遗憾结构?
  • RQ3新界限能否适配于内部遗憾和具有混合损失函数的多目标预测?
  • RQ4与现有界限(如 NormalHedge)相比,该界限在 $ N $ 和 $ \epsilon $ 依赖性方面有何定量改进?

主要发现

  • 本文建立了新的遗憾界:$ L_T \leq L_\epsilon^T + 2\sqrt{T \ln(1/\epsilon)} + 7\sqrt{T} $,该界限仅依赖于有效专家数量 $ 1/\epsilon $,而不依赖于名义专家数量 $ N $。
  • 该界限对所有 $ T $ 和 $ \epsilon $ 均具有一致有效性,且算法无需预先知道这些值。
  • 该界限通过消除依赖于专家总数的 $ \mathcal{O}(\ln^2 N) $ 项,优于 NormalHedge 算法。
  • 该方法引入并证明了多值上鞅的有界性,这是一种新颖工具,使新界限的推导成为可能。
  • 该框架成功扩展至内部遗憾,所得界限与主结果结构一致。
  • 构建了一个玩具算法,能同时保证 Brier 损失和绝对损失的界限,展示了该方法的灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。