Skip to main content
QUICK REVIEW

[论文解读] A new Hedging algorithm and its application to inferring latent random variables

Yoav Freund, Daniel Hsu|ArXiv.org|Jun 30, 2008
Advanced Bandit Algorithms Research参考文献 8被引用 5
一句话总结

本文提出 NormalHedge,一种新颖的在线学习算法,用于累积折扣收益,通过基于遗憾的加权方案,对表现劣于主算法的专家赋予零权重。其遗憾界为 $ R_i^j \leq \sqrt{\frac{8\ln(2.32N)}{\alpha}} $,且不依赖于事先知晓专家数量 $ N $,并将其框架应用于在 $ L_1 $ 损失下推断 HMM 中的潜变量。

ABSTRACT

We present a new online learning algorithm for cumulative discounted gain. This learning algorithm does not use exponential weights on the experts. Instead, it uses a weighting scheme that depends on the regret of the master algorithm relative to the experts. In particular, experts whose discounted cumulative gain is smaller (worse) than that of the master algorithm receive zero weight. We also sketch how a regret-based algorithm can be used as an alternative to Bayesian averaging in the context of inferring latent random variables.

研究动机与目标

  • 开发一种在线对冲算法,实现在累积折扣收益中低遗憾,且无需事先知道专家数量 $ N $。
  • 为推断概率模型中的潜随机变量,提供一种基于遗憾的贝叶斯平均替代方法。
  • 在 $ L_1 $ 损失下实现对隐马尔可夫模型(HMM)中隐藏状态的鲁棒推断,其中标准贝叶斯方法可能失效。
  • 通过分析潜在函数参数 $ c $ 的作用,弥合理论边界与实际性能之间的差距。

提出的方法

  • 该算法基于每个专家 $ i $ 的遗憾 $ R_i^j $ 设计加权方案,当 $ R_i^j \leq 0 $ 时赋予零权重,否则赋予正权重。
  • 权重定义为 $ w_i^j = R_i^j \exp\left(\frac{\alpha (R_i^j)^2}{8}\right) $(当 $ R_i^j > 0 $ 时),并进行归一化以形成对冲分布 $ p_i^j $。
  • 使用参数 $ c=4 $ 的潜在函数 $ \Phi(x) $ 分析遗憾,定义为:当 $ x>0 $ 时为 $ \exp(x^2/8) $,否则为 1。
  • 通过将专家与模型可能的参数向量关联,将该算法应用于 HMM,其中每个专家的置信度为其对应状态的后验概率。
  • 该方法利用每轮迭代中 $ L_1 $ 损失有界的特点,使其与 NormalHedge 的遗憾保证兼容,而不同于对数似然损失。
  • 分析表明,在小 $ \alpha $ 条件下,累积遗憾被统一有界于 $ \sqrt{\frac{8\ln(2.32N)}{\alpha}} $,且不依赖于 $ N $。

实验结果

研究问题

  • RQ1能否设计一种基于遗憾的在线学习算法,无需事先知晓专家数量 $ N $,即可实现有界的遗憾?
  • RQ2如何将此类算法适配于推断概率模型(如 HMM)中的潜随机变量?
  • RQ3潜在函数参数 $ c $ 的理论边界与其实用下限之间的性能差距是什么?
  • RQ4当真实模型不在假设集合中且使用 $ L_1 $ 损失时,NormalHedge 是否优于贝叶斯平均?
  • RQ5能否分析博弈的连续时间极限,以获得关于随机估计与控制的新见解?

主要发现

  • NormalHedge 算法实现了统一的遗憾界 $ R_i^j \leq \sqrt{\frac{8\ln(2.32N)}{\alpha}} $,且不依赖于预先知晓 $ N $。
  • 该算法对累积折扣收益劣于主算法的专家赋予零权重,从而提升了鲁棒性。
  • 当真实模型不在假设集合中时,该方法在 $ L_1 $ 损失下优于贝叶斯平均,因为后者可能遭受无界的累积损失。
  • 潜在函数参数 $ c $ 的下界为 1,上界为 4,在 $ \alpha \to 0 $ 极限下,更紧的边界为 $ c=2 $。
  • 该框架通过将每个参数向量视为专家,并从后验概率中导出置信度,实现了对 HMM 中隐藏状态的有效推断。
  • 即使没有任何专家能完美匹配真实数据生成过程,该算法仍能收敛至集合中表现最佳的专家。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。