Skip to main content
QUICK REVIEW

[论文解读] Online variants of the cross-entropy method

István Szita, András Lörincz|ArXiv.org|Jan 14, 2008
Theoretical and Computational Physics参考文献 2被引用 15
一句话总结

本文提出了交叉熵方法(CEM)的两种在线变体,用于组合优化,其中参数在每次采样后通过滑动窗口或无记忆方法进行增量更新。作者在较弱条件下证明了几乎必然收敛至全局最优解,将批量CEM的理论保证扩展至具有时间不变分布的在线设置。

ABSTRACT

The cross-entropy method is a simple but efficient method for global optimization. In this paper we provide two online variants of the basic CEM, together with a proof of convergence.

研究动机与目标

  • 开发交叉熵方法的在线变体,使参数在每次采样后增量更新,而非在完整种群采样完成后批量更新。
  • 在与批量版本相同的条件下,建立这些在线CEM算法的理论收敛保证。
  • 通过用增量更新或无记忆采样替代批量排序和窗口历史,降低内存和计算开销。
  • 证明在线CEM即使在每一步缺乏完整种群知识的情况下,仍能收敛至全局最优解。

提出的方法

  • 第一种在线变体使用大小为 $N$ 的滑动窗口,以维护最近 $N$ 个样本,动态计算精英阈值 $\gamma_{t+1}$ 为窗口中第 $\lceil \rho N \rceil$ 高的适应度值。
  • 每次采样后,算法检查该样本是否属于当前窗口中前 $\rho$-百分位;若是,则使用步长 $\alpha_1 = \alpha / \lceil \rho N \rceil$ 执行在线更新。
  • 参数更新规则为 $\mathbf{p}_{t+1} = (1 - \alpha_1) \mathbf{p}_t + \alpha_1 \mathbf{x}^{(t)}$,仅在样本为精英时应用,确保增量适应。
  • 无记忆变体通过固定递减的阈值更新规则消除对存储历史样本的需求,每步将精英阈值减少常数 $\rho \Delta$,确保最终检测到精英样本。
  • 理论分析使用递归概率界,表明在适当的步长条件下,时间 $T$ 前未采样到最优解的概率随 $T$ 指数衰减。
  • 通过证明参数更新次数几乎必然无限,且参数向量最终停止改变符号,从而以概率 1 收敛至 0 或 1,完成收敛性证明。

实验结果

研究问题

  • RQ1能否在不牺牲收敛性保证的前提下,将批量交叉熵方法改造为在线增量学习框架?
  • RQ2在内存有限且每样本时间复杂度恒定的在线设置中,如何动态计算精英阈值?
  • RQ3即使更新基于过去样本的局部滑动窗口,在线CEM变体是否仍能几乎必然收敛至全局最优解?
  • RQ4为消除对内存的依赖并保持在线CEM的收敛性,需要进行哪些修改?
  • RQ5在无记忆变体中使用固定递减的精英阈值,与滑动窗口方法相比,对收敛性有何影响?

主要发现

  • 使用滑动窗口的在线CEM几乎必然收敛至全局最优解,因为未采样到最优解的概率随时间呈指数衰减。
  • 无记忆在线CEM变体同样几乎必然收敛,因为精英阈值最终会降至任何非最优解的最小适应度值以下,强制检测到精英样本。
  • 参数更新次数几乎必然无限,确保算法能无限期地持续优化分布参数。
  • 每个分量的参数向量 $\mathbf{p}_t$ 以概率 1 收敛至 0 或 1,意味着收敛至确定性解。
  • 收敛速率取决于步长 $\alpha_1$,$\alpha_1$ 越小,未找到最优解的概率衰减越快。
  • 理论框架将批量CEM的收敛性证明扩展至在线设置,确立了增量更新可保持该方法的全局优化特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。