Skip to main content
QUICK REVIEW

[论文解读] Active Importance Sampling for Variational Objectives Dominated by Rare Events: Consequences for Optimization and Generalization

Grant M. Rotskoff, Andrew Mitchell|arXiv (Cornell University)|Aug 11, 2020
Machine Learning and Algorithms参考文献 37被引用 18
一句话总结

该论文提出主动重要性采样方法,以优化高维问题中由罕见事件主导的变分目标,利用神经网络学习介稳系统中的罕见转移路径。通过自适应地采样关键区域,该方法降低了方差,提高了优化稳定性,并增强了求解高维偏微分方程(如统计物理中的传质方程)时的泛化能力。

ABSTRACT

Deep neural networks, when optimized with sufficient data, provide accurate representations of high-dimensional functions; in contrast, function approximation techniques that have predominated in scientific computing do not scale well with dimensionality. As a result, many high-dimensional sampling and approximation problems once thought intractable are being revisited through the lens of machine learning. While the promise of unparalleled accuracy may suggest a renaissance for applications that require parameterizing representations of complex systems, in many applications gathering sufficient data to develop such a representation remains a significant challenge. Here we introduce an approach that combines rare events sampling techniques with neural network optimization to optimize objective functions that are dominated by rare events. We show that importance sampling reduces the asymptotic variance of the solution to a learning problem, suggesting benefits for generalization. We study our algorithm in the context of learning dynamical transition pathways between two states of a system, a problem with applications in statistical physics and implications in machine learning theory. Our numerical experiments demonstrate that we can successfully learn even with the compounding difficulties of high-dimension and rare data.

研究动机与目标

  • 解决在平衡测度下主导贡献来自罕见事件的高维系统中优化变分目标的挑战。
  • 克服标准蒙特卡罗采样在训练神经网络处理以罕见事件为主导的目标时存在的数据效率低下和方差高的问题。
  • 通过自适应采样策略,提升求解高维偏微分方程(如后向柯尔莫哥洛夫方程或传质方程)时的泛化能力和优化稳定性。
  • 在标准采样无法捕捉低概率区域中过渡路径的介稳态系统中,实现有效学习。
  • 证明重要性采样可降低损失景观中的渐近方差,从而实现更好的泛化和更可靠的优化。

提出的方法

  • 结合主动学习与重要性采样,将采样聚焦于对变分目标贡献最大的状态空间区域,特别是罕见的转移路径。
  • 使用单个 ReLU 隐层和 Sigmoid 输出的神经网络参数化传质函数,确保输出值保持在 (0,1) 区间,以实现概率解释。
  • 采用包含边界条件在内的共 12 个窗口的分窗优化方案,使用随机梯度下降法,学习率为 5×10⁻²,迭代 5000 步。
  • 每个窗口执行 25 次采样步骤,迭代优化损失函数估计值,并根据当前模型不确定性自适应调整采样分布。
  • 利用福克-普朗克方程或后向柯尔莫哥洛夫方程的结构定义平衡测度和势能景观,以识别介稳态。
  • 使用具有双势阱势的朗之万动力学模拟介稳性,并模拟状态间的罕见跃迁,其中传质函数捕捉先到达某一状态的概率。

实验结果

研究问题

  • RQ1主动重要性采样能否降低在以罕见事件为主导的变分目标中训练神经网络时的渐近方差?
  • RQ2主动采样如何提升高维偏微分方程(如传质方程)中优化的稳定性和泛化能力?
  • RQ3当标准采样无法捕捉罕见构型时,神经网络能否有效学习介稳态之间的过渡路径?
  • RQ4自适应采样对高维系统中所学传质函数的收敛性和准确性有何影响?
  • RQ5神经网络架构和采样策略的选择如何影响在复杂多阱势能景观中对真实过渡态的恢复能力?

主要发现

  • 主动重要性采样显著降低了经验损失的渐近方差,从而实现了对变分目标更稳定、更精确的优化。
  • 该方法成功恢复了 144 维系统中两个介稳态之间的典型沙漏形过渡路径,与弦方法和最小作用量法的结果一致。
  • 基于均匀采样的经验损失由于罕见事件区域的稀疏性,无法捕捉真实损失的形状与尺度,导致较大的泛化误差。
  • 训练初期损失的上升是由于对过渡路径的初始表示不一致所致,随着代表性构型被采样,损失估计得到改善,问题得以纠正。
  • 该算法在高维问题上具有良好的泛化能力,如在 12×12 晶格(144 个自由度)上的实验所示,能准确识别传质函数和过渡态。
  • 即使在数据稀缺且平衡测度高度非均匀的情况下,该方法仍能实现有效学习,适用于统计物理和生物物理中的复杂系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。