Skip to main content
QUICK REVIEW

[论文解读] Efficient Bayesian Learning Curve Extrapolation using Prior-Data Fitted Networks

Steven Adriænsen, Herilalaina Rakotoarison|arXiv (Cornell University)|Oct 31, 2023
Machine Learning in Healthcare被引用 7
一句话总结

本文提出了 LC-PFN,首次将先验数据拟合网络(PFNs)应用于贝叶斯学习曲线外推。通过在参数先验生成的合成右删失学习曲线数据上训练基于 Transformer 的 PFN,LC-PFN 实现了相较于 MCMC 超过 10,000 倍的速度提升,同时提供更精确的概率预测,并在来自多样化架构与数据集的 20,000 条真实学习曲线中展现出强大的泛化能力,实现了 2–6 倍的高效早期停止加速。

ABSTRACT

Learning curve extrapolation aims to predict model performance in later epochs of training, based on the performance in earlier epochs. In this work, we argue that, while the inherent uncertainty in the extrapolation of learning curves warrants a Bayesian approach, existing methods are (i) overly restrictive, and/or (ii) computationally expensive. We describe the first application of prior-data fitted neural networks (PFNs) in this context. A PFN is a transformer, pre-trained on data generated from a prior, to perform approximate Bayesian inference in a single forward pass. We propose LC-PFN, a PFN trained to extrapolate 10 million artificial right-censored learning curves generated from a parametric prior proposed in prior art using MCMC. We demonstrate that LC-PFN can approximate the posterior predictive distribution more accurately than MCMC, while being over 10 000 times faster. We also show that the same LC-PFN achieves competitive performance extrapolating a total of 20 000 real learning curves from four learning curve benchmarks (LCBench, NAS-Bench-201, Taskset, and PD1) that stem from training a wide range of model architectures (MLPs, CNNs, RNNs, and Transformers) on 53 different datasets with varying input modalities (tabular, image, text, and protein data). Finally, we investigate its potential in the context of model selection and find that a simple LC-PFN based predictive early stopping criterion obtains 2 - 6x speed-ups on 45 of these datasets, at virtually no overhead.

研究动机与目标

  • 为解决现有贝叶斯学习曲线外推方法存在的限制过强或计算成本过高的问题。
  • 首次探索将先验数据拟合网络(PFNs)应用于学习曲线外推的可行性和有效性。
  • 在已知先验生成的合成曲线和跨多样化架构与数据模态的真实学习曲线中,评估 LC-PFN 的性能。
  • 通过将 LC-PFN 集成到超参数优化的早期停止准则中,展示其实际应用价值。
  • 通过开源代码、数据和模型,确保 LC-PFN 框架的可复现性。

提出的方法

  • LC-PFN 是一种基于 Transformer 的神经网络,其在使用 MCMC 采样生成的、来自参数先验的人工右删失学习曲线数据上进行预训练。
  • PFN 能够在单次前向传播中近似学习曲线上的后验预测分布(PPD),从而实现快速的贝叶斯推理。
  • 该模型被训练以在给定部分训练数据并基于先验条件的情况下,预测完整的未来性能分布。
  • LC-PFN 在合成与真实学习曲线基准上,与基于 MCMC 的后验预测近似方法进行对比评估。
  • 采用细粒度的早期停止准则,利用 LC-PFN 的预测不确定性,在性能提升可能性低于置信度阈值时终止训练。
  • 该方法在五个基准上进行了验证:LCBench、NAS-Bench-201、Taskset、PD1,以及来自先验的合成曲线。

实验结果

研究问题

  • RQ1先验数据拟合网络(PFNs)能否有效应用于贝叶斯学习曲线外推任务?
  • RQ2在来自已知先验的合成学习曲线中,LC-PFN 的准确率与速度相较于基于 MCMC 的后验预测近似方法表现如何?
  • RQ3LC-PFN 是否能泛化到来自多样化架构(MLPs、CNNs、RNNs、Transformers)与数据模态(表格、图像、文本、蛋白质)的真实学习曲线?
  • RQ4基于 LC-PFN 的早期停止对超参数优化效率的实际影响是什么?
  • RQ5基于 LC-PFN 的早期停止准则在置信度阈值与最小观测值截断点变化时的鲁棒性如何?

主要发现

  • LC-PFN 在来自先验的合成曲线上实现了相较于 MCMC 超过 10,000 倍的速度提升,同时提供了更精确的概率外推结果。
  • LC-PFN 在真实学习曲线中表现出良好的泛化能力,在四个多样化基准(LCBench、NAS-Bench-201、Taskset、PD1)的 20,000 条曲线中均达到具有竞争力的性能。
  • 基于 LC-PFN 的早期停止准则在 45 个数据集中的全部 45 个上实现了 2–6 倍的速度提升,且计算开销极低。
  • 该方法对超参数选择具有鲁棒性:置信度水平为 0.90、0.95、0.99 和 0.999 时均表现良好,更高的置信度水平带来更一致但略慢的性能提升。
  • 在应用终止前,最少观察两个样本为最优策略,因为单一样本的截断点在简单任务上会降低性能,而更高的截断点则导致轻微的延迟。
  • 定性外推图显示,LC-PFN 的预测大多合乎逻辑,与观测数据和先验一致,且 MCMC-PP 几乎从未优于 LC-PFN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。