Skip to main content
QUICK REVIEW

[论文解读] Model adaptation and unsupervised learning with non-stationary batch data under smooth concept drift

Subhro Das, Prasanth Lade|arXiv (Cornell University)|Feb 10, 2020
Data Stream Mining Techniques参考文献 27被引用 4
一句话总结

该论文提出了一种无监督、迭代的算法,用于在平滑概念漂移条件下对非平稳批次数据中的预测模型进行适应,采用后验概率漂移的定量度量。该方法在未经适应的模型上提升了分类准确率,并在显著降低运行时间的前提下,实现了与当前最先进方法(如SGARC)相当或更优的性能——在合成数据和真实制造数据上均得到验证。

ABSTRACT

Most predictive models assume that training and test data are generated from a stationary process. However, this assumption does not hold true in practice. In this paper, we consider the scenario of a gradual concept drift due to the underlying non-stationarity of the data source. While previous work has investigated this scenario under a supervised-learning and adaption conditions, few have addressed the common, real-world scenario when labels are only available during training. We propose a novel, iterative algorithm for unsupervised adaptation of predictive models. We show that the performance of our batch adapted prediction algorithm is better than that of its corresponding unadapted version. The proposed algorithm provides similar (or better, in most cases) performance within significantly less run time compared to other state of the art methods. We validate our claims though extensive numerical evaluations on both synthetic and real data.

研究动机与目标

  • 解决在实际部署中标签不可用(尽管训练数据有标签)的模型适应挑战。
  • 基于数据点间后验概率分布的变化,提出概念漂移的定量定义。
  • 设计一种高效、迭代的算法,通过仅使用测试数据和先前训练的模型来估计点级漂移并适应分类器,而无需在适应过程中访问标签。
  • 在合成数据和真实数据集上验证该方法,展示其更高的准确率和更低的计算成本。
  • 证明所提方法在准确率上优于或匹配最先进方法(如SGARC),同时运行时间显著更短。

提出的方法

  • 该方法通过测量每个数据点在初始(训练)数据与漂移后(测试)数据之间后验概率分布的变化来量化概念漂移。
  • 它构建了一个迭代优化过程,仅使用测试数据和先前训练的模型来调整模型参数,而无需访问标签。
  • 算法采用步长调度 γ^(k) = 50 / √(k+1) 和 10^−10 的收敛阈值,以确保更新的稳定性。
  • 通过分析类别后验概率的偏移,估计每个数据点在漂移估计中的重要性。
  • 适应过程应用于朴素贝叶斯分类器,但该框架可推广至其他分类器。
  • 该方法在批次适应设置下进行评估,即训练后仅可访问模型和测试数据。

实验结果

研究问题

  • RQ1在非平稳数据流的分类任务中,如何对概念漂移进行定量测量?
  • RQ2在适应过程中无标签的情况下,点级漂移估计对模型性能有何影响?
  • RQ3无监督、迭代的适应算法能否在显著降低运行时间的前提下,实现优于或等同于有监督最先进方法的准确率?
  • RQ4在具有渐进、平滑概念漂移的真实制造数据上,该方法表现如何?
  • RQ5在漂移条件下的批次模式模型适应中,适应准确率与计算效率之间存在何种权衡?

主要发现

  • 在 UG_2C_2D 数据集上,所提算法实现了 96.08% 的分类准确率,优于 SGARC (1NN) 的 95.56% 和 SGARC (SVM) 的 95.53%。
  • 在 UG_2C_3D 数据集上,该方法实现了 95.11% 的准确率,超过 SGARC (1NN) 的 94.77% 和 SGARC (SVM) 的 94.79%。
  • 在 UG_2C_5D 数据集上,所提方法实现了 93.65% 的准确率,优于 SGARC (1NN) 的 90.98% 和 SGARC (SVM) 的 88.24%。
  • 所提算法在每个数据集上的平均运行时间为 5.20–5.50 秒,而 SGARC (SVM) 的运行时间为 10.11–120.21 秒,显示出显著的速度优势。
  • 在真实制造数据集上,经适应的模型优于未适应的模型,并与有监督基线方法具有竞争力,证明了其在真实世界漂移场景中的有效性。
  • 所有实验中,该算法均在 10 次迭代内收敛,表明其收敛速度快且计算开销低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。