Skip to main content
QUICK REVIEW

[论文解读] Towards AutoML in the presence of Drift: first results

Jorge G. Madrid, Hugo Jair Escalante|arXiv (Cornell University)|Jul 24, 2019
Data Stream Mining Techniques参考文献 36被引用 17
一句话总结

本文提出对 Auto-sklearn 的扩展,通过集成漂移检测与模型自适应策略,使自动化机器学习能够适应数据流中的概念漂移。该方法在检测到漂移时动态重新训练或重新加权模型,从而在基准数据集和真实世界 AutoML2 挑战数据集上显著提升性能,优于静态基线模型。

ABSTRACT

Research progress in AutoML has lead to state of the art solutions that can cope quite wellwith supervised learning task, e.g., classification with AutoSklearn. However, so far thesesystems do not take into account the changing nature of evolving data over time (i.e., theystill assume i.i.d. data); even when this sort of domains are increasingly available in realapplications (e.g., spam filtering, user preferences, etc.). We describe a first attempt to de-velop an AutoML solution for scenarios in which data distribution changes relatively slowlyover time and in which the problem is approached in a lifelong learning setting. We extendAuto-Sklearn with sound and intuitive mechanisms that allow it to cope with this sort ofproblems. The extended Auto-Sklearn is combined with concept drift detection techniquesthat allow it to automatically determine when the initial models have to be adapted. Wereport experimental results in benchmark data from AutoML competitions that adhere tothis scenario. Results demonstrate the effectiveness of the proposed methodology.

研究动机与目标

  • 为解决现有 AutoML 系统假设数据独立同分布(i.i.d.)的问题,实现对真实世界中演化数据流中概念漂移的自适应能力。
  • 评估在数据分布随时间变化的终身学习(LML)场景下 AutoML 的可行性。
  • 将概念漂移检测与 AutoML 流水线集成,实现模型重新训练与集成加权的自动化。
  • 评估 AutoML 是否能在具有渐进或突变分布变化的数据流上维持或提升性能。

提出的方法

  • 在 Auto-sklearn 中扩展漂移检测机制,当检测到数据分布变化时触发模型自适应。
  • 应用四种自适应策略:模型替换、WU-all(使用所有历史模型进行重加权)、WU-latest(仅使用最新模型进行重加权)以及 Add new(增量添加新模型)。
  • 采用基于批次的评估方式监控性能并检测漂移,自适应操作在漂移确认后执行。
  • 结合贝叶斯优化与元学习进行超参数调优,保持 Auto-sklearn 核心 AutoML 流水线的完整性。
  • 使用概念漂移检测器(如 ADWIN)识别数据批次之间的分布变化。
  • 在合成数据集与真实世界数据集上评估自适应策略,并与静态基线模型进行性能对比。

实验结果

研究问题

  • RQ1AutoML 系统能否在无需人工干预的情况下有效适应数据流中的概念漂移?
  • RQ2在漂移条件下,不同模型自适应策略(如替换、重加权)的性能表现如何比较?
  • RQ3将漂移检测与 AutoML 集成是否能提升演化数据上的长期预测性能?
  • RQ4在具有不同漂移特征(如突变与渐变)的数据集上,自适应策略的表现如何?
  • RQ5在概念漂移常见的现实世界数据流(如推荐系统或用户行为预测)中,AutoML 是否能维持高性能?

主要发现

  • 在 AutoML2 挑战赛的 RL 数据集上,模型替换策略相比基线模型显著提升准确率 47%。
  • 在 RH 数据集上,WU-all 方法实现了 73% 的相对性能提升,表明其在缓慢演化漂移场景下表现优异。
  • 在 RI 数据集上,WU-latest 方法性能提升超过 60%,表明其与漂移检测器的检测时机具有高度匹配性。
  • Add new 模型策略在漂移过程中无法维持准确率,因其难以平衡漂移前与漂移后的性能表现。
  • 在具有突变漂移的合成 Stagger 数据集上,除替换策略外,所有其他方法均表现不佳,凸显了突发概念漂移带来的挑战。
  • WU-batch 方法性能表现不稳定,因其对批次选择敏感,表明权重调整过程存在不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。