Skip to main content
QUICK REVIEW

[论文解读] Adaptive Deep Forest for Online Learning from Drifting Data Streams

Łukasz Korycki, Bartosz Krawczyk|arXiv (Cornell University)|Oct 14, 2020
Data Stream Mining Techniques参考文献 41被引用 4
一句话总结

本文提出自适应深度随机森林(ADF),一种在线学习算法,通过将自适应决策树与深度森林架构相结合,以处理高维数据流中的概念漂移问题。通过采用多粒度扫描与级联集成学习机制,ADF在复杂数据(如图像和文本)上的表现优于当前最先进的浅层流分类器。

ABSTRACT

Learning from data streams is among the most vital fields of contemporary data mining. The online analysis of information coming from those potentially unbounded data sources allows for designing reactive up-to-date models capable of adjusting themselves to continuous flows of data. While a plethora of shallow methods have been proposed for simpler low-dimensional streaming problems, almost none of them addressed the issue of learning from complex contextual data, such as images or texts. The former is represented mainly by adaptive decision trees that have been proven to be very efficient in streaming scenarios. The latter has been predominantly addressed by offline deep learning. In this work, we attempt to bridge the gap between these two worlds and propose Adaptive Deep Forest (ADF) - a natural combination of the successful tree-based streaming classifiers with deep forest, which represents an interesting alternative idea for learning from contextual data. The conducted experiments show that the deep forest approach can be effectively transformed into an online algorithm, forming a model that outperforms all state-of-the-art shallow adaptive classifiers, especially for high-dimensional complex streams.

研究动机与目标

  • 通过使深度学习适用于高维非平稳数据流,弥合深度学习与流数据挖掘之间的差距。
  • 克服浅层流分类器在处理复杂上下文数据(如图像、文本和时间序列)时的局限性。
  • 开发一种深度架构,在保持深度学习表征能力的同时,对概念漂移保持高响应性。
  • 将在线学习与多粒度特征扫描及级联森林集成相结合,实现在动态环境中的持续适应。

提出的方法

  • 通过用在线自适应随机森林(ARF)集成替换gcForest架构中的离线组件,实现增量学习。
  • 采用不同分辨率的滑动窗口实现多粒度扫描机制,从高维输入中提取分层特征。
  • 构建级联深度森林结构,使每一层处理前序层的特征,实现在在线设置下的深度表征学习。
  • 在每一级联层中使用自适应决策树,以确保对概念漂移的快速响应,并长期保持模型准确性。
  • 在每一级联层中将多粒度特征作为附加输入,以丰富表征学习并提升泛化能力。
  • 采用在线学习结合概念漂移检测与模型自适应策略,以在演化数据流中持续维持性能。

实验结果

研究问题

  • RQ1深度森林架构能否在存在概念漂移的数据流环境中被有效适配为在线学习方法?
  • RQ2多粒度扫描在高维流数据中如何增强特征表征与模型性能?
  • RQ3ADF在图像和文本等复杂数据上的表现相较于当前最先进的浅层流分类器,优势程度如何?
  • RQ4当前ADF设计中的计算与可扩展性瓶颈是什么,它们如何影响模型性能与训练时间?
  • RQ5模型结构(如树深度、层配置)与不同数据流类型下的性能之间存在何种关联?

主要发现

  • ADF 显著优于所有当前最先进的浅层自适应流分类器,尤其在高维数据流(如 AGNEWS、MALARIA 和 DOGSvCATS)上表现突出。
  • 多粒度扫描的使用改善了特征表征,并显著提升了预测性能,尤其在视觉与文本数据流中表现明显。
  • ADF 展现出对概念漂移的强响应能力,在数据分布随时间变化时仍能保持高准确率。
  • 对于较大的数据流(如 AGNEWS),模型表现出更高的运行时与计算开销,表明存在可扩展性挑战。
  • 树深度分析显示,在大型模型中,输入层的树通常最深,提示可能存在过拟合风险;而在小型模型中,级联层的树更深,可能因模式捕捉不足所致。
  • 尽管性能有所提升,但增加模型规模并未带来成比例的性能增益,提示未来工作需增强学习单元的多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。