Skip to main content
QUICK REVIEW

[论文解读] Streaming Active Deep Forest for Evolving Data Stream Classification

Anh Vu Luong, Tien Thanh Nguyen|arXiv (Cornell University)|Feb 26, 2020
Data Stream Mining Techniques参考文献 16被引用 11
一句话总结

本文提出Streaming Deep Forest(SDF),一种专为动态数据流分类设计的新型深度集成模型,以及增强型可变不确定性(AVU)主动学习策略,以优化标注效率。SDF通过将gcForest的级联结构与自适应随机森林(ARF)结合,实现在线学习与概念漂移适应;AVU在传统不确定性采样基础上动态调整阈值,充分利用标注预算,在仅使用70%标注数据的情况下实现SOTA性能。

ABSTRACT

In recent years, Deep Neural Networks (DNNs) have gained progressive momentum in many areas of machine learning. The layer-by-layer process of DNNs has inspired the development of many deep models, including deep ensembles. The most notable deep ensemble-based model is Deep Forest, which can achieve highly competitive performance while having much fewer hyper-parameters comparing to DNNs. In spite of its huge success in the batch learning setting, no effort has been made to adapt Deep Forest to the context of evolving data streams. In this work, we introduce the Streaming Deep Forest (SDF) algorithm, a high-performance deep ensemble method specially adapted to stream classification. We also present the Augmented Variable Uncertainty (AVU) active learning strategy to reduce the labeling cost in the streaming context. We compare the proposed methods to state-of-the-art streaming algorithms in a wide range of datasets. The results show that by following the AVU active learning strategy, SDF with only 70\% of labeling budget significantly outperforms other methods trained with all instances.

研究动机与目标

  • 为解决在动态数据流场景中缺乏深度集成模型的问题,传统DNN面临可扩展性与重新训练的挑战。
  • 降低流式环境中的人工标注成本,因人工标注昂贵且耗时。
  • 通过克服现有基于不确定性的策略中对标注预算的利用不足,提升流式环境中的主动学习性能。
  • 开发一种可扩展的在线学习框架,在概念漂移、内存与时间约束下仍能保持高准确率。

提出的方法

  • SDF通过将标准随机森林替换为自适应随机森林(ARF),将gcForest的级联架构适配至数据流,实现在线学习与漂移适应。
  • SDF中每一层通过ARF处理特征,支持增量模型更新,并在各层间保持表征学习能力。
  • 该模型采用在线训练机制,仅对每个实例处理一次,在预测后即丢弃,以满足内存与时间约束。
  • AVU通过基于预测置信度动态调整置信度阈值,扩展了可变不确定性(VU)策略,确保标注预算的完全利用。
  • 阈值更新规则定义为:若预测置信度u_k < θ_k,则θ_{k+1} = θ_k(1-s);若u_k ≥ θ_k,则θ_{k+1} = θ_k(1+s),其中s为小的正数常量。
  • 理论分析表明,在置信度分数均匀分布的条件下,当k→∞时,P(u_k < θ_k)收敛至0.5,确保采样平衡与预算最优使用。

实验结果

研究问题

  • RQ1gcForest的深度集成架构能否在严格的时间与内存约束下,有效适配至动态数据流分类任务?
  • RQ2所提出的AVU主动学习策略是否通过在流式环境中充分利用标注预算,优于传统不确定性采样?
  • RQ3当仅使用可用标注数据的有限部分时,SDF相较于当前最先进流分类器的性能如何?
  • RQ4模型深度(层数)对SDF在流式场景下的性能与计算效率有何影响?
  • RQ5所提出框架能否实现实时检测与适应概念漂移,同时保持高预测准确率?

主要发现

  • SDF仅使用70%的标注预算,在20个多样化数据集上显著优于所有在100%标注数据下训练的基线方法。
  • SDF性能随深度增加而提升,从1层到5层准确率呈现明显上升趋势,表明更深模型能获得更好结果。
  • AVU在长期运行中实现P(u_k < θ_k)收敛至0.5,证明其完全利用了标注预算,而原始VU策略则存在利用不足问题。
  • 理论分析证实,AVU中的自适应阈值可确保对不确定样本的平衡采样,避免过早收敛或对高置信预测的过度采样。
  • SDF通过集成主动漂移检测机制,展现出对概念漂移的鲁棒性,在数据分布随时间变化时仍能保持高准确率。
  • 实验结果表明,当计算资源允许时,SDF在两层或以上深度的模型始终优于单层变体,且深度越大性能越优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。