Skip to main content
QUICK REVIEW

[论文解读] One-Pass Learning with Incremental and Decremental Features

Chenping Hou, Zhi‐Hua Zhou|arXiv (Cornell University)|May 30, 2016
Advanced Bandit Algorithms Research参考文献 15被引用 12
一句话总结

本文提出OPID,一种针对特征动态演变的流式数据的一次性学习方法——即部分特征消失而其他特征被引入——通过将消失特征的信息压缩为存活特征的函数,并扩展以包含新特征。该方法实现了高效、可扩展的学习,无需存储数据,在真实场景(如传感器监控和移动游戏推荐)中,尤其在训练数据有限时,显著提升了准确率。

ABSTRACT

In many real tasks the features are evolving, with some features being vanished and some other features augmented. For example, in environment monitoring some sensors expired whereas some new ones deployed; in mobile game recommendation some games dropped whereas some new ones added. Learning with such incremental and decremental features is crucial but rarely studied, particularly when the data coming like a stream and thus it is infeasible to keep the whole data for optimization. In this paper, we study this challenging problem and present the OPID approach. Our approach attempts to compress important information of vanished features into functions of survived features, and then expand to include the augmented features. It is the one-pass learning approach, which only needs to scan each instance once and does not need to store the whole data, and thus satisfy the evolving streaming data nature. The effectiveness of our approach is validated theoretically and empirically.

研究动机与目标

  • 解决在实例和特征随时间动态演变的流式数据中学习的挑战。
  • 开发一种可扩展的一次性学习方法,无需存储完整数据集,适用于实时应用。
  • 在不从头开始重新训练的前提下,处理特征演变——包括旧特征的消失和新特征的引入。
  • 在训练数据有限的场景中确保鲁棒性能,特别是当引入新特征时。
  • 为单次学习流程中的特征压缩(C-stage)和扩展(E-stage)提供统一框架。

提出的方法

  • 提出两阶段框架:C-stage(压缩阶段)用于处理消失特征,E-stage(扩展阶段)用于整合增强特征。
  • 在C-stage中,使用仅处理每个实例一次的一次性学习方法,将消失特征的信息压缩为存活特征的函数。
  • 使用线性模型将消失特征投影到存活特征空间,以保留下游分类所需的判别性信息。
  • 在E-stage中,扩展模型以包含新增的增强特征,同时保持从C-stage继承的性能。
  • 将C-stage的压缩表示集成到E-stage的学习过程中,实现在特征变化中跨阶段的知识迁移。
  • 将学习目标表述为正则化优化问题,以在特征演变下平衡模型准确率与泛化能力。

实验结果

研究问题

  • RQ1当特征被逐步增加和逐步移除时,如何有效从流式数据中学习?
  • RQ2能否设计一种一次性学习算法,在不存储完整数据集的同时,维持在特征演变下的高分类准确率?
  • RQ3对消失特征的压缩表示在后续引入新特征的学习阶段中,能在多大程度上提升性能?
  • RQ4在训练数据有限且特征发生变化的场景下,所提方法与传统方法相比性能如何?
  • RQ5该方法在特征演变下是否能在不同类型的数据(如生物数据、图像数据和传感器数据)上表现出良好的泛化能力?

主要发现

  • OPID在基线方法上实现了显著的准确率提升,尤其在E-stage训练数据稀缺时,表现出从C-stage有效迁移知识的能力。
  • 在USPS0vs5数据集上,OPID在240个训练样本下达到94.7%的准确率,优于SVM及其他基线方法,p值为0.012,表明具有统计显著性。
  • 在Gisette数据集上,OPID在100个训练样本下达到97.10%的准确率,显著优于SVM(87.95%)及其他方法,p值为0.0185。
  • OPID在所有数据集和特征配置下均持续优于所有基线方法,在测试集的24次比较中全部获胜,无一失利。
  • 在多分类设置(如Protein、Splice)中,性能提升更为显著,可能是因为基线准确率较高,进一步提升空间有限。
  • 在高维数据(如Gisette,含4955个特征)上性能略有下降,表明对维度灾难较为敏感,但OPID仍优于所有基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。