Skip to main content
QUICK REVIEW

[论文解读] Online Deep Learning: Learning Deep Neural Networks on the Fly

Doyen Sahoo, Quang Pham|arXiv (Cornell University)|Nov 10, 2017
Data Stream Mining Techniques被引用 5
一句话总结

本文提出了一种新型在线深度学习框架——Hedge反向传播(HBP),通过在不同隐藏层生成的多个输出分类器之间采用对冲策略,动态调整网络深度,实现在流式数据上训练深度神经网络(DNN)。HBP通过在浅层与深层网络之间共享知识,实现了更优的收敛性和鲁棒性,有效提升了在线学习性能,在静态和概念漂移场景下均优于标准在线反向传播算法及固定深度的DNN。

ABSTRACT

Deep Neural Networks (DNNs) are typically trained by backpropagation in a batch learning setting, which requires the entire training data to be made available prior to the learning task. This is not scalable for many real-world scenarios where new data arrives sequentially in a stream form. We aim to address an open challenge of "Online Deep Learning" (ODL) for learning DNNs on the fly in an online setting. Unlike traditional online learning that often optimizes some convex objective function with respect to a shallow model (e.g., a linear/kernel-based hypothesis), ODL is significantly more challenging since the optimization of the DNN objective function is non-convex, and regular backpropagation does not work well in practice, especially for online learning settings. In this paper, we present a new online deep learning framework that attempts to tackle the challenges by learning DNN models of adaptive depth from a sequence of training data in an online learning setting. In particular, we propose a novel Hedge Backpropagation (HBP) method for online updating the parameters of DNN effectively, and validate the efficacy of our method on large-scale data sets, including both stationary and concept drifting scenarios.

研究动机与目标

  • 解决在数据按顺序到达、无法存储完整批次的在线设置中训练深度神经网络(DNN)的挑战。
  • 克服标准在线反向传播的局限,包括梯度消失、收敛缓慢以及网络深度不当时性能不佳的问题。
  • 实现自动、数据驱动的模型容量自适应——从浅层开始,随数据量增加逐步加深网络,且无需验证数据。
  • 促进浅层与深层网络组件之间的知识共享,以提升在线设置下的预测性能与学习效率。
  • 开发一种可扩展、内存高效的在线DNN训练框架,支持概念漂移与大规模流式数据。

提出的方法

  • 通过在每个隐藏层附加一个输出分类器,扩展DNN架构,实现在在线学习过程中进行多深度预测。
  • 提出Hedge反向传播(HBP),一种改进的反向传播算法,利用Hedge算法动态加权来自不同深度分类器的预测结果。
  • 使用Hedge算法维护并更新每个分类器的置信度分数(基于在线性能表现),使系统能自适应地在每个学习步骤选择最有效的网络深度。
  • 扩展反向传播机制,同时更新所有网络参数,并在不同深度的分类器之间共享梯度,实现知识迁移。
  • 将在线学习目标表述为所有深度特定分类器损失的加权组合,权重通过基于累积性能的Hedge策略进行更新。
  • 通过让系统学习随时间推移哪个深度提供最佳预测性能,实现自动模型选择,而无需事先知晓最优深度。

实验结果

研究问题

  • RQ1如何在数据按顺序到达、全批量训练不可行的在线环境中有效训练深度神经网络?
  • RQ2何种机制可在无需验证数据或事先了解数据复杂度的情况下,实现在线DNN训练中网络深度的动态自适应?
  • RQ3如何在浅层与深层网络组件之间实现知识共享,以提升在线学习中的收敛速度与预测性能?
  • RQ4在多个深度特定分类器上采用对冲策略,是否能相比固定深度或标准在线反向传播,提升在线DNN的性能?
  • RQ5所提方法在流式环境中对概念漂移和数据复杂度变化的鲁棒性如何?

主要发现

  • 在HIGGS数据集上,Hedge反向传播(HBP)实现了最低的测试误差0.2615,优于标准在线反向传播(0.2868)及所有测试的固定深度DNN。
  • HBP在训练初期和后期均达到或超过最佳固定深度DNN(如20层)的性能,展现出卓越的适应能力。
  • 分类器间的权重分布随时间演变:初期浅层分类器占主导(0.5%数据),而5–7层的深层分类器在60–80%数据时逐渐占据优势,表明实现了有效的动态深度自适应。
  • HBP对基础网络深度具有强鲁棒性,测试误差在12、16、20和30层网络间仅轻微波动(0.2609–0.2620),而标准在线反向传播的误差随深度显著上升。
  • 在概念漂移场景(CD1和CD2)中,HBP保持了稳定的性能,展现出对真实流式数据中常见分布偏移的强适应能力。
  • 由于早期利用浅层网络,HBP在初始学习阶段实现了更快收敛,同时在后期利用深层表示,实现了速度与表征能力的平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。