[论文解读] Deep Broad Learning - Big Models for Big Data
本文提出深度广义学习(DBL),一种新颖算法,结合了深度学习建模复杂高阶特征交互的能力与广义学习利用大量特征的能力。通过采用混合生成-判别方法,DBL能高效优化至 $n$ 阶的逻辑回归模型,实现对大规模数据的最先进准确率,且调参极少,并支持核外学习,在包括扑克牌型和人口收入在内的大规模数据集上表现出高度竞争力的性能。
Deep learning has demonstrated the power of detailed modeling of complex high-order (multivariate) interactions in data. For some learning tasks there is power in learning models that are not only Deep but also Broad. By Broad, we mean models that incorporate evidence from large numbers of features. This is of especial value in applications where many different features and combinations of features all carry small amounts of information about the class. The most accurate models will integrate all that information. In this paper, we propose an algorithm for Deep Broad Learning called DBL. The proposed algorithm has a tunable parameter $n$, that specifies the depth of the model. It provides straightforward paths towards out-of-core learning for large data. We demonstrate that DBL learns models from large quantities of data with accuracy that is highly competitive with the state-of-the-art.
研究动机与目标
- 为应对构建大规模数据高精度模型的挑战,结合深度学习建模复杂交互的能力与广义学习利用大量特征的能力。
- 开发一种可扩展的学习算法,能够高效处理大规模数据集,特别是在单个特征对目标类别仅携带少量信息时。
- 通过设计可调深度 $n$ 的模型并利用随机梯度下降实现高效参数优化,实现对大规模数据集的核外学习。
- 证明混合生成-判别学习可在极少超参数调优下实现高准确率,优于传统模型在大规模数据上的表现。
提出的方法
- 提出 DBL$^n$,一种深度广义学习框架,将逻辑回归扩展至建模从 $n=1$ 到 $n=3$ 的所有 $n$ 阶特征交互。
- 采用混合生成-判别方法:使用生成方法的最大似然估计预训练判别性逻辑回归模型,以加速收敛。
- 采用随机梯度下降(SGD)进行高效优化,实现快速收敛至全局最小值,并支持核外学习。
- 引入分层扩展 $h\text{DBL}^n$,将 $n=1$ 到 $n$ 的模型组合起来,当训练数据中缺少高阶交互时可回退至低阶交互。
- 应用稀疏实现技术,高效处理高阶交互,尤其适用于许多组合在数据中未出现的情况。
- 当前版本仅支持分类数据,需在建模前将数值特征离散化。
实验结果
研究问题
- RQ1混合生成-判别方法能否高效优化大规模数据的高阶逻辑回归模型($\text{LR}^n$)?
- RQ2能够捕捉复杂多变量交互的深度广义学习模型是否在大规模数据集上优于最先进模型?
- RQ3所提出的 DBL 框架能否通过高效的 SGD 优化支持核外学习,并扩展至超大规模数据集?
- RQ4DBL$^n$ 在大规模数据上的性能与随机森林及其他集成方法相比如何,特别是在特征仅携带微弱证据时?
- RQ5当训练数据中缺少高阶交互时,对 $n$ 阶交互的分层建模是否能提升模型鲁棒性?
主要发现
- DBL$^3$ 在 MIT-FaceSetC 数据集上达到最低的 0-1 损失(0.0005),并在 8 个大规模数据集中的 6 个上表现第二,优于随机森林和 A2DE。
- 在 Census-income 数据集上,DBL$^3$ 的 0-1 损失为 0.0056,显著低于 A2DE(0.01348)和 RF(0.0687)。
- DBL$^2$ 在 MIT-FaceSetB 数据集上达到最低均方根误差(RMSE)(0.0123),并在 8 个数据集中的 5 个上表现第二,优于 RF 和 A2DE。
- 在 Kddcup 数据集上,DBL$^3$ 的 0-1 损失为 0.0013,RMSE 为 0.1494,两项均为最佳结果之一,优于 RF 和 A2DE。
- DBL$^1$(等价于 WANBIA-C)在多个数据集上表现具有竞争力,验证了混合方法的基础有效性。
- 该模型表现出快速收敛且调参极少,支持其通过随机梯度下降实现大规模、核外学习的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。