[论文解读] Enhancing Multi-Class Classification of Random Forest using Random Vector Functional Neural Network and Oblique Decision Surfaces
本文提出一种混合集成分类器,将新型倾斜随机森林与随机向量功能链接(RVFL)网络相结合,以提升多分类性能。通过利用RVFL对训练数据进行类别特定的子集划分,该方法能够构建更有效、更精细的倾斜决策树,在计算成本更低的前提下,相比标准随机森林和倾斜随机森林,实现了更高的准确率。
Both neural networks and decision trees are popular machine learning methods and are widely used to solve problems from diverse domains. These two classifiers are commonly used base classifiers in an ensemble framework. In this paper, we first present a new variant of oblique decision tree based on a linear classifier, then construct an ensemble classifier based on the fusion of a fast neural network, random vector functional link network and oblique decision trees. Random Vector Functional Link Network has an elegant closed form solution with extremely short training time. The neural network partitions each training bag (obtained using bagging) at the root level into C subsets where C is the number of classes in the dataset and subsequently, C oblique decision trees are trained on such partitions. The proposed method provides a rich insight into the data by grouping the confusing or hard to classify samples for each class and thus, provides an opportunity to employ fine-grained classification rule over the data. The performance of the ensemble classifier is evaluated on several multi-class datasets where it demonstrates a superior performance compared to other state-of- the-art classifiers.
研究动机与目标
- 通过引入能更好捕捉复杂决策边界的倾斜决策边界,解决标准随机森林中轴向平行切分的局限性。
- 通过利用RVFL网络快速、闭式训练的特性进行数据划分,降低多分类任务中的计算成本。
- 通过在难以分类的样本上实现更精细的分类规则,提升在高维或复杂多分类数据集上的分类性能。
- 构建一种混合集成模型,结合RVFL的快速训练优势与倾斜树的表示能力,实现更优的泛化性能。
- 证明在RVFL数据划分引导下,浅层树与小规模集成即可实现高性能,从而显著减少训练时间与资源消耗。
提出的方法
- 提出一种新型倾斜决策树变体,在每个节点使用线性超平面(倾斜切分),通过基尼不纯度准则进行优化,与标准随机森林类似,但边界逼近能力更优。
- 利用RVFL网络在根节点将训练数据集划分为C个子集,其中C为类别数量,依据各类别的特定模式进行划分。
- 在每个RVFL划分的子集上分别训练C棵倾斜决策树,使模型能聚焦于各类别中难以分类或易混淆的样本。
- 通过将RVFL划分后的倾斜随机森林预测结果与原始RVFL网络的预测结果进行融合,构建混合集成分类器(obRaFL),实现最终决策融合。
- 采用闭式解进行RVFL训练,无需反向传播,实现极快的学习速度,显著降低训练时间。
- 应用自助采样(bagging)生成多个训练子集,并在每个子集中利用RVFL创建类别特定的划分,增强模型多样性与鲁棒性。
实验结果
研究问题
- RQ1在RVFL划分数据上训练的倾斜决策树是否能相比标准随机森林与倾斜随机森林,提升多分类准确率?
- RQ2利用RVFL进行数据划分是否能提升对难以分类样本的学习效率,从而实现更好的泛化性能?
- RQ3RVFL与倾斜随机森林的混合集成是否能在保持高性能的同时,实现比现有最先进方法更低的计算成本?
- RQ4所提方法在大规模或高维数据集上,能在多大程度上减少训练时间,同时保持或提升性能?
- RQ5树的深度、树的数量以及特征数量等超参数如何影响该混合集成模型的性能?
主要发现
- 所提出的倾斜随机森林(obRaF(M))在10个数据集上的平均准确率达到84.36%,优于标准随机森林(83.07%)与倾斜随机森林(83.68%)。
- 混合集成模型(obRaFL)取得最高平均准确率84.6%,Friedman检验排名为1.1,表明其整体性能最优。
- 在Pendigits数据集上,混合集成模型仅使用300棵树与最大深度6,即达到97.15%的准确率,优于更深的标准随机森林。
- 该方法即使在浅层树与小规模集成下仍保持高性能,体现出显著的计算效率。
- 基于RVFL的划分成功将易混淆样本按类别分组,使模型能够生成更精细的分类规则,从而提升准确率。
- 该混合集成模型在多种数据集上均表现出强泛化能力,包括高维数据集如Statlog-image(准确率98.27%)与Letter(准确率97.58%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。