[论文解读] One Class Splitting Criteria for Random Forests
本文通过自适应建模隐藏异常值,提出了一种新型的一类随机森林分裂准则,以克服异常检测中的维度灾难问题。通过根据节点体积动态调整每节点的异常值期望数量,该方法实现了结构合理的单类随机森林,在基准测试中表现优于现有方法,且无需第二类采样即可实现强大的经验性能。
Random Forests (RFs) are strong machine learning tools for classification and regression. However, they remain supervised algorithms, and no extension of RFs to the one-class setting has been proposed, except for techniques based on second-class sampling. This work fills this gap by proposing a natural methodology to extend standard splitting criteria to the one-class setting, structurally generalizing RFs to one-class classification. An extensive benchmark of seven state-of-the-art anomaly detection algorithms is also presented. This empirically demonstrates the relevance of our approach.
研究动机与目标
- 为解决随机森林缺乏系统性的一类扩展方法这一问题,因为其本质上是监督学习方法。
- 克服一类异常检测中的维度灾难问题,因为在高维空间中,由于内点分布稀疏,标准的不纯度准则会失效。
- 开发一种分裂准则,即使在小范围、低概率区域也能保持有意义的类别比例。
- 使随机森林能够学习单一内点类的支持与密度结构,而无需人工生成异常值。
- 通过实证验证,将所提方法与当前最先进的单类异常检测算法进行比较。
提出的方法
- 通过将隐藏异常值数量建模为节点体积的函数,提出一种自适应的一类不纯度减少代理准则,确保在小区域内异常值期望值非可忽略。
- 定义节点特定的模型 One-Class-Model(n(Lt), α(Lt)),其中 α(Lt) 和 n(Lt) 被调整,以使所有节点的异常值与内点比例保持恒定。
- 施加两个约束条件:(1) 内点期望数量保持不变,即 (1−α)n = (1−α(Lt))n(Lt);(2) 通过 α(Lt)n(Lt)Lt = γnt 确保期望类别比例 γt 恒定。
- 推导出自适应不纯度减少准则 IOC−adG(tL,tR),作为两类 Gini 准则的推广,其中各项按体积和比例调整后的异常值期望进行缩放。
- 利用节点体积 Lt → 0 的渐近极限来证明模型的合理性,表明在极限情况下,异常值数量发散,而内点服从参数为 (1−α)n 的泊松分布。
- 通过包含七种当前最先进的异常检测算法的基准测试,实证验证了所提方法,结果表明其在性能上优于现有方法。
实验结果
研究问题
- RQ1是否可以自然地将标准随机森林分裂准则扩展到一类设置,而无需依赖人工生成的第二类采样?
- RQ2如何调整不纯度准则,以在内点稀疏的低密度、高维区域保持判别能力?
- RQ3对隐藏异常值模型施加何种约束,才能在避免维度灾难的同时与两类随机森林框架保持一致?
- RQ4如何在节点体积缩小的情况下,仍能将每个节点中异常值的期望比例维持在有意义的水平?
- RQ5所提出的自适应一类分裂准则是否能带来相较于现有最先进方法的异常检测性能提升?
主要发现
- 所提自适应一类分裂准则成功地在所有节点间维持了恒定的异常值与内点期望比例,防止了在小区域中不纯度准则的崩溃。
- 在包含七种当前最先进的异常检测算法的基准测试中,该方法表现出强大的经验性能,优于现有方法。
- 自适应模型确保了内点期望数量与原始数据集规模保持一致,从而维持了统计保真度。
- 该模型的渐近行为得到了良好解释:当节点体积趋近于零时,隐藏异常值数量发散,而内点服从参数为 (1−α)n 的泊松分布。
- 推导出的准则 (14) 在将隐藏异常值数量替换为实际第二类数量时,可恢复原始两类 Gini 不纯度减少准则。
- 该方法为随机森林提供了一种自然且结构上可推广的一类分类扩展,避免了人工生成异常值或对树结构设计施加人为约束。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。