Skip to main content
QUICK REVIEW

[论文解读] Distance approximation using Isolation Forests

David Cortés‐Polo|arXiv (Cornell University)|Oct 27, 2019
Anomaly Detection Techniques and Applications参考文献 5被引用 7
一句话总结

本文提出了一种基于孤立森林的新颖距离度量,通过测量数据点在随机树中的平均分离深度来估计其相似性,生成一种与尺度无关、非线性的距离度量,对变量间关系的多样性及缺失数据具有鲁棒性。该方法在捕捉复杂数据结构方面优于传统的欧几里得距离和马氏距离,并在混合类型数据上与Gower距离保持高度相关性。

ABSTRACT

This work briefly explores the possibility of approximating spatial distance (alternatively, similarity) between data points using the Isolation Forest method envisioned for outlier detection. The logic is similar to that of isolation: the more similar or closer two points are, the more random splits it will take to separate them. The separation depth between two points can be standardized in the same way as the isolation depth, transforming it into a distance metric that is limited in range, centered, and in compliance with the axioms of distance. This metric presents some desirable properties such as being invariant to the scales of variables or being able to account for non-linear relationships between variables, which other metrics such as Euclidean or Mahalanobis distance do not. Extensions to the Isolation Forest method are also proposed for handling categorical variables and missing values, resulting in a more generalizable and robust metric.

研究动机与目标

  • 开发一种能够捕捉高维特征空间中变量间复杂非线性关系的距离度量。
  • 创建一种对变量缩放不变且对非正态分布和缺失数据具有鲁棒性的相似性度量。
  • 将孤立森林的应用从异常值检测扩展至估计数据点之间的成对距离。
  • 在统一的距离框架中处理混合数据类型(数值型、分类变量、缺失值)。
  • 生成一种标准化、有界的距离度量,满足距离公理,并支持基于阈值的相似性判断。

提出的方法

  • 通过在特征上进行随机二元分割来计算多个树中两点间平均分离深度。
  • 利用均匀随机分割下的期望值对分离深度进行标准化,以生成有界且中心化的距离度量。
  • 应用与孤立深度用于异常值检测时相同的逻辑,但将其调整为用于成对分离而非孤立。
  • 通过将分类变量视为离散分割,并采用类似Gower的逻辑处理混合数据,将该方法扩展至处理分类变量。
  • 通过将缺失值视为分割中的独立类别来处理缺失值,从而在不进行插补的情况下保持距离估计的完整性。
  • 使用有限深度的树并采用非随机分割(例如基于方差最小化)以提高稳定性并降低计算成本。

实验结果

研究问题

  • RQ1孤立森林随机树中的分离深度能否作为数据点之间有意义且标准化的距离度量?
  • RQ2在复杂数据分布下,所提出的距离度量与欧几里得、马氏和余弦等传统度量相比,在捕捉真实相似性方面表现如何?
  • RQ3该方法在保持与真实距离相关性的同时,能在多大程度上处理缺失值和分类变量?
  • RQ4扩展模型(含分类变量和缺失值处理)在真实世界混合类型数据集上是否保持了该度量的鲁棒性和准确性?
  • RQ5在多变量且非独立同分布的数据(如具有相关分量的高斯混合分布)中,该度量能否一致地区分组内与组间距离?

主要发现

  • 在具有独立变量的多元正态分布中,所提出的基于孤立的度量与理想距离的相关系数达到0.96。
  • 在具有相关分量的非独立同分布高斯混合分布中,扩展模型(IsoExt)与理想组内距离的相关系数达到0.97,优于欧几里得距离(0.95)和马氏距离(0.89)。
  • 在15%缺失值的情况下,扩展模型与原始距离度量的相关系数保持在0.87,显著优于插补后的欧几里得距离(0.78)和马氏距离(0.72)。
  • 在包含数值型、布尔型和分类变量的甲状腺功能减退数据集上,所提度量与Gower距离的相关系数为0.731,表明其与广泛使用的基准度量高度一致。
  • 该方法在镜像高斯混合分布中成功保持了组内距离的对称性,而马氏距离因协方差结构混合而失效。
  • 在缺失数据场景下,扩展模型表现出显著优势,即使其他度量显著退化,仍能保持高度相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。