[논문 리뷰] Distance approximation using Isolation Forests
이 논문은 무작위 트리에서 데이터 포인트 간 평균 분리 깊이를 측정함으로써 유사도를 추정하는 새로운 거리 측도를 제안한다. 이는 척도 불변성과 비선형성을 갖추고 있으며, 변수 간 관계의 변동성과 결측치에 대해 강건한 거리 측도를 제공한다. 기존의 유클리드 거리 및 마할라노비스 거리와 비교해도 복잡한 데이터 구조를 더 잘 포착하며, 혼합형 데이터에서 고어 거리와 높은 상관성을 유지한다.
This work briefly explores the possibility of approximating spatial distance (alternatively, similarity) between data points using the Isolation Forest method envisioned for outlier detection. The logic is similar to that of isolation: the more similar or closer two points are, the more random splits it will take to separate them. The separation depth between two points can be standardized in the same way as the isolation depth, transforming it into a distance metric that is limited in range, centered, and in compliance with the axioms of distance. This metric presents some desirable properties such as being invariant to the scales of variables or being able to account for non-linear relationships between variables, which other metrics such as Euclidean or Mahalanobis distance do not. Extensions to the Isolation Forest method are also proposed for handling categorical variables and missing values, resulting in a more generalizable and robust metric.
연구 동기 및 목표
- 고차원 특성 공간에서 변수 간 복잡한 비선형 관계를 포착할 수 있는 거리 측도를 개발하는 것.
- 변수 척도에 영향을 받지 않으며, 비정규 분포와 결측치에 강건한 유사도 측도를 만드는 것.
- 이소레이션 포레스트를 이상치 탐지 외의 목적인 데이터 포인트 간 쌍별 거리 추정으로 확장하는 것.
- 수치형, 범주형, 결측치를 포함한 혼합형 데이터 유형을 통합된 거리 프레임워크 내에서 다루는 것.
- 거리 공리(axioms)를 충족하고 임계값 기반의 유사도 결정이 가능한 표준화되고 유한한 거리 측도를 생성하는 것.
제안 방법
- 다양한 트리에서 두 포인트 간 평균 분리 깊이를 계산하기 위해 특성에 대한 무작위 이진 분할을 사용한다.
- 균일한 무작위 분할 하에서 기대값을 사용해 분리 깊이를 표준화함으로써 유한하고 중심화된 거리 측도를 생성한다.
- 이소레이션 깊이에서 사용된 동일한 논리를 적용하지만, 고립이 아닌 쌍별 분리에 적용한다.
- 범주형 변수를 처리하기 위해 이산적 분할로 간주하고 혼합형 데이터에 대해 고어 유사 논리를 적용한다.
- 결측치는 분할에서 별도의 범주로 간주하여 보간 없이도 거리 추정을 유지한다.
- 안정성 향상과 계산 비용 감소를 위해 비랜덤 분할(예: 분산 최소화 기반)을 사용한 제한 깊이의 트리를 사용한다.
실험 결과
연구 질문
- RQ1무작위 이소레이션 포레스트 트리에서의 분리 깊이가 데이터 포인트 간 의미 있는 표준화된 거리 측도로 기능할 수 있는가?
- RQ2비선형 복잡한 데이터 분포 하에서, 제안된 거리 측도가 유클리드, 마할라노비스, 코사인과 같은 전통적 측도보다 진정한 유사도를 얼마나 잘 포착하는가?
- RQ3결측치와 범주형 변수를 다룰 때, 이 방법이 기준 거리 측도와의 상관성을 유지할 수 있는 정도는 어느 정도인가?
- RQ4범주형 및 결측치 처리 기능을 통합한 확장 모델이 실제 혼합형 데이터셋에서 거리 측도의 강건성과 정확성을 유지하는가?
- RQ5다변량 비i.i.d. 데이터, 예를 들어 상관 구조를 가진 가우시안 믹스처에서, 이 거리 측도는 그룹 내 거리와 그룹 간 거리를 일관되게 구분할 수 있는가?
주요 결과
- 독립 변수를 가진 다변량 정규분포에서 제안된 이소레이션 기반 거리 측도는 이상 거리와 상관계수가 0.96을 기록했다.
- 상관 구조를 가진 비i.i.d. 가우시안 믹스처에서 확장된 모델(IsoExt)은 이상 내부 그룹 거리와 상관계수가 0.97을 기록했으며, 유클리드(0.95) 및 마할라노비스(0.89)를 모두 초월했다.
- 15%의 결측치가 존재할 경우, 확장된 모델은 원래 거리 측도와 상관계수가 0.87을 유지했으며, 보간된 유클리드(0.78) 및 마할라노비스(0.72)보다 뚜렷한 우월성을 보였다.
- 혼합형 수치형, 불린형, 범주형 변수를 포함한 히포티로이드 데이터셋에서 제안된 측도는 고어 거리와 상관계수가 0.731로 나타나 널리 사용되는 기준과 강력한 일치를 보였다.
- 반사된 가우시안 믹스처에서 이 방법은 대칭적인 내부 그룹 거리를 잘 유지했으며, 혼합 공분산 구조로 인해 실패한 마할라노비스 거리와는 대조적으로 성능을 유지를 하였다.
- 결측치가 많은 상황에서 확장된 모델은 뚜렷한 이점을 보였으며, 다른 측도가 심각하게 악화되는 상황에서도 높은 상관성을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.