Skip to main content
QUICK REVIEW

[논문 리뷰] One Class Splitting Criteria for Random Forests

Nicolas Goix, Nicolas Drougard|arXiv (Cornell University)|2016. 11. 07.
Machine Learning and Data Classification참고 문헌 1인용 수 13
한 줄 요약

이 논문은 음성 탐지에서 차원의 저주를 극복하기 위해 은닉 이상치를 적응적으로 모델링함으로써 랜덤 포레스트에 대한 새로운 일류 분할 기준을 제안한다. 노드당 기대 이상치 수를 부피에 따라 동적으로 조정함으로써, 구조적으로 타당한 일류 랜덤 포레스트를 가능하게 하여 기준 테스트에서 기존 방법들을 능가하는 강력한 경험적 성능을 보이며, 제2류 샘플링이 필요 없이도 성능을 발휘한다.

ABSTRACT

Random Forests (RFs) are strong machine learning tools for classification and regression. However, they remain supervised algorithms, and no extension of RFs to the one-class setting has been proposed, except for techniques based on second-class sampling. This work fills this gap by proposing a natural methodology to extend standard splitting criteria to the one-class setting, structurally generalizing RFs to one-class classification. An extensive benchmark of seven state-of-the-art anomaly detection algorithms is also presented. This empirically demonstrates the relevance of our approach.

연구 동기 및 목표

  • 랜덤 포레스트의 원칙적인 일류 확장을 위한 부족함을 해결하기 위해, 랜덤 포레스트는 본질적으로 지도 학습임.
  • 일류 이상 탐지에서 차원의 저주를 극복하기 위해, 표준 불순도 기준이 희박한 내재자 분포로 인해 실패하는 문제를 해결하기 위해.
  • 작은, 낮은 확률 영역에서도 의미 있는 클래스 비율을 유지하는 분할 기준을 개발하기 위해.
  • 인위적인 이상치 생성 없이도 단일 내재자 클래스의 지지 및 밀도 구조를 학습할 수 있도록 랜덤 포레스트를 가능하게 하기 위해.
  • 제안된 방법을 최첨단 일류 이상 탐지 알고리즘들과 비교하여 경험적으로 검증하기 위해.

제안 방법

  • 노드 부피에 따라 은닉 이상치 수를 함수로 모델링함으로써, 불순도 감소에 대한 적응형 일류 대체 기준을 제안하여, 작은 영역에서도 무시할 수 없는 이상치 기대치를 보장한다.
  • 노드별 모델 One-Class-Model(n(Lt), α(Lt))을 정의하며, α(Lt)와 n(Lt)를 조정하여 모든 노드에서 기대 이상치 대 내재자 비율이 일정하게 유지되도록 한다.
  • 두 가지 제약 조건을 도입한다: (1) 내재자 기대 수는 그대로 유지된다 (1−α)n = (1−α(Lt))n(Lt), (2) α(Lt)n(Lt)Lt = γnt를 통해 기대 클래스 비율 γt를 일정하게 유지한다.
  • 부피 및 비율 조정된 이상치 기대치에 따라 스케일링된 항목을 포함한, 두 클래스 Gini 기준의 일반화된 형태인 적응형 불순도 감소 기준 IOC−adG(tL,tR)를 유도한다.
  • 노드 부피 Lt → 0의 점근적 극한을 사용하여 모델을 정당화하며, 극한에서 이상치 수는 발산하고 내재자 수는 (1−α)n을 파라미터로 하는 포아송 분포를 따른다.
  • 일곱 개의 최첨단 이상 탐지 알고리즘으로 구성된 벤치마크를 통해 방법을 경험적으로 검증하여, 제안된 일류 랜덤 포레스트가 기존 방법보다 뛰어난 성능을 보였다.

실험 결과

연구 질문

  • RQ1표준 랜덤 포레스트 분할 기준은 인위적인 제2류 샘플링에 의존하지 않고 일류 설정으로 자연스럽게 확장될 수 있는가?
  • RQ2내재자가 희박한 저밀도, 고차원 영역에서 불순도 기준은 어떻게 조정되어야 하며, 이로 인해 분류 성능이 유지될 수 있는가?
  • RQ3은닉 이상치 모델에 대한 어떤 제약 조건이 두 클래스 랜덤 포레스트 프레임워크와 일관성을 유지하면서도 차원의 저주를 피할 수 있는가?
  • RQ4노드 부피가 줄어들면서도 각 노드의 기대 이상치 비율을 의미 있는 수준으로 유지할 수 있는가?
  • RQ5제안된 적응형 일류 분할 기준은 기존 최첨단 방법들과 비교해 이상 탐지 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 적응형 일류 분할 기준은 노드 간 기대 이상치 대 내재자 비율을 일정하게 유지하여, 작은 영역에서 불순도 기준이 붕괴되는 것을 방지한다.
  • 일곱 개의 최첨단 이상 탐지 알고리즘으로 구성된 벤치마크에서 강력한 경험적 성능을 달성하여, 기존 방법들을 능가한다.
  • 적응형 모델은 원래 데이터셋 크기와 일致하는 기대 내재자 수를 보장하여 통계적 정밀도를 유지한다.
  • 모델의 점근적 행동은 잘 정당화되어 있으며, 노드 부피가 0에 수렴할 때 이상치 수는 발산하고 내재자 수는 (1−α)n을 파라미터로 하는 포아송 분포를 따른다.
  • 식 (14)는 은닉 이상치 수를 실제 제2류 수로 대체할 경우, 원래의 두 클래스 Gini 불순도 감소 기준을 회복한다.
  • 이 방법은 인위적인 이상치 생성이나 트리 설계에 대한 구조적 제약 없이, 랜덤 포레스트의 일류 분류로의 자연스럽고 구조적으로 일반화된 확장이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.