Skip to main content
QUICK REVIEW

[논문 리뷰] TE2Rules: Explaining Tree Ensembles using Rules

G Roshan Lal, Xiaotong Chen|arXiv (Cornell University)|2022. 06. 29.
Natural Language Processing Techniques인용 수 6
한 줄 요약

TE2Rules는 이진 트리 앙상블 모델에 대한 고정밀도, 해석 가능한 규칙을 생성하는 새로운 방법으로, 주로 소수의(양성) 클래스에 초점을 맞춘다. Apriori 알고리즘을 사용해 다수의 트리에 걸쳐 결정 경로를 추출하며, 보다 간결하고 정확한 규칙을 도출하여 기존 최고 수준의 설명 도구들보다 양성 클래스에 대해 뛰어난 정밀도를 달성한다. 또한 런타임 효율성을 유지하면서 조기 정지 기능을 통해 런타임-정밀도 간의 트레이드오���을 가능하게 한다.

ABSTRACT

Tree Ensemble (TE) models, such as Gradient Boosted Trees, often achieve optimal performance on tabular datasets, yet their lack of transparency poses challenges for comprehending their decision logic. This paper introduces TE2Rules (Tree Ensemble to Rules), a novel approach for explaining binary classification tree ensemble models through a list of rules, particularly focusing on explaining the minority class. Many state-of-the-art explainers struggle with minority class explanations, making TE2Rules valuable in such cases. The rules generated by TE2Rules closely approximate the original model, ensuring high fidelity, providing an accurate and interpretable means to understand decision-making. Experimental results demonstrate that TE2Rules scales effectively to tree ensembles with hundreds of trees, achieving higher fidelity within runtimes comparable to baselines. TE2Rules allows for a trade-off between runtime and fidelity, enhancing its practical applicability. The implementation is available here: https://github.com/linkedin/TE2Rules.

연구 동기 및 목표

  • 의료 및 사기 탐지와 같은 고위험 응용 분야에서 사용되는 트리 앙상블 모델에서 소수의(양성) 클래스에 대한 충실도가 높고 해석 가능한 설명이 부족한 문제를 해결하기 위해.
  • 전체적으로 뿐 아니라 특히 양성 클래스 예측에 대해 높은 정밀도를 유지하는 규칙 기반 설명 도구를 개발하기 위해.
  • 수백 개의 트리로 구성된 트리 앙상블에서 스케일링 가능하고 효율적인 규칙 추출을 가능하게 하여 실세계 시스템에의 실용적 구현을 지원하기 위해.
  • 규칙 생성 중 조기 정지를 허용함으로써 런타임과 정밀도 사이의 조정 가능한 트레이드오프를 제공하기 위해.
  • 생성된 규칙들이 정밀도(높은 양성 예측 비율)가 높고 동시에 양성 예측의 의미 있는 비율을 커버할 수 있도록 보장하기 위해.

제안 방법

  • TE2Rules는 다수의 트리에 걸쳐 양성 예측을 유도하는 데 자주 공통으로 나타나는 내부 트리 노드를 식별함으로써 규칙를 추출한다.
  • Apriori 알고리즘을 적용하여, 양성 예측에 대해 자주 활성화되지만 음성 예측에선 비활성화되는 트리 노드의 아이템셋을 탐색한다.
  • 각 규칙는 노드 조합에서 유도되며, 데이터 포인트가 해당 노드들을 통과하고 양성 예측을 받기 위해 충족해야 하는 특성 기준을 명시한다.
  • 규칙는 높은 정밀도를 유지하면서 대부분의 양성 예측을 커버하는 최소한의 규칙 집합을 유지하기 위해 근사적 선택 알고리즘을 통해 후처리된다.
  • 알고리즘은 최대 3단계의 단계적 처리를 지원하며, 각 단계에서 더 복잡한 노드 조합을 발견함으로써 양성 클래스에 대한 규칙 품질과 정밀도를 향상시킨다.
  • 조기 정지 기능을 지원한다: 단계 2 또는 3까지만 실행하면 런타임이 크게 감소하면서도 거의 최적의 정밀도를 확보할 수 있다.

실험 결과

연구 질문

  • RQ1규칙 기반 설명 도구가 트리 앙상블 모델에서 기존 방법들이 실패하는 소수의(양성) 클래스에 대해 높은 정밀도를 달성할 수 있는가?
  • RQ2단일 트리나 히وري스틱 기반 규칙 추출과 비교해 복수 트리의 노드 조합을 Apriori 기반으로 추출함으로써 규칙의 품질과 정밀도는 어떻게 향상되는가?
  • RQ3규칙 생성 과정에서 런타임과 정밀도 사이의 트레이드오프는 어떠한가? 그리고 조기 정지 기능을 통해 계산 비용을 줄이면서도 높은 정밀도를 유지할 수 있는가?
  • RQ4TE2Rules는 수백 개의 트리를 포함한 대규모 트리 앙상블에 어떻게 스케일링되며, 기존 최고 수준의 설명 도구들과의 성능 비교는 어떠한가?
  • RQ5추출된 규칙들이 양성 예측을 얼마나 커버하는가? 그리고 정밀도와 커버리지가 규칙 생성의 각 단계에서 어떻게 변화하는가?

주요 결과

  • TE2Rules는 deFragTrees보다 더 적은 수의 규칙를 추출함에도 불구하고, 양성 클래스에 대해 더 높은 정밀도를 달성한다.
  • 단계 3까지 실행할 경우 양성 클래스 정밀도가 최고 수준에 도달하며, 단계 2를 넘어서는 추가적인 성능 향상이 미미하여 대부분의 응용 분야에선 2~3단계로 충분함을 시사한다.
  • inTrees보다 더 많은 규칙를 추출했음에도 불구하고, TE2Rules는 양성 클래스 정밀도에서 앞서며, 더 뛰어난 규칙 품질과 커버리지를 입증한다.
  • TE2Rules의 런타임은 최고 수준의 기준 도구들과 유사하며, 효율적인 Apriori 프루닝 덕분에 단계 3 실행이 단계 2보다 다소 더 비쌀 뿐이다.
  • 후처리 과정을 통해 규칙 수가 크게 감소하여, 대부분의 양성 예측을 최소한의 중복성으로 설명하는 작고 정밀도가 높은 규칙 집합을 도출한다.
  • 이 방법은 실용적인 런타임-정밀도 트레이드오프를 제공한다: 예를 들어 단계 2에서 조기 정지를 시행하면 계산 비용을 크게 줄일 수 있으며, 양성 클래스 정밀도 손실도 최소한도로 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.