Skip to main content
QUICK REVIEW

[논문 리뷰] LionForests: Local Interpretation of Random Forests

Ioannis Mollas, Nick Bassiliades|arXiv (Cornell University)|2019. 11. 20.
Explainable Artificial Intelligence (XAI)참고 문헌 36인용 수 5
한 줄 요약

LionForests는 랜덤 포레스트에 대한 모델별로 국한된 국소적 해석 방법을 제안하며, 연관 규칙 및 k-medoids 군집화와 같은 비지도 기법을 활용해 특성 수를 줄이고 특성 범위를 넓혀 간결하고 자연어 형태의 규칙을 생성한다. 이 방법은 이전의 방법보다 더 견고하고 해석 가능하며 신뢰할 수 있는 설명을 제공하며, 특히 범주형 특성을 포함한 표 형태의 데이터에 특히 효과적이다.

ABSTRACT

Towards a future where ML systems will integrate into every aspect of people’s lives, researching methods to interpret such systems is necessary, instead of focusing exclusively on enhancing their performance. Enriching the trust between these systems and people will accelerate this integration process. Many medical and retail banking/finance applications use state-of-the-art ML techniques to predict certain aspects of new instances. Thus, explainability is a key requirement for human-centred AI approaches. Tree ensembles, like random forests, are widely acceptable solutions on these tasks, while at the same time they are avoided due to their black-box uninterpretable nature, creating an unreasonable paradox. In this paper, we provide a methodology for shedding light on the predictions of the misjudged family of tree ensemble algorithms. Using classic unsupervised learning techniques and an enhanced similarity metric, to wander among transparent trees inside a forest following breadcrumbs, the interpretable essence of tree ensembles arises. An interpretation provided by these systems using our approach, which we call “LionForests”, can be a simple, comprehensive rule.

연구 동기 및 목표

  • 랜덤 포레스트는 널리 사용되지만 블랙박스 모델로 간주되기 때문에, 이해 가능하고 신뢰할 수 있는 국소적 해석의 부족을 해결하기 위해.
  • 기존 방법의 한계, 즉 좁은 특성 범위, 과도한 특성 수, 범주형 변수 처리 부족을 극복하기 위해.
  • 사람이 읽을 수 있고 견고하며 신뢰할 수 있는 자연어 형태의 정확하고 간결한 해석을 생성하기 위해.
  • 의료 및 금융과 같은 고위험 분야에서 법적 및 윤리적 요구사항이 요구하는 설명 가능한 AI를 향상시키기 위해.
  • 트리 앙상블 모델에 대해 신뢰성과 이해 가능성이 뛰어난 모델에 특화된 접근 방식을 개발하여 모델 무관 방법보다 성능을 뛰어넘기 위해.

제안 방법

  • 랜덤 포레스트의 개별 트리에서 경로를 추출하여 예측에 이르는 결정 경로를 식별한다.
  • 경로에서 빈번한 항목집합을 추출하기 위해 Apriori 알고리즘을 적용하여 연관 규칙 탐색을 통해 후보 규칙를 생성한다.
  • 유사한 경로를 군집화하고 대표 경로를 선별하기 위해 k-medoids 군집화를 사용하여 중복성과 경로 수를 감소시킨다.
  • 다양한 경로에서 겹치는 간격을 통합하여 특성 범위를 확장함으로써 견고성과 일반화 능력을 향상시킨다.
  • 범주형 특성은 원핫 인코딩을 통해 처리되며, 최종 규칙에선 관련 있는 카테고리(예: 'marital_status_Married')만 포함된다.
  • 규칙 간소화 과정을 통해 특성 수를 최소화하고 범위 폭을 최대화하여 간결하고 자연어 형태의 해석을 생성한다.

실험 결과

연구 질문

  • RQ1랜덤 포레스트에 대한 모델에 특화된 국소적 해석 방법이 기존 접근 방식보다 더 이해하기 쉽고 신뢰할 수 있는 설명을 제공할 수 있는가?
  • RQ2연관 규칙와 k-medoids 군집화의 조합이 국소적 해석에서 특성 수를 줄이고 특성 범위를 넓히는 데 얼마나 효과적인가?
  • RQ3제안된 방법이 이전 작업에 비해 범주형 및 수치형 특성의 해석 가능성에 얼마나 기여하는가?
  • RQ4결과 규칙는 예측 정확도와 견고성을 유지하면서 자연어로 표현될 수 있는가?
  • RQ5비영향을 미치는 범주형 값, 예를 들어 'native_country'의 경우, 이 방법이 어떻게 처리하는가?

주요 결과

  • LionForests 방법은 중복되거나 범위가 좁은 특성을 제거하여 40개의 특성에서 27개로 규칙의 특성 수를 줄여 이해 가능성을 크게 향상시켰다.
  • 나이 범위는 [47,53]에서 [47,63]으로 확장되었고, '주간 근무 시간'은 [15,25]에서 [15,99]로 확장되어 소규모 입력 변화에 대한 견고성이 향상되었다.
  • 이 방법은 'native_country'의 예측에 영향을 미치는 카테고리, 예를 들어 'Mexico'와 'United-States'를 성공적으로 식별했으며, 영향을 주지 않는 값인 'India'와 'France'는 제외했다.
  • 최종 규칙는 자연어 형태로 제시되었으며, 예를 들어 '만약 나이 ≥47이고 ≤63이고 주간 근무 시간 ≥15이고 ≤99이고 native_country=Jamaica이면 소득 >50K'와 같이 인간이 이해하기 쉬운 형태로 제공되었다.
  • iForest나 특성 목록 기반 해석과 같은 기존 방법에 비해 시각적 복잡성과 좁은 범위의 불안정성 문제를 피하면서도 우수한 성능을 보였다.
  • 예측 신뢰도를 유지하면서 경로 수를 일정 수준 이하로 줄여 신뢰성을 향상시켰지만, 과도한 최적화를 방지하기 위해 임계값 파rameter 설정이 제안된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.