Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Rule-Based Representation Learning for Interpretable Classification

Zhuo Wang, Wei Zhang|arXiv (Cornell University)|2021. 09. 30.
Machine Learning and Data Classification참고 문헌 40인용 수 20
한 줄 요약

이 논문은 Gradient Grafting라고 불리는 새로운 훈련 방법을 사용하여 이산적이고 흐릿하지 않은 규칙을 엔드 투 엔드로 학습하는 규칙 기반 표현 학습기(RRL)를 제안한다. 이는 이산 모델 구조를 통해 효과적인 역전파를 가능하게 하며, 대규모 및 소규모 데이터셋 모두에서 최신 기술 수준의 성능을 달성하면서도 높은 모델 해석성을 유지한다. RRL은 학습된 논리 규칙과 연속형 특징 이산화를 위한 향상된 논리 활성화 함수를 통해 이를 실현한다.

ABSTRACT

Rule-based models, e.g., decision trees, are widely used in scenarios demanding high model interpretability for their transparent inner structures and good model expressivity. However, rule-based models are hard to optimize, especially on large data sets, due to their discrete parameters and structures. Ensemble methods and fuzzy/soft rules are commonly used to improve performance, but they sacrifice the model interpretability. To obtain both good scalability and interpretability, we propose a new classifier, named Rule-based Representation Learner (RRL), that automatically learns interpretable non-fuzzy rules for data representation and classification. To train the non-differentiable RRL effectively, we project it to a continuous space and propose a novel training method, called Gradient Grafting, that can directly optimize the discrete model using gradient descent. An improved design of logical activation functions is also devised to increase the scalability of RRL and enable it to discretize the continuous features end-to-end. Exhaustive experiments on nine small and four large data sets show that RRL outperforms the competitive interpretable approaches and can be easily adjusted to obtain a trade-off between classification accuracy and model complexity for different scenarios. Our code is available at: https://github.com/12wang3/rrl.

연구 동기 및 목표

  • 대규모 데이터를 위한 규칙 기반 모델에서의 확장성과 해석 가능성 간의 상충 관계를 해결하기 위해.
  • 비미분 가능한 이산 규칙 모델의 효과적인 훈련을 가능하게 하기 위해 기울기 기반 최적화를 적용하기 위해.
  • 연속형 특징의 엔드 투 엔드 이산화를 지원하는 개선된 논리 활성화 함수를 설계하기 위해.
  • 탄력적인 규칙 표현과 규칙 중요도 평가를 지원하는 계층적 규칙 기반 모델을 개발하기 위해.
  • 소규모 및 대규모 데이터셋에서 RRL의 성능과 해석 가능성을 검증하여 다양한 복잡도-정확도 상충 관계에 적응 가능함을 보여주기 위해.

제안 방법

  • 규칙 기반 표현 학습기(RRL)를 제안하며, 이는 데이터 표현 및 분류를 위해 논리적 합리형 및 논리적 합리형 정규형을 갖는 계층적 모델로, 이해 가능한 규칙을 학습한다.
  • Gradient Grafting를 도입하며, 이는 연속적 및 이산적 매개변수 점에서의 기울기 정보를 활용하여 이산 RRL 모델의 직접 기울기 하강 최적화를 가능하게 한다.
  • 확장성 향상과 연속형 특징의 타겟된 이진화 레이어를 통한 엔드 투 엔드 이산화를 가능하게 하는 개선된 논리 활성화 함수를 설계한다.
  • 규칙 중요도 평가와 모델의 해석 가능성 지원을 위해 학습 가능한 규칙 가중치를 갖는 선형 레이어를 사용한다.
  • 모델 복잡도를 제어하기 위해 L2 정규화를 적용하며, 사용자가 응용 요구사항에 따라 정규화 계수 λ를 조정하여 해석 가능성(고λ) 또는 정확도(저λ)를 우선시할 수 있도록 한다.
  • 모델을 구조적 표본 데이터에 적용하고, 아홉 개의 소규모 및 네 개의 대규모 데이터셋에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1규칙 기반 모델이 대규모 데이터셋에서 높은 확장성과 해석 가능성을 동시에 달성할 수 있는가?
  • RQ2기울기 기반 최적화가 비가역적인 이산 규칙 모델에 효과적으로 적용될 수 있는가?
  • RQ3개선된 논리 활성화 함수가 기울기 기반 방식으로 연속형 특징의 엔드 투 엔드 이산화를 가능하게 할 수 있는가?
  • RQ4다양한 크기의 데이터 스케일에서 기존의 해석 가능한 모델과 비교해 RRL의 정확도와 해석 가능성은 어떠한가?
  • RQ5RRL이 학습한 규칙들이 의미적으로 해석 가능하고, 모델 이해 및 의사결정 지원에 활용될 수 있는가?

주요 결과

  • RRL은 소규모 및 대규모 데이터셋 모두에서 경쟁 가능한 해석 가능한 모델보다 높은 분류 정확도를 달성하며, 뛰어난 일반화 능력을 보였다.
  • Gradient Grafting는 모든 평가된 데이터셋에서 STE, ProxQuant, RB보다 더 빠르고 안정적인 수렴을 가능하게 했으며, 특히 다른 방법이 수렴하지 못하는 경우에 뚜렷한 이점을 보였다.
  • 개선된 논리 활성화 함수는 확장성에 크게 기여하여, 원래 함수가 실패하는 대규모 데이터셋인 activity에서도 성공적인 훈련을 가능하게 했다.
  • 희소한 facebook 데이터셋에서는 원래 활성화 함수조차도 잘 작동하여, 저밀도 특징 공간에서도 강건함을 입증했다.
  • 선형 레이어의 규칙 가중치 분포를 분석한 결과, 고가중치 규칙들은 이해 가능하고 실행 가능한 것으로 확인되었으며, 예를 들어 중년의 기혼 고객 중 저소득 고객이 정기예금에 가입할 가능성이 높다는 것을 식별하는 데 기여했다.
  • L2 정규화(λ)를 통해 모델 복잡도를 제어할 수 있으며, 사용자가 응용 목적에 따라 해석 가능성(고λ) 또는 정확도(저λ)를 우선시할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.