[논문 리뷰] Rule Covering for Interpretation and Boosting
이 논문은 랜덤 포레스트와 부스팅 결정 트리를 규칙 커버링을 사용하여 해석하기 위한 수학적 프로그래밍 기반 알고리즘 두 가지를 제안한다. 첫 번째 알고리즘은 훈련된 랜덤 포레스트에서 최소 수의 고정확도 규칙을 추출하여 원본 모델에 가까운 성능을 달성하면서도 훨씬 적은 수의 규칙을 사용한다. 두 번째 알고리즘은 이중 기반 샘플 가중치를 사용한 컬럼 생성 기법을 적용해 기저 결정 트리를 반복적으로 개선하며, 여러 데이터셋에서 표준 부스팅 방법들을 능가한다.
We propose two algorithms for interpretation and boosting of tree-based ensemble methods. Both algorithms make use of mathematical programming models that are constructed with a set of rules extracted from an ensemble of decision trees. The objective is to obtain the minimum total impurity with the least number of rules that cover all the samples. The first algorithm uses the collection of decision trees obtained from a trained random forest model. Our numerical results show that the proposed rule covering approach selects only a few rules that could be used for interpreting the random forest model. Moreover, the resulting set of rules closely matches the accuracy level of the random forest model. Inspired by the column generation algorithm in linear programming, our second algorithm uses a rule generation scheme for boosting decision trees. We use the dual optimal solutions of the linear programming models as sample weights to obtain only those rules that would improve the accuracy. With a computational study, we observe that our second algorithm performs competitively with the other well-known boosting methods. Our implementations also demonstrate that both algorithms can be trivially coupled with the existing random forest and decision tree packages.
연구 동기 및 목표
- 훈련된 랜덤 포레스트 모델을 해석하기 위한 방법을 개발하여 예측 정확도를 유지하면서도 최소한의 규칙 세트를 추출한다.
- 모델 성능을 향상시키기 위해 가장 효과적인 규칙만 선택적으로 생성하는 부스팅 알고리즘을 구축한다.
- 규칙 추출 및 규칙 기반 부스팅을 기존 머신러닝 프레임워크에 최소한의 구현 부담으로 통합한다.
- 수학적 프로그래밍이 모델의 해석 가능성과 예측 성능를 동시에 향상시킬 수 있음을 보여준다.
제안 방법
- 첫 번째 알고리즘은 혼합정수선형계획문제를 수립하여 모든 훈련 샘플을 커버하면서 총 불순도를 최소화하는 최소 수의 규칙을 선택한다.
- 규칙는 훈련된 랜덤 포레스트의 결정 트리의 리프에서 추출되며, 이를 수학적 프로그래밍 모델의 입력으로 사용한다.
- 두 번째 알고리즘은 컬럼 생성 기법을 사용한다: 각 반복에서 가격 하위문제가 이중 목표를 감소시키는 새로운 규칙을 식별하며, 이중 해를 샘플 가중치로 사용한다.
- 선형 프로그래밍의 이중 최적 해를 활용해 잘못 분류된 샘플을 재가중하여, 이후 반복에서 영향력 있는 규칙 생성을 유도한다.
- 반복적으로 풀리는 완화된 선형 프로그래밍 문제를 통해 모델 정확도를 향상시키며, 유익도가 높은 규칙들만 추가한다.
- 두 알고리즘은 기존의 랜덤 포레스트 및 결정 트리 패키지와 호환되도록 설계되어 플러그인 통합이 가능하다.
실험 결과
연구 질문
- RQ1랜덤 포레스트 모델에서 추출된 최소한의 규칙 세트가 전체 앙상블와 비교해 유사한 예측 정확도를 달성할 수 있는가?
- RQ2수학적 프로그래밍을 사용한 규칙 기반 부스팅 프레임워크가 AdaBoost나 기울기 부스팅과 같은 기존 부스팅 알고리즘을 능가할 수 있는가?
- RQ3선형 프로그래밍의 이중 해를 샘플 가중치로 사용할 경우, 부스팅을 위한 규칙 생성을 얼마나 효과적으로 이끌 수 있는가?
- RQ4규칙 커버링을 통해 얼마나 모델 복잡도를 줄일 수 있으며, 정확도를 유지하면서 해석 가능성을 얼마나 향상시킬 수 있는가?
주요 결과
- MIRCO 알고리즘은 15개 데이터셋 중 14개에서 랜덤 포레스트와 유사한 테스트 정확도를 달성했으며, 평균적으로 테스트 샘플의 6% 미만이 누락되었다.
- MIRCO는 유일한 예외를 제외한 모든 데이터셋에서 랜덤 포레스트와 결정 트리보다 적은 수의 규칙을 생성하여 해석 가능성 향상에 기여했다.
- RCBoost는 네 개의 데이터셋에서 AdaBoost와 기울기 부스팅을 능가했으며, 최소한의 규칙 생성으로도 경쟁 가능한 성능을 보였다.
- RCBoost에서 RMP(가격 하위문제) 호출 수는 평균 50 미만이었으며, 이는 효율적인 수렴을 의미한다.
- MIRCO의 규칙 수 표준편차는 대부분의 데이터셋에서 결정 트기보다 낮아, 더 안정적인 규칙 세트 생성을 나타낸다.
- 두 알고리즘 모두 파이썬으로 성공적으로 구현되었으며, 기존 머신러닝 라이브러리와 호환되어 간편한 통합이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.