Skip to main content
QUICK REVIEW

[논문 리뷰] Enhanced version of AdaBoostM1 with J48 Tree learning method

Kyongche Kang, Jack Michalak|arXiv (Cornell University)|2018. 02. 10.
Imbalanced Data Classification Techniques참고 문헌 3인용 수 8
한 줄 요약

이 논문은 가중치 임계값(P)과 반복 횟수(I)를 조정 가능한 파라미터를 갖는 J48(C4.5) 의사결정나무를 기반 학습기로 사용하여 개선된 AdaBoostM1 알고리즘을 제안한다. 이러한 파라미터를 최적화함으로써 개발 세트에서 평균 오차율 비율을 2.4에서 0.9로, 평가 세트에서 2.1에서 1.2로 감소시켜 기존의 결정자루 기반 AdaBoostM1에 비해 강건성과 분류 성능을 크게 향상시킨다.

ABSTRACT

Machine Learning focuses on the construction and study of systems that can learn from data. This is connected with the classification problem, which usually is what Machine Learning algorithms are designed to solve. When a machine learning method is used by people with no special expertise in machine learning, it is important that the method be robust in classification, in the sense that reasonable performance is obtained with minimal tuning of the problem at hand. Algorithms are evaluated based on how robust they can classify the given data. In this paper, we propose a quantifiable measure of robustness, and describe a particular learning method that is robust according to this measure in the context of classification problem. We proposed Adaptive Boosting (AdaBoostM1) with J48(C4.5 tree) as a base learner with tuning weight threshold (P) and number of iterations (I) for boosting algorithm. To benchmark the performance, we used the baseline classifier, AdaBoostM1 with Decision Stump as base learner without tuning parameters. By tuning parameters and using J48 as base learner, we are able to reduce the overall average error rate ratio (errorC/errorNB) from 2.4 to 0.9 for development sets of data and 2.1 to 1.2 for evaluation sets of data.

연구 동기 및 목표

  • 수동 조정을 최소화함으로써 비전문가 사용자를 위한 더 강건한 기계학습 분류기 개발
  • AdaBoostM1의 기본 결정자루 기반 학습기를 더 강력한 J48 의사결정나무로 대체하여 분류 정확도 향상
  • 핵심 하이퍼파라미터인 가중치 임계값(P)과 반복 횟수(I)의 체계적 조정을 통해 알고리즘의 강건성 정량화 및 향상
  • 기본 AdaBoostM1(결정자루 기반)과 표준 데이터셋에서의 성능 비교
  • J48를 사용한 파라미터 조정이 개발 및 평가 데이터 세트 전반에서 일관된 성능 향상을 이끌어내는지 입증

제안 방법

  • 제안된 방법은 결정자루 대신 J48 의사결정나무를 AdaBoostM1 프레임워크의 기반 학습기로 사용한다.
  • 가중치 임계값(P) — 표본 재가중치에 사용되며, 부스팅 반복 횟수(I) — 총 반복 수를 조정 가능한 두 하이퍼파라미터를 도입한다.
  • 알고리즘은 반복적으로 재가중된 훈련 데이터 세트에서 약한 학습기를 훈련시키며, 잘못 분류된 인스턴스에 더 초점을 맞춘다.
  • 최종 예측은 각 약한 학습기의 정확도에 따라 결정되는 가중치를 가진 다수결 투표 방식으로 이루어진다.
  • P 및 I 최적화를 위해 교차 검증을 사용하여 최소 오차율을 달성하도록 파라미터를 조정한다.
  • 강건성은 제안된 방법의 오차율(errorC)과 나이브 베이즈의 오차율(errorNB) 간의 비율로 측정되며, 이 비율이 낮을수록 성능이 우수함을 의미한다.

실험 결과

연구 질문

  • RQ1AdaBoostM1에서 결정자루를 J48 트리로 대체함으로써 전문가의 조정 없이도 분류 강건성을 향상시킬 수 있는가?
  • RQ2가중치 임계값(P)과 반복 횟수(I)를 조정할 경우, 제안된 방법과 나이브 베이즈 간의 오차율 비율에 어떤 영향을 미치는가?
  • RQ3J48를 사용한 개선된 AdaBoostM1은 개발 및 평가 데이터 세트 전반에서 일관되게 더 높은 성능을 달성하는가?
  • RQ4기본 AdaBoostM1(결정자루 기반)에 비해 파라미터 조정이 오차율 비율을 얼마나 감소시키는가?
  • RQ5강건성의 정량적 측정 기준을 효과적으로 활용하여 부스팅 알고리즘을 평가하고 비교할 수 있는가?

주요 결과

  • J48를 사용하고 파라미터를 조정한 개선된 AdaBoostM1은 개발 데이터 세트에서 평균 오차율 비율(errorC/errorNB)을 2.4에서 0.9로 감소시켰다.
  • 평가 세트에서는 오차율 비율이 2.1에서 1.2로 감소하여 성능 향상이 뚜렷하게 나타났다.
  • 모든 테스트된 데이터 세트에서 기존의 결정자루 기반 AdaBoostM1보다 제안된 방법이 뛰어난 성능을 보였다.
  • 가중치 임계값(P)과 반복 횟수(I)의 조정이 분류 정확도와 강건성 향상에 뚜렷한 영향을 미쳤다.
  • J48를 기반 학습기로 사용함으로써 더 정확한 약한 학습기가 도출되어 전체 앙상블 성능 향상에 기여했다.
  • 정량화된 강건성 측정 기준은 파라미터 조정과 모델 선택으로 인한 성능 향상을 효과적으로 반영했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.