Skip to main content
QUICK REVIEW

[논문 리뷰] Bayes Imbalance Impact Index: A Measure of Class Imbalanced Dataset for Classification Problem

Yang Lu, Yiu‐ming Cheung|arXiv (Cornell University)|2019. 01. 29.
Imbalanced Data Classification Techniques참고 문헌 35인용 수 8
한 줄 요약

이 논문은 분류 성능에 대한 클래스 불균형의 순수한 영향을 측정하기 위해 베이즈 불균형 영향 지수(BI³)와 개별 베이즈 불균형 영향 지수(IBI³)를 제안한다. 베이즈 최적 분류기의 이론적 분석을 통해 BI³는 불균형이 전체 성능을 얼마나 떨어뜨리는지 정량화하고, IBI³는 소수 클래스의 개별 샘플이 불균형으로 인해 얼마나 취약한지를 평가한다. 실험 결과, BI³와 불균형 복구 방법에 의한 F1 점수 향상 간에 높은 상관관계가 나타나, BI³가 이러한 방법을 적용할지 결정하는 신뢰할 수 있는 기준이 되며,

ABSTRACT

Recent studies have shown that imbalance ratio is not the only cause of the performance loss of a classifier in imbalanced data classification. In fact, other data factors, such as small disjuncts, noises and overlapping, also play the roles in tandem with imbalance ratio, which makes the problem difficult. Thus far, the empirical studies have demonstrated the relationship between the imbalance ratio and other data factors only. To the best of our knowledge, there is no any measurement about the extent of influence of class imbalance on the classification performance of imbalanced data. Further, it is also unknown for a dataset which data factor is actually the main barrier for classification. In this paper, we focus on Bayes optimal classifier and study the influence of class imbalance from a theoretical perspective. Accordingly, we propose an instance measure called Individual Bayes Imbalance Impact Index ($IBI^3$) and a data measure called Bayes Imbalance Impact Index ($BI^3$). $IBI^3$ and $BI^3$ reflect the extent of influence purely by the factor of imbalance in terms of each minority class sample and the whole dataset, respectively. Therefore, $IBI^3$ can be used as an instance complexity measure of imbalance and $BI^3$ is a criterion to show the degree of how imbalance deteriorates the classification. As a result, we can therefore use $BI^3$ to judge whether it is worth using imbalance recovery methods like sampling or cost-sensitive methods to recover the performance loss of a classifier. The experiments show that $IBI^3$ is highly consistent with the increase of prediction score made by the imbalance recovery methods and $BI^3$ is highly consistent with the improvement of F1 score made by the imbalance recovery methods on both synthetic and real benchmark datasets.

연구 동기 및 목표

  • 불균형 데이터셋에서 분류 난이도를 평가하는 데 유일한 지표로 사용되는 불균형 비율(IR)의 한계를 해결하기 위해.
  • 과도한 겹침, 노이즈, 또는 소규모 불연속성 등 외부 요인과는 별개로 클래스 불균형이 성능 저하의 주요 원인인지 확인하기 위해.
  • 기타 데이터 요인들로부터 불균형의 영향을 분리하여 이론적으로 근거를 지닌 측정 지표를 제안하기 위해.
  • 불균형 자체가 초래하는 성능 저하 정도를 정량화하여, 불균형 복구 방법을 적용할지 결정할 수 있는 기준을 제공하기 위해.

제안 방법

  • 클래스 불균형 하에서 베이즈 최적 분류기의 오차를 이론적으로 유도하여, 다른 데이터 요인들로부터 불균형의 영향을 분리하기 위해.
  • 개별 샘플 수준에서 한 개의 소수 클래스 샘플이 불균형으로 인해 얼마나 영향을 받는지를 반영하는 IBI³를 정의하기 위해.
  • 모든 소수 클래스 샘플에 대한 IBI³의 평균을 계산하여, 데이터셋 수준에서의 불균형 영향을 측정하는 BI³를 산정하기 위해.
  • IBI³ 계산을 위해 국소적 클래스 분포를 추정하기 위해 유연한 k 선택 기반의 k-최근접 이웃(k-NN)을 사용하기 위해.
  • 다양한 분류기와 불균형 복구 방법을 사용하여, 다양한 합성 및 실세계 데이터셋에서 BI³의 타당성을 검증하기 위해.
  • 성능 향상과의 상관관계를 최적화하기 위해 알고리즘 1에서 k를 동적으로 선택함으로써 고정된 k 설정보다 우수한 성능을 내는 것을 확인하기 위해.

실험 결과

연구 질문

  • RQ1과도한 겹침, 노이즈, 또는 소규모 불연속성과는 별개로, 클래스 불균형 자체가 분류 성능을 얼마나 떨어뜨리는가?
  • RQ2기타 데이터 복잡성 요인들로부터 불균형의 영향을 분리할 수 있는 측정 지표를 개발할 수 있는가?
  • RQ3다양한 데이터셋과 분류기에서 BI³가 실제로 불균형 복구 방법에 의한 성능 향상과 얼마나 잘 상관되는가?
  • RQ4불균형 복구 기법을 적용할지 결정하는 데 있어 BI³가 불균형 비율(IR)보다 더 나은 기준이 되는가?
  • RQ5IBI³는 불균형 데이터셋에서 소수 클래스 샘플의 개별 수준 복잡도 측정 지표로 활용될 수 있는가?

주요 결과

  • BI³는 합성 및 실세계 기준 데이터셋 전반에서 불균형 복구 방법에 의한 F1 점수 향상과 높은 상관관계(r ≈ 0.85–0.95)를 보이며,
  • IBI³는 복구 방법에 의해 예측 점수 상승과 강한 상관관계를 보이며, 이는 IBI³가 개별 수준의 불균형 복잡도 측정 지표로서의 역할을 확인함을 의미한다.
  • IBI³ 계산에 최적의 k는 약 5이며, k=5에서 상관관계가 최고에 도달하고 그 이후로 감소함을 확인함.
  • IBI³ 계산에서 고정된 k 설정보다 동적 k 선택 기법이 더 높은 상관관계를 보이며, 이는 그 효과성을 입증함.
  • BI³ 값이 낮은 데이터셋은 복구 방법에 의해 거의 향상되지 않으며, 이는 불균형이 주요 장애 요인이 아님을 시사함.
  • BI³는 IR이 중간 수준임에도 불구하고 haberman 및 kddcup-land_vs_satan 등의 데이터셋이 복구 방법에 적합함을 성공적으로 식별함으로써, IR보다 BI³가 우월함을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.