Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Mutual Information based Feature Selection by Boosting Unique Relevance

Shiyu Liu, Mehul Motani|arXiv (Cornell University)|2022. 12. 09.
Machine Learning and Data Classification인용 수 7
한 줄 요약

이 논문은 상호정보기반 특성 선택을 위한 새로운 기준인 MRwMR-BUR을 제안한다. 이는 최대 관련성 최소 상관성(MRwMR) 프레임워크를 개선하여 고유한 관련성(UR)을 명시적으로 강화함으로써 성능을 향상시킨다. KSG 또는 분류기 기반 방법을 통한 UR 추정을 통합함으로써, 알고리즘 복잡도에 변화가 없이도 특성의 중복을 25–30% 감소시키면서 테스트 정확도를 MRwMR 대비 2–3% 향상시킨다.

ABSTRACT

Mutual Information (MI) based feature selection makes use of MI to evaluate each feature and eventually shortlists a relevant feature subset, in order to address issues associated with high-dimensional datasets. Despite the effectiveness of MI in feature selection, we notice that many state-of-the-art algorithms disregard the so-called unique relevance (UR) of features, and arrive at a suboptimal selected feature subset which contains a non-negligible number of redundant features. We point out that the heart of the problem is that all these MIBFS algorithms follow the criterion of Maximize Relevance with Minimum Redundancy (MRwMR), which does not explicitly target UR. This motivates us to augment the existing criterion with the objective of boosting unique relevance (BUR), leading to a new criterion called MRwMR-BUR. Depending on the task being addressed, MRwMR-BUR has two variants, termed MRwMR-BUR-KSG and MRwMR-BUR-CLF, which estimate UR differently. MRwMR-BUR-KSG estimates UR via a nearest-neighbor based approach called the KSG estimator and is designed for three major tasks: (i) Classification Performance. (ii) Feature Interpretability. (iii) Classifier Generalization. MRwMR-BUR-CLF estimates UR via a classifier based approach. It adapts UR to different classifiers, further improving the competitiveness of MRwMR-BUR for classification performance oriented tasks. The performance of both MRwMR-BUR-KSG and MRwMR-BUR-CLF is validated via experiments using six public datasets and three popular classifiers. Specifically, as compared to MRwMR, the proposed MRwMR-BUR-KSG improves the test accuracy by 2% - 3% with 25% - 30% fewer features being selected, without increasing the algorithm complexity. MRwMR-BUR-CLF further improves the classification performance by 3.8%- 5.5% (relative to MRwMR), and it also outperforms three popular classifier dependent feature selection methods.

연구 동기 및 목표

  • 기존의 상호정보기반 특성 선택(MIBFS) 알고리즘들이 고유한 관련성(UR)을 간과하여 최적의 특성 집합을 도출하지 못하는 문제를 해결하기 위해.
  • 표준 MRwMR 기준이 고유한 관련성(UR)을 명시적으로 고려하지 않아 중복된 특성 선택과 성능 저하를 초래함을 규명하기 위해.
  • 고유한 관련성을 특성 선택 목표에 명시적으로 통합하여 관련성, 해석 가능성, 일반화 성능을 향상시키는 새로운 기준 MRwMR-BUR을 제안하기 위해.
  • 분류, 해석 가능성, 일반화 작업에 특화된 두 가지 변형—MRwMR-BUR-KSG(KSG 추정기)와 MRwMR-BUR-CLF(분류기 기반 UR 추정)—을 개발하기 위해.
  • MRwMR-BUR가 MRwMR 및 기존의 분류기 의존적 방법보다 정확도, 특성 수 감소, 다양한 분류기 간 일반화 성능에서 뛰어나다는 것을 검증하기 위해.

제안 방법

  • 고유한 관련성(UR)이 I(X_k; Y | Ω\X_k) > 0로 정의된 특성의 고유한 관련성을 우선시하는 β-가중 항을 추가함으로써 MRwMR를 확장한 MRwMR-BUR 기준을 도입한다.
  • 일반 목적의 특성 선택에 적합한 KSG 추정기를 사용하여 MRwMR-BUR-KSG에서 고유한 관련성을 최근접 이웃 기반으로 추정한다.
  • 분류기 기반 접근법을 사용하여 MRwMR-BUR-CLF에서 UR을 추정함으로써 특정 분류기에 맞는 관련성 측정법을 조정하여 분류 중심 작업의 성능을 향상시킨다.
  • 알고리즘 구조를 변경하지 않고 점수 함수를 수정함으로써 MRwMR와 동일한 계산 복잡도를 유지한다.
  • 기존의 MIBFS 알고리즘(MIM, mRMR, JMI, JMIM, GSA 등)에 새로운 기준을 적용하기 위해 관련성-중복성 트레이드오프를 UR 강화된 목표로 대체한다.
  • 관련성과 고유한 관련성의 균형을 맞추기 위해 하이퍼파rameter β를 조정하며, 실험적 검증을 통해 다양한 데이터셋에서 β = 0.1이 최적의 성능을 낼 것으로 확인된다.

실험 결과

연구 질문

  • RQ1상호정보기반 특성 선택에서 고유한 관련성(UR)을 간과할 경우, 중복된 특성을 포함하는 비최적의 특성 집합이 도출되는가?
  • RQ2새로운 기준인 MRwMR-BUR을 통해 고유한 관련성을 명시적으로 강화하면 분류 정확도 향상, 특성 수 감소, 모델 일반화 향상에 기여하는가?
  • RQ3다양한 데이터셋과 분류기에서 MRwMR-BUR-KSG와 MRwMR-BUR-CLF의 성능이 MRwMR 및 기타 최신 MIBFS 방법보다 어떻게 비교되는가?
  • RQ4제안된 방법이 분류 성능, 특성 해석 가능성, 분류기 일반화 성능 등의 다양한 평가 기준에서 효과적인가?
  • RQ5MRwMR-BUR 기준에서 최적의 β 값은 무엇이며, 이는 관련성과 중복성 간의 균형에 어떻게 영향을 미치는가?

주요 결과

  • MRwMR-BUR-KSG는 여섯 개의 공개 데이터셋에서 MRwMR 대비 테스트 정확도를 2%–3% 향상시키며, 선택된 특성 수를 25%–30% 감소시킨다.
  • MRwMR-BUR-CLF는 MRwMR 대비 분류 성능을 3.8%–5.5% 더 향상시켜 분류 작업에 있어 뛰어난 경쟁력을 입증한다.
  • MRwMR-BUR-CLF는 RFE, FFS, BFE와 같은 세 가지 인기 있는 분류기 의존적 특성 선택 방법보다 테스트 정확도와 특성 효율성 측면에서 뛰어나다.
  • 알고리즘 복잡도가 MRwMR와 동일하므로 고차원 데이터셋에 대해 확장 가능하고 실용적이다.
  • 관련성과 고유한 관련성의 균형을 맞추기 위한 최적의 β 값은 실험적으로 0.1로 확인되었으며, 다양한 데이터셋과 분류기에서 일관된 성능을 보였다.
  • MRwMR-BUR는 더 높은 고유한 관련성을 가진 정밀한 특성 집합을 선택함으로써 특성의 해석 가능성을 향상시켜 특성-라벨 관계 탐색에 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.