Skip to main content
QUICK REVIEW

[논문 리뷰] An Innovative Imputation and Classification Approach for Accurate Disease Prediction

Yelipe UshaRani, P. Sammulal|arXiv (Cornell University)|2016. 03. 10.
Artificial Intelligence in Healthcare참고 문헌 7인용 수 4
한 줄 요약

이 논문은 의료 데이터셋의 결측치를 처리하기 위해 군집 기반 차원 축소를 활용하는 새로운 보간 및 분류 프레임워크를 제안한다. 보간 이전에 데이터 차원을 축소함으로써 단일 클래스 분류 모델이 다중 레이블 접근 방식보다 더 높은 정밀도를 달성할 수 있게 되어 실제 사례 연구에서 분류 성능 향상이 두드러지게 나타났다.

ABSTRACT

Imputation of missing attribute values in medical datasets for extracting hidden knowledge from medical datasets is an interesting research topic of interest which is very challenging. One cannot eliminate missing values in medical records. The reason may be because some tests may not been conducted as they are cost effective, values missed when conducting clinical trials, values may not have been recorded to name some of the reasons. Data mining researchers have been proposing various approaches to find and impute missing values to increase classification accuracies so that disease may be predicted accurately. In this paper, we propose a novel imputation approach for imputation of missing values and performing classification after fixing missing values. The approach is based on clustering concept and aims at dimensionality reduction of the records. The case study discussed shows that missing values can be fixed and imputed efficiently by achieving dimensionality reduction. The importance of proposed approach for classification is visible in the case study which assigns single class label in contrary to multi-label assignment if dimensionality reduction is not performed.

연구 동기 및 목표

  • 의료 데이터셋에서 속성 값이 누락되어 정확한 질병 예측이 어려운 문제를 해결하기 위해.
  • 보간 이전에 데이터 차원을 축소시켜 분류 정확도를 향상시키기 위해.
  • 보간과 분류를 통합하여 향상된 예측 성능을 달성하는 통합 프레임워크를 개발하기 위해.
  • 차원 축소가 적용된 경우 단일 클래스 레이블링이 다중 레이블 할당보다 우수한 성능을 보이는지 확인하기 위해.
  • 실제 의료 사례 연구를 통해 분류 지표의 측정 가능한 향상으로 본 방법의 타당성을 검증하기 위해.

제안 방법

  • 이 방법은 유사한 의료 기록을 군집화하여 데이터셋의 차원을 보간 이전에 축소한다.
  • 결측치는 동일한 군집 내 유사한 인스턴스에서 유도된 군집별 통계적 측정치를 사용하여 보간한다.
  • 각 군집 내 특성의 집계 또는 요약을 통해 차원 축소를 달성하여 부재를 최소화한다.
  • 보간 이후, 축소되고 정제된 데이터셋을 기반으로 단일 클래스 분류 모델을 훈련시켜 질병 결과를 예측한다.
  • 보간 이전에 차원 축소를 수행함으로써 다중 레이블 할당을 피하고, 각 기록이 하나의 주요 클래스에 매핑되도록 보장한다.
  • 실제 의료 데이터셋을 대상으로 프레임워크를 평가하여 전통적인 보간 및 분류 파ipeline와의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1군집 기반 차원 축소는 결측치가 있는 의료 데이터셋에서 보간 정확도를 향상시킬 수 있는가?
  • RQ2차원 축소가 질병 예측에서 단일 클래스와 다중 레이블 분류 간의 선택에 어떤 영향을 미치는가?
  • RQ3군집을 통한 보간과 분류의 통합은 더 나은 종합 예측 성능을 이끌어낼 수 있는가?
  • RQ4의료 데이터셋에서 보간 품질이 후속 분류 정확도에 어떤 영향을 미치는가?
  • RQ5실제 의료 데이터에서 기존의 보간 및 분류 기법보다 본 방법이 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 개선된 보간 정확도 덕분에 제안된 방법이 기준 방법보다 더 높은 분류 정확도를 달성했다.
  • 차원 축소 덕분에 효과적인 단일 클래스 레이블링이 가능해져 모호성이 감소하고 모델의 해석성이 향상되었다.
  • 사례 연구에서 군집 내 보간이 전역 보간 방법보다 더 일관되고 신뢰할 수 있는 값 추정을 이끌어냈다.
  • 군집화와 보간의 통합은 노이즈와 중복을 줄여 최종 분류기의 예측 능력을 향상시켰다.
  • 보간 이전에 차원 축소를 적용한 경우, 다중 레이블 분류보다 본 방법이 뚜렷하게 뛰어난 성능을 보였다.
  • 결과는 보간 이전에 군집화를 통한 전처리가 결측 의료 데이터셋에서의 질병 예측 향상에 실현 가능한 전략임을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.