Skip to main content
QUICK REVIEW

[논문 리뷰] Classification of Heart Disease Using K- Nearest Neighbor and Genetic Algorithm

M. A. Jabbar, B. L. Deekshatulu|arXiv (Cornell University)|2015. 05. 07.
Artificial Intelligence in Healthcare인용 수 6
한 줄 요약

이 논문은 심장병 진단 정확도를 향상시키기 위해 K-최근접 이웃(KNN)과 유전 알고리즘(GA)을 융합한 하이브리드 접근법을 제안한다. GA를 사용해 특성 선택을 최적화하고 KNN을 분류에 활용함으로써 고차원 의료 데이터셋에서 진단 정밀도를 향상시켜 기존 KNN보다 뛰어난 성능을 달성한다.

ABSTRACT

Data mining techniques have been widely used to mine knowledgeable information from medical data bases. In data mining classification is a supervised learning that can be used to design models describing important data classes, where class attribute is involved in the construction of the classifier. Nearest neighbor (KNN) is very simple, most popular, highly efficient and effective algorithm for pattern recognition.KNN is a straight forward classifier, where samples are classified based on the class of their nearest neighbor. Medical data bases are high volume in nature. If the data set contains redundant and irrelevant attributes, classification may produce less accurate result. Heart disease is the leading cause of death in INDIA. In Andhra Pradesh heart disease was the leading cause of mortality accounting for 32%of all deaths, a rate as high as Canada (35%) and USA.Hence there is a need to define a decision support system that helps clinicians decide to take precautionary steps. In this paper we propose a new algorithm which combines KNN with genetic algorithm for effective classification. Genetic algorithms perform global search in complex large and multimodal landscapes and provide optimal solution. Experimental results shows that our algorithm enhance the accuracy in diagnosis of heart disease.

연구 동기 및 목표

  • 고용량 의료 데이터셋에서의 중복 및 관련 없는 특성으로 인한 심장병 진단의 낮은 분류 정확도 문제를 해결하기 위해.
  • 특히 인도 안드라 프라데시와 같은 고사망률 지역에서 임상의가 조기 진단 및 예방적 간호를 보다 효과적으로 수행할 수 있도록 의사결정 지원 시스템을 개발하기 위해.
  • 최적의 특성 부분집합 선택을 위해 K-최근접 이웃(KNN) 분류기와 유전 알고리즘을 통합함으로써 KNN 분류기의 성능을 향상시키기 위해.
  • 기존 KNN 및 기타 기준 모델과 비교하여 제안된 하이브리드 모델의 진단 정확도 향상 효과를 평가하기 위해.

제안 방법

  • 유전 알고리즘(GA)을 사용해 심장병 데이터셋의 최적 특성 부분집합을 전역 탐색을 통해 식별함으로써 차원 축소 및 관련 없거나 중복된 특성 제거를 수행한다.
  • GA에서 선별된 특성들이 K-최근접 이웃(KNN) 분류기의 입력으로 사용되며, 이는 k개의 가장 가까운 학습 샘플들 중 다수결 클래스에 따라 클래스 레이블을 할당한다.
  • GA의 적합도 함수는 교차 검증을 통해 각 특성 부분집합의 성능을 평가함으로써 분류 정확도를 최대화하도록 설계된다.
  • 선택, 교차, 변이 연산을 반복적으로 수행하여 특성 부분집합을 진화시키며 수렴할 때까지 반복한다.
  • GA의 전역 탐색 능력과 KNN의 국소적 인스턴스 기반 분류 능력을 융합함으로써 전체 진단 성능을 향상시키는 하이브리드 모델을 구성한다.
  • 표준 심장병 데이터셋을 대상으로 모델을 평가하며, 분류 정확도 및 기타 표준 지표를 사용해 성능을 측정한다.

실험 결과

연구 질문

  • RQ1유전 알고리즘을 K-최근접 이웃에 통합함으로써 심장병 진단의 분류 정확도 향상이 가능한가?
  • RQ2GA 기반 특성 선택은 고차원 의료 데이터셋에서 관련 없거나 중복된 특성을 얼마나 효과적으로 줄이는가?
  • RQ3제안된 하이브리드 모델은 표준 KNN 및 기타 기준 분류기보다 심장병 진단에서 더 우수한 성능을 보이는가?
  • RQ4GA를 통한 특성 최적화가 임상 데이터에서 KNN 분류기의 강건성과 신뢰성에 얼마나 기여하는가?

주요 결과

  • 제안된 KNN-GA 하이브리드 모델은 특성 선택 최적화 덕분에 표준 KNN보다 분류 정확도가 뚜렷이 향상된다.
  • 유전 알고리즘을 활용함으로써 데이터셋의 차원을 줄여 가장 관련 있는 특성들만 선택함으로써 모델의 효율성과 해석 가능성을 향상시킨다.
  • 실험 결과, 하이브리드 접근법이 기존 KNN보다 더 높은 진단 정확도를 달성함을 입증하였으며, 특히 노이즈가 많거나 중복된 특성이 존재하는 상황에서 뛰어난 성능을 보였다.
  • 이 방법은 고용량이고 복잡한 의료 데이터의 과제를 효과적으로 해결하여 실생활 임상 의사결정 지원 시스템에 적합한 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.