Skip to main content
QUICK REVIEW

[논문 리뷰] Investigation into respiratory sound classification for an imbalanced data set using hybrid LSTM-KAN architectures

Nithinkumar K., Anand R.|arXiv (Cornell University)|2026. 01. 07.
Phonocardiography and Auscultation Techniques인용 수 0
한 줄 요약

논문은 focal loss, 데이터 증강, SMOTE를 사용한 하이브리드 LSTM-KAN 모델로 불균형한 호흡 소리 데이터를 분류하고, COPD가 지배하는 여섯 클래스 데이터셋에서 94.6%의 정확도와 매크로 F1 0.703를 달성한다.

ABSTRACT

Respiratory sounds captured via auscultation contain critical clues for diagnosing pulmonary conditions. Automated classification of these sounds faces challenges due to subtle acoustic differences and severe class imbalance in clinical datasets. This study investigates respiratory sound classification with a focus on mitigating pronounced class imbalance. We propose a hybrid deep learning model that combines a Long Short-Term Memory (LSTM) network for sequential feature encoding with a Kolmogorov-Arnold Network (KAN) for classification. The model is integrated with a comprehensive feature extraction pipeline and targeted imbalance mitigation strategies. Experiments were conducted on a public respiratory sound database comprising six classes with a highly skewed distribution. Techniques such as focal loss, class-specific data augmentation, and Synthetic Minority Over-sampling Technique (SMOTE) were employed to enhance minority class recognition. The proposed Hybrid LSTM-KAN model achieves an overall accuracy of 94.6 percent and a macro-averaged F1 score of 0.703, despite the dominant COPD class accounting for over 86 percent of the data. Improved detection performance is observed for minority classes compared to baseline approaches, demonstrating the effectiveness of the proposed architecture for imbalanced respiratory sound classification.

연구 동기 및 목표

  • 호흡 소리 데이터셋의 심한 클래스 불균형 문제를 해결한다.
  • 시퀀스 특징 인코딩을 위한 LSTM과 분류를 위한 Kolmogorov-Arnold Network (KAN)을 결합한 하이브리드 아키텍처를 개발한다.
  • 특징 추출과 불균형 완화 기술을 통합하여 소수 클래스 인식을 향상시킨다.
  • COPD가 지배적인 분포를 가진 공개 여섯 클래스 호흡 소리 데이터셋에서 성능을 평가한다.

제안 방법

  • LSTM을 사용하여 연속 음향 특징을 인코딩한다.
  • LSTM과 Kolmogorov-Arnold Network (KAN)을 결합하여 분류를 수행한다.
  • 클래스 불균형을 다루기 위해 focal loss를 적용한다.
  • 클래스별 데이터 증강 전략을 통합한다.
  • 소수 클래스의 균형을 맞추기 위해 SMOTE를 적용한다.
  • 편향된 분포를 가진 여섯 클래스 호흡 소리 데이터셋에서 평가한다.

실험 결과

연구 질문

  • RQ1 hybrids LSTM-KAN 아키텍처가 baselines 대비 불균형한 호흡 소리 데이터의 분류를 개선할 수 있는가?
  • RQ2불균형 완화 기술(focal loss, 증강, SMOTE)이 소수 클래스 성능에 어떤 영향을 미치는가?
  • RQ3COPD가 지배하는 여섯 클래스 호흡 소리 데이터셋에서 전체 정확도와 매크로 평균 F1은 무엇인가?

주요 결과

  • 하이브리드 LSTM-KAN은 94.6%의 전체 정확도를 달성한다.
  • 매크로 평균 F1 점수는 0.703에 이른다.
  • 소수 클래스 탐지가 기저 접근 방식에 비해 개선된다.
  • COPD 클래스가 데이터의 86% 이상을 차지하여 심각한 불균형을 강조한다.
  • 불균형 완화 기술이 소수 클래스 인식 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.