Skip to main content
QUICK REVIEW

[논문 리뷰] Identification of Dementia Using Audio Biomarkers

Rupayan Chakraborty, Meghna Pandharipande|arXiv (Cornell University)|2020. 02. 27.
Music and Audio Processing참고 문헌 23인용 수 8
한 줄 요약

이 논문은 임상의와 환자 간 대화에서 비언어적 음향 특징만을 사용하여 치매 단계—정상 대조군(HC), 경도 인지 장애(MCI), 알츠하이머병(AD)—를 분류하는 언어에 종속되지 않은 음향 생체지표 기반 접근법을 제안한다. 여러 음향 특징 유형(스펙트럼, 시간, 체프스트럼)의 점수 수준 융합과 데이터 균형 조정을 통해 82%의 정확도를 달성하였으며, 이는 특징 수준 융합 대비 5%p의 절대적 향상으로, 특히 도전적인 MCI 분류에 있어서도 강력한 성능을 보였다.

ABSTRACT

Dementia is a syndrome, generally of a chronic nature characterized by a deterioration in cognitive function, especially in the geriatric population and is severe enough to impact their daily activities. Early diagnosis of dementia is essential to provide timely treatment to alleviate the effects and sometimes to slow the progression of dementia. Speech has been known to provide an indication of a person's cognitive state. The objective of this work is to use speech processing and machine learning techniques to automatically identify the stage of dementia such as mild cognitive impairment (MCI) or Alzheimers disease (AD). Non-linguistic acoustic parameters are used for this purpose, making this a language independent approach. We analyze the patients audio excerpts from a clinician-participant conversations taken from the Pitt corpus of DementiaBank database, to identify the speech parameters that best distinguish between MCI, AD and healthy (HC) speech. We analyze the contribution of various types of acoustic features such as spectral, temporal, cepstral their feature-level fusion and selection towards the identification of dementia stage. Additionally, we compare the performance of using feature-level fusion and score-level fusion. An accuracy of 82% is achieved using score-level fusion with an absolute improvement of 5% over feature-level fusion.

연구 동기 및 목표

  • 말의 언어적 내용에 의존하지 않고 음성에서만 추출한 음향 특징을 사용하여 치매 단계를 비침습적으로 분류하는 방법을 개발하는 것.
  • HC, MCI, AD를 구분하는 데 가장 유의미한 음향 생체지표(스펙트럼, 시간, 체프스트럼)를 식별하는 것.
  • 분류 성능 향상을 위해 초기 융합(특징 수준)과 후기 융합(점수 수준) 전략을 비교하는 것.
  • 특히 MCI에 대해 심각한 클래스 불균형 문제를 해결하여 모델의 강건성과 정확도를 향상시키는 것.
  • 언어적 또는 음성 전사 자료에 의존하지 않고 음성 음향 특징만으로 다중 클래스 치매 단계 분류에서 높은 정확도를 달성하는 것.

제안 방법

  • Pitt DementiaBank 코퍼스의 오디오 요소에서 비언어적 음향 특징—스펙트럼, 시간, 체프스트럼 및 그 조합—을 추출하였다.
  • 다양한 음향 특징 유형을 연결하여 단일 특징 벡터를 형성함으로써 특징 수준 융합을 적용하여 분류를 수행하였다.
  • 각기 다른 특징 세트에 대해 훈련된 개별 분류기의 후행 확률을 융합하는 점수 수준 융합을 구현하였으며, 두 가지 방법을 사용하였다: (1) 후행 확률 합의 argmax, (2) 가중 평균 후행 확률의 argmax.
  • SMO, MLP, BayesNet, SimpleLogistic 등의 다양한 분류기를 사용하여 초기 융합 및 후기 융합 구성 모두에서 성능을 평가하였다.
  • 특정 클래스 간 불균형 문제를 완화하고 MCI 분류 성능을 향상시키기 위해 재표본 추출 기법을 활용해 데이터셋을 균형 조정하였다.
  • 전체 정확도를 주요 지표로 하여 정밀도, 재현율, F-점수를 모두의 클래스에서 평가하였다.

실험 결과

연구 질문

  • RQ1스펙트럼, 시간, 체프스트럼 유형의 음향 특징 중 어느 것이 HC, MCI, AD의 음성 간 구분에 가장 효과적인가?
  • RQ2다양한 음향 특징 세트의 점수 수준 융합이 치매 단계 분류에서 특징 수준 융합보다 성능이 뛰어나게 되는가?
  • RQ3특히 MCI에 대한 클래스 불균형이 분류 성능에 어떤 영향을 미치며, 균형 조정을 통해 성능 향상을 이룰 수 있는가?
  • RQ4언어에 종속되지 않은 비언어적 접근법이 음성 음향 특징만으로 다중 클래스 치매 단계 분류에서 높은 정확도를 달성할 수 있는가?
  • RQ5분류 정확도를 극대화하기 위해 최적의 음향 생체지표 조합과 융합 전략은 무엇인가?

주요 결과

  • 데이터 균형 조정과 함께 점수 수준 융합을 적용한 결과, 전체 정확도가 82%에 도달하였으며, 이는 특징 수준 융합 대비 5%p 절대적 향상이다.
  • 가장 높은 성능을 보인 구성은 균형 조정된 데이터에서 SMO 분류기를 사용한 점수 수준 융합으로, 전체 F-점수 82%를 달성하였다.
  • MCI 분류가 여전히 가장 도전적인 클래스였으며, 대부분의 구성에서 F-점수는 60% 이하에 머물렀다. 데이터 균형 조정 후에도 마찬가지였다.
  • 특징 수준 융합은 기준 모델의 66%에서 F-점수 77%로 정확도를 향상시켜, 다양한 음향 특징을 융합하는 것이 유의미한 가치를 지닌다는 것을 입증하였다.
  • 데이터 균형 조정은 모든 분류기에서 성능 향상을 크게 개선하였으며, 특히 MCI에 대해 두드러진 효과를 보였고, 이는 초기 결과에서 클래스 불균형이 주요 혼란 요인임을 시사한다.
  • 제안된 방법은 오직 음향 생체지표만을 사용하여 높은 정확도(82%)를 달성하였으며, 언어에 종속되지 않고 비침습적인 치매 단계 분류에 효과적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.