Skip to main content
QUICK REVIEW

[논문 리뷰] Alzheimers Dementia Detection using Acoustic & Linguistic features and Pre-Trained BERT.

Akshay Valsaraj, Ithihas Madala|arXiv (Cornell University)|2021. 09. 22.
Speech Recognition and Synthesis참고 문헌 19인용 수 6
한 줄 요약

이 연구는 음성 데이터를 이용한 알츠하이머병 치매 진단을 위한 세 가지 모델을 제안한다: eGeMAPs 음성 특징 기반 모델, 음성 인식기(transcript)에서 유도한 맞춤형 언어적 특징 기반 모델, 그리고 미세조정된 BERT와 TF-IDF를 융합한 모델. BERT+TF-IDF 모델이 76.06%의 최고 테스트 정확도를 기록하며 음성 및 언어적 모델을 앞서며, 자발적 음성에서의 조기 AD 진단에 사전 학습된 언어 모델의 효과성을 입증한다.

ABSTRACT

Alzheimers disease is a fatal progressive brain disorder that worsens with time. It is high time we have inexpensive and quick clinical diagnostic techniques for early detection and care. In previous studies, various Machine Learning techniques and Pre-trained Deep Learning models have been used in conjunction with the extraction of various acoustic and linguistic features. Our study focuses on three models for the classification task in the ADReSS (The Alzheimers Dementia Recognition through Spontaneous Speech) 2021 Challenge. We use the well-balanced dataset provided by the ADReSS Challenge for training and validating our models. Model 1 uses various acoustic features from the eGeMAPs feature-set, Model 2 uses various linguistic features that we generated from auto-generated transcripts and Model 3 uses the auto-generated transcripts directly to extract features using a Pre-trained BERT and TF-IDF. These models are described in detail in the models section.

연구 동기 및 목표

  • 자발적 음성을 이용한 저비용, 비침습적 조기 알츠하이머병 치매 진단 도구 개발.
  • 음성, 언어 및 심층적 문맥 기반 NLP 특징이 건강 대조군과의 AD 분류에 얼마나 효과적인지 평가.
  • ADReSS 2021 챌린지 데이터셋에서 기존 기계학습 모델과 사전 학습된 BERT 기반 접근 방식을 비교.
  • 미래의 음성 모델링을 위해 시각적 트랜스포머(Vision Transformers)와 sPCEN 정규화된 스펙트로그램의 잠재력 탐색.

제안 방법

  • 모델 1은 환자 음성 기록에서 eGeMAPs 음성 특징을 추출하였다.
  • 모델 2는 자동 생성된 ASR 전사본에서 브루네티의 지수, 엔트로피, 유형-토큰 비율 등의 언어적 특징을 생성하였다.
  • 모델 3는 음성 전사본에 대해 사전 학습된 BERT 모델을 미세조정하여 문맥 임베딩을 확보하고, 이를 TF-IDF 특징과 결합하였다.
  • BERT 임베딩과 TF-IDF 벡터를 다음 공식을 사용해 통합하였다: tfidft,d = tft,d · log(N/dft), 여기서 tft,d는 어휘 빈도이고 dft는 문서 빈도이다.
  • 모든 세 모델에 대해 5겹 교차검증과 테스트 세트 평가를 수행하며 SVM, LR, RF 등의 분류기들을 훈련 및 평가하였다.
  • 미래 작업으로 시각적 트랜스포머(ViT)를 sPCEN 정규화된 스펙트로그램과 결합하고, 음성 및 BERT 기반 모델의 앙상블 모델링을 제안하였다.

실험 결과

연구 질문

  • RQ1사전 학습된 BERT 모델은 자발적 음성 전사본에서 알츠하이머병 치매의 언어적 지표를 효과적으로 포착할 수 있는가?
  • RQ2기존의 음성 특징(eGeMAPs)은 언어적 및 심층적 문맥 특징과 비교해 어떻게 AD 분류 성능을 보이는가?
  • RQ3BERT 임베딩과 TF-IDF를 융합하면 개별 특징 집합보다 분류 성능이 향상되는가?
  • RQ4sPCEN 정규화된 스펙트로그램과 함께 시각적 트랜스포머(ViT)는 기존 모델보다 음성 모델링에서 더 우수한 성능을 낼 수 있는가?

주요 결과

  • BERT 임베딩과 TF-IDF 특징을 융합한 모델 3가 76.06%의 최고 테스트 정확도를 기록하며, 모델 1(59.5%)과 모델 2(57.75%)를 뚜렷이 앞섰다.
  • BERT+TF-IDF 모델은 테스트 F1 스코어 0.7671을 기록하여 정밀도와 재현도 사이의 균형이 잘 잡혔음을 보여주었다.
  • 5겹 교차검증에서 모델 3는 70.0%의 정확도와 F1 스코어 0.717을 기록하여 각 폴드 간 일관된 일반화 능력을 보였다.
  • 언어적 모델(모델 2)은 높은 정밀도(0.867)를 보였지만 재현도가 낮아(0.464) 양성 AD 사례를 놓치는 경향이 있었다.
  • 음성 모델(모델 1)은 성능이 가장 열악했으며, 테스트 정확도 59.5%와 특이도 52.2%를 기록해 이 데이터셋에서는 구분 능력이 제한적이었다.
  • 이론적으로는 유망한 잠재력을 지녔지만, 스펙트로그램에 대한 시각적 트랜스포머 구현은 만족스러운 성능을 내지 못해 향후 최적화된 패치 설정과 sPCEN 정규화를 고려해 다시 학습할 계획이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.