Skip to main content
QUICK REVIEW

[논문 리뷰] Voiceprint recognition of Parkinson patients based on deep learning

Zhijing Xu, Juan Wang|arXiv (Cornell University)|2018. 01. 01.
Voice and Speech DisordersMedicine인용 수 1
한 줄 요약

이 연구는 지속된 모음 발음에서 파킨슨병(PD) 환자를 건강한 개인과 구분하기 위해 음성프린트 특징 추출에 웨이트드 멜 주파수 케프스트럼 계수(WMFCC)를 결합한 딥러닝 접근법을 제안한다. 이 방법은 전통적인 방법들인 SVM보다 뛰어난 성능을 보이며, 지속된 모음 기록을 사용해 89.5%의 정확도를 달성한다.

ABSTRACT

More than 90% of the Parkinson Disease (PD) patients suffer from vocal disorders. Speech impairment is already indicator of PD. This study focuses on PD diagnosis through voiceprint features. In this paper, a method based on Deep Neural Network (DNN) recognition and classification combined with Mini-Batch Gradient Descent (MBGD) is proposed to distinguish PD patients from healthy people using voiceprint features. In order to exact the voiceprint features from patients, Weighted Mel Frequency Cepstrum Coefficients (WMFCC) is applied. The proposed method is tested on experimental data obtained by the voice recordings of three sustained vowels /a/, /o/ and /u/ from participants (48 PD and 20 healthy people). The results show that the proposed method achieves a high accuracy of diagnosis of PD patients from healthy people, than the conventional methods like Support Vector Machine (SVM) and other mentioned in this paper. The accuracy achieved is 89.5%. WMFCC approach can solve the problem that the high-order cepstrum coefficients are small and the features component's representation ability to the audio is weak. MBGD reduces the computational loads of the loss function, and increases the training speed of the system. DNN classifier enhances the classification ability of voiceprint features. Therefore, the above approaches can provide a solid solution for the quick auxiliary diagnosis of PD in early stage.

연구 동기 및 목표

  • 비침습적 음성 기반 생체지표를 활용해 조기 단계의 파킨슨병(PD) 진단 문제를 해결하기 위해.
  • 음성프린트 특징을 활용해 PD 환자와 건강한 개인 간의 분류 정확도를 향상시키기 위해.
  • 고차 케프스트럼 계수의 표현이 약한 전통적인 특징 추출 방법의 한계를 극복하기 위해.
  • 딥러닝 프레임워크 내에서 미니배치 경사하강법(MBGD)을 통해 계산 부담을 줄이고 학습 속도를 가속화하기 위해.

제안 방법

  • 지속된 모음 /a/, /o/, /u/에서 음성프린트 특징을 추출하기 위해 웨이트드 멜 주파수 케프스트럼 계수(WMFCC)를 사용한다.
  • WMFCC 방법은 고차 케프스트럼 계수의 크기가 작은 문제를 해결함으로써 특징 표현을 향상시킨다.
  • 분류 성능 향상을 위해 미니배치 경사하강법(MBGD)을 사용해 딥 네트워크(DNN) 분류기를 학습시킨다.
  • MBGD는 DNN 학습 중 계산 부담을 줄이고 수렴 속도를 높인다.
  • 지속된 모음 기록을 사용해 48명의 PD 환자와 20명의 건강한 개인으로 구성된 데이터셋에서 시스템을 학습하고 테스트한다.
  • DNN 모델은 PD 환자와 건강한 대조군을 구분하기 위해 음성프린트 특징의 계층적 표현을 학습한다.

실험 결과

연구 질문

  • RQ1기존의 MFCC와 비교해 WMFCC가 파킨슨병 검출을 위한 음성프린트 특징의 구분 능력을 향상시킬 수 있는가?
  • RQ2SVM과 같은 전통적 분류기와 비교해 MBGD를 적용한 DNN는 음성 샘플에서 파킨슨병을 진단하는 데 어떻게 성능을 발휘하는가?
  • RQ3제안된 방법은 높은 진단 정확도를 유지하면서 계산 부담을 어느 정도 줄일 수 있는가?
  • RQ4지속된 모음 발음은 딥러닝을 활용해 조기 단계의 파킨슨병 진단을 신뢰성 있게 지원할 수 있는가?

주요 결과

  • 제안된 방법은 건강한 개인과 파킨슨병 환자를 구분하는 데 89.5%의 진단 정확도를 달성한다.
  • WMFCC의 사용은 특히 고차 케프스트럼 계수에 대해 특징 표현을 크게 향상시킨다.
  • 미니배치 경사하강법은 DNN 모델의 계산 부담을 줄이고 학습 속도를 증가시킨다.
  • DNN 분류기는 기존 방법들인 SVM과 비교해 뛰어난 분류 성능을 보인다.
  • 이 시스템은 신뢰성 있는 조기 단계의 PD 검출을 위해 지속된 모음 기록을 효과적으로 활용한다.
  • WMFCC와 DNN를 MBGD와 통합함으로써 자동 PD 스크리닝을 위한 강력하고 효율적인 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.