[논문 리뷰] Alzheimer's Dementia Recognition Using Acoustic, Lexical, Disfluency and Speech Pause Features Robust to Noisy Inputs
이 논문은 ASR로 변환된 음성, 음향 특징, 불순성 표시자, 휴지 정보, 단어 확률을 융합하는 다중모달 딥러닝 접근법을 제안하여 알츠하이머병 치매를 진단하고 MMSE 점수를 예측한다. 최고의 BiLSTM 모델(하이웨이 레이어 포함)은 84%의 정확도와 MMSE 회귀 과제에서 4.26의 RMSE를 기록하여, 게이팅을 통한 다중모달 융합이 노이즈가 많은 입력에 대해 강건성을 크게 향상시키고 단모달 모델보다 진단 성능을 향상시킴을 보여준다.
We present two multimodal fusion-based deep learning models that consume ASR transcribed speech and acoustic data simultaneously to classify whether a speaker in a structured diagnostic task has Alzheimer's Disease and to what degree, evaluating the ADReSSo challenge 2021 data. Our best model, a BiLSTM with highway layers using words, word probabilities, disfluency features, pause information, and a variety of acoustic features, achieves an accuracy of 84% and RSME error prediction of 4.26 on MMSE cognitive scores. While predicting cognitive decline is more challenging, our models show improvement using the multimodal approach and word probabilities, disfluency and pause information over word-only models. We show considerable gains for AD classification using multimodal fusion and gating, which can effectively deal with noisy inputs from acoustic features and ASR hypotheses.
연구 동기 및 목표
- 음성 전사 및 음향 특징을 모두 활용하여 알츠하이머병 치매 인식을 위한 강건한 다중모달 딥러닝 시스템을 개발한다.
- ASR 출력에서 유도된 불순성, 휴지, 단어 확률 특징의 기여도를 평가하여 인지 기능 저하 탐지에 기여하는지 분석한다.
- 특히 ASR 가설이 완벽하지 않은 상황에서 노이즈가 많은 입력 조건 하에서도 치매 분류 및 MMSE 회귀 과제 성능을 향상시킨다.
- 게이팅 메커니즘을 통한 다중모달 융합이 단모달 모델 대비 강건성과 예측 정확도를 향상시키는지 조사한다.
- 구조화된 진료 인터뷰에서의 오직 오디오 데이터만을 사용하여 조기 인지 기능 저하 및 질환 진행 상황을 탐지할 수 있는지의 타당성을 평가한다.
제안 방법
- 하이웨이 레이어를 갖춘 BiLSTM은 ASR 출력 및 원본 오디오에서 유도된 단어, 단어 확률, 불순성 표시자, 휴지 특징, 음향 특징(예: 말하기 속도, 휴지 비율, 발성 시간)의 시퀀스를 처리한다.
- 학습 가능한 게이팅 메커니즘을 갖춘 다중모달 융합 전략은 텍스트 및 음향 모달 간 기여도를 동적으로 가중하여 노이즈가 많은 입력에 대한 강건성을 향상시킨다.
- ASR 시스템에서 유도된 단어 확률은 어휘 예측 가능성과 문법적 통합성을 대체 지표로 사용하여 의미 및 문법 장애 탐지에 기여한다.
- 불순성 표시자(예: 채운 휴지 및 채우지 않은 휴지)는 ASR 전사에서 추출되어 조기 알츠하이머병에서 흔한 말하기 망설임을 캡처한다.
- 모델은 두 가지 ADReSSo 2021 과제(이元 분류 및 MMSE 점수 회귀)에 대해 엔드 투 엔드로 훈련되며, 추가적으로 인지 기능 저하 예측에 대한 평가도 수행된다.
- 텍스트 전용 모델링을 위한 기준 모델로 BERT를 사용하고, 단모달 및 다중모달 설정 간 비교를 통해 융합의 이점을 평가한다.
실험 결과
연구 질문
- RQ1ASR 전사에서 추출한 불순성 및 휴지 특징이 알츠하이머병 치매 분류 및 MMSE 점수 예측에 기여하는가?
- RQ2노이즈가 많은 전사 조건에서 ASR 출력에서 유도된 단어 확률은 인지 기능 저하 탐지에 어떻게 기여하는가?
- RQ3실제 노이즈가 많은 입력 환경에서 게이팅 메커니즘을 통한 다중모달 융합이 단모달 모델보다 성능을 뛰어나게 하는가?
- RQ4음향 특징이 ASR 출력에서 유도된 텍스트 및 언어적 특징과 융합되었을 때 성능 향상에 어느 정도 기여하는가?
- RQ5구조화된 진료 인터뷰 데이터로 훈련된 다중모달 모델은 2년 간의 인지 기능 저하 진행 상황을 효과적으로 예측할 수 있는가?
주요 결과
- 단어, 단어 확률, 불순성, 휴지, 음향 특징을 모두 사용한 하이웨이 레이어를 갖춘 BiLSTM이 가장 뛰어난 성능을 보이며, 알츠하이머병 치매 분류에서 84%의 정확도를 기록했다.
- MMSE 점수 회귀 과제에서 모델은 4.26의 RMSE를 기록하여 모든 다른 설정보다 뛰어난 회귀 성능을 보였다.
- 게이팅 메커니즘을 통한 다중모달 융합은 성능을 크게 향상시켜, 가장 뛰어난 단모달 모델 대비 RMSE를 1.15점 감소시켰다(4.26 vs. 5.31).
- 어휘 특징에 단어 확률을 추가함으로써 교차 검증에서 정확도가 0.76에서 0.77로 향상되었고, RMSE는 5.31에서 4.78로 감소했다.
- 게이팅 기반 다중모달 LSTM은 모든 다른 모델보다 인지 기능 저하 진행 상황 과제에서 뛰어난 성능을 보였으며, 테스트 F1 점수는 0.62를 기록하여 최고의 기준 모델(0.67)에 근접했다.
- 다중모달 융합의 이점에도 불구하고, BERT 기반 모델은 텍스트 전용 분류에서 LSTM보다 높은 성능(ACC 0.80 vs. 0.81)을 보였으며, 이는 이 맥락에서 BERT가 순수 텍스트 모델링에 더 효과적일 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.