[논문 리뷰] Automated speech- and text-based classification of neuropsychiatric conditions in a multidiagnostic setting
이 연구는 기존 기계학습과 고급 트랜스포머 모델을 사용하여 다중진단 환경에서 정신신경질환(우울장애, 조현병, 자폐스펙트럼장애)의 자동 음성 및 텍스트 기반 분류를 평가한다. 이질적인 다중분류 설정에서 성능이 이진 분류에 비해 뚜렷이 떨어지며, 이는 이진 작업에서 식별된 마커가 특정 질환 특이적 특징보다 일반적인 임상 및 비임상 집단 간의 차이를 반영할 수 있음을 시사한다. 음성 및 텍스트 모델의 조합은 상호보완적인 진단 가치를 보였다.
Speech patterns have been identified as potential diagnostic markers for neuropsychiatric conditions. However, most studies only compare a single clinical group to healthy controls, whereas clinical practice often requires differentiating between multiple potential diagnoses (multiclass settings). To address this, we assembled a dataset of repeated recordings from 420 participants (67 with major depressive disorder, 106 with schizophrenia and 46 with autism, as well as matched controls), and tested the performance of a range of conventional machine learning models and advanced Transformer models on both binary and multiclass classification, based on voice and text features. While binary models performed comparably to previous research (F1 scores between 0.54-0.75 for autism spectrum disorder, ASD; 0.67-0.92 for major depressive disorder, MDD; and 0.71-0.83 for schizophrenia); when differentiating between multiple diagnostic groups performance decreased markedly (F1 scores between 0.35-0.44 for ASD, 0.57-0.75 for MDD, 0.15-0.66 for schizophrenia, and 0.38-0.52 macro F1). Combining voice and text-based models yielded increased performance, suggesting that they capture complementary diagnostic information. Our results indicate that models trained on binary classification may learn to rely on markers of generic differences between clinical and non-clinical populations, or markers of clinical features that overlap across conditions, rather than identifying markers specific to individual conditions. We provide recommendations for future research in the field, suggesting increased focus on developing larger transdiagnostic datasets that include more fine-grained clinical features, and that can support the development of models that better capture the complexity of neuropsychiatric conditions and naturalistic diagnostic assessment.
연구 동기 및 목표
- 실제 임상 환경에서 다양한 정신신경질환을 구분하는 데 음성 및 텍스트 기반 기계학습 모델의 성능을 평가하는 것.
- 이진 분류(예: 한 질환 대 대조군)에서 훈련된 모델이 실제 진단 과제를 반영하는 다중분류 설정으로 일반화되는지 조사하는 것.
- 음성 및 텍스트 특징이 정신질환의 다중분류에서 보다 향상된 진단 분류를 위해 어떻게 상호보완적인 정보를 제공하는지 검토하는 것.
- 기존 기계학습 접근 방식에 비해 최신 트랜스포머 모델이 이 다중진단 맥락에서 정신신경질환을 분류하는 데 얼마나 효과적인지 평가하는 것.
- 더 큰 이질성 있는 데이터셋과 세분화된 임상 예측 목표를 강조하여 향후 자동 정신의학 평가 연구를 위한 실질적인 권고안을 제공하는 것.
제안 방법
- MDD 환자 67명, 조현병 환자 106명, 자폐스펙트럼장애 환자 46명, 대조군을 포함한 총 420명의 참가자로부터 반복적인 음성 및 텍스트 기록을 수집한 새로운 데이터셋을 확보하였다.
- 피치, 에너지, 스펙트럼 계수, 프로소디 등의 음성 특징을 표준 도구(예: OpenSMILE, Covarep)를 사용해 추출하였고, 감정, 단어 빈도, 의미 임베딩 등을 포함한 언어적 특징을 음성의 텍스트 변환을 통해 추출하였다.
- 기존 기계학습 모델(예: SVM, 랜덤 포레스트)과 디프 러닝 모델, 특히 미세조정된 BERT 기반 및 기타 트랜스포머 아키텍처를 음성 및 텍스트 모odalities 모두에서 훈련하였다.
- 조기 또는 후기 융합 전략을 통해 음성 및 텍스트 모델을 융합하여 다중모odal 성능 향상을 평가하였다.
- 이진 분류(한 질환 대 대조군) 및 다중분류(모든 세 질환 + 대조군) 작업을 수행하고 각 설정에서 F1 점수 및 매크로 F1 점수를 보고하였다.
- 개별 모odalities 및 모델 유형의 기여도를 평가하기 위해 아블레이션 연구를 수행하였고, 사전학습 및 미세조정의 성능에 미치는 영향을 탐색하였다.

실험 결과
연구 질문
- RQ1음성 및 텍스트 기반 기계학습 모델은 이진 분류 설정과 비교해 다중정신신경질환을 동시에 분류할 때 어떻게 성능을 발휘하는가?
- RQ2정신질환의 다중분류에서 음성 및 텍스트 특징은 얼마나 상호보완적인 진단 정보를 제공하는가?
- RQ3최신 트랜스포머 모델은 다중진단 맥락에서 기존 기계학습 모델보다 정신신경질환을 분류하는 데 뛰어나다고 할 수 있는가?
- RQ4진단 간 임상적 특징이 겹치는 상황에서 현재 모델이 질환 특이적 마커를 포착하는 데에 얼마나 제한되어 있는가?
- RQ5향후 연구는 자동 정신의학 분류 시스템의 임상적 유용성과 강건성을 어떻게 향상시킬 수 있는가?
주요 결과
- 이진 분류 모델은 이전 연구와 유사한 성능를 보였으며, ASD의 F1 점수 범위는 0.54–0.75, MDD는 0.67–0.92, 조현병은 0.71–0.83이었다.
- 다중분류 설정에서는 성능이 뚜렷이 저하되었으며, F1 점수는 ASD 0.35–0.44, MDD 0.57–0.75, 조현병 0.15–0.66이었고, 매크로 F1은 0.38–0.52였다.
- 음성 및 텍스트 특징을 융합함으로써 분류 성능가 향상되었으며, 이는 이 모달리티가 상호보완적인 진단 정보를 캡처하고 있음을 시사한다.
- 트랜스포머 모델이 항상 기존 기계학습 모델을 능가하지는 않았으며, 이는 이 맥락에서 아키텍처의 복잡성만으로는 성능 향상이 보장되지 않음을 시사한다.
- 다중분류 설정에서의 성능 저하로 인해 이진 작업에서 식별된 마커가 특정 질환 특이적 특징보다 일반적인 임상 및 비임상 집단 간의 차이를 반영할 수 있음을 시사한다.
- 본 연구는 넓은 질환 범주를 진단하는 데서 벗어나 영상, 인지 부하, 증상 심각도와 같은 세분화된 임상 특징을 예측하는 데 초점을 맞추는 것이 더 큰 임상적 유용성을 제공할 수 있음을 권고한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.