[논문 리뷰] Depression Detection and Analysis using Large Language Models on Textual and Audio-Visual Modalities
이 논문은 E-DAIC 데이터셋의 텍스트, 음성 및 시각 데이터에서 대규모 언어 모델(Large Language Models, LLMs)을 사용한 다중모odal 우울증 탐지 프레임워크를 제안한다. GPT-4를 사용할 경우 회귀 분석에서 RMSE 3.98, 분류 분석에서 정확도 71.43%를 기록하여 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 PHQ-8 중증도 예측 및 우울증 분류에 있어 LLM의 텍스트 모odal에서의 우수성을 입증한다.
Depression has proven to be a significant public health issue, profoundly affecting the psychological well-being of individuals. If it remains undiagnosed, depression can lead to severe health issues, which can manifest physically and even lead to suicide. Generally, Diagnosing depression or any other mental disorder involves conducting semi-structured interviews alongside supplementary questionnaires, including variants of the Patient Health Questionnaire (PHQ) by Clinicians and mental health professionals. This approach places significant reliance on the experience and judgment of trained physicians, making the diagnosis susceptible to personal biases. Given that the underlying mechanisms causing depression are still being actively researched, physicians often face challenges in diagnosing and treating the condition, particularly in its early stages of clinical presentation. Recently, significant strides have been made in Artificial neural computing to solve problems involving text, image, and speech in various domains. Our analysis has aimed to leverage these state-of-the-art (SOTA) models in our experiments to achieve optimal outcomes leveraging multiple modalities. The experiments were performed on the Extended Distress Analysis Interview Corpus Wizard of Oz dataset (E-DAIC) corpus presented in the Audio/Visual Emotion Challenge (AVEC) 2019 Challenge. The proposed solutions demonstrate better results achieved by Proprietary and Open-source Large Language Models (LLMs), which achieved a Root Mean Square Error (RMSE) score of 3.98 on Textual Modality, beating the AVEC 2019 challenge baseline results and current SOTA regression analysis architectures. Additionally, the proposed solution achieved an accuracy of 71.43% in the classification task. The paper also includes a novel audio-visual multi-modal network that predicts PHQ-8 scores with an RMSE of 6.51.
연구 동기 및 목표
- 텍스트, 음성 및 시각 데이터를 기반으로 대규모 언어 모델(LLMs)을 활용한 다중모달 우울증 탐지 시스템을 개발한다.
- 기존 최신 기술 수준(SOTA)의 회귀 및 분류 모델을 향상시켜 PHQ-8 점수 예측 및 우울증 중증도 분석을 수행한다.
- GPT-4, GPT-3.5 및 LLaMA 3 8B를 포함한 기업 소유 및 오픈소스 LLM의 임상 우울증 탐지 작업 성능을 평가한다.
- 정신건강 AI 분야에서 데이터 부족 및 개인정보 보호 문제를 해결하기 위한 방안을 제안하기 위해 E-DAIC 데이터셋의 한계를 조사한다.
- 임상 정신건강 응용 분야에서 LLM을 활용한 소수의 예시 프ompting(few-shot prompting)이 회귀 및 분류 작업에 얼마나 실현 가능할지 탐색한다.
제안 방법
- LLM 입력을 위해 음성 데이터를 OpenAI Whisper를 사용해 음성 인식하여 텍스트 전사본을 추출한다.
- GPT-4, GPT-3.5, LLaMA 3 8B와 같은 LLM을 사용해 소수의 예시 프롬프트를 활용해 텍스트 데이터에서 PHQ-8 점수 예측 및 우울증 상태 분류를 수행한다.
- Whisper와 BiLSTM를 융합한 새로운 음성-시각 다중모달 네트워크를 설계하여 음성 및 시각 신호에서 PHQ-8 점수를 예측한다.
- 임상 인터뷰 전사본에서 텍스트 표현 학습을 위한 미세조정을 위해 RoBERTa 및 DepRoBERTa를 활용한다.
- PHQ-8 점수 예측 및 이진 분류(우울증 여부 대비 비우울증)에 적합한 손실 함수를 사용해 회귀 및 분류 헤드를 적용한다.
- 테스트 및 검증 세트에서 RMSE, MAE, CCC, 정확도, F1 점수, 정밀도 및 재현율 지표를 사용해 E-DAIC 데이터셋에서 모델 성능을 평가한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델(LLMs)은 기존 최신 기술 수준(SOTA) 아키텍처보다 텍스트 데이터를 활용한 회귀 기반 PHQ-8 점수 예측에서 슈퍼리어한 성능을 낼 수 있는가?
- RQ2소수의 예시 프롬프트를 사용한 LLM은 텍스트 전사본에서 우울증 중증도를 얼마나 효과적으로 분류할 수 있는가?
- RQ3LLM과 함께 음성 및 시각 신호를 융합한 다중모달 접근 방식은 단일모달 접근 방식을 뛰어넘어 PHQ-8 예측 성능을 향상시킬 수 있는가?
- RQ4샘플 수 부족 및 개인정보 보호 문제 측면에서 E-DAIC 데이터셋의 한계는 무엇이며, 향후 연구에서 이를 어떻게 해결할 수 있는가?
- RQ5기업 소유의 LLM(GPT-4 등)과 오픈소스 모델(LLaMA 3 8B 등)은 임상 우울증 탐지 작업에서 어떻게 비교되는가?
주요 결과
- GPT-4는 테스트 세트에서 RMSE 3.975를 기록하여 AVEC 2019 기준선 및 현재 최신 기술 수준(SOTA) 모델를 모두 초월하는 최고의 회귀 성능을 보였다.
- 제안된 음성-시각 다중모달 네트워크는 PHQ-8 점수 예측에서 RMSE 6.51을 기록하여 경쟁 기준선을 뛰어넘는 성능을 보였다.
- GPT-4는 분류 작업에서 71.43%의 정확도를 기록했으며, 가중 평균 F1 점수는 71.44%로, 소수의 예시 프롬프트에서 강력한 성능을 입증했다.
- LLaMA 3 8B Instruct는 분류 작업에서 73.21%의 정확도를 기록하여 GPT-3.5(58.93%)를 초월했으며, 정신건강 응용 분야에서 오픈소스 LLM의 잠재력을 보여주었다.
- LLM가 강화한 텍스트 모달이 음성 및 시각 모달보다 뛰어난 성능을 보였으며, 이는 우울증 탐지에서 언어적 신호의 지배적 역할을 시사한다.
- GPT-4는 CCC 점수 0.781을 기록하여 다른 모델들을 크게 능가했으며, PHQ-8 예측 분야에서 새로운 최신 기술 수준(SOTA)을 수립했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.