[논문 리뷰] Depression Detection on Social Media with Large Language Models
DORIS는 DSM-5 기반의 의학 지식과 대형 언어 모델 및 임베딩 기능을 결합하여 소셜 미디어 게시물에서 우울증을 탐지하고, AUPRC를 높이고 설명을 제공합니다. SWDD 데이터셋에서 기준 모델 대비 성능이 우수합니다.
Limited access to mental healthcare resources hinders timely depression diagnosis, leading to detrimental outcomes. Social media platforms present a valuable data source for early detection, yet this task faces two significant challenges: 1) the need for medical knowledge to distinguish clinical depression from transient mood changes, and 2) the dual requirement for high accuracy and model explainability. To address this, we propose DORIS, a framework that leverages Large Language Models (LLMs). To integrate medical knowledge, DORIS utilizes LLMs to annotate user texts against established medical diagnostic criteria and to summarize historical posts into temporal mood courses. These medically-informed features are then used to train an accurate Gradient Boosting Tree (GBT) classifier. Explainability is achieved by generating justifications for predictions based on the LLM-derived symptom annotations and mood course analyses. Extensive experimental results validate the effectiveness as well as interpretability of our method, highlighting its potential as a supportive clinical tool.
연구 동기 및 목표
- 전문 의학 지식(DSM-5)을 자동화된 우울증 탐지 시스템에 통합합니다.
- LLMs를 활용하여 우울 증상을 주석화하고 기분 이력을 요약합니다.
- 의학 지식 특징과 임베딩 기반 표현을 결합하여 정확하고 설명 가능한 예측을 제공합니다.
- 향상된 성능(AUPRC)을 시연하고 결과에 대한 해석 가능한 설명을 제공합니다.
제안 방법
- DSM-5 증상 기준을 사용하여 LLM으로 주석된 포스트당 9차원 우울 증상 벡터를 생성합니다.
- 고감정 게시물을 식별하고 LLM을 통해 기분 경과를 서술한 후 임베딩하여 기분 경과 특징으로 집계합니다.
- 세 가지 사용자 특징을 구성합니다: 진단 기준(DC), 기분 경과(MC), 게시물 이력(PH).
- 그레이디언트 부스팅 트리(GBT) 분류기에 특징을 결합하여 최종 우울증 예측을 수행합니다.
- 예측에 대해 LLM이 증상과 기분 경과를 주석하고 설명(T^Exp)을 생성함으로써 설명 가능성을 확보합니다.
- 상위-k 유사도에 해당하는 고위험 게시물만 주석하도록 필터링하여 LLM 사용을 줄이는 효율적인 주석화.

실험 결과
연구 질문
- RQ1LLMs에 의한 DSM-5 기반 증상 주석이 소셜 미디어에서의 우울증 탐지를 향상시킬 수 있습니까?
- RQ2기분 경과와 고감정 게시물 이력을 모델링하는 것이 텍스트 기반 기준선보다 정확도와 설명 가능성을 향상시키나요?
- RQ3의학 지식과 LLM 및 전통적 분류기를 결합한 하이브리드 시스템이 순수 LLM 또는 임베딩 방법을 능가할 수 있나요?
- RQ4선별 주석화(k)와 정서 필터 임계값(m)이 성능과 효율성에 어떤 영향을 미치나요?
- RQ5모델의 설명(T^Exp)이 사용자나 임상의에게 유용하고 일관성 있나요?
주요 결과
- DORIS는 AUPRC(0.8134) 및 AUROC(0.9715)에서 기준 모델보다 더 높은 성능을 달성합니다.
- DORIS는 SWDD 데이터셋에서 AUPRC 기준으로 Mood2Content보다 0.0360 더 우수합니다.
- 제거 실험은 구성 요소(DC, MC, PH)를 제거하면 F1, AUROC, AUPRC가 감소함을 보여줍니다.
- LLM 기반의 직접 우울 판단은 통합 접근법에 비해 성능이 떨어집니다.
- 효율적인 주석화(텍스트의 20% 주석)는 AUPRC의 상당한 향상을 가져오며 모든 텍스트를 사용하는 것에 거의 근접합니다.
- 시스템은 기분 경과 및 증상 주석에서 도출된 설명 가능 출력(T^Exp)을 제공합니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.