Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Learning and Large Language Model Benchmarks on Mental Health Datasets: Cognitive Distortions and Suicidal Risks in Chinese Social Media

Hongzhi Qi, Qing Zhao|arXiv (Cornell University)|2023. 09. 07.
Mental Health via Writing인용 수 6
한 줄 요약

이 논문은 인지 왜곡과 자살 위험 분류를 위한 두 가지 새로운 전문가 주석이 달린 중국어 소셜 미디어 데이터셋을 소개하며, GPT-3.5와 GPT-4와 같은 대규모 언어 모델(LMs)과 지도 학습 간의 성능을 비교한다. Zero-shot, few-shot, 그리고 파인튜닝 전략을 사용하여 평가한다. GPT-4는 일관되게 다른 모델들을 능가하며, 파인튜닝은 GPT-3.5의 자살 위험 분류 성능을 크게 향상시킨다. 이는 대규모 언어 모델의 잠재력은 물론, 미묘한 심리적 텍스트 분석에서의 한계를 보여준다.

ABSTRACT

On social media, users often express their personal feelings, which may exhibit cognitive distortions or even suicidal tendencies on certain specific topics. Early recognition of these signs is critical for effective psychological intervention. In this paper, we introduce two novel datasets from Chinese social media: SOS-HL-1K for suicidal risk classification and SocialCD-3K for cognitive distortions detection. The SOS-HL-1K dataset contained 1,249 posts and SocialCD-3K dataset was a multi-label classification dataset that containing 3,407 posts. We propose a comprehensive evaluation using two supervised learning methods and eight large language models (LLMs) on the proposed datasets. From the prompt engineering perspective, we experimented with two types of prompt strategies, including four zero-shot and five few-shot strategies. We also evaluated the performance of the LLMs after fine-tuning on the proposed tasks. The experimental results show that there is still a huge gap between LLMs relying only on prompt engineering and supervised learning. In the suicide classification task, this gap is 6.95% points in F1-score, while in the cognitive distortion task, the gap is even more pronounced, reaching 31.53% points in F1-score. However, after fine-tuning, this difference is significantly reduced. In the suicide and cognitive distortion classification tasks, the gap decreases to 4.31% and 3.14%, respectively. This research highlights the potential of LLMs in psychological contexts, but supervised learning remains necessary for more challenging tasks. All datasets and code are made available.

연구 동기 및 목표

  • 중국어 소셜 미디어에서 인지 왜곡과 자살 위험에 특화된 정교한 정신건강 NLP 자원의 부족을 해결하기 위해.
  • 이 새로운 데이터셋을 바탕으로 지도 학습 모델과 대규모 언어 모델(LMs) 간의 상대적 효과성을 평가하기 위해.
  • 프롬프트 엔지니어링 전략—zero-shot, few-shot, 파인튜닝—이 심리적 텍스트 분류에서 LLM 성능에 미치는 영향을 조사하기 위해.
  • LLM이 정신건강 맥락에서 미묘한 정서적 신호를 인식하는 데서 기여하는 심리적 통찰을 제공하기 위해.
  • 향후 정신건강 NLP 및 자살 예방 연구를 지원하기 위해 오픈소스 데이터셋과 코드를 공개하기 위해.

제안 방법

  • Sina Weibo 댓글에서 유래한 두 가지 새로운 전문가 주석이 달린 데이터셋을 구성하였으며, 이는 인지 왜곡과 자살 위험 분류에 집중한다.
  • Zero-shot, few-shot, 파인튜닝 세 가지 프롬프팅 전략을 적용하여 기존 지도 학습 모델과 LLM(GPT-3.5, GPT-4, ChatGLM2-6B, GLM-130B) 간의 성능을 비교하는 종합적인 벤치마크를 설계하였다.
  • LLM의 경우, zero-shot는 직접적인 프롬프트 템플릿을 사용하였고, few-shot는 소량의 레이블이 붙은 예시를 디모나션으로 활용하였다. 파인튜닝은 전체 훈련 세트를 기반으로 수행되었다.
  • 표준 NLP 메트릭(예: F1 점수, 정밀도, 재현율)을 사용하여 모델 성능을 평가하였으며, 통계적 유의성 검정도 실시하였다.
  • 모델 예측의 심리적 해석을 수행하여 임상적 이해와의 일치성을 평가하였다. 특히 인지 왜곡과 자살 고려의 임상적 기준과의 일치 여부를 점검하였다.
  • 모든 데이터셋과 코드는 재현 가능성과 커뮤니티 재사용을 보장하기 위해 GitHub를 통해 공개되었다.
Figure 1: Typical examples of true labels versus GPT-4 predicted labels in cognitive distortion.
Figure 1: Typical examples of true labels versus GPT-4 predicted labels in cognitive distortion.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(LMs)은 지도 학습 모델 대비 중국어 소셜 미디어 텍스트에서 인지 왜곡과 자살 위험을 분류하는 데 어떻게 성능을 내는가?
  • RQ2파인튜닝은 복잡하거나 미묘한 정서적 신호를 포함한 정신건강 분류 과제에서 LLM의 성능을 향상시키는가?
  • RQ3특수 과제를 위한 파인튜닝 없이도 zero-shot 및 few-shot 프롬프팅 전략이 LLM이 정신건강 텍스트에 일반화하는 데 얼마나 효과적인가?
  • RQ4LLM이 정신건강 관련 언어에서 미묘한 정서적 뉘앙스를 구분하는 데서 보이는 심리적 한계는 무엇인가?
  • RQ5모델 크기와 아키텍처는 이러한 심리적으로 민감한 NLP 과제에서 성능에 어떤 영향을 미치는가?

주요 결과

  • GPT-4는 인지 왜곡과 자살 위험 분류 과제에서 일관되게 뛰어난 성능을 보였으며, 다른 모델들을 능가하였다.
  • GPT-3.5는 파인튜닝을 거친 후 자살 위험 분류 성능에서 뚜렷한 향상을 보였으며, 이는 파인튜닝이 특정 정신건강 과제에서 성능을 크게 향상시킬 수 있음을 시사한다.
  • Few-shot 프롬프팅은 일관되게 성능 향상을 이끌지 못했으며, 단순히 예시를 프롬프트에 추가하는 것만으로는 복잡한 심리적 분류 과제에서 충분하지 않음을 시사한다.
  • 지도 학습과 LLM 간의 성능 격차는 여전히 두드러지며, 특히 정교한 인지 왜곡 탐지 과제에서 두드러진다. 이는 LLM이 아직 보편적인 대체 수 Mittel이 되지 못하고 있음을 의미한다.
  • 모델 성능은 과제의 복잡성과 모델 크기에 크게 의존하며, GPT-4와 같은 큰 모델일수록 미묘한 언어적 신호에 더 강건함을 보였다.
  • 이 연구는 LLM이 비록 유망하지만, 특히 구분이 미묘한 경우 정서적 상태를 정확히 포착하는 데 어려움을 겪고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.