Skip to main content
QUICK REVIEW

[논문 리뷰] WellXplain: Wellness Concept Extraction and Classification in Reddit Posts for Mental Health Analysis

Muskan Garg|arXiv (Cornell University)|2023. 08. 25.
Mental Health via WritingPsychology인용 수 3
한 줄 요약

WellXplain는 할버트 L. 뜀의 이론을 바탕으로 7개의 웰빙 차원에 대해 약 3,092개의 Reddit 게시글을 주석 처리한 새로운 데이터셋을 소개한다. 이는 개념 추출과 설명 가능한 분류를 통해 세밀한 정신건강 스크리닝을 가능하게 한다. 본 연구는 다양한 모델을 활용해 기준 성능을 수립하였으며, 도메인 적응형 트랜스포머와 LLM이 전통적인 분류기보다 뛰어난 성능을 보임을 입증하였다. 또한 인간이 주석 처리한 텍스트 스트립이 모델의 해석 가능성 향상에 기여한다.

ABSTRACT

During the current mental health crisis, the importance of identifying potential indicators of mental issues from social media content has surged. Overlooking the multifaceted nature of mental and social well-being can have detrimental effects on one's mental state. In traditional therapy sessions, professionals manually pinpoint the origins and outcomes of underlying mental challenges, a process both detailed and time-intensive. We introduce an approach to this intricate mental health analysis by framing the identification of wellness dimensions in Reddit content as a wellness concept extraction and categorization challenge. We've curated a unique dataset named WELLXPLAIN, comprising 3,092 entries and totaling 72,813 words. Drawing from Halbert L. Dunn's well-regarded wellness theory, our team formulated an annotation framework along with guidelines. This dataset also includes human-marked textual segments, offering clear reasoning for decisions made in the wellness concept categorization process. Our aim in publishing this dataset and analyzing initial benchmarks is to spearhead the creation of advanced language models tailored for healthcare-focused concept extraction and categorization.

연구 동기 및 목표

  • 정신건강 스크리닝의 다차원적 접근 부족을 해결하기 위해 사회적 미디어 텍스트에서 웰빙 차원을 식별함으로써 증상 중심 분석을 넘어서는 데 기여한다.
  • 맥락적이고 임상적으로 기반한 웰빙 개념을 활용해 정신적 고통의 조기 징후를 탐지하기 위한 신뢰성 있고 설명 가능한 프레임워크를 개발한다.
  • 모델의 해석 가능성과 임상 검증을 지원하기 위해 명시적인 텍스트 스트립을 포함한 고품질의 인간 주석 처리 데이터셋을 구축한다.
  • 사용자 생성 콘텐츠 내에서 시간에 따라 변화하는 웰빙 차원을 캡처함으로써 정신건강의 종단적 모니터링을 가능하게 한다.
  • 도메인 특화 및 대규모 언어 모델을 활용해 정신건강 응용 분야의 강력하고 설명 가능한 AI 모델 개발을 촉진한다.

제안 방법

  • 할버트 L. 뜀의 웰빙 이론에서 유래한 7개의 웰빙 차원에 대해 주석 처리된 3,092개의 Reddit 게시글과 72,813개의 단어를 포함한 새로운 데이터셋인 WellXplain를 구축한다.
  • 주석 처리의 일관성과 임상적 관련성을 확보하기 위해 상세한 주석 체계와 난이도 지침을 설계한다.
  • 각 웰빙 개념 예측에 대한 설명으로서 인간이 주석 처리한 텍스트 스트립을 수집하여 모델의 해석 가능성 향상과 인간-중심 검증 지원을 도모한다.
  • 전통적인 다중 클래스 분류기, 도메인 적응형 BERT 변형, 대규모 언어 모델(LLMs)를 포함한 다양한 모델을 웰빙 개념 분류 작업에 대해 훈련 및 평가한다.
  • 주석 처리된 스트립을 보조 supervision으로 활용하여 모델의 주의 집중을 텍스트 내 관련 언어적 신호에 유도한다.
  • 표준 평가 지표(F1, 정확도 등)를 사용해 모델 성능을 평가하고, 다양한 모델 유형 간 일반화 성능을 비교함으로써 신뢰성과 해석 가능성에 중점을 둔다.

실험 결과

연구 질문

  • RQ1증상 중심 접근에 비해 다차원 웰빙 개념 추출 프레임워크가 사회적 미디어 텍스트에서 정신건강 문제의 조기 발견에 기여할 수 있는가?
  • RQ2도메인 적응형 트랜스포머와 대규모 언어 모델은 전통적 분류기 대비 Reddit 게시글에서 웰빙 차원을 어떻게 분류하는가?
  • RQ3인간이 주석 처리한 설명 스트립은 웰빙 개념 분류에서 모델 성능과 해석 가능성에 얼마나 기여하는가?
  • RQ4모델 예측은 다양한 웰빙 차원에서 얼마나 안정적이고 신뢰할 수 있는가? 그리고 시간에 따라 정신적 안녕의 미세한 변화를 탐지하는 데 있어 주요 과제는 무엇인가?
  • RQ5WellXplain 데이터셋은 사용자 게시글 내 변화하는 웰빙 상태를 캡처함으로써 종단적 정신건강 분석을 지원할 수 있는가?

주요 결과

  • 도메인 적응형 트랜스포머와 대규모 언어 모델이 전통적인 다중 클래스 분류기보다 웰빙 차원 분류에서 뛰어난 성능을 보이며, 이는 정교한 정신건강 분석에 적합함을 시사한다.
  • 인간이 주석 처리한 설명 스트립의 포함으로 모델의 주의 집중과 해석 가능성 향상이 뚜렷하게 향상되었으며, 이는 인간의 검증과 예측에 대한 신뢰를 강화한다.
  • 강력한 성능에도 불구하고 모델 예측는 임상 진단에 부적합하여 인간의 감독과 윤리적 보호 조치가 여전히 필요함을 시사한다.
  • 데이터셋 분석 결과, 정서적, 사회적, 영적 웰빙과 같은 웰빙 차원은 정치적 및 인간관계 스트레스 요인과 함께 함께 변화하는 경향을 보이며, 복잡한 정신건강 경로를 반영한다.
  • 사용자 게시글의 종단적 분석 결과, 웰빙 차원의 점진적 악화가 관찰되었으며 예를 들어 T1에서 혼란(T1)에서 T5에서 자살 생각으로의 전환을 보였다. 이는 시간적 모니터링의 가치를 입증한다.
  • WellXplain 데이터셋은 지속 가능한 발전 목표(SDG 3)와 일치하는 통합적이고 다차원적인 안녕 평가를 가능하게 하여 정책 및 임상 연구 분야에서 잠재적 응용 가능성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.