Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-specific Continued Pretraining of Language Models for Capturing Long Context in Mental Health

Shaoxiong Ji, Tianlin Zhang|arXiv (Cornell University)|2023. 04. 20.
Mental Health via Writing인용 수 16
한 줄 요약

논문은 Reddit 데이터를 사용하여 도메인 특화된 장맥락 언어 모델인 MentalXLNet과 MentalLongformer를 학습시키고, 정신 건강 분류 및 장거리 텍스트 이해에 대한 효과를 평가합니다. MentalLongformer는 일반적으로 더 긴 문서에서 뛰어납니다.

ABSTRACT

Pretrained language models have been used in various natural language processing applications. In the mental health domain, domain-specific language models are pretrained and released, which facilitates the early detection of mental health conditions. Social posts, e.g., on Reddit, are usually long documents. However, there are no domain-specific pretrained models for long-sequence modeling in the mental health domain. This paper conducts domain-specific continued pretraining to capture the long context for mental health. Specifically, we train and release MentalXLNet and MentalLongformer based on XLNet and Longformer. We evaluate the mental health classification performance and the long-range ability of these two domain-specific pretrained models. Our models are released in HuggingFace.

연구 동기 및 목표

  • 도메인 특화된 지속적 사전학습을 통해 정신 건강 분류 성능을 향상시키는 것.
  • 정신 건강 데이터(예: Reddit 게시물)에서 긴 문서의 효과적인 모델링을 가능하게 하는 것.
  • 긴 컨텍스트 모델(Longformer, XLNet)을 다수의 데이터셋에서 도메인 특화 기준선과 비교하는 것.
  • 정신 건강 과제에서 짧은 텍스트 대 긴 텍스트에 대한 모델 선택에 대한 지침을 제공하는 것.

제안 방법

  • 관련 서브레딧의 Reddit 기반 코퍼스를 사용하여 정신 건강 도메인에서 XLNet 및 Longformer의 지속적 사전학습을 진행한다.
  • 짧은 텍스트와 긴 텍스트를 포함하는 여러 정신 건강 분류 데이터셋에서 평가한다.
  • 마지막 계층의 표현을 풀링하고 MLP 분류기로 미세조정한다.
  • 바닐라 사전학습 모델, 도메인 특화 기준선, 제로샷 ChatGPT 기준선과 비교한다.
  • 입력 시퀀스 길이를 달리하여 장거리 능력을 분석하고 성능 추세를 관찰한다.
Figure 1: Median number of tokens in the datasets
Figure 1: Median number of tokens in the datasets

실험 결과

연구 질문

  • RQ1도메인 특화 지속적 사전학습이 다양한 데이터셋에서 정신 건강 분류를 개선할 수 있는가?
  • RQ2짧은 텍스트 대 긴 텍스트에서 긴 컨텍스트 모델이 표준 및 도메인 특화 기준선과 어떻게 비교되는가?
  • RQ3정신 건강 과제에서 입력 시퀀스 길이를 늘리는 것이 장거리 모델링에 미치는 영향은 무엇인가?
  • RQ4긴 문서(예: CLPsych15) 대 짧은 게시물(예: Dreaddit, SAD 데이터셋)에서 어떤 모델이 더 바람직한가?

주요 결과

  • MentalXLNet와 MentalLongformer가 분류 작업에서 대부분의 기준선을 능가하며, 특히 CLPsych15 같은 더 긴 시퀀스에서 강력한 성능을 보인다.
  • MentalLongformer는 긴 텍스트에서 강한 성능을 보이며, 도메인 특화 사전학습이 적용되었을 때 Longformer에 필수적으로 근접하거나 이를 능가하는 경우가 많다.
  • MentalRoBERTa는 짧은 512토큰 데이터셋(Dreaddit)에서 최고 성능을 보이는 반면, MentalLongformer는 더 긴 입력에 유리하다.
  • 장거리 분석의 경우 시퀀스 길이를 늘리는 것이 일반적으로 재현율과 F1을 향상시키지만 변동도 있다.
  • 도메인 특화 지속적 사전학습은 여러 데이터셋에서 비도메인 Longformer/XLNet 기준선 대비 일관된 이점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.