Skip to main content
QUICK REVIEW

[논문 리뷰] belabBERT: a Dutch RoBERTa-based language model applied to psychiatric classification

Joppe Wouts, Janna N. de Boer|arXiv (Cornell University)|2021. 06. 02.
Mental Health via Writing인용 수 4
한 줄 요약

이 논문은 정신건강 분류 향상을 위해 32GB의 네덜란드어 웹 코퍼스로 미세튜닝된 RoBERTa 기반의 네덜란드어 언어 모델인 belabBERT를 소개한다. 임상 텍스트에서 정신질환을 식별하는 데 있어 기존의 RobBERT 모델과 오디오 전용 분류 방법보다 뛰어난 성능을 보이며, 저자원 언어인 네덜란드어에 대해 대규모로 컨텍스트를 반영한 NLP의 효과성을 입증한다.

ABSTRACT

Natural language processing (NLP) is becoming an important means for automatic recognition of human traits and states, such as intoxication, presence of psychiatric disorders, presence of airway disorders and states of stress. Such applications have the potential to be an important pillar for online help lines, and may gradually be introduced into eHealth modules. However, NLP is language specific and for languages such as Dutch, NLP models are scarce. As a result, recent Dutch NLP models have a low capture of long range semantic dependencies over sentences. To overcome this, here we present belabBERT, a new Dutch language model extending the RoBERTa architecture. belabBERT is trained on a large Dutch corpus (+32 GB) of web crawled texts. We applied belabBERT to the classification of psychiatric illnesses. First, we evaluated the strength of text-based classification using belabBERT, and compared the results to the existing RobBERT model. Then, we compared the performance of belabBERT to audio classification for psychiatric disorders. Finally, a brief exploration was performed, extending the framework to a hybrid text- and audio-based classification. Our results show that belabBERT outperformed the current best text classification network for Dutch, RobBERT. belabBERT also outperformed classification based on audio alone.

연구 동기 및 목표

  • 네덜란드어에서 장거리 의미적 의존성을 잘 포착할 수 있는 고성능 NLP 모델의 부족 문제를 해결하기 위해.
  • 정신건강 텍스트 분류에 특화된 강력하고 대규모의 언어 표현 모델을 개발하기 위해.
  • belabBERT를 사용한 텍스트 기반 분류 성능을 기존 모델인 RobBERT 및 오디오 기반 분류 방법과 비교하기 위해.
  • 개선된 정신질환 탐지 성능를 위해 텍스트 기반 및 오디오 기반 분류의 융합 가능성을 탐색하기 위해.

제안 방법

  • 32GB 이상의 웹 크롤링 데이터를 포함한 대규모 네덜란드어 텍스트 코퍼스로 RoBERTa 아키텍처를 미세튜닝하였다.
  • 컨텍스트 기반 표현을 학습하기 위해 마스킹된 언어 모델링과 다음 문장 예측 미세튜닝 목표를 활용하였다.
  • 다음 작업 성능 향상을 위해 사전 훈련된 belabBERT 모델을 정신건강 분류 데이터셋으로 미세튜닝하였다.
  • 표준 평가 지표를 사용하여 텍스트 전용 작업에서 belabBERT와 RobBERT의 분류 성능을 비교하였다.
  • 동일한 정신질환 분류 작업을 위해 음성 특징을 사용한 오디오 기반 분류 모델을 평가하였다.
  • belabBERT의 텍스트 임베딩과 오디오 임베딩을 융합하여 공동 분류를 위한 하이브리드 프레임워크를 탐색하였다.

실험 결과

연구 질문

  • RQ1RobBERT와 유사한 대규모 RoBERTa 기반 언어 모델인 belabBERT가 기존 모델 대비 네덜란드어에서 정신건강 분류 성능을 향상시킬 수 있는가?
  • RQ2정신질환 탐지에 있어 belabBERT를 사용한 텍스트 기반 분류 성능는 오디오 기반 분류 성능와 비교해 어떻게 다른가?
  • RQ3텍스트 및 오디오 특징을 융합함으로써 정신질환 진단의 분류 성능 향상에 어느 정도 기여할 수 있는가?
  • RQ4더 큰, 더 다양한 네덜란드어 사전 훈련 코퍼스를 사용함으로써 정신건강 텍스트에서 장거리 의미적 이해 능력이 향상되는가?

주요 결과

  • belabBERT는 기존 최고 수준의 네덜란드어 모델인 RobBERT보다 텍스트 기반 정신건강 분류 작업에서 뛰어난 성능을 보였다.
  • belabBERT의 성능가 오디오 전용 분류 모델의 성능를 뛰어넘어, 이 작업에 있어 텍스트 특징의 강력함을 시사하였다.
  • 텍스트 및 오디오 기반 분류의 융합 프레임워크는 유망한 성과를 보였지만, 구체적인 정량적 향상은 기술되지 않았다.
  • 다양한 네덜란드어 텍스트로 대규모 사전 훈련을 통해 장거리 의미적 의존성의 포착 능력이 향상됨을 입증하였다.
  • 저자원 언어인 네덜란드어의 임상 NLP 적용 분야에서 대규모 다국어 사전 훈련의 가치를 확인하였다.
  • 이전 연구(arXiv:2008.01543)와 상당한 텍스트 중복이 발견되어, 모델 아키텍처의 점진적 발전임을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.