Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering Mental Health Research Topics with Topic Modeling

Xin Gao, Cem Sazara|arXiv (Cornell University)|2023. 08. 25.
Mental Health via WritingPsychology인용 수 3
한 줄 요약

이 연구는 2010~2023년 동안의 정신건강 연구 논문 96,676편에 대해 미세조정된 BERTopic 모델을 적용하여 변화하는 연구 주제와 추세를 규명한다. BERT 기반 임bedding과 주제 모델링을 사용하여 LDA-BERT와 Top2Vec보다 더 높은 일관성과 다양성 지표를 확보하였으며, 자살, 약물 남용, 자폐 스펙트럼 장애 등의 핵심 주제를 드러냈다. 또한 GPT-3.5-turbo 기반 분석을 통해 기계학습 기법의 추세가 딥러닝과 NLP로 이동하고 있음을 확인하였다.

ABSTRACT

Mental health significantly influences various aspects of our daily lives, and its importance has been increasingly recognized by the research community and the general public, particularly in the wake of the COVID-19 pandemic. This heightened interest is evident in the growing number of publications dedicated to mental health in the past decade. In this study, our goal is to identify general trends in the field and pinpoint high-impact research topics by analyzing a large dataset of mental health research papers. To accomplish this, we collected abstracts from various databases and trained a customized Sentence-BERT based embedding model leveraging the BERTopic framework. Our dataset comprises 96,676 research papers pertaining to mental health, enabling us to examine the relationships between different topics using their abstracts. To evaluate the effectiveness of the model, we compared it against two other state-of-the-art methods: Top2Vec model and LDA-BERT model. The model demonstrated superior performance in metrics that measure topic diversity and coherence. To enhance our analysis, we also generated word clouds to provide a comprehensive overview of the machine learning models applied in mental health research, shedding light on commonly utilized techniques and emerging trends. Furthermore, we provide a GitHub link* to the dataset used in this paper, ensuring its accessibility for further research endeavors.

연구 동기 및 목표

  • 최근 10년간 정신건강 연구 분야에서 변화하는 주제를 규명하고, 특히 코로나19 패an데믹에 대응하여 변화하는 주제를 분석하는 것.
  • 정신건강 연구 논문 초록에 대해 고급 주제 모델링 기법인 BERTopic, LDA-BERT, Top2Vec의 성능을 평가하는 것.
  • LLM 기반 추출 및 시각화를 통해 정신건강 연구에서 사용되는 주요 기계학습 기법을 규명하고, 그 추세를 분석하는 것.
  • 향후 계산 정신건강 분야 연구를 지원하기 위해 공개된 데이터셋과 모델을 제공하는 것.

제안 방법

  • 2010년 1월부터 2023년 3월까지 arXiv, ACM, bioRxiv, medRxiv, PubMed에서 수집한 초록을 바탕으로 총 96,676편의 정신건강 연구 논문 데이터셋을 구축하였다.
  • BERTopic 프레임워크 내에서 커스터마이징된 Sentence-BERT 기반 임bedding 모델을 훈련하여 맥락 기반 문서 임베딩을 생성하고, 이를 의미적으로 일관된 주제로 군집화하였다.
  • 다양한 지표를 사용해 주제 품질을 평가: NPMI(정규화된 포인트와이즈 상호정보량), Cv(주제 일관성 계수), TD(주제 다양성), Inv. RBO(역전된 순위-편향된 오버랩).
  • 동일한 평가 지표를 사용해 BERTopic의 성능을 LDA-BERT와 Top2Vec라는 두 가지 최첨단 기준 모델과 비교하였다.
  • GPT-3.5-turbo API 프롬프트를 활용해 논문에 언급된 기계학습 기법을 추출하고 분류하여 시간에 따른 추세 분석을 수행하였다.
  • 기계학습 모델의 빈도와 두드러짐을 시각적으로 표현하기 위해 워드 클라우드를 생성하였으며, 기존 기계학습에서 딥러닝으로의 전환을 강조하였다.
Figure 1: 2D UMAP Visualization of BERTopic Clusters
Figure 1: 2D UMAP Visualization of BERTopic Clusters

실험 결과

연구 질문

  • RQ12010년부터 2023년까지 정신건강 연구에서 지배적이고 새로운 주제는 무엇이며, 특히 코로나19 패안데믹 기간 및 이후에 어떻게 변화했는가?
  • RQ2정신건강 연구 논문에 적용했을 때 BERTopic이 LDA-BERT와 Top2Vec보다 주제 일관성, 다양성, 해석 가능성 측면에서 어떻게 우수한가?
  • RQ3정신건강 연구에서 기계학습 방법론에 나타나는 추세는 무엇이며, 시간이 지남에 따라 어떻게 변화해 왔는가?
  • RQ4주제 모델링 결과에서 가장 두드러진 임상 및 심리사회적 주제는 무엇이며, 연구 우선순위에 대한 통찰을 제공하는가?

주요 결과

  • BERTopic은 주제 다양성(TD 점수 0.7208)과 주제 일관성(Cv 점수 0.8068)에서 LDA-BERT와 Top2Vec를 모두 앞서며, 더 높은 품질의 해석 가능한 주제를 생성함을 시사한다.
  • BERTopic 모델은 각 주제의 단어들 간 강한 의미 일관성을 반영하는 정규화된 포인트와이즈 상호정보량(NPMI) 점수 0.2892를 기록하였다.
  • Top2Vec는 가장 높은 Inv. RBO 점수(0.9669)를 기록하여 단어 순서 유사성과 다양성이 뛰어나지만, BERTopic가 종합적인 일관성과 해석 가능성에서 승승을 거두었다.
  • 주제 모델링을 통해 자살(예: '자살', '의도', '도전'), 약물 남용(담배, 대마, 옅포이드), 자폐 스펙트럼 장애에서의 부모-자녀 관계 등의 핵심 주제가 드러났다.
  • GPT-3.5-turbo로 추출한 기계학습 기법을 기반으로 생성한 워드 클라우드는 2017년 이전에는 전통적 기계학습에서 2017년 이후에는 신경망, NLP, 컴퓨터 비전, 강화 학습으로의 명확한 전환을 보였다.
  • 연구는 GitHub(https://github.com/stella-gao/Mental-Health-Research-Paper-Dataset)를 통해 공개된 데이터셋과 모델을 제공하여 재현성과 향후 연구를 지원한다.
Figure 2: Word Scores of Top 8 Topics from BERTopic
Figure 2: Word Scores of Top 8 Topics from BERTopic

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.