[논문 리뷰] Data Quality Matters: Suicide Intention Detection on Social Media Posts Using RoBERTa-CNN
이 논문은 소셜 미디어 게시물에서 자살 의도 탐지(SID)를 위한 RoBERTa-CNN 모델을 제안한다. RoBERTa의 문맥적 이해 능력과 CNN의 국소적 패턴 추출 능력을 결합하여 Suicide and Depression Detection(SDD) 데이터셋에서 평균 정확도 98%와 97.5% 이상의 AUC를 달성한다. 연구는 데이터 품질이 성능에 결정적인 영향을 미친다는 점을 강조하며, GPT 기반 정제를 통해 성능을 향상시켰다.
Suicide remains a pressing global health concern, necessitating innovative approaches for early detection and intervention. This paper focuses on identifying suicidal intentions in posts from the SuicideWatch subreddit by proposing a novel deep-learning approach that utilizes the state-of-the-art RoBERTa-CNN model. The robustly Optimized BERT Pretraining Approach (RoBERTa) excels at capturing textual nuances and forming semantic relationships within the text. The remaining Convolutional Neural Network (CNN) head enhances RoBERTa's capacity to discern critical patterns from extensive datasets. To evaluate RoBERTa-CNN, we conducted experiments on the Suicide and Depression Detection dataset, yielding promising results. For instance, RoBERTa-CNN achieves a mean accuracy of 98% with a standard deviation (STD) of 0.0009. Additionally, we found that data quality significantly impacts the training of a robust model. To improve data quality, we removed noise from the text data while preserving its contextual content through either manually cleaning or utilizing the OpenAI API.
연구 동기 및 목표
- 소셜 미디어 텍스트를 활용한 조기 자살 의도 탐지를 위한 강력한 NLP 모델 개발.
- RoBERTa를 CNN 헤드와 통합하여 패턴 인식 능력을 향상시킴으로써 기존 방법을 개선.
- 자살 탐지 작업에서 데이터 품질이 모델 성능에 미치는 영향을 조사.
- SDD 데이터셋에서 최적의 성능을 내기 위한 최적의 초모수, 특히 시퀀스 길이(Max_Len)를 규명.
- GPT 기반 데이터 정제가 모델 일반화 능력과 정확도 향상에 기여하는지 입증.
제안 방법
- 텍스트의 의미적 및 문법적 관계를 포괄하기 위해 RoBERTa를 미세조정하여 문맥 인코더로 사용.
- 국소적 언어 패턴을 추출하고 특징 학습을 향상시키기 위해 컨volutional 신경망(CNN) 헤드를 추가.
- 객관적이고 재현 가능한 평가를 보장하기 위해 5겹 교차검증을 활용한 지도 학습 설정을 사용.
- 최적의 성능를 찾기 위해 64, 128, 256 토큰으로 설정된 Max_Len에 대해 추론 실험을 수행.
- SDD 데이터셋의 전처리 및 정제를 위해 GPT API를 활용하여 학습 이전에 데이터 품질을 향상.
- 표준 NLP 평가 지표인 정확도, 정밀도, 재현율, F1 점수 및 AUC를 사용해 RoBERTa-CNN 모델을 훈련 및 평가.
실험 결과
연구 질문
- RQ1RoBERTa-CNN 모델은 소셜 미디어 텍스트에서 기존 최첨단 모델보다 자살 의도 탐지 성능을 뛰어넘을 수 있는가?
- RQ2데이터 품질은 자살 탐지 작업에서 딥 러닝 모델의 성능에 어떤 영향을 미치는가?
- RQ3SDD 데이터셋에서 RoBERTa-CNN 모델에 최적의 입력 시퀀스 길이(Max_Len)는 얼마인가?
- RQ4GPT 기반 데이터 정제는 자살 의도 탐지에서 모델의 강건성과 정확도 향상에 어느 정도 기여하는가?
- RQ5RoBERTa에 CNN을 통합함으로써 모델은 자살 게시물의 미묘한 언어적 신호 탐지 능력이 어떻게 향상되는가?
주요 결과
- RoBERTa-CNN 모델은 SDD 데이터셋에서 평균 테스트 정확도 98.00% ± 0.09%를 기록했으며, 표준편차는 0.0009에 불과했다.
- 테스트 세트에서 평균 AUC는 97.63% ± 0.13%를 기록하여 강력한 분류 성능를 입증했다.
- 추론 실험 결과, Max_Len = 256일 때 가장 높은 정확도(98.00%)와 안정적인 정밀도를 확보했다.
- 데이터 품질은 결정적인 요소로 확인되었으며, GPT 기반 정제가 모델 성능 향상에 크게 기여했다.
- 동일한 데이터셋에서 CNN-BiLSTM 및 XGBoost와 같은 경쟁 모델보다 RoBERTa-CNN이 뛰어난 성능을 보였다.
- 모델은 F1 점수 96.81% ± 0.14%와 재현율 96.64% ± 0.30%로 다양한 지표에서 뛰어난 강건성을 확보했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.