[논문 리뷰] Benchmarking for Public Health Surveillance tasks on Social Media with a Domain-Specific Pretrained Language Model
이 논문은 공중보건 감시(PHS) 작업을 햖을 때 성능을 햖을 때 성능을 향상시키기 위해 건강 관련 소셜 미디어 텍스트로 미세조정된 도메인 특화 사전 훈련된 언어 모델인 PHS-BERT를 소개한다. 다양한 플랫폼에서 수집한 사용자 생성 콘텐츠를 기반으로 훈련된 PHS-BERT는 7개의 PHS 작업을 포함하는 25개 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 자살 생각 태스크에서 일반 및 생물의학적 PLM보다 최대 18.45% 높은 성능을 기록했고, 평균적으로 11.82% 향상된 성능을 보였다.
A user-generated text on social media enables health workers to keep track of information, identify possible outbreaks, forecast disease trends, monitor emergency cases, and ascertain disease awareness and response to official health correspondence. This exchange of health information on social media has been regarded as an attempt to enhance public health surveillance (PHS). Despite its potential, the technology is still in its early stages and is not ready for widespread application. Advancements in pretrained language models (PLMs) have facilitated the development of several domain-specific PLMs and a variety of downstream applications. However, there are no PLMs for social media tasks involving PHS. We present and release PHS-BERT, a transformer-based PLM, to identify tasks related to public health surveillance on social media. We compared and benchmarked the performance of PHS-BERT on 25 datasets from different social medial platforms related to 7 different PHS tasks. Compared with existing PLMs that are mainly evaluated on limited tasks, PHS-BERT achieved state-of-the-art performance on all 25 tested datasets, showing that our PLM is robust and generalizable in the common PHS tasks. By making PHS-BERT available, we aim to facilitate the community to reduce the computational cost and introduce new baselines for future works across various PHS-related tasks.
연구 동기 및 목표
- 소셜 미디어에서 공중보건 감시(PHS) 작업을 위한 도메인 특화 사전 훈련된 언어 모델(PLM)의 부족을 해결하기 위해.
- 소셜 미디어 플랫폼에서의 건강 관련 사용자 생성 콘텐츠에 특화하여 훈련된 강력하고 일반화 능력이 뛰어난 PLM을 개발하기 위해.
- 기존 최신 기술 수준(SOTA) 모델들과의 비교를 통해 제안된 모델의 성능을 다양한 PHS 작업과 데이터셋에서 평가하여 그 우월성을 입증하기 위해.
- 계산 비용을 줄이고 향후 PHS 관련 NLP 작업의 새로운 기준을 설정하기 위해 PHS-BERT를 공개적으로 배포하기 위해.
제안 방법
- 다양한 플랫폼에서 수집한 정제된 건강 관련 소셜 미디어 텍스트로 구성된 대규모 코퍼스를 기반으로 트랜스포머 기반 BERT 모델을 사전 훈련하기 위해.
- 7개의 다른 PHS 작업을 포함한 다양한 분류 데이터셋 25개에 대해 사전 훈련된 PHS-BERT 모델을 미세조정하기 위해.
- 표준 NLP 미세조정 프로토콜을 사용하여 교차 엔트로피 손실과 조기 정지 기법을 적용하여 각 작업에서 최적의 성능을 달성하기 위해.
- 모든 25개 데이터셋에서 BERT, BioBERT, BERTweet, CT-BERT, MentalBERT와 같은 여러 최신 기술 수준의 PLM과의 성능 비교를 수행하기 위해.
- 일致하고 신뢰할 수 있는 벤치마킹을 보장하기 위해 F1 점수, 정밀도, 재현율, 정확도와 같은 표준 평가 지표를 사용하기 위해.
- 재현성과 커뮤니티 수용을 보장하기 위해 Hugging Face에 훈련된 PHS-BERT 모델을 배포하기 위해.
실험 결과
연구 질문
- RQ1건강 관련 소셜 미디어 텍스트로 훈련된 도메인 특화 PLM이 일반 및 생물의학적 PLM보다 공중보건 감시 작업에서 뛰어난 성능을 보일 수 있는가?
- RQ2PHS-BERT는 우울증 탐지, 백신 태도 분석, 유행병 감시와 같은 다양한 소셜 미디어 플랫폼과 PHS 작업에 대해 얼마나 일반화 가능한가?
- RQ3여러 데이터셋과 작업에서 기존 최신 기술 수준 모델인 BERT, CT-BERT, BioBERT에 비해 PHS-BERT는 얼마나 높은 성능 향상을 보이는가?
- RQ4일반적이거나 생물의학적 사전 훈련과 비교했을 때 도메인 특화 소셜 미디어 데이터로 사전 훈련하는 것이 하류 분류 성능 향상에 얼마나 기여하는가?
- RQ5PHS-BERT는 급성(예: 유행병) 및 만성(예: 정신 건강) 상태를 포함한 다양한 유형의 PHS 작업에서 뛰어난 성능을 유지하는가?
주요 결과
- PHS-BERT는 7개의 다른 공중보건 감시 작업을 포함하는 25개의 테스트 데이터셋에서 최신 기술 수준 성능을 달성하여 그 강력성과 일반화 능력을 입증하였다.
- 자살 생각 태스크에서 PHS-BERT는 BERT 대비 F1 점수를 18.45% 향상시켰고, 두 번째로 우수한 모델 대비 12.79% 향상되었다.
- 우울증 탐지 태스크에서 PHS-BERT는 BERT 대비 평균 F1 점수를 6.03% 향상시켰고, 두 번째로 뛰어난 모델 대비 2.76% 향상되었다.
- 백신 태도 분석 태스크에서 PHS-BERT는 모든 기준 모델을 초월하여 BERT 대비 평균 F1 점수를 7.70% 향상시켰고, 두 번째로 뛰어난 모델 대비 0.34% 향상되었다.
- 모든 태스크 평균적으로 PHS-BERT는 BERT 대비 F1 점수를 11.82% 높게 기록했고, 두 번째로 뛰어난 모델 대비 4.71% 향상되었다.
- PHS-BERT는 CT-BERT와 MentalBERT와 같은 도메인 특화 모델들보다 여러 태스크에서 뛰어난 성능을 보여, 목적에 맞게 설계된 건강 중심의 소셜 미디어 코퍼스로 훈련하는 데서 유의미한 이점이 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.