[논문 리뷰] VaccineLies: A Natural Language Resource for Learning to Recognize Misinformation about the COVID-19 and HPV Vaccines
이 논문은 트위터에서 코로나19 및 HPV 백신 오보에 대해 텍스트, 오보 대상(MisTs), 그리고 태도 주석을 포함하는 대규모 자연어 처리 자료인 VaccineLies를 소개한다. 이 자료는 오보 탐지 및 태도 식별을 위한 지도 학습을 가능하게 하며, 교차 백신 전이 학습에서 사전 훈련 및 미세조정을 통해 코로나19 태도 탐지에서 F1 점수 84.0, HPV 태도 탐지에서 F1 점수 94.5의 최신 기술 수준을 달성한다.
Billions of COVID-19 vaccines have been administered, but many remain hesitant. Misinformation about the COVID-19 vaccines and other vaccines, propagating on social media, is believed to drive hesitancy towards vaccination. The ability to automatically recognize misinformation targeting vaccines on Twitter depends on the availability of data resources. In this paper we present VaccineLies, a large collection of tweets propagating misinformation about two vaccines: the COVID-19 vaccines and the Human Papillomavirus (HPV) vaccines. Misinformation targets are organized in vaccine-specific taxonomies, which reveal the misinformation themes and concerns. The ontological commitments of the Misinformation taxonomies provide an understanding of which misinformation themes and concerns dominate the discourse about the two vaccines covered in VaccineLies. The organization into training, testing and development sets of VaccineLies invites the development of novel supervised methods for detecting misinformation on Twitter and identifying the stance towards it. Furthermore, VaccineLies can be a stepping stone for the development of datasets focusing on misinformation targeting additional vaccines.
연구 동기 및 목표
- 소셜 미디어에서 백신 오보를 탐지하기 위한 주석이 부여된 데이터셋, 특히 코로나19 및 HPV 백신에 대한 부족함을 보완하기 위해.
- 백신 관련 논의에서 반복적으로 나타나는 주제와 우려를 포괄하는 오보 대상(MisTs)의 체계적 분류 체계를 개발하기 위해.
- 각각의 오보 대상(MisT)을 유발하는 트윗 1,000건 이상을 수집하고, 언어 전문가의 검증을 통해 언어 전문가가 확인한 태도 레이블(수용, 기각, 태도 없음)을 각 트윗에 주석 처리하기 위해.
- 교차 백신 오보 탐지 및 태도 식별을 위한 훈련, 검증, 테스트 분할을 제공함으로써 백신 간 전이 학습을 가능하게 하기 위해.
- 공중보건 개입을 지원하기 위해 대규모로 오보를 식별하고 시정할 수 있도록 NLP 모델을 가능하게 하기 위해.
제안 방법
- 위키백과에서 널리 논의되는 오해를 채굴하고, 바이럴 트위터 대화를 분석하는 이중 접근 방식을 통해 MisTs를 식별하였다.
- 백신에 특화된 MisTs 분류 체계를 구축하여, DNA 변경 또는 백신 금지와 같은 주제 및 우려에 따라 오보를 분류하였다.
- 최소한 하나의 MisT를 유발하는 1,000건 이상의 트윗 ID를 각 백신별로 수집하고, 언어 전문가의 검증을 통해 정제하였다.
- 전문가가 검증한 레이블링을 사용하여 각 트윗을 유발된 MisT에 대해 수용, 기각, 또는 태도 없음으로 태도 주석을 하였다.
- 클래식, 제로샷, 공동 훈련, 사전 훈련/미세조정의 네 가지 전이 학습 시나리오에서 BERT 기반 모델(BERT-VMED 및 BERT-VMSI)을 훈련하고 평가하였다.
- CoVaxLies(코로나19) 및 HpVaxLies(HPV)의 별도 테스트 세트에서 정밀도, 재현율, F1 점수를 사용해 성능을 평가하였다.
실험 결과
연구 질문
- RQ1트위터에서 코로나19 및 HPV 백신을 대상으로 하는 오보의 주요 주제와 우려는 무엇인가?
- RQ2새로운 백신에 대해 훈련 데이터가 부족할 경우, 전이 학습이 오보 탐지에 얼마나 효과적인가?
- RQ3한 백신에서 훈련된 태도 탐지 모델이 다른 백신으로 일반화 가능한가? 그리고 다양한 전이 학습 시나리오에서 성능은 어떻게 변하는가?
- RQ4BERT 기반 모델이 VaccineLies 데이터셋을 사용하여 오보 유발과 저자 태도 식별에 얼마나 잘 성능을 내는가?
- RQ5사전 훈련, 미세조정, 공동 훈련과 같은 다양한 훈련 전략은 오보 탐지 및 태도 분류에 어떤 영향을 미치는가?
주요 결과
- 사전 훈련 시나리오에서 HPV 백신 데이터셋(HpVaxLies)에서 태도 식별에 대해 F1 점수 94.5를 기록하여 다른 전이 학습 전략보다 뛰어난 성능을 보였다.
- 오보 탐지에서 사전 훈련 접근 방식은 CoVaxLies에서 F1 점수 91.7, HpVaxLies에서 F1 점수 94.5를 기록하여 강력한 교차 백신 일반화 능력을 보였다.
- 제로샷 전이 학습 시나리오는 경쟁력 있는 성능을 기록하였으며, 태도 식별에서 CoVaxLies에서 F1 점수 73.5, HpVaxLies에서 F1 점수 74.6를 기록하여 목표 도메인 데이터 없이도 타당한 성능을 보였다.
- 양 백신에서 공동 훈련을 통해 HpVaxLies의 성능은 향상되었지만 CoVaxLies에서는 향상되지 않아, 백신 간 오보 패tern의 비대칭성이 존재함을 시사했다.
- 사전 훈련 시나리오에서 BERT-VMSI 모델은 CoVaxLies에서 매크로 F1 점수 84.0, HpVaxLies에서 매크로 F1 점수 83.6을 기록하여 태도 식별에서 뛰어난 성능을 보였다.
- 데이터셋의 분류 체계는 명백한 오보 주제의 차이를 드러내었다: 코로나19의 경우 mRNA가 DNA를 변경한다는 우려가 두드러졌고, HPV의 경우 백신 금지나 기업의 이득에 대한 음모론이 흔했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.