Skip to main content
QUICK REVIEW

[논문 리뷰] Analysing the Extent of Misinformation in Cancer Related Tweets

Rakesh Bal, Sayan Sinha|arXiv (Cornell University)|2020. 03. 30.
Misinformation and Its Impacts인용 수 5
한 줄 요약

이 논문은 20,137건의 암 관련 트윗으로 구성된 데이터셋을 제시하고, 암 원인과 치료법에 대한 오락성 정보를 탐지하기 위해 주의 기반 BiLSTM-CRF 모델을 개발한다. 연구 결과, 오락성 정보가 표면상으로 보이는 것보다 훨씬 더 광범위하게 퍼지고 있으며, 치료법 관련 트윗의 76.19%와 원인 관련 트윗의 53.32%가 오락성 정보임을 확인하였고, 기만성, 신뢰 문제, 정서적 언어와 같은 언어적 지표가 거짓 내용의 주요 지표로 나타났다.

ABSTRACT

Twitter has become one of the most sought after places to discuss a wide variety of topics, including medically relevant issues such as cancer. This helps spread awareness regarding the various causes, cures and prevention methods of cancer. However, no proper analysis has been performed, which discusses the validity of such claims. In this work, we aim to tackle the misinformation spread in such platforms. We collect and present a dataset regarding tweets which talk specifically about cancer and propose an attention-based deep learning model for automated detection of misinformation along with its spread. We then do a comparative analysis of the linguistic variation in the text corresponding to misinformation and truth. This analysis helps us gather relevant insights on various social aspects related to misinformed tweets.

연구 동기 및 목표

  • 암에 관한 소셜 미디어에서의 건강 오락성 정보 문제를 해결하기 위해, 공개 가능한 암 관련 트윗 데이터셋을 구축하기 위해.
  • 암 원인과 치료법을 다루는 의학적으로 관련 있는 트윗을 자동으로 식별하기 위한 방법을 개발하기 위해.
  • 딥 러닝과 언어적 특성 분석을 활용해 암 관련 트윗의 오락성 정보를 탐지하고 분석하기 위해.
  • 트위터에서 암 논의에서 오락성 정보와 정확한 정보를 구분하는 데에 기여하는 언어적 및 사회적 특성에 대해 연구하기 위해.

제안 방법

  • 원인, 치료법, 예방과 관련된 키워드를 사용해 트위터 스트리밍 API를 통해 29일 간 20,137건의 고유한 암 관련 트윗을 수집하였다.
  • URL, 멘션, 이모티콘 제거 및 캐멀 케이스 및 히우리스틱 기반 해시태그 분할을 통해 트윗을 전처리하였다.
  • 의학적으로 관련 있는 트윗을 특정 암 원인 또는 치료법을 언급하는 트윗으로 정의하였으며, 은유적 또는 비의학적 용도의 사용은 제외하였다.
  • 의학적으로 관련 있는 트윗에서 엔티티(원인/치료법)를 추출하기 위해 시퀀스 레이블링을 위한 주의 기반 BiLSTM-CRF 모델을 제안하였다.
  • 다양한 NLP 어휘집(LIWC, NRC, Empath)을 사용해 진술의 진실성과 비교하기 위해 총 251개의 언어적 특징을 추출하였다.
  • 통계적 T-검정을 수행하여 오락성 정보와 정확한 트윗 간의 유의미한 언어적 차이를 확인하고, 핵심 특징에 대한 오즈 오즈 비율을 보고하였다.

실험 결과

연구 질문

  • RQ1트위터에서 암 관련 트윗에 얼마나 광범위하게 오락성 정보가 퍼져 있는가, 특히 원인과 치료법에 관해?
  • RQ2오락성 정보를 담고 있는 트윗과 정확한 의학 정보를 담고 있는 트윗 간 언어적 특징은 어떻게 다를까?
  • RQ3오락성 정보의 확산 정도는 오락성 트윗의 수에 비해 어느 정도 높은가?
  • RQ4암 원인과 치료법에 대한 오락성 정보와 가장 자주 연관되는 키워드는 무엇인가?
  • RQ5주의 기반 BiLSTM-CRF 모델은 암 관련 트윗에서 오락성 정보 탐지에 얼마나 효과적인가?

주요 결과

  • 암 원인에 관한 오락성 정보는 관련 트윗의 53.32%에서 발견되었으며, 초기 수치보다 훨씬 높은 확산률을 보여, 상당한 확산 증폭이 일어났음을 시사한다.
  • 치료법 관련 콘텐츠의 경우 76.19%의 트윗이 오락성 정보였고, 이러한 트윗의 수보다 오락성 정보의 확산이 훨씬 더 높았으며, 이는 바이러스적 전파를 의미한다.
  • 주의 기반 BiLSTM-CRF 모델은 암 원인에 대한 오락성 정보 탐지에서 F1 스코어 0.6846을 기록하였고, 치료법에 대한 대체 탐지 방법을 사용할 경우 F1 스코어 0.7363을 기록하였다.
  • 오락성 정보 트윗은 기만성(오즈 오즈 비율 1.860), 신뢰 문제(1.884), 기쁨(1.287) 및 저속어(1.920)와 같은 정서적 언어를 더 자주 포함하고 있었다.
  • 진실된 트윗은 과학적 언어(-3.402), 슬픔(-1.103), 공포 및 사망 관련 어휘를 더 많이 포함하고 있어 더 임상적인 어조임을 시사한다.
  • 오락성 정보를 담은 트윗은 더 매력적(오즈 오즈 비율 3.770)이며, 뉴스 기자들의 주목을 더 많이 받는 경향(1.616)이 있어, 미디어 확산이 퍼짐의 주요 요인임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.