Skip to main content
QUICK REVIEW

[논문 리뷰] Combat COVID-19 Infodemic Using Explainable Natural Language Processing Models

Jackie Ayoub, X. Jessie Yang|arXiv (Cornell University)|2021. 02. 28.
Misinformation and Its Impacts참고 문헌 29인용 수 8
한 줄 요약

이 논문은 높은 정확도와 공공의 신뢰를 확보하기 위해 DistilBERT와 SHAP를 사용한 설명 가능 NLP 모델을 제안한다. 이 모델은 정제된 데이터셋에서 97.2%의 정확도를 기록했고, 공동 과제 데이터셋에서는 93.8%의 정확도를 달성하였다. 실험 조건에서 SHAP 설명은 사용자의 신뢰도와 정보 공유 의지를 크게 향상시켰다.

ABSTRACT

Misinformation of COVID-19 is prevalent on social media as the pandemic unfolds, and the associated risks are extremely high. Thus, it is critical to detect and combat such misinformation. Recently, deep learning models using natural language processing techniques, such as BERT (Bidirectional Encoder Representations from Transformers), have achieved great successes in detecting misinformation. In this paper, we proposed an explainable natural language processing model based on DistilBERT and SHAP (Shapley Additive exPlanations) to combat misinformation about COVID-19 due to their efficiency and effectiveness. First, we collected a dataset of 984 claims about COVID-19 with fact checking. By augmenting the data using back-translation, we doubled the sample size of the dataset and the DistilBERT model was able to obtain good performance (accuracy: 0.972; areas under the curve: 0.993) in detecting misinformation about COVID-19. Our model was also tested on a larger dataset for AAAI2021 - COVID-19 Fake News Detection Shared Task and obtained good performance (accuracy: 0.938; areas under the curve: 0.985). The performance on both datasets was better than traditional machine learning models. Second, in order to boost public trust in model prediction, we employed SHAP to improve model explainability, which was further evaluated using a between-subjects experiment with three conditions, i.e., text (T), text+SHAP explanation (TSE), and text+SHAP explanation+source and evidence (TSESE). The participants were significantly more likely to trust and share information related to COVID-19 in the TSE and TSESE conditions than in the T condition. Our results provided good implications in detecting misinformation about COVID-19 and improving public trust.

연구 동기 및 목표

  • 소셜 미디어에서 증가하는 코로나19 가짜 뉴스 위협에 대응하기 위해 정확하고 신뢰할 수 있는 탐지 모델을 개발하기 위해.
  • SHAP를 통한 설명 가능성 통합을 통해 자동화된 가짜 뉴스 탐지에 대한 공공의 신뢰를 향상시키기 위해.
  • 모델 설명의 영향 — 텍스트 전용, 텍스트+SHAP, 텍스트+SHAP+근거 — 이 사용자 신뢰도 및 공유 행동에 미치는 영향을 평가하기 위해.
  • 제한된 984건의 사실 확인된 진술 데이터셋을 대상으로 백트랜스레이션을 통한 데이터 증강을 통해 모델 성능을 향상시키기 위해.

제안 방법

  • 코로나19에 관한 984건의 사실 확인된 진술 데이터셋을 기반으로 DistilBERT를 미세조정하여 높은 정확도로 가짜 뉴스를 분류하기 위해.
  • 모델 일반화 능력을 향상시키기 위해 데이터 증강을 위해 백트랜스레이션을 적용하여 데이터셋 크기를 두 배로 늘림.
  • 개별 입력 토큰에 대한 예측 결정을 기여도 기반으로 설명하기 위해 SHAP(샤플리 추가 설명)를 사용하여 국소적 해석 가능성 확보.
  • 사용자 신뢰도와 공유 행동을 평가하기 위해 세 가지 조건(T, TSE, TSESE)을 가진 간접 설계 실험을 수행함: 텍스트 전용(T), 텍스트+SHAP(TSE), 텍스트+SHAP+출처 및 근거(TSESE).
  • 통계 분석을 통해 실험 조건 간 사용자 신뢰도 및 공유 의향을 비교함.
  • 모델 성능의 견고성을 확보하기 위해 AAAI2021 코로나19 가짜 뉴스 탐지 공동 과제 데이터셋에서 성능을 검증함.

실험 결과

연구 질문

  • RQ1SHAP 설명을 DistilBERT 기반의 가짜 뉴스 탐지 모델에 통합할 경우 사용자의 모델 예측에 대한 신뢰도가 유의미하게 증가하는가?
  • RQ2SHAP 설명 외에 출처와 근거를 함께 제공할 경우 사용자의 가짜 뉴스 관련 콘텐츠 공유 의향은 어떻게 변화하는가?
  • RQ3백트랜스레이션을 통한 데이터 증강이 코로나19 가짜 뉴스 탐지에서 DistilBERT 모델의 성능 향상에 기여하는가?
  • RQ4제안된 설명 가능 모델은 소규모 및 대규모 데이터셋 모두에서 기존 기계 학습 모델보다 더 효과적인가?
  • RQ5다양한 수준의 설명 세부성에 따라 참가자의 신뢰도와 공유 의도는 어떻게 변화하는가?

주요 결과

  • 데이터 증강 이후 원본 984개 진술 데이터셋에서 모델은 97.2%의 정확도와 0.993 AUC를 기록하여 높은 탐지 성능를 입증함.
  • 더 큰 AAAI2021 공동 과제 데이터셋에서 모델은 93.8%의 정확도와 0.985 AUC를 기록하여 기존 기계 학습 모델을 초월함.
  • TSE(T+SHAP) 및 TSESE(T+SHAP+출처 및 근거) 조건에 속한 참가자들은 텍스트 전용(T) 조건에 비해 유의미하게 더 높은 신뢰도와 공유 의향을 보였음.
  • TSE와 TSESE 조건 간 유의미한 차이가 없었으며, 이는 이 맥락에서 출처 및 근거 추가가 SHAP 설명 자체의 효과를 넘어선 신뢰도 향상에 기여하지는 않는다는 것을 시사함.
  • 연구는 설명 가능 AI 모델이 자동화된 가짜 뉴스 탐지 시스템에 대한 공공의 신뢰도를 유의미하게 향상시킬 수 있음을 확인함.
  • 참가자들은 때로 SHAP 설명을 해석하는 데 어려움을 느꼈으며, 향후 연구에서는 더 직관적인 설명 인터페이스가 필요함을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.