Skip to main content
QUICK REVIEW

[논문 리뷰] Fake news detection using parallel BERT deep neural networks

Mahmood Farokhian, Vahid Rafe|arXiv (Cornell University)|2022. 04. 10.
Misinformation and Its Impacts인용 수 7
한 줄 요약

이 논문은 뉴스 헤드라인과 사실 확인이 가능한 본문을 별도로 분석하기 위해 두 개의 별도 BERT 네트워크를 사용하는 병렬 BERT 기반 딥러닝 모델인 MWPBert를 제안한다. 장문의 뉴스 본문에서 가장 관련성이 높은 부분을 추출하기 위해 MaxWorth 알고리즘을 적용함으로써, 모델은 가짜 뉴스 탐지 정확도를 향상시켜 다양한 평가 지표에서 이전 방법들을 능가한다.

ABSTRACT

Fake news is a growing challenge for social networks and media. Detection of fake news always has been a problem for many years, but after the evolution of social networks and increasing speed of news dissemination in recent years has been considered again. There are several approaches to solving this problem, one of which is to detect fake news based on its text style using deep neural networks. In recent years, one of the most used forms of deep neural networks for natural language processing is transfer learning with transformers. BERT is one of the most promising transformers who outperforms other models in many NLP benchmarks. This article, we introduce MWPBert, which uses two parallel BERT networks to perform veracity detection on full-text news articles. One of the BERT networks encodes news headline, and another encodes news body. Since the input length of the BERT network is limited and constant and the news body is usually a long text, we cannot fed the whole news text into the BERT. Therefore, using the MaxWorth algorithm, we selected the part of the news text that is more valuable for fact-checking, and fed it into the BERT network. Finally, we encode the output of the two BERT networks to an output network to classify the news. The experiment results showed that the proposed model outperformed previous models in terms of accuracy and other performance measures.

연구 동기 및 목표

  • 소셜 미디어 플랫폼에서의 가짜 뉴스 유포 증가 문제를 다루기 위해.
  • 헤드라인과 본문 양쪽에 BERT 모델의 맥락적 이해 능력을 활용하여 가짜 뉴스 탐지 성능을 향상시키기 위해.
  • 장문의 뉴스 기사에 대해 BERT의 입력 길이 제한을 극복하기 위해 지능적인 텍스트 요약 기법을 적용하기 위해.
  • 헤드라인과 본문에 대한 병렬 BERT 인코더의 표현을 융합함으로써 분류 성능을 향상시키기 위해.
  • 기존 딥러닝 모델들과 비교해 더 높은 정확도와 강건성을 보여주기 위해.

제안 방법

  • 두 개의 병렬 BERT 네트워크를 사용한다: 하나는 뉴스 헤드라인을 인코딩하고, 다른 하나는 선택된 본문 텍스트를 인코딩한다.
  • MaxWorth 알고리즘이 장문의 뉴스 본문에서 가장 사실적으로 관련성이 높은 세그먼트를 식별하고 추출하여 BERT의 입력 길이 제약를 충족시킨다.
  • 두 BERT 인코더의 출력 표현을 연결하여 최종 분류 헤드로 전달한다.
  • 모델은 레이블이 부여된 뉴스 기사 데이터셋에서 엔드 투 엔드로 미세조정되어 진위 예측 최적화를 위해 사용된다.
  • 입력 텍스트는 토큰화되고, BERT의 최대 시퀀스 길이(512 토큰)에 맞게 패딩되며, MaxWorth는 고가치 콘텐츠가 유지되도록 보장한다.
  • 최종 분류 레이어는 가짜 또는 진짜 뉴스에 대한 확률 점수를 출력한다.

실험 결과

연구 질문

  • RQ1헤드라인과 본문을 별도로 모델링하는 이중 분지 BERT 아키텍처가 가짜 뉴스 탐지 성능을 향상시킬 수 있는가?
  • RQ2MaxWorth 알고리즘이 BERT 입력에 적합한 장문의 뉴스 기사에서 가장 관련성이 높은 부분을 선택하는 데 얼마나 효과적인가?
  • RQ3병렬 BERT 인코더의 표현을 융합하는 것이 단일 분지 모델보다 더 나은 성능을 내는가?
  • RQ4MWPBert는 정확도와 F1 점수 측면에서 기존 최신 기술 수준의 모델들과 비교해 어떻게 성능을 내는가?
  • RQ5BERT의 시퀀스 길이 제한 내에서 장기 뉴스 콘텐츠를 처리할 때 모델이 높은 성능을 유지할 수 있는가?

주요 결과

  • 연구에서 사용된 벤치마크 데이터셋에서 MWPBert는 이전 모델들보다 더 높은 정확도를 달성했다.
  • 모델은 F1 점수와 AUC를 포함한 다양한 평가 지표에서 뛰어난 성능을 보였다.
  • MaxWorth를 사용해 핵심 본문 세그먼트를 추출함으로써, 전체 또는 무작위로 샘플된 텍스트를 사용한 경우보다 모델 성능이 크게 향상되었다.
  • 헤드라인과 본문을 별도로 인코딩하는 병렬 아키텍처는 단일 인코더 접근 방식보다 더 나은 표현 학습을 이끌어냈다.
  • 정밀도와 재현율 모두에서 기존 BERT 기반 베이스라인 모델들을 능가함으로써, 강건한 일반화 능력을 보였다.
  • 제거 실험을 통해 헤드라인 및 본문 인코더 양쪽 모두가 최종 예측에 의미 있는 기여를 하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.