Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Fusion with BERT and Attention Mechanism for Fake News Detection

Nguyễn Mạnh Tuấn, Phạm Quang Minh|arXiv (Cornell University)|2021. 04. 23.
Misinformation and Its Impacts인용 수 4
한 줄 요약

이 논문은 BERTweet에서 유도된 텍스트 특징과 VGG-19에서 추출한 시각적 특징을 새로운 스케일된 디트-곱 주의 메커니즘을 사용해 융합하여 다중모달 관계를 포착하는 멀티모달 위조 뉴스 탐지 모델을 제안한다. 이 방법은 MediaEval 2016 데이터셋에서 81.2%의 정확도와 80.8%의 F1 스코어를 기록했으며, 최신 기술 대비 정확도 3.1% 향상과 매크로-F1 4.4% 향상을 달성했다.

ABSTRACT

Fake news detection is an important task for increasing the credibility of information on the media since fake news is constantly spreading on social media every day and it is a very serious concern in our society. Fake news is usually created by manipulating images, texts, and videos. In this paper, we present a novel method for detecting fake news by fusing multimodal features derived from textual and visual data. Specifically, we used a pre-trained BERT model to learn text features and a VGG-19 model pre-trained on the ImageNet dataset to extract image features. We proposed a scale-dot product attention mechanism to capture the relationship between text features and visual features. Experimental results showed that our approach performs better than the current state-of-the-art method on a public Twitter dataset by 3.1% accuracy.

연구 동기 및 목표

  • 소셜 미디어를 통한 위성 뉴스 확산의 증가하는 사회적 위협을 해결하기 위해 다중모달 데이터를 활용해 탐지 정확도를 향상시키는 것.
  • 위성 뉴스에서 상보적인 신호를 포착하기 위해 텍스트 및 시각적 특징을 융합함으로써 단모달 접근법의 한계를 극복하는 것.
  • 텍스트와 이미지 간의 다중모달 의존성을 모델링하기 위해 새로운 스케일된 디트-곱 주의 메커니즘을 도입하여 특징 융합을 향상시키는 것.
  • 트위터 텍스트에 특화된 사전학습을 통해 일반 도메인 BERT 모델보다 BERTweet의 우수성을 입증함으로써 소셜 미디어 텍스트에 적합한 사전학습의 이점을 입수하는 것.
  • 주의 메커니즘이 위성 뉴스의 텍스트와 이미지 콘텐츠 간의 모순을 식별하는 데 효과적인지 검증하는 것.

제안 방법

  • 850M개의 영어 트윗으로 미세조정된 BERTweet(비슷한 BERT의 변종)을 사용하여 텍스트 콘텐츠에서 문맥 기반 문장 임베딩을 추출한다.
  • ImageNet으로 미세조정된 사전학습된 VGG-19 모델에서 고수준의 이미지 표현을 포착하기 위해 시각적 특징을 추출한다.
  • 텍스트 및 시각적 특징 간의 동적 주의 가중치를 계산하기 위해 스케일된 디트-곱 주의 메커니즘을 구현하여 적응적 융합을 가능하게 한다.
  • 이미지 특징에 대해 자체 주의(self-attention)를 적용하여 내부 공간적 관계를 모델링하고 시각적 표현 학습을 향상시킨다.
  • 다중모달 주의와 자체 주의의 출력을 원본 텍스트 및 시각적 특징과 연결하여 최종 분류를 위한 특징 표현을 생성한다.
  • 융합된 특징 표현을 전결합층을 거친 후 시그모이드 활성화 함수를 적용하여 이진 위성 뉴스 분류를 수행한다.

실험 결과

연구 질문

  • RQ1BERT 기반 텍스트 임베딩과 VGG-19 기반 이미지 특징을 융합한 다중모달 접근법이 단모달 모델 대비 위성 뉴스 탐지 정확도를 향상시킬 수 있는가?
  • RQ2새로운 스케일된 디트-곱 주의 메커니즘이 위성 뉴스의 텍스트와 이미지 콘텐츠 간의 다중모달 의존성을 효과적으로 포착하는가?
  • RQ3소셜 미디어 데이터로 사전학습된 BERTweet는 일반 도메인 BERT 모델 대비 트위터 데이터셋에서 위성 뉴스 탐지에 얼마나 우수한가?
  • RQ4주의 히트맵은 위성 뉴스에서 텍스트와 이미지 콘텐츠 간의 모순을 어느 정도 시각적으로 드러내며, 이러한 모순은 탐지 성능과 정량적으로 연관될 수 있는가?
  • RQ5이미지 특징에 대한 자체 주의가 위성 뉴스에서 이미지 편집 또는 오용을 탐지하는 데 모델의 능력을 향상시키는가?

주요 결과

  • 제안된 모델은 MediaEval 2016 데이터셋에서 81.2%의 정확도와 80.8%의 F1 스코어를 기록했으며, 이는 이전 최신 기술인 Spotfake 대비 정확도 3.1% 향상과 매크로-F1 4.4% 향상이다.
  • BERTweet는 동일한 데이터셋에서 BERT base 및 BERT large보다 우수한 성능을 보였으며, 81.2%의 정확도를 기록함으로써 소셜 미디어 텍스트에 특화된 사전학습의 이점이 있음을 입증했다.
  • 주의 히트맵은 위성 뉴스 이미지에서 지역 간 주의 상관관계가 낮음을 시각적으로 입증했으며, 이는 편집 또는 관련 없는 이미지-텍스트 조합을 시사했고, 진짜 뉴스는 일관된 다중모달 주의 패턴을 보였다.
  • 모델의 자체 주의 메커니즘은 공간적 관계를 효과적으로 포착하여 편집되지 않은 그러나 맥락적으로 오해의 소지가 있는 이미지를 탐지하는 데 기여했다.
  • 제거 실험(ablation study)는 다중모달 주의와 자체 주의의 조합이 성능 향상에 크게 기여했음을 확인했으며, 전체 모델은 EANN, MVAE, att-RNN를 포함한 모든 베이스라인을 능가했다.
  • 위성 뉴스에 대해 정밀도 84.3%와 재현율 81.0%를 기록했으며, F1 스코어 76.7%를 확보하여 위장 콘텐츠를 식별하는 데 강력한 일반화 및 강인성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.