Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrapping Multi-view Representations for Fake News Detection

Qichao Ying, Xiaoxiao Hu|arXiv (Cornell University)|2022. 06. 12.
Misinformation and Its Impacts인용 수 5
한 줄 요약

이 논문은 텍스트, 이미지 패턴, 이미지 의미 표현을 추출하고, 개선된 다중 게이트 혼합 전문가(iMMoE)를 통해 이를 정제하며, 단일 시각 예측과 다중 모odal 일致성에 기반해 표현을 적응적으로 재가중하는 새로운 가짜 뉴스 탐지 프레임워크인 부트스트랩 다중 시각 표현(BMR)을 제안한다. BMR는 Weibo에서 91.8%의 정확도와 90.4%의 F1 점수를 기록하며 최신 기술 수준(SOTA)을 달성하였으며, 학습된 재가중 메커니즘을 통해 해석 가능한 특징 중요도를 제공한다.

ABSTRACT

Previous researches on multimedia fake news detection include a series of complex feature extraction and fusion networks to gather useful information from the news. However, how cross-modal consistency relates to the fidelity of news and how features from different modalities affect the decision-making are still open questions. This paper presents a novel scheme of Bootstrapping Multi-view Representations (BMR) for fake news detection. Given a multi-modal news, we extract representations respectively from the views of the text, the image pattern and the image semantics. Improved Multi-gate Mixture-of-Expert networks (iMMoE) are proposed for feature refinement and fusion. Representations from each view are separately used to coarsely predict the fidelity of the whole news, and the multimodal representations are able to predict the cross-modal consistency. With the prediction scores, we reweigh each view of the representations and bootstrap them for fake news detection. Extensive experiments conducted on typical fake news detection datasets prove that the proposed BMR outperforms state-of-the-art schemes.

연구 동기 및 목표

  • 기존의 다중 모달 가짜 뉴스 탐지 방법에서의 해석 가능성 부족과 특징 분리 불량 문제를 해결하기 위해.
  • 단모달(T, IP, IS)과 다중 모달 표현이 가짜 뉴스 탐지에 미치는 개별적 및 통합적 역할을 조사하기 위해.
  • 각 표현의 예측 신뢰도와 다중 모달 일치성을 기반으로 다중 시각 특징을 적응적으로 재가중하여 탐지 성능을 향상시키기 위해.
  • 최종 결정에 가장 기여하는 모달리티가 무엇인지 이해할 수 있는 투명한 메커니즘을 제공하여 모델의 해석 가능성 향상시키기 위해.

제안 방법

  • 사전 훈련된 인코더를 사용하여 뉴스 항목으로부터 텍스트(T), 이미지 패턴(IP), 이미지 의미(IS)라는 세 가지 별개의 표현을 추출한다.
  • 모달리티 특이 정보를 유지하면서 다중 시각 표현을 공동으로 정제하고 융합하기 위해 개선된 다중 게이트 혼합 전문가(iMMoE) 네트워크를 활용한다.
  • 각 모달리티의 거친 신뢰도 점수를 생성하기 위해 단일 시각 예측 헤드를 사용하며, 이를 바탕으로 표현에 대한 적응적 재가중 계수를 계산한다.
  • 다양한 모달리티 간의 정렬을 학습하기 위해 전용의 다중 모달 일치(CC) 헤드를 도입하며, 이는 최종 결정을 지배하지는 않지만 다중 모달 표현 정제를 안내한다.
  • 단일 시각 예측 및 일치 예측의 신뢰도 점수를 반복적으로 사용하여 표현을 재가중하고 재정제하는 부트스트랩 기반 메커니즘을 적용한다.
  • 이미지 표현의 사전 훈련을 위해 마스킹 오토인코더(MAE)를 활용하고, 특징 정제를 위해 비전 트랜스포머(ViT) 블록을 통합하며, 설계 선택 사항을 검증하기 위해 분석 연구를 실시한다.

실험 결과

연구 질문

  • RQ1단일 모달 표현(T, IP, IS)이 가짜 뉴스 탐지에 어떻게 기여하는가? 그 중요도는 정량적으로 측정할 수 있는가?
  • RQ2다중 모달 일치가 다중 모달 가짜 뉴스 탐지에서 어떤 역할을 하는가? 주요 신호인지, 보조 제약 조건인지 여부는 무엇인가?
  • RQ3단일 시각 예측 신뢰도에 기반해 다중 시각 표현을 적응적으로 재가중하는 것이 탐지 성능 향상에 기여하는가?
  • RQ4개별 예측 헤드와 일치 학습을 통해 단모달 및 다중 모달 특징를 분리함으로써 모델의 강건성과 해석 가능성은 어느 정도 향상되는가?

주요 결과

  • BMR는 Weibo 데이터셋에서 91.8%의 정확도와 90.4%의 F1 점수를 기록하며 최신 기술 수준의 방법들보다 유의미한 성능 향상을 달성했다.
  • 분석 연구 결과, 단일 시각 예측을 제거할 경우 정확도가 2.3% 감소하여, 이는 정규화된 편향으로서의 유용성을 확인한다.
  • 다중 모달 일치 학습을 비활성화할 경우 성능이 1.3% 감소하여, 이는 일치 학습이 도움이 되지만 필수적인 역할은 아니라는 점을 시사한다.
  • 학습된 재가중 함수는 역방향 'V'자형 패턴을 보이며, 이는 모델이 일관성 점수가 약 0.5에 가까운 모호한 표현을 억제하는 방식으로 학습하고 있음을 시사한다.
  • MAE를 ViT로 대체할 경우 정확도가 0.8% 감소하여, 이는 이 작업에서 MAE가 표현 학습에 더 뛰어난 성능을 보임을 입증한다.
  • iMMoE를 사용할 경우 별도의 ViT 블록을 사용하는 것보다 성능이 1.3% 향상되어, 파라미터 공유와 공동 특징 학습의 이점이 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.