[논문 리뷰] Multimodal Fake News Detection via CLIP-Guided Learning
이 논문은 텍스트와 이미지 표현의 융합을 향상시키기 위해 CLIP 유도 특징 학습과 모odal 별 주의 메커니즘을 활용하는 다중모态 가짜 뉴스 탐지 프레임워크인 FND-CLIP을 제안한다. CLIP가 생성한 이질적 유사도와 BERT/ResNet 특징을 통합함으로써 Weibo, Politifact, GossipCop에서 각각 0.7%, 6.8%, 1.3%의 정확도 향상을 기록하며 최신 기술 수준을 달성한다.
Multimodal fake news detection has attracted many research interests in social forensics. Many existing approaches introduce tailored attention mechanisms to guide the fusion of unimodal features. However, how the similarity of these features is calculated and how it will affect the decision-making process in FND are still open questions. Besides, the potential of pretrained multi-modal feature learning models in fake news detection has not been well exploited. This paper proposes a FND-CLIP framework, i.e., a multimodal Fake News Detection network based on Contrastive Language-Image Pretraining (CLIP). Given a targeted multimodal news, we extract the deep representations from the image and text using a ResNet-based encoder, a BERT-based encoder and two pair-wise CLIP encoders. The multimodal feature is a concatenation of the CLIP-generated features weighted by the standardized cross-modal similarity of the two modalities. The extracted features are further processed for redundancy reduction before feeding them into the final classifier. We introduce a modality-wise attention module to adaptively reweight and aggregate the features. We have conducted extensive experiments on typical fake news datasets. The results indicate that the proposed framework has a better capability in mining crucial features for fake news detection. The proposed FND-CLIP can achieve better performances than previous works, i.e., 0.7\%, 6.8\% and 1.3\% improvements in overall accuracy on Weibo, Politifact and Gossipcop, respectively. Besides, we justify that CLIP-based learning can allow better flexibility on multimodal feature selection.
연구 동기 및 목표
- 흑상자 주의 융합에 의존하는 기존 다중모달 가짜 뉴스 탐지(FND) 방법에서의 해석 가능성과 메커니즘 투명성 부족 문제를 해결한다.
- 텍스트와 이미지 특징의 정렬 및 대비 학습을 통해 CLIP의 표현 능력을 활용하여 특징 품질과 관련성을 향상시킨다.
- 모달 별 주의 메커니즘을 도입하여 특징의 분류 기여도에 따라 적응적으로 재가중함으로써 다중모달 융합의 부정확성과 노이즈를 감소시킨다.
- CLIP 기반 특징 학습이 가짜 뉴스 탐지에 필수적인 특징을 선택하는 데 있어 더 높은 유연성과 일반화 능력을 제공함을 입증한다.
- 표준 벤치마크에서 프레임워크를 평가하여 실제 FND 시나리오에서 단모달 및 다중모달 베이스라인 대비 우수성을 검증한다.
제안 방법
- 이미지의 깊이 있는 표현을 ResNet 기반 인코더를 통해 추출하고, 텍스트의 표현은 BERT 기반 인코더를 통해 추출한다.
- 두 개의 쌍별 CLIP 인코더를 활용하여 텍스트와 이미지 모달 간의 대비적이고 정렬된 특징을 생성한다.
- 다중모달 융합 과정에서 CLIP가 생성한 특징의 가중치를 부여하기 위해 표준화된 이질적 유사도를 계산한다.
- 가중된 CLIP 특징을 단모달 특징(텍스트 및 이미지)과 결합하고, 모달 별 주의 모듈을 적용하여 특징을 적응적으로 재가중하고 집계한다.
- 최종 융합 특징을 분류기로 전달하기 전에 부정확성 감소 기법을 적용하여 분류 능력을 향상시킨다.
- 가짜 뉴스 분류 최적화를 위해 교차 엔트로피 손실을 사용하여 엔드 투 엔드 네트워크를 훈련시킨다.

실험 결과
연구 질문
- RQ1CLIP 유도 특징 학습은 가짜 뉴스 탐지에서 다중모달 표현의 품질과 정렬도를 어떻게 향상시키는가?
- RQ2모달 별 주의 메커니즘이 관련 특징을 적응적으로 선택하고 노이즈를 억제함으로써 특징 융합을 얼마나 향상시키는가?
- RQ3CLIP 기반 특징은 기존의 단모달 특징(예: BERT 및 ResNet)을 초월하거나 보완할 수 있는가?
- RQ4다양한 데이터셋에서 제안된 프레임워크는 최신 기술 수준의 방법과 정확도 및 강건성 측면에서 어떻게 비교되는가?
- RQ5각 모달(텍스트, 이미지, 융합)이 최종 분류에 기여하는 정도는 어떠하며, 의사결정 과정에서 상호작용은 어떻게 이루어지는가?
주요 결과
- FND-CLIP는 Weibo, Politifact, GossipCop 데이터셋에서 각각 0.7%, 6.8%, 1.3%의 절대 정확도 향상을 기록하며 최신 기술 수준의 성능을 달성한다.
- 이미지 전용 브랜치는 성능이 열악하며, 특히 GossipCop에서 가짜 뉴스의 F1 스코어가 거의 0에 가까워 시각적 특징만으로는 분류 능력이 떨어진다는 것을 시사한다.
- CLIP를 제외한 다중모달 전용 설정은 Weibo, Politifact, GossipCop에서 각각 81.7%, 90.3%, 86.2%의 정확도를 기록하지만, Weibo와 GossipCop에서는 텍스트 전용 브랜치보다 성능이 열 劣하여 원시 융합의 유용성이 제한적임을 시사한다.
- 텍스트 전용 브랜치는 두 번째로 높은 성능를 기록하며, 텍스트 신호가 매우 유용함을 확인하지만, FND-CLIP는 보완적인 시각적 특징과 CLIP 강화 특징을 통합함으로써 이를 뛰어넘는다.
- t-SNE 시각화 결과 FND-CLIP는 CAFE 및 분석 제거 모델 대비 더 분리 가능하고 분류 능력이 뛰어난 특징 표현을 생성하며, 더 명확한 클래스 경계를 보인다.
- 분석 제거 연구 결과, CLIP 유도 특징 학습과 모달 별 주의 구성 요소가 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 떨어진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.