[논문 리뷰] Cross-modal Contrastive Learning for Multimodal Fake News Detection
COOLANT은 이중 인코더 아키텍처를 통해 이미지-텍스트 정렬을 향상시키고, 보조 일致성 작업을 통해 음성 대비 손실을 부드럽게 하며, 주의 기반 융합을 사용하여 특징 집합을 향상시키는 다중모odal 가짜 뉴스 탐지를 위한 교차모달 대비 학습 프레임워크이다. 이는 트위터 및 웨이보 데이터셋에서 최신 기술 성능을 달성하며, 각각 F1 스코어 0.901과 0.920을 기록한다.
Automatic detection of multimodal fake news has gained a widespread attention recently. Many existing approaches seek to fuse unimodal features to produce multimodal news representations. However, the potential of powerful cross-modal contrastive learning methods for fake news detection has not been well exploited. Besides, how to aggregate features from different modalities to boost the performance of the decision-making process is still an open question. To address that, we propose COOLANT, a cross-modal contrastive learning framework for multimodal fake news detection, aiming to achieve more accurate image-text alignment. To further improve the alignment precision, we leverage an auxiliary task to soften the loss term of negative samples during the contrast process. A cross-modal fusion module is developed to learn the cross-modality correlations. An attention mechanism with an attention guidance module is implemented to help effectively and interpretably aggregate the aligned unimodal representations and the cross-modality correlations. Finally, we evaluate the COOLANT and conduct a comparative study on two widely used datasets, Twitter and Weibo. The experimental results demonstrate that our COOLANT outperforms previous approaches by a large margin and achieves new state-of-the-art results on the two datasets.
연구 동기 및 목표
- 기존의 다중모달 가짜 뉴스 탐지 방법이 유연하지 못한 단모달 융합과 one-hot 대비 손실에 의존하는 한계를 해결하기 위해.
- 가짜 뉴스에서 시각적 표현과 언어 표현 간의 교차모달 정렬을 향상시키기 위해 음성 샘플에 대해 소프트 타겟을 활용하기 위해.
- 단모달 및 교차모달 특징를 융합하는 해석 가능하고 효과적인 메커니즘을 개발하여 의사결정을 향상시키기 위해.
- 다양한 구성 요소가 다중모달 가짜 뉴스 탐지 성능에 미치는 영향을 조사하기 위해.
- 고도화된 대비 학습 및 융합 전략을 통해 기준 데이터셋에서 최신 기술 성능을 달성하기 위해.
제안 방법
- 이중 인코더 아키텍처를 사용하여 의미 수준에서 시각적 및 텍스처적 표현을 학습한다.
- 이미지-텍스트 대비(이미지-텍스트 대비, ITC) 학습은 양성 이미지-텍스트 쌍을 정렬하고 음성 쌍을 분리시켜 교차모달 정렬을 향상시킨다.
- 보조 일치 학습 작업을 통해 음성 샘플에 대한 대비 손실을 부드럽게 하여 잘못 매칭된 쌍에 대한 과적합을 줄인다.
- 교차모달 융합(CMF) 모듈은 정렬된 단모달 특징과 교차모달 표현 간의 상관관계를 학습한다.
- 주의 메커니즘과 주의 유도 모듈을 함께 사용하여 단모달, 교차모달, 융합된 표현의 특징를 동적으로 집계함으로써 더 높은 해석 가능성과 성능을 확보한다.
- 특징 집합을 학습된 주의 가중치로 유도하면서, 대비 및 일치 목표를 기반으로 엔드 투 엔드로 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1음성 샘플에 대한 대비 손실을 부드럽게 함으로써 다중모달 가짜 뉴스 탐지의 일반화 성능을 향상시킬 수 있는가?
- RQ2교차모달 대비 학습은 가짜 뉴스에서 시각적 표현과 텍스트 표현 간의 정렬을 어떻게 향상시키는가?
- RQ3ITC, ITM, CMF, ATT, AGU 각 구성 요소가 모델의 전체 성능에 기여하는 정도는 어떠한가?
- RQ4주의 유도 융합 메커니즘은 해석 가능성과 탐지 정확도를 어떻게 향상시키는가?
- RQ5제안된 프레임워크는 트위터 및 웨이보와 같은 다양한 소셜 미디어 데이터셋에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- COOLANT은 트위터 데이터셋에서 기존 방법을 능가하는 새로운 최신 기술 F1 스코어 0.901을 달성한다.
- 웨이보 데이터셋에서는 F1 스코어 0.920을 기록하여 더 큰 규모이자 더 복잡한 데이터셋에서도 뛰어난 성능을 입증한다.
- 제거 실험 결과, ITC 손실을 제거할 경우 성능 저하가 가장 크게 발생하여, 이가 정렬에 핵심적인 역할을 한다는 것을 확인한다.
- ITM(일치 학습) 작업이 없는 변형은 트위터에서 유의미하게 성능이 떨어지며, 이는 소프트 타겟이 이벤트 관련 데이터에서 노이즈를 완화하는 데 기여함을 시사한다.
- t-SNE 시각화 결과, COOLANT은 제거된 변형들보다 더 구분력 있고 잘 분리된 특징 표현을 학습함을 확인한다.
- 주의 유도 융합 메커니즘이 특징 집합을 크게 향상시키며, ATT 및 AGU 구성 요소를 유지할 경우 성능 향상이 뚜렷하게 나타남을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.