[논문 리뷰] Team Yao at Factify 2022: Utilizing Pre-trained Models and Co-attention Networks for Multi-Modal Fact Verification
이 논문은 텍스트 및 이미지 특징 추출을 위해 사전 훈련된 DeBERTa와 DeiT 모델을 사용하고, 공통 주의 메커니즘(co-attention networks)을 통해 이질적 및 동질적 모odal 표현을 융합하는 다중모달 사실 확인 프레임워크인 Pre-CoFact를 제안한다. 이 방법은 보조 작업이나 OCR 데이터를 사용하지 않아도 Factify 2022 대회에서 5위를 차지하며 74.585%의 F1 스코어를 달성하였다.
In recent years, social media has enabled users to get exposed to a myriad of misinformation and disinformation; thus, misinformation has attracted a great deal of attention in research fields and as a social issue. To address the problem, we propose a framework, Pre-CoFact, composed of two pre-trained models for extracting features from text and images, and multiple co-attention networks for fusing the same modality but different sources and different modalities. Besides, we adopt the ensemble method by using different pre-trained models in Pre-CoFact to achieve better performance. We further illustrate the effectiveness from the ablation study and examine different pre-trained models for comparison. Our team, Yao, won the fifth prize (F1-score: 74.585\%) in the Factify challenge hosted by De-Factify @ AAAI 2022, which demonstrates that our model achieved competitive performance without using auxiliary tasks or extra information. The source code of our work is publicly available at https://github.com/wywyWang/Multi-Modal-Fact-Verification-2021
연구 동기 및 목표
- 소셜 미디어를 통한 가짜 정보 유포 증가 추세에 대응하기 위해, 텍스트와 이미지를 융합한 다중모달 가짜 뉴스에 대응하는 것.
- OCR나 외부 데이터에 의존하지 않고 텍스트 및 시각적 콘텐츠를 모두 활용하는 강력한 사실 확인 시스템을 개발하는 것.
- 공통 주의 메커니즘을 통해 이질적 및 내부 모달 간의 종속성을 모델링하여 다중모달 사실 확인 성능을 향상시키는 것.
- 제로샷 또는 최소 데이터 설정에서 다양한 사전 훈련된 모델과 앙상블 전략의 효과를 평가하는 것.
제안 방법
- 프레임워크는 텍스트적 진술과 문서를 인코딩하기 위해 DeBERTa-base를, 이미지를 인코딩하기 위해 DeiT-base-patch16-224를 사용한다.
- 공통 주의 모듈은 서로 다른 모달 간(텍스트와 이미지) 및 동일 모달 내(진술 및 문서 텍스트/이미지)의 특징을 융합하는 데 적용된다.
- 네 가지 임bedding 표현—텍스트, 이미지, 교차 주의, 공통 주의—를 연결하여 다섯 가지 카테고리 중 하나로 분류한다.
- 다양한 사전 훈련된 모델(예: RoBERTa, XLM-RoBERTa)과 활성화 함수(예: Mish)를 사용한 Pre-CoFact의 여러 변종을 조합하는 앙상블 전략을 통해 일반화 능력을 향상시킨다.
- 사전 훈련된 지식을 유지하기 위해 DeBERTa 및 DeiT의 모델 파라미터는 미세조정 중 동결된다.
- 데이터 전처리 과정으로는 이미지 리사이징(256x256), 중심 컷팅(224x224), 정규화를 수행하며, 텍스트 시퀀스는 512 토큰으로 잘라낸다.
실험 결과
연구 질문
- RQ1OCR나 보조 데이터 없이도 원시 텍스트와 이미지만으로 다중모달 사실 확인 시스템이 경쟁 가능한 성능을 달성할 수 있는가?
- RQ2공통 주의 메커니즘이 사실 확인 작업에서 이질적 및 내부 모달 간 종속성을 모델링하는 데 얼마나 효과적인가?
- RQ3다음과 같은 사전 훈련된 모델들(예: DeBERTa, RoBERTa, XLM-RoBERTa, DeiT, DINO) 중에서 이 다중모달 환경에서 가장 높은 성능을 내는 것은 무엇인가?
- RQ4앙상블 전략이 다중모달 사실 확인에서 견고성과 성능 향상에 얼마나 기여하는가?
주요 결과
- 제안된 Pre-CoFact 프레임워크는 검증 세트에서 가중 평균 F1 스코어 78.46%를 기록하였으며, 앙상블 모델은 80.02%에 도달하였다.
- 제거 실험 결과, 공통 주의 메커니즘이 성능 향상에 크게 기여하며, 공통 주의를 제거할 경우 F1 스코어가 4.34% 감소함을 확인하였다.
- 단지 동일 모달 내에서의 공통 주의(예: 텍스트-텍스트 또는 이미지-이미지)만 사용할 경우 성능이 76.43%로 떨어지며, 전체 공통 주의 모델(78.46%)보다 낮은 성능을 보여, 이질적 모달 간 주의의 필요성을 입증하였다.
- 앙상블 방법은 기본 Pre-CoFact 모델 대비 1.56%p 향상된 성능을 기록하여 일반화 능력 향상에 효과적임을 입증하였다.
- 사전 훈련된 모델 중 DeBERTa와 DeiT가 XLM-RoBERTa와 RoBERTa를 능가하였으며, 이 작업에서 DeiT가 DINO보다 더 높은 성능을 보였다.
- 모델은 테스트 F1 스코어 74.585%를 기록하여 Factify 2022 대회에서 5위를 차지하였으며, 베이스라인 대비 40.5% 높은 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.