Skip to main content
QUICK REVIEW

[논문 리뷰] MiDAS: Multi-integrated Domain Adaptive Supervision for Fake News Detection

Abhijit Suprem, Calton Pu|arXiv (Cornell University)|2022. 05. 19.
Misinformation and Its Impacts인용 수 5
한 줄 요약

MiDAS는 도메인 불변 임베딩과 국소 리프시츠 스무쓰니스를 사용하여 각 새로운 샘플에 대해 가장 관련성이 높은 사전 훈련된 모델을 선택하는 다중 통합 도메인 적응형 감독 프레임워크를 제안한다. 훈련 데이터 겹침 기반 동적 모델 순위 매기기를 통해 9개의 다양한 가짜 뉴스 데이터셋에서 최신 기술 수준 성능을 달성하며, 약 10퍼센트 이상의 정확도 향상을 기록한다. 이는 약한 감독 기반 모델보다도 뛰어난 성능이다.

ABSTRACT

COVID-19 related misinformation and fake news, coined an 'infodemic', has dramatically increased over the past few years. This misinformation exhibits concept drift, where the distribution of fake news changes over time, reducing effectiveness of previously trained models for fake news detection. Given a set of fake news models trained on multiple domains, we propose an adaptive decision module to select the best-fit model for a new sample. We propose MiDAS, a multi-domain adaptative approach for fake news detection that ranks relevancy of existing models to new samples. MiDAS contains 2 components: a doman-invariant encoder, and an adaptive model selector. MiDAS integrates multiple pre-trained and fine-tuned models with their training data to create a domain-invariant representation. Then, MiDAS uses local Lipschitz smoothness of the invariant embedding space to estimate each model's relevance to a new sample. Higher ranked models provide predictions, and lower ranked models abstain. We evaluate MiDAS on generalization to drifted data with 9 fake news datasets, each obtained from different domains and modalities. MiDAS achieves new state-of-the-art performance on multi-domain adaptation for out-of-distribution fake news classification.

연구 동기 및 목표

  • 진행 중인 가짜 뉴스 패tern 변화로 인한 개념 이동 문제를 해결함으로써 시간과 도메인 간 일반화 능력 저하를 완화한다.
  • 특히 코로나19 가짜 뉴스 유행과 같은 변화하는 주제에서 발생하는 실세계적 개념 이동 상황에서 단일 도메인 모델의 한계를 극복한다.
  • 샘플의 훈련 데이터 분포와의 관련성 기반으로 각 도착 샘플에 가장 적합한 모델을 선택하는 동적 결정보 모듈을 개발한다.
  • 통합된 도메인 불변 표현 공간을 활용해 다수의 미세조정된 모델을 통합함으로써 초기 가짜 뉴스 탐지에서 일반화 능력과 강건성을 향상시킨다.

제안 방법

  • 다양한 도메인의 입력을 공통의 불변 임베딩 공간으로 매핑하기 위해 도메인 불변 인코더를 사용하여 도메인 간 의미적 유사성을 유지한다.
  • 테스트 샘플 주변의 임베딩 공간에서 국소 리프시츠 스무쓰니스를 이용해 모델 관련성 추정—높은 스무쓰니스는 모델의 훈련 데이터와의 높은 일치도를 나타낸다.
  • 모델의 추정 스무쓰니스(훈련 데이터 겹침의 대체 지표) 기반으로 모델 순위를 매기며, 예측에 사용할 최상위 모델만 선택하고 낮은 순위 모델은 예측을 기피한다.
  • 각각의 훈련 데이터와 함께 사전 훈련 및 미세조정된 모델을 통합하여 도메인 불변 표현을 공동으로 학습하고 모델 간 비교를 가능하게 한다.
  • 각 테스트 샘플 주위의 ε-구 내에서 편향 기반 샘플링을 적용하여 국소 스무쓰니스를 추정하고, 리프시츠 상수 L을 모델 신뢰도 측정 지표로 사용한다.
  • 예측 커버리지와 정확도의 균형을 맞추기 위해 근접 이웃 수(m)와 ε 임계값을 조정하며, 아블레이션 연구를 통해 강건성과 일반화 능력 간의 상충 관계를 확인한다.

실험 결과

연구 질문

  • RQ1새로운, 도메인 외부의 샘플에 대해 사전 훈련된 도메인 특화 가짜 뉴스 탐지기 중에서 가장 관련성이 높은 모델을 효과적으로 선택할 수 있는 방법은 무엇인가?
  • RQ2도메인 불변 임베딩 공간에서의 국소 리프시츠 스무쓰니스는 모델 관련성과 예측 정확도에 대한 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ3공통 인코더를 통해 다수의 도메인 특화 모델을 통합함으로써 개념 이동이 발생한, 새로운 가짜 뉴스 데이터에 대한 일반화 능력은 어떻게 향상되는가?
  • RQ4국소 스무쓰니스 추정에서 스무쓰니스 임계값과 이웃 수를 조정할 때 예측 커버리지와 정확도 사이의 상충 관계는 어떻게 나타나는가?
  • RQ5개념 이동 상황에서 MiDAS는 약한 감독 및 기존 도메인 적응 방법에 비해 다중 도메인 가짜 뉴스 탐지에서 얼마나 뛰어난 성능을 발휘할 수 있는가?

주요 결과

  • MiDAS는 다양한 도메인과 모odalities를 포함하는 9개의 다양한 가짜 뉴스 데이터셋에서 최신 기술 수준의 성능을 달성하며, 개념 이동 상황에서도 강력한 일반화 능력을 입증한다.
  • 약한 레이블링 기반 모델 대비 정확도를 10퍼센트 이상 향상시키며, 특히 도메인 외부 설정에서 두드러진 성능 향상을 보였다.
  • m=1(가장 가까운 이웃)일 경우 커버리지가 최소(0.03–0.05)이지만 정확도가 가장 높으며(F1 최대 0.97), m를 150으로 늘리면 커버리지가 1.00으로 증가하지만 정확도는 감소한다(F1 일부 데이터셋에서 0.57으로 하락).
  • 아블레이션 연구 결과, 구성 요소 간 수렴이 안정적이며, 전체 MiDAS 모델이 아블레이션된 변형보다 정확도와 커버리지 측면에서 뛰어난 성능을 보였다.
  • m 파라미터와 ε 임계값 조정을 통해 커버리지와 정확도의 균형을 효과적으로 조절할 수 있었으며, 스무쓰니스 임계값을 완화하면 더 많은 모델이 예측할 수 있지만 정밀도가 감소하는 경향을 보였다.
  • coaid 데이터셋에서 m=100일 때 F1 스코어는 0.73에서 m=150일 때 0.56으로 감소했으며, 커버리지가 0.98에서 1.00으로 약간 증가하는 데 그쳤다. 이는 지나치게 관대한 임계값 설정이 성능 저하를 초래할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.