Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Fake News Detection of Influential Domain via Domain- and Instance-Level Transfer

Qiong Nan, Danding Wang|arXiv (Cornell University)|2022. 09. 19.
Misinformation and Its Impacts인용 수 9
한 줄 요약

이 논문은 정치 및 보건과 같은 영향력 있는 도메인에서 가짜 뉴스 탐지 성능을 향상시키기 위해 메타학습을 통한 일반 도메인 수준 지식 및 도메인 적응형 언어 모델을 활용한 인스턴스 수준 이송 가능성 점수를 제공하는 도메인 및 인스턴스 수준 이송 프레임워크인 DITFEND을 제안한다. 실험 결과, 특히 데이터가 불균형한 실세계 온라인 환경에서 기준 모델 대비 뚜렷한 성능 향상을 보였다.

ABSTRACT

Both real and fake news in various domains, such as politics, health, and entertainment are spread via online social media every day, necessitating fake news detection for multiple domains. Among them, fake news in specific domains like politics and health has more serious potential negative impacts on the real world (e.g., the infodemic led by COVID-19 misinformation). Previous studies focus on multi-domain fake news detection, by equally mining and modeling the correlation between domains. However, these multi-domain methods suffer from a seesaw problem: the performance of some domains is often improved at the cost of hurting the performance of other domains, which could lead to an unsatisfying performance in specific domains. To address this issue, we propose a Domain- and Instance-level Transfer Framework for Fake News Detection (DITFEND), which could improve the performance of specific target domains. To transfer coarse-grained domain-level knowledge, we train a general model with data of all domains from the meta-learning perspective. To transfer fine-grained instance-level knowledge and adapt the general model to a target domain, we train a language model on the target domain to evaluate the transferability of each data instance in source domains and re-weigh each instance's contribution. Offline experiments on two datasets demonstrate the effectiveness of DITFEND. Online experiments show that DITFEND brings additional improvements over the base models in a real-world scenario.

연구 동기 및 목표

  • 일부 도메인에서의 성능 향상이 다른 도메인의 성능을 떨어뜨리는 '갈림길 문제'를 해결하기 위해.
  • 정치 및 보건과 같이 사회적 영향력이 큰 영향력 있는 도메인에서 탐지 정확도를 향상시키기 위해.
  • 다양한 도메인 간에 이식 가능한 인스턴스와 이식할 수 없는 인스턴스를 구분함으로써 효과적인 도메인 간 지식 이동을 가능하게 하기 위해.
  • 기타 도메인의 성능을 저하시키지 않으면서도 타겟 도메인 성능을 향상시키는 프레임워크를 개발하기 위해.

제안 방법

  • 모든 도메인을 아우르는 일반 모델을 메타학습을 통해 훈련시켜 타겟 도메인으로의 빠른 적응을 가능하게 한다.
  • 도메인 적응형 언어 모델을 활용해 문자/단어 수준의 특징을 예측함으로써 인스턴스 이송 가능성의 정도를 추정한다.
  • 각 소스 인스턴스의 타겟 도메인에 대한 관련성을 평가하는 이송 가능성 측정기(quantifier)를 도입한다.
  • 훈련 중에 각 소스 인스턴스의 이송 가능성 점수에 따라 기여도를 재가중한다.
  • 도메인 수준의 일반화와 인스턴스 수준의 선택적 지식 이동을 결합하여 탐지 성능을 향상시킨다.
  • 왜곡된 데이터 분포를 보이는 오프라인 데이터셋과 실세계 온라인 시스템 양쪽 모두에 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1도메인 수준의 메타학습은 타겟 도메인에서의 일반화 및 빠른 적응에 도움이 될 수 있는가?
  • RQ2인스턴스 수준의 이송 가능성은 어떻게 효과적으로 측정할 수 있으며, 이를 통해 소스 도메인에서 타겟 도메인으로의 지식 이동을 향상시킬 수 있는가?
  • RQ3인스턴스 수준의 관련성 기반 선택적 이송은 관련성이 없는 소스 인스턴스로부터의 간섭을 줄일 수 있는가?
  • RQ4제안된 프레임워크는 실세계에서 데이터가 불균형한 온라인 환경에서 기존의 다중 도메인 및 단일 도메인 기준 모델을 초월할 수 있는가?

주요 결과

  • 온라인 테스트에서 DITFEND는 EANN 기준 모델 대비 표준화된 부분 AUC(SPAUC)에서 3.40%의 상대적 향상을 보였다. (FPR ≤ 0.1)
  • TextCNN 대비 SPAUC에서 2.07% 향상되었고, EANN 대비 3.40% 향상되어 희귀 가짜 뉴스 탐지에서 뛰어난 성능을 입증했다.
  • 절단 실험 결과, 도메인 수준 및 인스턴스 수준의 이송 구성 요소가 전체 성능 향상에 기여한다는 것이 확인되었다.
  • 사례 연구 결과, 이송 가능성 측정기가 관련성이 높은 소스 인스턴스를 성공적으로 선별했으며, 예를 들어 정치 뉴스 탐지에 보건 관련 콘텐츠를 효과적으로 활용했다.
  • 온라인 실험을 통해 DITFEND가 극도로 불균형한 데이터 분포(실제 대 가짜 비율 40:1)를 가진 실세계 시스템에서 실질적인 이점을 제공한다는 것이 검증되었다.
  • 타겟 도메인 성능 향상과 함께 다른 도메인의 성능 저하 없이 갈림길 문제를 효과적으로 완화함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.