Skip to main content
QUICK REVIEW

[논문 리뷰] Do All Good Actors Look The Same? Exploring News Veracity Detection Across The U.S. and The U.K

Benjamin D. Horne, Maurício Gruppi|arXiv (Cornell University)|2020. 05. 26.
Misinformation and Its Impacts참고 문헌 9인용 수 4
한 줄 요약

이 연구는 미국 및 영국 뉴스 매체에서 텍스트 기반 뉴스 진위성 검증 모델을 평가하며, 같은 언어를 사용하더라도 한 국가의 데이터로 훈련된 모델이 다른 국가로 일반화하는 데에 빈약한 성능을 보임을 발견한다. 주요 결과로는, 훈련 데이터에 포함되지 않은 신뢰할 수 없는 소스를 분류할 때 성능이 크게 떨어지며, 이는 텍스트 기반 특징의 한계와 진위성 검증 시스템에서의 다문화적 내성 및 외부 신호의 필요성을 드러낸다.

ABSTRACT

A major concern with text-based news veracity detection methods is that they may not generalize across countries and cultures. In this short paper, we explicitly test news veracity models across news data from the United States and the United Kingdom, demonstrating there is reason for concern of generalizabilty. Through a series of testing scenarios, we show that text-based classifiers perform poorly when trained on one country's news data and tested on another. Furthermore, these same models have trouble classifying unseen, unreliable news sources. In conclusion, we discuss implications of these results and avenues for future work.

연구 동기 및 목표

  • 미국 뉴스 데이터로 훈련된 텍스트 기반 뉴스 진위성 검증 모델이 영국 뉴스 데이터로 일반화되는지 여부를 조사하는 것.
  • 두 나라 모두에서 훈련 데이터에 포함되지 않은 신뢰할 수 없는 뉴스 소스에 대해 모델 성능을 평가하는 것.
  • 특징 스케일링 및 정규화가 국가 간 및 소스 간 일반화에 미치는 영향을 평가하는 것.
  • 미국 및 영국의 신뢰할 수 있는 소스를 함께 훈련 데이터로 사용할 경우 교차 국가 성능 향상 여부를 평가하는 것.
  • 텍스트 기반 모델의 한계를 규명하고, 진위성 검증에 외부 신호를 통합할 수 있는 방안을 제안하는 것.

제안 방법

  • 미국(US), 영국(UK), 그리고 신뢰할 수 없는(UR) 소스에서 뉴스 기사를 추출하기 위해 NELA-GT-2018 데이터셋을 사용하였으며, 각 클래스별로 5개 소스씩 균형을 맞췄다.
  • 두 가지 특징 세트를 사용: NELA(스타일, 복잡성, 편향, 감정, 도덕적 요소 등에 걸쳐 194개의 수작업 특징) 및 Doc2Vec(100차원의 문단 임베딩).
  • 모델 안정성과 일반화를 향상시키기 위해 특징 스케일링 및 정규화(NELA-scaled, Doc2Vec-scaled)를 적용하였다.
  • 두 가지 테스트 시나리오에서 다수의 분류기(Random Forest, SVM)를 훈련 및 테스트: 기사 분할(동일한 소스) 및 소스 분할(알 수 없는 소스).
  • 정확도, 혼동 행렬, 5폴드 교차 검증에서의 표준편차를 사용해 정확도를 평가하고, 안정성을 분석하였다.
  • 국가 간 분할과 소스 간 분할의 성능을 비교하여 일반화 실패 원인을 규명하였다.

실험 결과

연구 질문

  • RQ1미국 뉴스 데이터로 훈련된 텍스트 기반 뉴스 진위성 검증 모델이 영국 뉴스 데이터로 효과적으로 일반화되는가? 반대로도 마찬가지인가?
  • RQ2훈련 데이터에 포함되지 않은 신뢰할 수 없는 소스를 분류할 때 모델은 어떤 성능을 보이는가?
  • RQ3특징 스케일링 및 정규화가 국가 간 및 소스 간 일반화에 성능 향상 기여를 하는가?
  • RQ4미국 및 영국의 신뢰할 수 있는 소스를 함께 훈련 데이터로 사용할 경우 교차 국가 검증 성능 향상이 가능한가?
  • RQ5알 수 없는 신뢰할 수 없는 소스를 탐지하는 데서 모델이 실패하는 주요 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • 미국 뉴스 데이터로 훈련된 모델이 영국 뉴스 데이터로 테스트했을 때 정확도가 오직 44.0%에 그쳤으며, 반대로도 동일한 결과를 보여, 교차 국가 일반화가 빈약함을 시사한다.
  • 가장 높은 성능을 보인 모델(SVM + Doc2Vec-scaled 특징)은 훈련 데이터에 포함되지 않은 신뢰할 수 없는 소스에 대해 61.0%의 정확도를 기록했지만, 이는 볼 수 있는 소스에 비해 여전히 유의미하게 낮은 성능이었다.
  • Random Forest 모델은 기사 분할 테스트와 소스 분할 테스트 사이에서 정확도가 24.9% 감소하여, 알 수 없는 신뢰할 수 없는 소스 탐지에 있어 뚜렷한 실패를 보였다.
  • SVM 모델은 소스 분할 시나리오에서 Random Forest를 능가했으며, Doc2Vec-scaled 특징을 사용할 경우 볼 수 있는 소스와 볼 수 없는 소스 테스트 간 정확도 감소가 2.7%에 그쳤다.
  • 혼동 행렬 분석 결과, 훈련 데이터에 없는 신뢰할 수 없는 소스의 오분류 비율이 신뢰할 수 있는 소스보다 유의미하게 높았으며, 이는 신뢰할 수 없는 매체 간 광범위한 스타일의 다양성 때문이었다.
  • 미국 및 영국의 신뢰할 수 있는 소스를 함께 훈련 데이터로 사용할 경우 이상 탐지 수가 증가하여, 이러한 데이터 융합이 일반화 성능 향상에 기여하지 못하고 오히려 신뢰성에 악영향을 줄 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.