Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time Claim Detection from News Articles and Retrieval of Semantically-Similar Factchecks

Ben Adler, Giacomo Boscaini-Gilroy|arXiv (Cornell University)|2019. 07. 03.
Topic Modeling참고 문헌 14인용 수 6
한 줄 요약

이 논문은 문맥적 문장 임베딩과 동적 클러스터링을 사용하여 뉴스 기사에서 진술을 실시간으로 탐지하고 이전에 사실 확인된 유사한 진술을 검색하는 실시간 시스템을 제안한다. 고정밀도의 진술 임베딩을 위해 Google의 Universal Sentence Encoder Large를 활용하고, DBScan과 Louvain 커뮤니티 탐지 기법을 조합하여 컴act하고 확장 가능한 클러스터를 구축하여, 평균 300ms의 저지연 검색을 실현한다.

ABSTRACT

Factchecking has always been a part of the journalistic process. However with newsroom budgets shrinking it is coming under increasing pressure just as the amount of false information circulating is on the rise. We therefore propose a method to increase the efficiency of the factchecking process, using the latest developments in Natural Language Processing (NLP). This method allows us to compare incoming claims to an existing corpus and return similar, factchecked, claims in a live system-allowing factcheckers to work simultaneously without duplicating their work.

연구 동기 및 목표

  • 예산 제약 하에 증가하는 가짜 정보 문제를 해결하기 위해 뉴스룸 내 사실 확인 과정을 자동화하고 확장화하고자 한다.
  • 수동 모니터링과 중복 노력을 줄이기 위해 뉴스 기사에서 진술을 자동으로 탐지하고자 한다.
  • 기존에 사실 확인된 유사한 진술을 검색하여 기존 사실 확인 작업의 재사용을 가능하게 하고자 한다.
  • 문맥적 임베딩과 동적 클러스터링을 활용한 확장성 있고 실시간인 진술 클러스터링 시스템을 개발하고자 한다.
  • 최신 NLP 기법을 활용해 사실 확인의 효율성을 높이고 비용을 절감하고자 한다.

제안 방법

  • 진술 탐지용 레이블링된 데이터셋을 구축하기 위해 PolitiTax와 Full Fact의 진술 정의를 조합한다.
  • 임베딩 모델로 Google의 Universal Sentence Encoder Large (USE Large)를 주로 사용하며, 클러스터링 정확도와 커버리지 측면에서 TF-IDF와 InferSent를 능가한다.
  • 진술은 조밀한 벡터 공간으로 임bedded되며, DBScan을 사용하고 최소 클러스터 크기를 1로 설정하여 동적이고 점진적인 클러스터링을 허용한다.
  • 클러스터의 밀도를 높이고 부적절한 연결을 방지하기 위해, 진술 유사성 그래프에 대해 Louvain 커뮤니티 탐지 알고리즘을 적용한다.
  • 클러스터 크기에 관계없이 평균 300ms 이내의 지연 시간을 유지하면서 실시간으로 진술을 삽입할 수 있도록 최적화된 계산을 지원한다.
  • 정밀도(양성 진술 기준), 클러스터 기반 정밀도, 진술 수를 조합한 공식을 사용해 클러스터링 품질을 평가한다.

실험 결과

연구 질문

  • RQ1문맥적 문장 임베딩은 뉴스 기사 내 실시간 진술 탐지 및 검색에 효과적으로 진술을 표현할 수 있는가?
  • RQ2동적 실시간 환경에서 진술 클러스터링을 어떻게 효율적이고 확장 가능하게 만들 수 있는가?
  • RQ3다양한 임베딩 모델(예: TF-IDF, InferSent, USE Large)은 클러스터링 정확도와 커버리지에 어떤 영향을 미치는가?
  • RQ4밀도 기반 클러스터링 기법(예: DBScan)과 함께 그래프 기반 커뮤니티 탐지 기법이 클러스터 품질을 향상시킬 수 있는가?
  • RQ5기존에 사실 확인된 진술이 새로운 유사한 진술에 대해 얼마나 효과적으로 재사용될 수 있는가?

주요 결과

  • Google의 Universal Sentence Encoder Large는 클러스터링 정확도와 진술 커버리지 측면에서 TF-IDF와 InferSent를 모두 능가하여 이 작업에 최적의 임베딩으로 확인되었다.
  • TF-IDF는 기준 모델로써 놀라운 성능을 보였지만, 정밀도와 재현율 측면에서 신경망 기반 임베딩에 열등했다.
  • DBScan과 Louvain 커뮤니티 탐지의 조합은 클러스터의 밀도를 높이고 분할 현상을 줄이는 데 뚜렷한 효과를 보였다.
  • 시스템은 기존 진술 수가 증가함에 따라 시간이 약간 증가하는 것 외에는 일관된 약 300ms의 지연 시간을 기록했다.
  • 평가 공식을 통해 USE Large 기반 클러스터링이 가장 높은 점수를 기록하여 실제 기사 클러스터와의 강한 일치를 보였다.
  • 이 방법은 사실 확인 전문가가 새로운 유사한 진술에 대해 기존 사실 확인 자료를 효율적으로 검색하고 재사용할 수 있도록 하여 중복 작업을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.