Skip to main content
QUICK REVIEW

[论文解读] Real-time Claim Detection from News Articles and Retrieval of Semantically-Similar Factchecks

Ben Adler, Giacomo Boscaini-Gilroy|arXiv (Cornell University)|Jul 3, 2019
Topic Modeling参考文献 14被引用 6
一句话总结

本文提出了一种实时系统,用于检测新闻文章中的主张,并利用上下文句子嵌入和动态聚类技术,检索语义上相似的、先前已核实的主张。该系统采用 Google 的通用句子编码器大型版(USE Large)实现高精度的主张嵌入,并结合 DBScan 与 Louvain 社区检测算法,构建紧凑且可扩展的聚类,实现高效、低延迟的检索,每条主张的处理时间约为 300ms。

ABSTRACT

Factchecking has always been a part of the journalistic process. However with newsroom budgets shrinking it is coming under increasing pressure just as the amount of false information circulating is on the rise. We therefore propose a method to increase the efficiency of the factchecking process, using the latest developments in Natural Language Processing (NLP). This method allows us to compare incoming claims to an existing corpus and return similar, factchecked, claims in a live system-allowing factcheckers to work simultaneously without duplicating their work.

研究动机与目标

  • 为应对 misinformation 的日益增长挑战,通过自动化和规模化事实核查流程,提升新闻机构在预算受限条件下的核查效率。
  • 自动检测新闻文章中的主张,减少对人工监控的依赖以及重复性工作。
  • 检索语义上相似的、先前已核实的主张,以实现已有事实核查工作的复用。
  • 开发一种可扩展的实时系统,利用上下文嵌入和动态聚类技术对主张进行聚类。
  • 通过利用最先进的 NLP 技术,提升事实核查的效率并降低相关成本。

提出的方法

  • 系统结合 PolitiTax 和 Full Fact 的主张定义,构建用于主张检测的标注数据集。
  • 采用 Google 的通用句子编码器大型版(USE Large)作为主要嵌入模型,在聚类准确率和覆盖范围方面优于 TF-IDF 和 InferSent。
  • 将主张嵌入到稠密向量空间,并使用 DBScan 进行聚类,最小聚类大小设为 1,以支持动态、增量式聚类。
  • 为提升聚类紧凑性并避免产生虚假连接,对主张相似性图应用 Louvain 社区检测算法。
  • 系统支持实时主张插入,通过计算优化,确保每条主张的延迟保持在约 300ms,且不受聚类规模影响。
  • 采用一个结合正样本精确率、聚类精确率和主张数量的公式,用于评估聚类质量。

实验结果

研究问题

  • RQ1上下文句子嵌入能否有效表示主张,以实现在新闻文章中的实时检测与检索?
  • RQ2在动态、实时环境中,如何实现主张聚类的可扩展性与高效性?
  • RQ3不同嵌入模型(如 TF-IDF、InferSent、USE Large)对聚类准确率和覆盖范围有何影响?
  • RQ4在使用 DBScan 等基于密度的聚类方法时,基于图的社区检测能否提升聚类质量?
  • RQ5在多大程度上可以复用先前已核实的主张,以应对语义上相似的新主张?

主要发现

  • Google 的通用句子编码器大型版在聚类准确率和主张覆盖范围方面均优于 TF-IDF 和 InferSent,是本任务的最优嵌入模型。
  • TF-IDF 作为基线表现令人意外地出色,但其在精确率和召回率方面仍不及神经网络嵌入模型。
  • DBScan 与 Louvain 社区检测的结合显著提升了聚类的紧凑性,并减少了碎片化现象。
  • 系统实现了每条主张约 300ms 的稳定延迟,且随着已有主张数量的增加,处理时间增长极小。
  • 评估公式表明,基于 USE Large 的聚类得分最高,表明其与真实文章聚类具有高度一致性。
  • 该方法使事实核查人员能够高效检索并复用已有事实核查结果,用于新出现的语义相似主张,从而减少重复工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。