Skip to main content
QUICK REVIEW

[论文解读] Measuring Structural Distances between Texts.

Uli Fahrenberg, Fabrizio Biondi|arXiv (Cornell University)|Mar 17, 2014
Authorship Attribution and Profiling参考文献 2被引用 4
一句话总结

本文提出了一种新颖的文本间距离度量方法,该方法基于多词短语而非单个词汇来量化文本之间的结构差异,从而实现更细致的比较。该方法计算效率高,并在样本语料库的统计分析中有效区分了真实与虚假的科学论文。

ABSTRACT

We define and use a new inter-textual distance which, contrary to other common approaches, not only measures differences in occurrences of words, but in occurrences of multi-word phrases. We show that this distance may easily be calculated and use it for statistical analysis of some sample corpuses of genuine and fake scientific papers.

研究动机与目标

  • 开发一种更精确的文本相似性度量方法,以捕捉超越单个词汇频率的结构差异。
  • 解决传统基于词汇的距离度量方法在检测科学文本中细微风格与结构差异方面的局限性。
  • 评估所提出度量方法在区分真实科学论文与伪造或虚假论文方面的有效性。
  • 提供一种计算高效的方案,适用于学术文档验证中的大规模文本分析。

提出的方法

  • 本文提出一种基于多词短语共现与分布而非单个词汇的新型文本间距离度量方法。
  • 通过比较文档间短语单元的频率与分布模式来建模文本相似性。
  • 该距离度量采用统计框架计算,根据短语的稀有性与分布一致性对出现频率进行加权。
  • 该方法设计为计算轻量级,适用于大规模文本语料库。
  • 利用标准统计技术分析文本间短语层面结构的差异。
  • 通过真实与合成的科学论文对方法进行验证,以评估其区分能力。

实验结果

研究问题

  • RQ1基于短语的距离度量是否能比基于词汇的方法更有效地检测科学文本中的结构差异?
  • RQ2在实证评估中,所提出的度量方法在区分真实与虚假科学论文方面表现如何?
  • RQ3该基于短语的距离度量在大规模文本分析中的计算效率如何?
  • RQ4引入多词短语是否能提升对科学写作中风格异常的检测能力?

主要发现

  • 基于短语的距离度量成功捕捉了传统基于词汇比较方法所忽略的文本结构差异。
  • 在所分析的样本语料库中,该方法在区分真实科学论文与虚假论文方面表现出色。
  • 该度量计算效率高,适用于大规模文档分析。
  • 多词短语在识别科学写作中的风格不一致性方面比单个词汇更具信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。