Skip to main content
QUICK REVIEW

[论文解读] Text Segmentation Based on Similarity between Words

Hideki Kozima|ArXiv.org|Jan 23, 1996
Natural Language Processing Techniques参考文献 3被引用 4
一句话总结

本文提出词汇衔接轮廓(LCP),一种新颖的文本分割方法,通过语义网络测量词语相似性来识别连贯的文本片段。与人工标注的片段相比,LCP与人类判断具有高度相关性,为检测话语边界以及辅助解决回指和省略提供了稳健的方法。

ABSTRACT

This paper proposes a new indicator of text structure, called the lexical cohesion profile (LCP), which locates segment boundaries in a text. A text segment is a coherent scene; the words in a segment are linked together via lexical cohesion relations. LCP records mutual similarity of words in a sequence of text. The similarity of words, which represents their cohesiveness, is computed using a semantic network. Comparison with the text segments marked by a number of subjects shows that LCP closely correlates with the human judgments. LCP may provide valuable information for resolving anaphora and ellipsis.

研究动机与目标

  • 开发一种客观的、计算基础的指标,用于识别文本片段边界。
  • 将词汇衔接建模为词语序列中词语相似性的函数。
  • 提供一种支持话语分析并解决回指和省略的工具。
  • 通过与人工标注的文本片段对比,评估该方法的有效性与可靠性。
  • 证明基于语义网络的词语相似性与人类对连贯性的感知具有强相关性。

提出的方法

  • 构建词汇衔接轮廓(LCP),记录文本序列中连续词语之间的相互相似性。
  • 利用语义网络计算词语相似性,捕捉词语对之间的词汇衔接。
  • 应用LCP检测词语相似性显著下降的位置,作为潜在的片段边界。
  • 使用人工标注的文本片段作为真实标签,用于对比与验证。
  • 采用计算模型,基于语义关系而非句法结构来量化衔接程度。
  • 依赖预定义的语义网络来表示并计算词语之间的词汇相似性。

实验结果

研究问题

  • RQ1通过语义网络测量的词语相似性是否能可靠地指示文本片段边界?
  • RQ2LCP与人工识别的文本片段相关性如何?
  • RQ3LCP在多大程度上可支持话语中回指和省略的解决?
  • RQ4基于语义相似性的词汇衔接是否优于句法或统计方法在片段检测中的表现?
  • RQ5基于文本序列中词语相似性的轮廓能否有效建模话语连贯性?

主要发现

  • 词汇衔接轮廓(LCP)与人工标注的文本片段具有强相关性,表明其作为分割指标的有效性。
  • LCP通过检测序列中词语相似性的下降,有效捕捉话语边界。
  • 该方法表明,词语之间的语义相似性是文本中词汇衔接的可靠代理。
  • LCP提供了有助于自然语言处理中解决回指和省略的有价值结构信息。
  • 该方法通过利用语义关系,优于纯粹的句法或统计方法。
  • 结果证实,通过语义网络计算的词语相似性能以高精度建模人类对文本连贯性的感知。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。