Skip to main content
QUICK REVIEW

[论文解读] What Makes Sentences Semantically Related: A Textual Relatedness Dataset and Empirical Study

Mahmoud A. Abdalla, Krishnapriya Vishnubhotla|arXiv (Cornell University)|Oct 10, 2021
Topic Modeling被引用 6
一句话总结

本文介绍了 STR-2022,这是一个新的英语句子对数据集,包含 5,500 组句子对,采用比较标注框架进行语义文本相关性标注,实现了较高的标注者间一致性(r = 0.84)。研究证明了人类对相关性的直觉是可靠的,识别出影响相关性的关键语言因素,并展示了 STR-2022 在评估句子表示方法和下游 NLP 任务中的实用性。

ABSTRACT

The degree of semantic relatedness of two units of language has long been considered fundamental to understanding meaning. Additionally, automatically determining relatedness has many applications such as question answering and summarization. However, prior NLP work has largely focused on semantic similarity, a subset of relatedness, because of a lack of relatedness datasets. In this paper, we introduce a dataset for Semantic Textual Relatedness, STR-2022, that has 5,500 English sentence pairs manually annotated using a comparative annotation framework, resulting in fine-grained scores. We show that human intuition regarding relatedness of sentence pairs is highly reliable, with a repeat annotation correlation of 0.84. We use the dataset to explore questions on what makes sentences semantically related. We also show the utility of STR-2022 for evaluating automatic methods of sentence representation and for various downstream NLP tasks. Our dataset, data statement, and annotation questionnaire can be found at: https://doi.org/10.5281/zenodo.7599667

研究动机与目标

  • 解决语义文本相关性(STR)领域缺乏高质量、细粒度数据集的问题,该领域相较于语义相似性而言是 NLP 中一个关键但研究不足的方面。
  • 克服先前数据集使用粗粒度评分尺度的局限性,这些尺度存在尺度区域偏差和标注不一致的问题。
  • 探究使句子对在语义上相关联的因素,超越相似性,捕捉更广泛的语义关联。
  • 利用新数据集评估现有句子表示方法在向量空间中保留语义相关性的有效性。
  • 通过更优的表示学习,展示 STR-2022 在提升下游 NLP 任务性能方面的实用性。

提出的方法

  • 从多样化来源(包括社交媒体和网络文本)收集 5,500 组语言多样的英语句子对,以确保语言多样性。
  • 采用比较标注模式,标注者将句子对相互比较排序,而非分配绝对分数,从而减少尺度偏差并提高可靠性。
  • 在连续的 0–1 尺度上获得精细的相关性评分,评分反映人类对语义接近程度的直觉判断。
  • 通过统计分析评估标注者间的一致性,重复标注的皮尔逊相关系数为 0.84,表明具有高度可靠性。
  • 分析词汇重叠、词性模式以及句法结构(如主语-宾语角色)等语言特征,以识别相关性的预测因子。
  • 评估预训练句子嵌入(例如,词嵌入的平均池化、最大池化)在向量空间中保持相关性的能力。

实验结果

研究问题

  • RQ1人类说话者在句子对的语义相关性上有多高的可靠性?
  • RQ2哪些语言和结构特征最能预测句子对之间的语义相关性?
  • RQ3现有句子表示模型在向量空间中保留语义相关性的能力如何?
  • RQ4更优的相关性标注方案如何提升下游 NLP 任务的性能?
  • RQ5像 STR-2022 这类人工标注的 STR 数据集在伦理和表征方面存在哪些局限性?

主要发现

  • 人类对语义相关性的直觉具有高度可靠性,重复标注的相关系数为 0.84,表明标注者之间具有一致性。
  • 词汇重叠和句法相似性(如共享主语或宾语角色)是相关性的重要预测因子,尽管并非唯一因素。
  • 即使词汇重叠较低,具有共同主题或主题连贯性的句子对也被评为更相关。
  • 现有句子表示方法,尤其是使用上下文嵌入的方法,与人工标注的相关性评分表现出中等到强相关性。
  • 相比传统的评分尺度方法,比较标注方法显著减少了尺度偏差并提高了可靠性。
  • 该数据集表明,相关性并非二元的,而是存在于一个连续谱上,而‘相关’与‘不相关’的阈值是上下文相关的,不是绝对的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。