Skip to main content
QUICK REVIEW

[论文解读] Evaluating Text Coherence at Sentence and Paragraph Levels

Sennan Liu, Shuang Zeng|arXiv (Cornell University)|Jun 5, 2020
Topic Modeling参考文献 22被引用 4
一句话总结

本文提出段落级文本排序作为评估文本连贯性的句子级排序的补充任务。它在八个多样化数据集(四个句子级,四个段落级)上评估现有模型,通过合成数据测试可学习性和鲁棒性,并通过人工评估表明,WLCS-l 在与人类判断的相关性上优于广泛使用的 τ 指标,图神经网络模型表现出优异的性能和鲁棒性。

ABSTRACT

In this paper, to evaluate text coherence, we propose the paragraph ordering task as well as conducting sentence ordering. We collected four distinct corpora from different domains on which we investigate the adaptation of existing sentence ordering methods to a paragraph ordering task. We also compare the learnability and robustness of existing models by artificially creating mini datasets and noisy datasets respectively and verifying the efficiency of established models under these circumstances. Furthermore, we carry out human evaluation on the rearranged passages from two competitive models and confirm that WLCS-l is a better metric performing significantly higher correlations with human rating than tau, the most prevalent metric used before. Results from these evaluations show that except for certain extreme conditions, the recurrent graph neural network-based model is an optimal choice for coherence modeling.

研究动机与目标

  • 提出并确立段落级文本排序作为句子级排序的补充任务,以实现更全面的连贯性评估。
  • 在多样领域和不同数据规模下,评估现有文本排序模型的性能、可学习性和鲁棒性。
  • 评估自动指标(τ、准确率、WLCS-l)与人类对重排文本连贯性判断的相关性。
  • 识别在不同数据条件下最有效的连贯性建模模型架构。

提出的方法

  • 提出使用四个新领域特定语料(新闻、声明、经济学家、歌词)的段落排序任务,以超越句子级摘要。
  • 收集并预处理八个数据集——四个句子级(NIPS、AAN、arXiv、SIND)和四个段落级(新闻、声明、经济学家、歌词)——并提供关于长度、词汇量和划分的详细统计。
  • 使用标准指标(τ、准确率、WLCS-l)评估模型性能,并通过三位评分者的人工评估,评估模型生成顺序的连贯性。
  • 通过下采样人工创建小规模数据集(mini-datasets)和通过注入噪声创建噪声数据集,以测试模型的可学习性和鲁棒性。
  • 应用 Krippendorff’s α 和评分者间相关性以验证人工标注的可靠性。
  • 使用回归分析比较指标性能,结果显示 WLCS-l 在预测人类评分方面具有最高的决定系数(R-squared = 0.665)。

实验结果

研究问题

  • RQ1现有文本排序模型在句子和段落两个层面的多样化领域中表现如何?
  • RQ2自动指标(τ、准确率、WLCS-l)在预测人类对文本连贯性的判断方面相对有效性如何?
  • RQ3在低资源(小规模数据集)和噪声数据条件下,模型表现如何,反映出其可学习性和鲁棒性?
  • RQ4基于图的循环神经网络模型(SE-Graph)是否在不同数据规模和噪声水平下均保持优越性能?
  • RQ5WLCS-l 是否比 τ 更可靠地用于评估句子排序的连贯性?

主要发现

  • WLCS-l 与人类判断的相关性最高(R-squared = 0.665),显著优于 τ(R-squared = 0.571)和准确率(R-squared = 0.618)。
  • 基于循环图神经网络的模型(SE-Graph)表现出强大的鲁棒性和可学习性,在数据稀缺和噪声注入条件下仍保持高性能。
  • 人工评估显示,评分者受文本内在复杂性的影响,可能导致对连贯性的感知扭曲,从而产生模型表现更优的误导性印象。
  • 评分者间一致性为中等(Krippendorff’s α = 0.53),表明在缺乏详细指导的情况下,连贯性评估是一项复杂且主观的任务。
  • SOTA 模型 SE-Graph 在人工评分中表现略逊于 ATTOrderNet,尽管这可能是复杂性效应所致,而非实际连贯性质量的差异。
  • 本研究证实,与 τ 相比,WLCS-l 是评估句子排序连贯性的更可靠自动指标,提示应从成对比较指标转向序列级指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。