[论文解读] How to Find Strong Summary Coherence Measures? A Toolbox and a Comparative Study for Summary Coherence Measure Evaluation
本文提出了一套全面的工具箱和大规模评估框架,用于总结连贯性度量(CMs),引入了系统内相关性和偏差矩阵,以检测系统级混杂因素和模型偏差。研究发现,尽管在洗牌任务上微调的大语言模型(LLMs)表现优异,但大多数现有CMs在更严格的评估下表现不佳,尤其是在跨不同摘要长度和内容的泛化能力方面,凸显了基于分类的训练相较于成对排序的优势。
Automatically evaluating the coherence of summaries is of great significance both to enable cost-efficient summarizer evaluation and as a tool for improving coherence by selecting high-scoring candidate summaries. While many different approaches have been suggested to model summary coherence, they are often evaluated using disparate datasets and metrics. This makes it difficult to understand their relative performance and identify ways forward towards better summary coherence modelling. In this work, we conduct a large-scale investigation of various methods for summary coherence modelling on an even playing field. Additionally, we introduce two novel analysis measures, intra-system correlation and bias matrices, that help identify biases in coherence measures and provide robustness against system-level confounders. While none of the currently available automatic coherence measures are able to assign reliable coherence scores to system summaries across all evaluation metrics, large-scale language models fine-tuned on self-supervised tasks show promising results, as long as fine-tuning takes into account that they need to generalize across different summary lengths.
研究动机与目标
- 为解决总结连贯性度量(CMs)缺乏标准化评估的问题,这些度量通常在不同数据集和指标上进行评估,导致性能比较不可靠。
- 识别并缓解CMs中的系统级混杂因素,这些因素利用不同摘要生成器之间的性能差距,而非真正建模连贯性。
- 提出新的评估指标——特别是系统内相关性和偏差矩阵——以提升鲁棒性并检测模型偏差。
- 在一致且严格的条件下,对近期的SummEval数据集上广泛评估多种CMs,以评估其在不同摘要长度和内容下的泛化能力和性能表现。
- 通过识别现有方法的局限性并提出改进建议,为未来研究提供指导,尤其关注自监督训练和模型架构的优化。
提出的方法
- 提出系统内相关性作为新的评估指标,用于衡量同一摘要生成器生成的摘要中连贯性得分的一致性,从而降低对系统级混杂因素的敏感性。
- 引入偏差矩阵作为诊断工具,用于可视化和检测CMs对特定摘要生成器或模型类型的系统性偏差。
- 开展对14种CMs在多种评估范式下的大规模对比研究,包括系统级相关性、成对排序和系统内相关性。
- 使用二分类目标(CCL)对大语言模型(LLMs)在句子洗牌任务上进行微调,与标准的成对排序损失形成对比。
- 采用改进的洗牌测试,评估CMs在不同长度和内容的文档上的表现,以模拟摘要生成中的实际多样性。
- 应用Brown连贯性工具箱量化不同数据集间的实体重叠,评估基于实体的连贯性建模的可行性。
实验结果
研究问题
- RQ1现有总结连贯性度量能否可靠地评估跨不同摘要生成器输出的连贯性,还是它们会利用系统级混杂因素?
- RQ2系统级相关性、成对排序和系统内相关性这三种评估指标在揭示CMs真实连贯性建模能力方面有何差异?
- RQ3连贯性度量在多大程度上偏向特定摘要生成器?偏差矩阵能否有效检测此类偏差?
- RQ4为何在洗牌任务上表现良好的CMs在真实世界摘要数据集(如SummEval)上表现不佳,尤其是在摘要长度变化时?
- RQ5与成对排序相比,使用全局分类目标(如CCL)训练连贯性模型是否能提升在不同摘要长度和内容下的泛化能力?
主要发现
- 所评估的任何连贯性度量均未在所有评估指标上实现可靠性能,尤其在系统内相关性指标下表现显著不足,表明其泛化能力存在重大局限。
- 即使表现最佳的CMs也显示出对特定摘要生成器的强烈偏向,这通过偏差矩阵得以揭示,引发了对其可靠性与公平性的担忧。
- 基于实体的连贯性模型(如EEG、EGR、NEG)表现欠佳,原因在于CNN/DM和SummEval摘要中实体重叠极少,限制了其适用性。
- 采用成对排序损失训练的模型(如UNF、GRA)无法泛化到不同长度的摘要,而采用分类目标的CCL模型则在长度变化下保持了稳定的性能。
- 在洗牌任务上微调的大语言模型,尤其是作为二分类器训练的模型,表现最为出色,表明这是未来连贯性建模的可行路径。
- 本研究证明,系统级相关性不足以评估连贯性模型,因其易受混杂因素影响,且无法反映对连贯性的真正理解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。