[论文解读] DiscoFuse: A Large-Scale Dataset for Discourse-Based Sentence Fusion
本文提出 DiscoFuse,一个包含6000万条基于语篇的句子融合示例的大规模数据集,这些示例通过规则化方法从维基百科和体育文章中自动生成,方法基于对融合句子的逆向规则分解。该方法可有效用于神经模型的预训练,显著提升下游融合任务(如 WebSplit)的性能,证明了 DiscoFuse 在低资源设置下的迁移学习实用性。
Sentence fusion is the task of joining several independent sentences into a single coherent text. Current datasets for sentence fusion are small and insufficient for training modern neural models. In this paper, we propose a method for automatically-generating fusion examples from raw text and present DiscoFuse, a large scale dataset for discourse-based sentence fusion. We author a set of rules for identifying a diverse set of discourse phenomena in raw text, and decomposing the text into two independent sentences. We apply our approach on two document collections: Wikipedia and Sports articles, yielding 60 million fusion examples annotated with discourse information required to reconstruct the fused text. We develop a sequence-to-sequence model on DiscoFuse and thoroughly analyze its strengths and weaknesses with respect to the various discourse phenomena, using both automatic as well as human evaluation. Finally, we conduct transfer learning experiments with WebSplit, a recent dataset for text simplification. We show that pretraining on DiscoFuse substantially improves performance on WebSplit when viewed as a sentence fusion task.
研究动机与目标
- 解决神经句子融合模型缺乏大规模、高质量训练数据的问题。
- 开发一种可扩展的、基于规则的方法,从原始文本语料中自动生成多样化的句子融合示例。
- 评估 DiscoFuse 在训练序列到序列模型以及在相关任务上实现迁移学习方面的有效性。
- 分析模型在不同语篇现象(如连接词、回指、并列)上的表现。
- 证明在 DiscoFuse 上进行预训练可提升下游融合任务(如 WebSplit)的性能。
提出的方法
- 应用手工设计的规则,通过反转常见的融合操作(包括连接词插入、代词指代和并列结构),将融合句子分解为两个独立句子。
- 将基于规则的分解流程应用于两个大规模语料库:维基百科和体育文章,分别生成1600万和4400万条示例。
- 使用 Transformer 架构构建序列到序列模型,从生成的示例中学习融合。
- 通过众包方式进行人工评估,以衡量拆分后句子的质量与连贯性,获得85%的理解率。
- 通过在 DfWiki 上进行预训练并在 WebSplit 数据集上微调,开展迁移学习实验,以实现句子融合的逆向任务。
- 使用 SARI 和 F1 分数评估模型在自动与人工评估指标上的表现。
实验结果
研究问题
- RQ1基于规则的方法能否在无需人工标注的情况下,从原始文本中生成大规模、高质量的句子融合示例?
- RQ2在 DiscoFuse 上训练的神经模型在处理如连接词插入和代词指代等不同语篇现象时,泛化能力如何?
- RQ3在数据量有限的下游融合任务(如 WebSplit)中,基于 DiscoFuse 的预训练能在多大程度上提升性能?
- RQ4当前模型在处理句子融合中的语篇层面现象时,主要的失败模式是什么?
- RQ5在连贯性与语义保真度方面,自动生成示例的质量与人工标注数据相比如何?
主要发现
- DiscoFuse 数据集包含从维基百科和体育文章中衍生出的6000万条句子融合示例,其中85%的拆分示例经人工标注者判断为连贯。
- 基于 Transformer 的模型在处理如同位语和定语从句等结构融合操作时表现良好,但在连接词插入和代词选择方面表现显著不足。
- 在 DfWiki(1600万条示例)上进行预训练,并在 WebSplit 上微调,相比仅在 WebSplit 上训练,SARI 分数提升9%,'added' n-gram 的 F1 分数相对提升33%。
- 模型在 'added' n-gram 上的 F1 分数(10.4)仍较低,表明在改写与内容恢复方面存在挑战,尤其在经过大幅简化的数据中更为明显。
- 迁移学习设置表明,DiscoFuse 为融合任务提供了有用的归纳偏置,即使目标数据分布不同,也验证了其泛化能力。
- 基于规则的生成方法成功捕捉了多样的语篇现象,包括对比、因果和举例连接词,其中 'unless' 的对齐准确率达68.9%,'so that' 达67.0%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。