[论文解读] A Continuously Growing Dataset of Sentential Paraphrases
本文提出了一种新颖且可扩展的方法,通过链接共享相同URL的推文,持续从Twitter中收集大规模的句子级释义对,无需人工介入或基于分类器的过滤。该方法生成了一个包含51,524对人工标注句子对的黄金标准数据集,并能以约70%的精确度每月自动提取超过30,000条新的释义对,显著推进了释义识别与生成的研究。
A major challenge in paraphrase research is the lack of parallel corpora. In this paper, we present a new method to collect large-scale sentential paraphrases from Twitter by linking tweets through shared URLs. The main advantage of our method is its simplicity, as it gets rid of the classifier or human in the loop needed to select data before annotation and subsequent application of paraphrase identification algorithms in the previous work. We present the largest human-labeled paraphrase corpus to date of 51,524 sentence pairs and the first cross-domain benchmarking for automatic paraphrase identification. In addition, we show that more than 30,000 new sentential paraphrases can be easily and continuously captured every month at ~70% precision, and demonstrate their utility for downstream NLP tasks through phrasal paraphrase extraction. We make our code and data freely available.
研究动机与目标
- 解决句级释义研究中大规模高质量平行语料库严重缺乏的关键问题。
- 开发一种可扩展的自动化方法,无需依赖人工标注数据或基于分类器的过滤来收集释义对。
- 创建迄今为止最大的人工标注释义语料库,支持释义识别模型的稳健训练与评估。
- 实现实时、持续的释义对收集,以支持最新技术的自然语言处理应用。
- 通过捕捉社交媒体中非正式的用户生成释义,补充现有资源(如PPDB)的不足。
提出的方法
- 利用Twitter帖子中共享的URL作为信号,将可能表达相同含义的句子分组。
- 通过URL共现形成候选句子对,假设链接至同一文章的推文很可能表达相似内容。
- 通过人工标注验证语义等价性,从而构建一个包含51,524对句子的黄金标准数据集。
- 应用自动词对齐技术(如GIZA++、Jacana、Sultan)从收集到的句子对中提取短语级释义。
- 使用语言模型得分、翻译得分和GloVe特征来评估并排序提取出的短语级释义。
- 通过每月重新应用基于URL的方法,持续更新资源以捕捉新的释义对。
实验结果
研究问题
- RQ1社交媒体中共享的URL能否作为可靠信号,在大规模范围内识别潜在的释义句子?
- RQ2通过URL链接收集的释义语料库在质量和多样性上与现有手工整理的数据集相比如何?
- RQ3当在该跨领域语料库上进行训练时,自动释义识别模型在不同领域间的泛化能力如何?
- RQ4能否有效利用对齐技术从该数据中提取出最新的短语级释义?
- RQ5在覆盖范围和语言多样性方面,该新数据集与PPDB等现有资源相比有何互补性?
主要发现
- 所提出的方法成功构建了一个包含51,524对句子的黄金标准释义语料库,是迄今为止最大的此类数据集。
- 每月可自动收集超过30,000条新的句子级释义对,估计精确度约为70%。
- 该语料库包含有意义的非释义对以及多组参考句,有助于更好地训练和评估释义识别与生成模型。
- 通过词对齐提取的短语级释义取得了高质量结果,Sultan对齐器提取的前10%结果中,34.4%的配对与PPDB重叠,表明其具有强大的覆盖范围和新颖性。
- 与先前工作(BUCC-2013)相比,该方法在提取高质量短语级释义方面表现更优,人类评估中90%的前10%高分配对被评为高质量(5/5分)。
- 覆盖范围对比显示,新基于Twitter URL的释义数据与PPDB之间的重叠极小(1.3%),证实其在捕捉非正式、动态语言方面的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。