[论文解读] Liputan6: A Large-scale Indonesian Dataset for Text Summarization
本文介绍了Liputan6,这是一个大规模的印度尼西亚文本摘要数据集,包含从印度尼西亚新闻门户Liputan6.com收集的215,827对文档-摘要。作者使用单语和多语种BERT开发了基准的抽取式和生成式摘要模型,并进行了错误分析,发现低ROUGE分数通常源于ROUGE对改写和缩写的敏感性,而非模型失效。
In this paper, we introduce a large-scale Indonesian summarization dataset. We harvest articles from Liputan6.com, an online news portal, and obtain 215,827 document-summary pairs. We leverage pre-trained language models to develop benchmark extractive and abstractive summarization methods over the dataset with multilingual and monolingual BERT-based models. We include a thorough error analysis by examining machine-generated summaries that have low ROUGE scores, and expose both issues with ROUGE it-self, as well as with extractive and abstractive summarization models.
研究动机与目标
- 为解决印度尼西亚文本摘要领域缺乏大规模公开NLP数据集的问题。
- 创建一个支持印度尼西亚语抽取式和生成式摘要研究的基准数据集。
- 评估预训练BERT模型在印度尼西亚语文本摘要任务上的表现。
- 对摘要模型和ROUGE评估指标进行详细错误分析。
- 发布一个包含两个测试集(一个标准集和一个高度生成式)的数据集,以支持模型的稳健评估。
提出的方法
- 从2000年10月至2010年10月的10年期间,从印度尼西亚新闻门户Liputan6.com收集了215,827对文档-摘要。
- 通过去除HTML实体、转为小写,并使用标点符号启发式方法进行句子分割,对数据进行预处理。
- 构建了两个测试集:一个标准测试集和一个名为'Xtreme'的变体,其包含更多生成式摘要,以增加难度。
- 对单语和多语种BERT模型进行微调,以完成抽取式和生成式摘要任务。
- 使用ROUGE分数评估模型性能,并对低ROUGE输出进行定性错误分析。
- 发现低ROUGE分数通常源于改写、缩写和词形变化,而非模型幻觉或覆盖不全。
实验结果
研究问题
- RQ1单语和多语种BERT模型在生成印度尼西亚语文本的抽取式和生成式摘要方面效果如何?
- RQ2ROUGE分数在多大程度上能准确反映印度尼西亚语文本摘要的质量?
- RQ3印度尼西亚语文本摘要中低ROUGE分数的主要原因是什么?是模型失效还是评估局限性所致?
- RQ4摘要的生成性随时间如何变化?这对模型泛化能力有何影响?
- RQ5一个大规模、公开可用的印度尼西亚语文本摘要数据集能否提升低资源NLP的SOTA水平?
主要发现
- Liputan6数据集包含215,827对文档-摘要,是目前最大的非英语摘要数据集之一,规模比此前最大的印度尼西亚数据集高出一个数量级。
- 'Xtreme'测试集的n-gram(n=4)新颖度达87.5%,显著高于标准集的82.4%,表明其生成性内容更高。
- ROUGE分数对改写和缩写极为敏感,部分高质量摘要因词汇差异而获得低ROUGE分数。
- 覆盖不全和焦点偏移是低质量摘要的主要原因,BertExtAbs模型生成的所有摘要(100%)均存在覆盖问题。
- 幻觉并非主要问题,仅约20%的低质量摘要包含虚构内容。
- 错误分析表明,由于印尼语的词形丰富性和缩写频繁使用,ROUGE评估在印尼语中存在根本性问题,即使摘要内容正确,也会因词汇变化导致ROUGE分数降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。