Skip to main content
QUICK REVIEW

[论文解读] Liputan6: A Large-scale Indonesian Dataset for Text Summarization

Fajri Koto, Jey Han Lau|arXiv (Cornell University)|Nov 2, 2020
Topic Modeling参考文献 31被引用 14
一句话总结

本文介绍了Liputan6,这是一个大规模的印度尼西亚文本摘要数据集,包含从印度尼西亚新闻门户Liputan6.com收集的215,827对文档-摘要。作者使用单语和多语种BERT开发了基准的抽取式和生成式摘要模型,并进行了错误分析,发现低ROUGE分数通常源于ROUGE对改写和缩写的敏感性,而非模型失效。

ABSTRACT

In this paper, we introduce a large-scale Indonesian summarization dataset. We harvest articles from Liputan6.com, an online news portal, and obtain 215,827 document-summary pairs. We leverage pre-trained language models to develop benchmark extractive and abstractive summarization methods over the dataset with multilingual and monolingual BERT-based models. We include a thorough error analysis by examining machine-generated summaries that have low ROUGE scores, and expose both issues with ROUGE it-self, as well as with extractive and abstractive summarization models.

研究动机与目标

  • 为解决印度尼西亚文本摘要领域缺乏大规模公开NLP数据集的问题。
  • 创建一个支持印度尼西亚语抽取式和生成式摘要研究的基准数据集。
  • 评估预训练BERT模型在印度尼西亚语文本摘要任务上的表现。
  • 对摘要模型和ROUGE评估指标进行详细错误分析。
  • 发布一个包含两个测试集(一个标准集和一个高度生成式)的数据集,以支持模型的稳健评估。

提出的方法

  • 从2000年10月至2010年10月的10年期间,从印度尼西亚新闻门户Liputan6.com收集了215,827对文档-摘要。
  • 通过去除HTML实体、转为小写,并使用标点符号启发式方法进行句子分割,对数据进行预处理。
  • 构建了两个测试集:一个标准测试集和一个名为'Xtreme'的变体,其包含更多生成式摘要,以增加难度。
  • 对单语和多语种BERT模型进行微调,以完成抽取式和生成式摘要任务。
  • 使用ROUGE分数评估模型性能,并对低ROUGE输出进行定性错误分析。
  • 发现低ROUGE分数通常源于改写、缩写和词形变化,而非模型幻觉或覆盖不全。

实验结果

研究问题

  • RQ1单语和多语种BERT模型在生成印度尼西亚语文本的抽取式和生成式摘要方面效果如何?
  • RQ2ROUGE分数在多大程度上能准确反映印度尼西亚语文本摘要的质量?
  • RQ3印度尼西亚语文本摘要中低ROUGE分数的主要原因是什么?是模型失效还是评估局限性所致?
  • RQ4摘要的生成性随时间如何变化?这对模型泛化能力有何影响?
  • RQ5一个大规模、公开可用的印度尼西亚语文本摘要数据集能否提升低资源NLP的SOTA水平?

主要发现

  • Liputan6数据集包含215,827对文档-摘要,是目前最大的非英语摘要数据集之一,规模比此前最大的印度尼西亚数据集高出一个数量级。
  • 'Xtreme'测试集的n-gram(n=4)新颖度达87.5%,显著高于标准集的82.4%,表明其生成性内容更高。
  • ROUGE分数对改写和缩写极为敏感,部分高质量摘要因词汇差异而获得低ROUGE分数。
  • 覆盖不全和焦点偏移是低质量摘要的主要原因,BertExtAbs模型生成的所有摘要(100%)均存在覆盖问题。
  • 幻觉并非主要问题,仅约20%的低质量摘要包含虚构内容。
  • 错误分析表明,由于印尼语的词形丰富性和缩写频繁使用,ROUGE评估在印尼语中存在根本性问题,即使摘要内容正确,也会因词汇变化导致ROUGE分数降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。