Skip to main content
QUICK REVIEW

[论文解读] Klexikon: A German Dataset for Joint Summarization and Simplification

Dennis Aumiller, Michael Gertz|arXiv (Cornell University)|Jan 18, 2022
Text Readability and Simplification被引用 8
一句话总结

本文介绍了 Klexikon,这是一个新的德语数据集,包含近 2,900 对来自德语维基百科和儿童百科全书 Klexikon 的文档对齐样本,专为联合文本摘要与简化任务而设计。该数据集支持端到端训练能够同时压缩和简化长文本的模型,并通过定量证据表明,该数据集能有效支持摘要与简化两项任务。

ABSTRACT

Traditionally, Text Simplification is treated as a monolingual translation task where sentences between source texts and their simplified counterparts are aligned for training. However, especially for longer input documents, summarizing the text (or dropping less relevant content altogether) plays an important role in the simplification process, which is currently not reflected in existing datasets. Simultaneously, resources for non-English languages are scarce in general and prohibitive for training new solutions. To tackle this problem, we pose core requirements for a system that can jointly summarize and simplify long source documents. We further describe the creation of a new dataset for joint Text Simplification and Summarization based on German Wikipedia and the German children's lexicon "Klexikon", consisting of almost 2900 documents. We release a document-aligned version that particularly highlights the summarization aspect, and provide statistical evidence that this resource is well suited to simplification as well. Code and data are available on Github: https://github.com/dennlinger/klexikon

研究动机与目标

  • 为解决德语中缺乏大规模、文档对齐的联合文本摘要与简化数据集的问题。
  • 创建一个反映现实世界简化过程的资源,其中摘要与简化在长文档中同时发生。
  • 为训练和评估能够联合简化和摘要长篇文本的端到端模型提供基准。
  • 通过提供高质量、非英语的对齐源文档与简化文档数据集,支持低资源自然语言处理研究。
  • 支持使用多种指标(包括 ROUGE 和可读性评分)对模型在摘要与简化质量方面的评估。

提出的方法

  • 通过半自动方式将德语维基百科文章与儿童百科全书 Klexikon 中相应条目进行对齐,构建数据集。
  • 优先采用文档级对齐,以反映在长文本中摘要作为简化核心组成部分的特性。
  • 使用统计分析和可读性指标(Flesch、句子长度、单词长度、词元覆盖率)验证目标文本的简化质量。
  • 使用 ROUGE 分数评估抽取式基线模型(如 Lead-3、Luhn、LexRank),以建立摘要性能的基线。
  • 通过 Flesch 阅读易读性分数、平均句子长度、平均单词长度以及前 1,000 个词元覆盖率评估简化质量。
  • 数据集以文档对齐版本发布,突出显示摘要部分,代码与数据在 GitHub 上公开可用。

实验结果

研究问题

  • RQ1Klexikon 数据集在训练能够联合摘要和简化德语长文本的模型方面效果如何?
  • RQ2考虑到从源文本到简化文本的句子数量显著减少,该数据集在多大程度上支持摘要任务?
  • RQ3基于可读性与词汇复杂度指标,Klexikon 数据的简化质量与其它语料相比如何?
  • RQ4抽取式摘要方法能否在该数据集上取得良好表现?这对其相对于现有摘要基准的难度意味着什么?
  • RQ5标准评估指标(如 ROUGE)在捕捉词汇简化方面存在哪些局限性?这对模型评估有何影响?

主要发现

  • Klexikon 数据集包含 2,898 对文档对齐样本,源文章平均为 242 个句子,简化版本平均仅 32.5 个句子,表明存在显著的摘要效果。
  • Klexikon 中的简化文本平均 Flesch 阅读易读性得分为 66.7,显著高于维基百科的 40.1,证实可读性得到提升。
  • Klexikon 中的平均句子长度为 13.5 个词元,而维基百科为 22.7 个;平均单词长度为 6.9 个字符,而维基百科为 8.7 个,表明存在词汇简化。
  • Klexikon 在前 1,000 个语料特定词元中的词元覆盖率为 82.3%,而维基百科为 68.8%,表明更广泛使用高频词汇。
  • Lead-3 抽取式基线在 ROUGE-1 上取得 24.87 的 F1 分数,显著优于完整文章基线,但 ROUGE-2 的最优分数为 41.85,表明抽象模型具有巨大潜力。
  • 由于同时要求摘要与简化,尤其是德语词汇与句法复杂性较高,该数据集相比现有摘要数据集更具挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。