Skip to main content
QUICK REVIEW

[论文解读] Subjective Assessment of Text Complexity: A Dataset for German Language

Babak Naderi, Salar Mohtaj|arXiv (Cornell University)|Apr 16, 2019
Text Readability and Simplification参考文献 6被引用 9
一句话总结

本论文提出 TextComplexityDE,一个德语语料库,包含从维基百科和 Leichte Sprache 中选取的 1,000 个句子,通过众包和实验室研究,由 A1–B2 水平的德语学习者对句子的复杂性、可理解性和词汇难度进行主观评分。该数据集还包含由母语者手动简化过的 250 个句子,可用于开发德语文本复杂性模型和自动简化系统。

ABSTRACT

This paper presents TextComplexityDE, a dataset consisting of 1000 sentences in German language taken from 23 Wikipedia articles in 3 different article-genres to be used for developing text-complexity predictor models and automatic text simplification in German language. The dataset includes subjective assessment of different text-complexity aspects provided by German learners in level A and B. In addition, it contains manual simplification of 250 of those sentences provided by native speakers and subjective assessment of the simplified sentences by participants from the target group. The subjective ratings were collected using both laboratory studies and crowdsourcing approach.

研究动机与目标

  • 为德语文本复杂性评估开发一个高质量的、基于句子级别的数据集,以支持自动文本简化和可读性建模。
  • 通过已验证的方法,从 A1–B2 水平的德语学习者处收集关于复杂性、可理解性和词汇难度的主观评分。
  • 提供由母语者手动简化的 250 个复杂句子的版本,作为自动文本简化模型的黄金标准参考。
  • 评估主观评分与 Flesch Reading Ease 等定量可读性公式的可靠性与有效性。
  • 为未来研究提供支持,以比较感知复杂性与实际理解能力(例如通过内容问题)或生理测量方法(例如眼动追踪)之间的关系。

提出的方法

  • 从历史、社会和科学领域的 23 篇维基百科文章中收集了 1,019 个句子,另从 Leichte Sprache 数据集中选取 100 个句子作为黄金标准。
  • 设计了一个 7 分制的绝对类别评分量表,用于复杂性、可理解性和词汇难度,并通过试点研究和专家评审完成验证。
  • 通过三种渠道进行主观评估:付费众包(16%)、通过 87 个 Facebook 群组招募志愿者(21%),以及在实验室环境中对 33 名学习者进行受控测试(占有效评分的 63%)。
  • 使用统计方法筛选数据,每条句子保留 5–18 个有效评分,报告平均意见得分(MOS)、标准差和 95% 置信区间。
  • 从 265 个高度复杂的句子中(复杂性 MOS > 4.0,可理解性 MOS > 3.5)选出句子,由 75 名母语者进行人工简化。
  • 在文章和句子两个层级上计算 Flesch Reading Ease(FRE)得分,以与主观评分进行比较,并评估公式在捕捉复杂性方面的局限性。

实验结果

研究问题

  • RQ1德语学习者对文本复杂性、可理解性和词汇难度的主观评分之间存在何种相关性?
  • RQ2在句子层级上,Flesch Reading Ease 等定量可读性公式与主观评分的相关性如何?
  • RQ3与文本难度的客观度量相比,语言学习者的主观评分在多大程度上具有可靠性和有效性?
  • RQ4母语者人工简化后的句子能否作为训练德语自动文本简化模型的有效参考?
  • RQ5现有可读性公式在捕捉学习者感知的句子层级复杂性方面存在哪些局限性?

主要发现

  • 维基百科句子的复杂性平均意见得分(MOS)为 3.22,Leichte Sprache 句子的 MOS 为 1.20,表明正常文本与简化文本之间存在显著区分。
  • 各维度间存在强相关性:复杂性与可理解性(r = .896)、复杂性与词汇难度(r = .905)、可理解性与词汇难度(r = .935)。
  • Flesch Reading Ease(FRE)得分在句子层级上与主观复杂性呈中等相关(r = .55,p < .001),但标准化后截距较大,表明与感知难度的对齐性较差。
  • FRE 公式在句子层级表现欠佳,尤其在高复杂度范围内,证实了其在句子层级评估中缺乏稳健性。
  • 被评定为最复杂的句子通常在主题上较复杂或句法结构较繁琐,甚至对母语者而言也难以理解,表明结构和语义因素在感知难度中起着重要作用。
  • 在 265 个选定的复杂句子中,250 个至少获得一次来自母语者的简化,而 90 个被认为无法简化,凸显了简化特定句法或语义结构的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。