Skip to main content
QUICK REVIEW

[论文解读] DaLAJ - a dataset for linguistic acceptability judgments for Swedish: Format, baseline, sharing

Elena Volodina, Yousuf Ali Mohammed|arXiv (Cornell University)|May 14, 2021
Natural Language Processing Techniques参考文献 20被引用 7
一句话总结

DaLAJ 1.0 是一个包含 9,596 个瑞典语句子的新数据集,源自学习者作文,专为语言可接受性判断任务而设计。该数据集采用句子乱序、匿名化的学习者数据,仅保留母语和熟练度水平元数据,确保符合 GDPR 要求。使用 BERT 嵌入的基线二分类模型在该数据集上达到 58% 的准确率,证明其在自然语言处理与第二语言习得研究中的实用性。

ABSTRACT

We present DaLAJ 1.0, a Dataset for Linguistic Acceptability Judgments for Swedish, comprising 9 596 sentences in its first version; and the initial experiment using it for the binary classification task. DaLAJ is based on the SweLL second language learner data, consisting of essays at different levels of proficiency. To make sure the dataset can be freely available despite the GDPR regulations, we have sentence-scrambled learner essays and removed part of the metadata about learners, keeping for each sentence only information about the mother tongue and the level of the course where the essay has been written. We use the normalized version of learner language as the basis for the DaLAJ sentences, and keep only one error per sentence. We repeat the same sentence for each individual correction tag used in the sentence. For DaLAJ 1.0 we have used four error categories (out of 35 available in SweLL), all connected to lexical or word-building choices. Our baseline results for the binary classification show an accuracy of 58% for DaLAJ 1.0 using BERT embeddings. The dataset is included in the SwedishGlue (Swe. SuperLim) benchmark. Below, we describe the format of the dataset, first experiments, our insights and the motivation for the chosen approach to data sharing.

研究动机与目标

  • 创建一个公开可共享、符合 GDPR 的瑞典语语言可接受性判断数据集,基于第二语言学习者数据。
  • 通过将学习者标注的数据转换为标准化格式,支持大规模 NLP 研究,涵盖错误检测、纠正与可接受性判断。
  • 通过移除个人身份标识并采用句子乱序技术,解决敏感学习者数据共享的挑战。
  • 通过将 DaLAJ 整合到瑞典语 Glue(Swe. SuperLim)评估套件中,为瑞典语 NLP 建立基准。
  • 探索将学习者语料库作为真实、专家标注的“不可接受”语言示例来源,用于 NLU 任务的可行性。

提出的方法

  • 该数据集源自 SweLL 学习者语料库,其中包含 502 篇标准化作文,共 29,285 个校对标签,涵盖 35 种错误类型。
  • 仅选取了四种错误类别——词汇派生、复合词、非瑞典语词汇使用、错误词语/短语——用于 DaLAJ 1.0,均与词汇或词形变化选择相关。
  • 每个句子均配有一个仅包含一个错误差异的修正版本,形成 4,798 对句子,共计 9,596 个句子。
  • 为确保符合 GDPR,所有学习者身份标识信息已被移除,且通过句子乱序技术防止重新识别。
  • 最终数据集仅包含母语和课程级别作为元数据,每个句子均以标准化形式保留。
  • 基于 BERT 的二分类模型在该数据集上进行训练,基线性能准确率达到 58%。

实验结果

研究问题

  • RQ1学习者语料库能否被转化为符合 GDPR、可公开共享的语言可接受性判断数据集?
  • RQ2基于 BERT 的模型在分类源自学习者错误的瑞典语句子可接受性方面效果如何?
  • RQ3句子乱序与匿名化方法是否保留了数据在 NLP 任务中的语言完整性和实用性?
  • RQ4所提出的数据显示格式能否支持第二语言习得研究中的细粒度错误分析与模型评估?
  • RQ5此类数据集在多语言 NLP 的共享任务与基准测试中具有何种潜力?

主要发现

  • DaLAJ 1.0 包含 9,596 个句子,源自 4,798 对句子,每对句子仅在一个词汇或词形变化错误上存在差异。
  • 该数据集基于 SweLL 学习者语料库,包含 502 篇标准化作文和 29,285 个校对标签,从中筛选出 4,798 个相关校正。
  • 使用 BERT 嵌入的基线二分类模型在可接受性判断任务中达到 58% 的准确率。
  • 该数据集已集成至 SwedishGlue 基准测试中,支持对瑞典语 NLP 模型的标准化评估。
  • 所提出的共享方法——句子乱序与最小化元数据——在符合 GDPR 的同时,实现了更广泛的研究可及性。
  • 未来工作包括扩展数据集以涵盖全部 35 个校对标签、测试模型在多错误句子上的表现,以及组织共享任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。