Skip to main content
QUICK REVIEW

[论文解读] KorNLI and KorSTS: New Benchmark Datasets for Korean Natural Language Understanding

Jiyeon Ham, Yo Joong Choe|arXiv (Cornell University)|Apr 7, 2020
Topic Modeling参考文献 28被引用 17
一句话总结

本文提出了KorNLI和KorSTS,这是首个公开可用的韩语自然语言推理(NLI)与语义文本相似性(STS)基准数据集,通过将英文训练集进行机器翻译,并由人工进行后编辑处理开发集和测试集构建而成。作者使用多语言模型建立了强基线,并表明在KorNLI上微调可显著提升KorSTS上的性能,证明了这些数据集在推动韩语自然语言理解研究方面的实用性。

ABSTRACT

Natural language inference (NLI) and semantic textual similarity (STS) are key tasks in natural language understanding (NLU). Although several benchmark datasets for those tasks have been released in English and a few other languages, there are no publicly available NLI or STS datasets in the Korean language. Motivated by this, we construct and release new datasets for Korean NLI and STS, dubbed KorNLI and KorSTS, respectively. Following previous approaches, we machine-translate existing English training sets and manually translate development and test sets into Korean. To accelerate research on Korean NLU, we also establish baselines on KorNLI and KorSTS. Our datasets are publicly available at https://github.com/kakaobrain/KorNLUDatasets.

研究动机与目标

  • 为解决韩语缺乏公开可用的NLI和STS数据集的问题,该问题阻碍了韩语自然语言理解的发展。
  • 通过利用机器翻译和人工后编辑,构建高质量的韩语NLI与STS基准数据集。
  • 为KorNLI和KorSTS建立基线模型,以加速韩语NLU研究。
  • 评估翻译质量对跨语言NLU任务中语义关系保留的影响。
  • 通过在韩语数据上训练和评估模型,促进NLU中的语言多样性。

提出的方法

  • 使用内部神经机器翻译引擎将现有的英文NLI和STS训练集(SNLI、MNLI、XNLI、STS-B)翻译成韩语。
  • 由具备学术和技术文本专业背景的译员对开发集和测试集进行人工后编辑,以确保质量和一致性。
  • 使用多语言预训练模型(如M-USE、XLM-R、Korean RoBERTa)在KorNLI和KorSTS上进行微调,适用于交叉编码和双编码方法。
  • 应用Sentence-BERT微调,采用孪生网络架构和MEAN池化进行句子嵌入学习。
  • 使用Spearman等级相关系数(KorSTS)和准确率(KorNLI)评估模型性能,并对在KorNLI上微调的效果进行消融研究。
  • 比较仅在多语言预训练上训练的模型与在KorNLI和KorSTS上额外微调的模型,以评估迁移学习的优势。

实验结果

研究问题

  • RQ1机器翻译结合人工后编辑在多大程度上能保留韩语NLI任务中的语义关系(蕴含、矛盾、中性)?
  • RQ2现有多语言模型在新发布的KorNLI和KorSTS数据集上的零样本或少样本设置下表现如何?
  • RQ3在KorNLI上微调是否能提升下游KorSTS基准的性能,表明KorNLI作为预训练或微调资源的实用性?
  • RQ4在跨语言迁移设置下,与仅在多语言数据上预训练的模型相比,在KorNLI上微调的模型性能如何?
  • RQ5在保留NLI和STS标签方面,翻译中的主要失败模式是什么,它们如何影响模型泛化能力?

主要发现

  • 机器翻译与人工后编辑句子之间的BLEU分数在KorNLI上为63.30,在KorSTS上为73.26,表明翻译质量较高,所需后编辑量较少(分别有47%和53%的句子未更改)。
  • 在KorNLI上微调能持续提升KorSTS基准的性能,Korean RoBERTa模型提升1%,XLM-R模型提升4%–11%,表明KorNLI是宝贵的训练资源。
  • 在KorSTS上表现最佳的模型是同时在KorNLI和KorSTS上微调的大规模XLM-R,其Spearman等级相关系数达到81.84。
  • 在KorNLI上微调的XLM-R在测试集上达到80.3%的准确率,与它在其他XNLI语言上的平均表现(80.1%)相当,表明其具备稳健的跨语言迁移能力。
  • 尽管存在如将'sir'翻译为'선생님'(不具性别)导致标签不匹配等翻译相关问题,整体标签质量仍具意义,这从微调带来的稳定性能提升中得到验证。
  • 如M-USE和基于SentenceBERT的模型在KorNLI上微调后,在KorSTS上实现了具有竞争力的无监督性能,优于fastText和未微调的多语言模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。