Skip to main content
QUICK REVIEW

[论文解读] OCNLI: Original Chinese Natural Language Inference

Hai Hu, Kyle Richardson|arXiv (Cornell University)|Oct 12, 2020
Natural Language Processing Techniques被引用 9
一句话总结

本文提出了OCNLI,这是首个大规模、人工标注的中文自然语言推理数据集,由母语汉语语言学训练的标注员直接构建,而非通过机器翻译生成。与以往多语言NLI数据集不同,OCNLI采用原始中文的前提和假设,涵盖五个语域,实现了高达98%的标注一致性,并表明即使最先进的模型在性能上仍显著落后于人类水平约12个百分点,凸显了该数据集的挑战性与推动中文自然语言理解发展的价值。

ABSTRACT

Despite the tremendous recent progress on natural language inference (NLI), driven largely by large-scale investment in new datasets (e.g., SNLI, MNLI) and advances in modeling, most progress has been limited to English due to a lack of reliable datasets for most of the world's languages. In this paper, we present the first large-scale NLI dataset (consisting of ~56,000 annotated sentence pairs) for Chinese called the Original Chinese Natural Language Inference dataset (OCNLI). Unlike recent attempts at extending NLI to other languages, our dataset does not rely on any automatic translation or non-expert annotation. Instead, we elicit annotations from native speakers specializing in linguistics. We follow closely the annotation protocol used for MNLI, but create new strategies for eliciting diverse hypotheses. We establish several baseline results on our dataset using state-of-the-art pre-trained models for Chinese, and find even the best performing models to be far outpaced by human performance (~12% absolute performance gap), making it a challenging new resource that we hope will help to accelerate progress in Chinese NLU. To the best of our knowledge, this is the first human-elicited MNLI-style corpus for a non-English language.

研究动机与目标

  • 为解决高质量非英语NLI数据集的缺乏,创建一个大规模、人工生成的中文NLI语料库。
  • 克服机器翻译生成的NLI数据集所存在的局限性,后者常引入噪声并降低模型泛化能力。
  • 建立一个反映语言多样性与复杂性的中文自然语言理解基准。
  • 提供一个资源,以支持训练和评估适用于中文的鲁棒、可泛化NLP模型。
  • 支持未来在低资源语言中进行模型探针、偏差减少和句子表示学习的研究。

提出的方法

  • 该数据集基于56,000对前提-假设对构建,涵盖五个不同语域:电视(TV)、政府(GOV)、文学(LIT)、新闻(NEWS)和电话对话(PHONE)。
  • 采用具有语言学训练背景的母语中文标注员生成假设,确保语言准确性与文化相关性。
  • 采用与MNLI高度相似的标注协议,每条前提设置三个难度等级的假设生成(简单、中等、困难),以保证多样性与难度变化。
  • 采用三票共识机制以确保高标注质量,实现标注员之间约98%的一致性。
  • 为每条前提设计四种假设生成模式,以增强假设多样性并减少标注偏差。
  • 使用BERT和RoBERTa架构在OCNLI上微调基线模型,并在保留的测试集上评估性能。

实验结果

研究问题

  • RQ1与机器翻译生成的替代方案相比,人工生成的、非翻译的中文NLI数据集在模型性能和标注质量方面表现如何?
  • RQ2当前最先进的中文预训练模型在新的高质量NLI基准(如OCNLI)上的泛化能力如何?
  • RQ3通过逐步提升难度等级(简单→中等→困难)的多假设生成,是否能产生更鲁棒、更具挑战性的NLI数据?
  • RQ4与在大规模翻译数据集(如XNLI)上微调相比,在OCNLI上微调是否能提升模型性能?
  • RQ5在这一新的中文NLI基准上,最佳模型与人类标注员之间的性能差距是多少?

主要发现

  • OCNLI数据集在标注员之间实现了98%的共识一致率,表明其具有高标注质量与一致性。
  • 在OCNLI上表现最佳的模型(RoBERTa)准确率为78%,而人类专家约为90%,揭示了12个百分点的性能差距。
  • 仅在OCNLI上微调的性能优于在更大的XNLI数据集上微调,表明在此设置下数据质量优于数量。
  • 将OCNLI与XNLI联合微调并未超越仅在OCNLI上微调的性能,表明OCNLI包含更具信息量和更可靠的样本。
  • 学习曲线显示,OCNLI在约25,000个训练样本时达到性能峰值,而XNLI在50,000个样本时仍持续提升,凸显了OCNLI在数据效率与质量方面的优势。
  • 多假设生成与难度等级递增(从简单到困难)导致模型准确率持续下降,证实该数据集有效捕捉了语言复杂性的逐步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。