Skip to main content
QUICK REVIEW

[论文解读] KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension

Seungyoung Lim, Myungji Kim|arXiv (Cornell University)|Sep 16, 2019
Topic Modeling参考文献 7被引用 37
一句话总结

KorQuAD1.0 引入了一个面向韩语的大规模抽取式问答数据集,基于韩语维基百科的 70,000+ 个人工生成的问题-答案对,用以推进机器阅读理解研究。

ABSTRACT

Machine Reading Comprehension (MRC) is a task that requires machine to understand natural language and answer questions by reading a document. It is the core of automatic response technology such as chatbots and automatized customer supporting systems. We present Korean Question Answering Dataset(KorQuAD), a large-scale Korean dataset for extractive machine reading comprehension task. It consists of 70,000+ human generated question-answer pairs on Korean Wikipedia articles. We release KorQuAD1.0 and launch a challenge at https://KorQuAD.github.io to encourage the development of multilingual natural language processing research.

研究动机与目标

  • 激发并推动韩语的稳健机器阅读理解研究。
  • 提供一个面向韩语的大规模、人工生成的抽取式问答数据集,以支持评估和模型开发。
  • 通过发布 KorQuAD1.0 并举办挑战赛,促进多语言自然语言处理研究。

提出的方法

  • 构建一个具有 70,000+ 人工生成的问题-答案对的大规模韩语问答数据集。
  • 将任务格式化为基于韩语维基百科文章的抽取式机器阅读理解。
  • 公开发布 KorQuAD1.0 并启动挑战赛以促进自然语言处理研究。

实验结果

研究问题

  • RQ1模型在韩语维基百科段落上的抽取式问答任务中能达到多好的性能?
  • RQ2该数据集是否能推动韩语领域的多语言NLP研究与评估的进展?
  • RQ3作为韩语机器阅读理解资源,KorQuAD1.0 会带来哪些基准和基线?

主要发现

  • 该数据集包含关于韩语维基百科文章的 70,000+ 人工生成的问题-答案对。
  • KorQuAD1.0 是发布以支持并推动在问答任务中的多语言NLP研究。
  • 在数据集发布后启动的挑战赛旨在鼓励韩语机器阅读理解模型的开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。