[논문 리뷰] KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension
KorQuAD1.0은 한국어 위키백과에서 70,000개 이상의 사람 생성 질문-답변 쌍으로 대규모 한국어 추출형 QA 데이터셋을 도입하여 MRC 연구를 진전시킨다.
Machine Reading Comprehension (MRC) is a task that requires machine to understand natural language and answer questions by reading a document. It is the core of automatic response technology such as chatbots and automatized customer supporting systems. We present Korean Question Answering Dataset(KorQuAD), a large-scale Korean dataset for extractive machine reading comprehension task. It consists of 70,000+ human generated question-answer pairs on Korean Wikipedia articles. We release KorQuAD1.0 and launch a challenge at https://KorQuAD.github.io to encourage the development of multilingual natural language processing research.
연구 동기 및 목표
- 한국어에서 견고한 기계 독해 연구를 동기부여하고 가능하게 한다.
- 한국어를 위한 대규모의 사람 생성 추출형 QA 데이터셋을 제공하여 평가 및 모델 개발을 지원한다.
- KorQuAD1.0을 공개하고 도전을 주최하여 다국어 NLP 연구를 촉진한다.
제안 방법
- 70,000+명의 사람 생성 질문-답변 쌍으로 대규모 한국어 QA 데이터셋을 구성한다.
- 한국어 위키피디아 기사에 대해 추출형 기계 독해로 작업을 형식화한다.
- KorQuAD1.0을 공개적으로 발표하고 NLP 연구를 촉진하기 위한 도전을 시작한다.
실험 결과
연구 질문
- RQ1모델이 한국어 위키피디아 구절에서 추출형 QA를 얼마나 잘 수행할 수 있는가?
- RQ2데이터셋이 한국어를 위한 다국어 NLP 연구 및 평가의 발전을 촉진할 수 있는가?
- RQ3KorQuAD1.0이 한국어 MRC 자원으로 어떤 벤치마크와 기준선을 제시하는가?
주요 결과
- 데이터셋은 한국어 위키피디아 기사에 대해 70,000+명의 사람 생성 질문–답변 쌍을 포함한다.
- KorQuAD1.0은 QA 작업에서 다국어 NLP 연구를 지원하고 동기를 부여하기 위해 공개된다.
- 데이터셋 공개에 따른 도전이 시작되어 한국어 MRC 모델의 개발을 장려한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.