Skip to main content
QUICK REVIEW

[논문 리뷰] New Vietnamese Corpus for Machine Reading Comprehension of Health News Articles

Kiet Van Nguyen, Tin Van Huynh|arXiv (Cornell University)|2020. 06. 19.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 기계 읽기 이해(MRC)를 위한 대규모이고 인간이 애너테이션한 베트남어 코퍼스인 ViNewsQA를 소개한다. 이 코퍼스는 22,057개의 질문-답변 쌍으로 구성되어 있으며, 건강 뉴스 기사에서 유래하였다. 이 코퍼스는 복잡한 추론과 영역 전문 지식을 강조하며, 최고의 모델(알버트)이 정확도 매칭 점수 65.26%와 F1 점수 84.89%를 기록했으나, 인간 성능에 비해 크게 뒤처져 있어, 베트남어 MRC 시스템의 향상 여지가 크다는 점을 시사한다.

ABSTRACT

Large-scale and high-quality corpora are necessary for evaluating machine reading comprehension models on a low-resource language like Vietnamese. Besides, machine reading comprehension (MRC) for the health domain offers great potential for practical applications; however, there is still very little MRC research in this domain. This paper presents ViNewsQA as a new corpus for the Vietnamese language to evaluate healthcare reading comprehension models. The corpus comprises 22,057 human-generated question-answer pairs. Crowd-workers create the questions and their answers based on a collection of over 4,416 online Vietnamese healthcare news articles, where the answers comprise spans extracted from the corresponding articles. In particular, we develop a process of creating a corpus for the Vietnamese machine reading comprehension. Comprehensive evaluations demonstrate that our corpus requires abilities beyond simple reasoning, such as word matching and demanding difficult reasoning based on single-or-multiple-sentence information. We conduct experiments using different types of machine reading comprehension methods to achieve the first baseline performances, compared with further models' performances. We also measure human performance on the corpus and compared it with several powerful neural network-based and transfer learning-based models. Our experiments show that the best machine model is ALBERT, which achieves an exact match score of 65.26% and an F1-score of 84.89% on our corpus. The significant differences between humans and the best-performance model (14.53% of EM and 10.90% of F1-score) on the test set of our corpus indicate that improvements in ViNewsQA could be explored in the future study. Our corpus is publicly available on our website for the research purpose to encourage the research community to make these improvements.

연구 동기 및 목표

  • 베트남어와 같은 저자원 언어에 대해 고품질의 영역 특화 MRC 코퍼스가 부족한 문제를 해결하기 위해.
  • 베트남어를 사용한 건강 분야의 기계 읽기 이해 모델 평가를 위한 벤치마크 코퍼스를 만들기 위해.
  • 베트남어 사용자를 대상으로 한 AI 기반 건강 정보 시스템 개발을 지원하기 위해.
  • SQuAD 및 CMRC를 포함한 다국어 MRC 데이터셋 간 비교 연구를 가능하게 하기 위해.
  • 공개된 코퍼스를 통해 공동 작업 및 모델 향상에 기여할 수 있도록 향후 연구를 장려하기 위해.

제안 방법

  • 현장 작업자들이 4,416개의 온라인 베트남어 건강 뉴스 기사 기반으로 질문-답변 쌍을 생성하였다.
  • 답변는 원본 텍스트에서 스파닝 추출 방식으로 제한되어 있어 사실 기반 보장을 확보하였다.
  • 일관성을 확보하기 위해 구조화된 애너테이션 파이프라인을 사용하였으며, 질문은 다양한 유형(무엇, 어떻게, 왜, 누가 등)을 포함하였다.
  • 코퍼스는 복잡한 추론, 다중 문장 간 추론 및 영역 전문 지식이 요구되도록 설계되었다.
  • 기준 모델은 드쿼리, QANet, BERT, 알버트와 같은 표준 MRC 아키텍처를 사용하여 평가되었다.
  • 인간 성능은 신경망 모델과 비교하여 성능 상한선을 설정하기 위해 측정되었다.

실험 결과

연구 질문

  • RQ1기존의 신경망 MRC 모델은 저자원, 영역 특화의 베트남어 코퍼스에서 얼마나 효과적인가?
  • RQ2ViNewsQA 코퍼스는 단순한 스팬 매칭을 넘어서 얼마나 복잡한 추론을 요구하는가?
  • RQ3이 베트남어 건강 MRC 벤치마크에서 인간 애너테이터와 최첨단 신경망 모델 간의 성능 격차는 어느 정도인가?
  • RQ4질문 길이, 답변 길이, 기사 길이는 ViNewsQA에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5이 코퍼스에서 모델 예측 시 가장 흔히 발생하는 오류 유형(예: 모호한 답변 경계, 지식 부족 등)은 무엇인가?

주요 결과

  • 최고 성능을 낸 모델인 알버트는 테스트 세트에서 정확도 매칭 점수 65.26%와 F1 점수 84.89%를 기록하였다.
  • 인간 성능은 최고의 모델을 크게 앞서며, 정확도 매칭 점수에서 14.53%의 격차, F1 점수에서 10.90%의 격차를 보였다.
  • ViNewsQA의 42.25%의 질문이 단일 또는 다중 문장 기반의 복잡한 추론을 요구하였다.
  • 긴 질문과 짧은 답변은 모델 성능 향상과 관련이 있었으며, 이는 복잡성과 길이가 모델 일반화에 영향을 미칠 수 있음을 시사한다.
  • 흔한 오류 유형으로는 모호한 답변 경계, 잘못된 추론, 세계 지식 부족 등이 있었으며, 특히 'kiêng'(피해야 할 것)와 같은 용어에서 두드러졌다.
  • 이 코퍼스는 공동 연구, 공동 과제, 베트남어 MRC 분야의 모델 개발을 장려하기 위해 공개되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.