Skip to main content
QUICK REVIEW

[論文レビュー] New Vietnamese Corpus for Machine Reading Comprehension of Health News Articles

Kiet Van Nguyen, Tin Van Huynh|arXiv (Cornell University)|Jun 19, 2020
Topic Modeling被引用数 7
ひとこと要約

本稿では、健康関連のニュース記事から抽出した22,057件の質問-回答ペairを含む大規模かつ人手でアノテートされたベトナム語コーパス、ViNewsQAを紹介する。このコーパスは、複雑な推論と分野特異的知識を重視しており、最良のモデル(ALBERT)は正確一致スコア65.26%、F1スコア84.89%を達成したが、人間の性能より著しく低い水準にとどまっており、ベトナム語MRCシステムにおけるさらなる改善の余地が広く残っていることを示している。

ABSTRACT

Large-scale and high-quality corpora are necessary for evaluating machine reading comprehension models on a low-resource language like Vietnamese. Besides, machine reading comprehension (MRC) for the health domain offers great potential for practical applications; however, there is still very little MRC research in this domain. This paper presents ViNewsQA as a new corpus for the Vietnamese language to evaluate healthcare reading comprehension models. The corpus comprises 22,057 human-generated question-answer pairs. Crowd-workers create the questions and their answers based on a collection of over 4,416 online Vietnamese healthcare news articles, where the answers comprise spans extracted from the corresponding articles. In particular, we develop a process of creating a corpus for the Vietnamese machine reading comprehension. Comprehensive evaluations demonstrate that our corpus requires abilities beyond simple reasoning, such as word matching and demanding difficult reasoning based on single-or-multiple-sentence information. We conduct experiments using different types of machine reading comprehension methods to achieve the first baseline performances, compared with further models' performances. We also measure human performance on the corpus and compared it with several powerful neural network-based and transfer learning-based models. Our experiments show that the best machine model is ALBERT, which achieves an exact match score of 65.26% and an F1-score of 84.89% on our corpus. The significant differences between humans and the best-performance model (14.53% of EM and 10.90% of F1-score) on the test set of our corpus indicate that improvements in ViNewsQA could be explored in the future study. Our corpus is publicly available on our website for the research purpose to encourage the research community to make these improvements.

研究の動機と目的

  • リソースが乏しい言語としてのベトナム語における高品質で分野特異的なMRCコーパスの不足を解消すること。
  • ベトナム語を用いた医療分野における機械読解モデルの評価を目的としたベンチマークコーパスの構築。
  • ベトナム語ユーザー向けのAI駆動型健康情報システムの開発を支援すること。
  • SQuAD や CMRC を含む多言語MRCデータセット間の比較研究を可能にすること。
  • コミュニティ研究の促進のため、共有タスクやモデル改善を目的としてコーパスを公開すること。

提案手法

  • クラウドワーカーが4,416件のオンラインで入手可能なベトナム語の健康関連ニュース記事に基づいて質問-回答ペアを生成した。
  • 回答は元のテキストからのスパン抽出に制限され、事実の根拠が保証された。
  • 一貫性を確保するための構造化されたアノテーションプロセスが採用され、質問は「何」「どう」「なぜ」「だれ」など多様なタイプをカバーした。
  • このコーパスは、複数文にわたる推論や分野特異的知識を要する複雑な推論を必要とするように設計された。
  • 標準的なMRCアーキテクチャ(DrQA、QANet、BERT、ALBERT)を用いてベースラインモデルを評価した。
  • 人間の性能を測定し、ニューラルモデルと比較することで、性能の上限を確立した。

実験結果

リサーチクエスチョン

  • RQ1既存のニューラルMRCモデルは、リソースが乏しい分野特異的ベトナム語コーパスにおいてどの程度効果的か?
  • RQ2ViNewsQAコーパスは、単純なスパンマッチングをはるかに超えた複雑な推論をどの程度要求するか?
  • RQ3このベトナム語の健康分野MRCベンチマークにおいて、人間のアノテーターと最先端のニューラルモデルとの間の性能ギャップはどの程度か?
  • RQ4質問の長さ、回答の長さ、記事の長さは、ViNewsQAにおけるモデルの性能にどのように影響するか?
  • RQ5このコーパスにおけるモデル予測で最も一般的に発生する誤りの種類(例:曖昧な回答の境界、知識の欠如)は何か?

主な発見

  • 最良のモデルであるALBERTは、テストセットで正確一致スコア65.26%、F1スコア84.89%を達成した。
  • 人間の性能は最良のモデルを著しく上回り、正確一致スコアで14.53%、F1スコアで10.90%のギャップが生じた。
  • ViNewsQAの42.25%の質問が、1文または複数文にわたる推論を必要としていた。
  • 質問が長く、回答が短いほどモデルの性能が向上する傾向があり、複雑さと長さがモデルの汎化能力に影響を与える可能性を示唆した。
  • 一般的な誤りの種類には、曖昧な回答の境界、誤った推論、世界知識の欠如(特に「kiêng」(避けること)のような用語に関して)が含まれた。
  • このコーパスは公開されており、コミュニティ研究、共有タスク、およびベトナム語MRCにおけるモデル開発を促進することを目的としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。