Skip to main content
QUICK REVIEW

[論文レビュー] BIOMRC: A Dataset for Biomedical Machine Reading Comprehension

Petros Stavropoulos, Dimitris Pappas|arXiv (Cornell University)|May 13, 2020
Topic Modeling参考文献 30被引用数 5
ひとこと要約

この論文では、高精度なPubTatorエンティティアノテーションを用いて、PubMedの要旨とタイトルから抽出された大規模で低ノイズなバイオメディカル機械読解(MRC)データセットである biomrc を紹介する。BioRead や他の既存のノイズの多いデータセットとは異なり、構造化されたタイトルと要旨のみを用いることで、アーティファクトを低減し、人間およびモデルの性能が顕著に向上した。特に、BERTベースのモデルは特定のベンチマークで専門家の人間の精度を超えた。

ABSTRACT

We introduce BIOMRC, a large-scale cloze-style biomedical MRC dataset. Care was taken to reduce noise, compared to the previous BIOREAD dataset of Pappas et al. (2018). Experiments show that simple heuristics do not perform well on the new dataset, and that two neural MRC models that had been tested on BIOREAD perform much better on BIOMRC, indicating that the new dataset is indeed less noisy or at least that its task is more feasible. Non-expert human performance is also higher on the new dataset compared to BIOREAD, and biomedical experts perform even better. We also introduce a new BERT-based MRC model, the best version of which substantially outperforms all other methods tested, reaching or surpassing the accuracy of biomedical experts in some experiments. We make the new dataset available in three different sizes, also releasing our code, and providing a leaderboard.

研究の動機と目的

  • BioRead や他の既存のバイオメディカルMRCデータセットが、全文抽出に起因するアーティファクトや不正確なエンティティアノテーションにより、ノイズが多く、実用的でない問題を解決すること。
  • データをPubMedのタイトルと要旨に限定することで、より構造化されており、セクション跨ぎや関連のないコンテンツに起因するノイズが少ないため、クローズ形式のバイオメディカルMRCの質と実用性を向上させること。
  • biomrc で学習した新しい高精度なBERTベースのMRCモデルを開発し、従来のニューラルモデルを上回り、新しいデータセットで専門家の性能に達するかそれを上回ること。
  • biomrc を大規模、ライト、ミニチュアの3サイズでリリースし、コードとリーダーボードを提供することで、バイオメディカルNLP分野における再現性のある研究とモデルベンチマークを支援すること。

提案手法

  • PubTatorリポジトリを介して2500万件のPubMedエントリからタイトルと要旨を抽出し、構造的かつ信頼性の高いテキストソースを確保することで、biomrc データセットを構築した。
  • MetaMap よりも正確な DNorm を用いてバイオメディカルエンティティをアノテーションし、エンティティの誤検出や偽陽性を低減した。
  • タイトル内のバイオメディカルエンティティをプレースホルダーに置き換えることでクローズ形式の質問を作成し、モデルが要旨内のエンティティから正しいエンティティを予測するようにした。
  • 極めて簡単なインスタンスを除外するためのデータフィルタリングを実装し、データセットの難易度を向上させ、自明な解決策の発生を低減した。
  • エンティティ表現の最大集約(max-aggregation)を用いた新しいBERTベースのMRCモデルを提案し、回答予測の精度を向上させた。
  • 812k、100k、および60件のテストインスタンスの3サイズでデータセットをリリースし、コードとパブリックリーダーボードを併記して、モデル評価を可能にした。

実験結果

リサーチクエスチョン

  • RQ1PubMedのタイトルと要旨から構築されたバイオメディカルMRCデータセットは、BioRead や他の全文ベースのデータセットと比較して、顕著にノイズが低減され、人間の性能が向上するか?
  • RQ2単純なヒューリスティクスが新しい biomrc データセットで失敗するか? これは、データセットのアーティファクトが減少し、タスクの複雑さが増していることを示唆する。
  • RQ3biomrc で学習したBERTベースのMRCモデルは、同じタスクで専門家の性能に達するか、それを上回る性能を示すか?
  • RQ4biomrc のような大規模で自動生成されたデータセットで事前学習することで、小規模で専門家がアノテートしたバイオメディカルMRCベンチマークの性能が向上するか?

主な発見

  • biomrc における人間の性能は、BioRead より顕著に向上した。非専門家は30件のサンプルセットで82%の正確性を達成したのに対し、BioRead では68%であった。これはノイズが低減され、タスクの実行可能性が向上していることを示している。
  • バイオメディカル専門家は biomrc で70.23–72.30% のCohen’s Kappa一致度を示し、アノテータ間の一貫性が高く、データセットの品質が確認された。
  • 以前にテスト済みの2つのニューラルMRCモデルは、biomrc では BioRead よりも顕著に高い性能を示した。これは、biomrc がノイズが少なく、またはニューラル学習に適している可能性を示唆している。
  • 提案されたBERTベースのMRCモデルは、テストされたすべての他の手法を上回り、特定の評価設定では専門家の人間の正確性に達するか、それを上回った。
  • 高品質なアノテーションと構造化された設計のおかげで、人間の性能はBioReadと比較して60%向上した。これは、データのキュレーション戦略の有効性を裏付けている。
  • コードとリーダーボードを併記して、大規模、ライト、ミニチュアの3サイズで biomrc をリリースしたことで、バイオメディカルNLP研究におけるスケーラブルなベンチマークと再現可能な評価が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。