Skip to main content
QUICK REVIEW

[論文レビュー] PubMed 200k RCT: a Dataset for Sequential Sentence Classification in Medical Abstracts

Franck Dernoncourt, Ji Young Lee|arXiv (Cornell University)|Oct 16, 2017
Artificial Intelligence in Healthcare and Education被引用数 73
ひとこと要約

大規模な公開データセット(PubMed 200k RCT)の約195kのランダム化比較試験要約を含み、連続文分類のためのラベル付き文とベースラインを提供。

ABSTRACT

We present PubMed 200k RCT, a new dataset based on PubMed for sequential sentence classification. The dataset consists of approximately 200,000 abstracts of randomized controlled trials, totaling 2.3 million sentences. Each sentence of each abstract is labeled with their role in the abstract using one of the following classes: background, objective, method, result, or conclusion. The purpose of releasing this dataset is twofold. First, the majority of datasets for sequential short-text classification (i.e., classification of short texts that appear in sequences) are small: we hope that releasing a new large dataset will help develop more accurate algorithms for this task. Second, from an application perspective, researchers need better tools to efficiently skim through the literature. Automatically classifying each sentence in an abstract would help researchers read abstracts more efficiently, especially in fields where abstracts may be long, such as the medical field.

研究の動機と目的

  • 医療要約における大規模な連続文分類の必要性を動機づけ、効率的な文献スキミングと情報抽出を支援する。
  • 背景・目的・方法・結果・結論の文レベルラベルを含むPubMedベースの構造化データセットの構築を説明する。
  • ベンチマークとモデル開発を促進するためのデータセット統計、分割、およびアクセス可能なフォーマットを提供する。

提案手法

  • 3–9セクションで 'None' ラベルを含まないRCTとラベル付けされたPubMed要約からデータセットを構築する。
  • 学習/検証/テストの3つの分割でデータを提供し、便宜のための PubMed 20k RCT の小型サブセットを用意する。
  • 前処理用に元のテキストと数字を置換した版の2つのデータセット形式を提供する。
  • n-gramを用いたLR、Forward ANN、文脈付きCRF、ジョイント成分を持つbi-ANNなど、複数のベースラインを評価する。
  • F1スコアを用いて性能を報告し、方法間の直接比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1文の文脈を活用すると、医療要約における連続文分類はどの程度うまく機能するか?
  • RQ2大規模なPubMedベースの連続文分類のベンチマークを確立する基礎ライン手法は何か?
  • RQ3規模(PubMed 200k 対 PubMed 20k)がベースラインの性能と手法の有効性に与える影響はどうか。

主な発見

  • bi-ANNは、PubMed 20kおよびPubMed 200k RCTのすべての評価済みベースラインの中で最も高いF1スコアを達成した(例: 90.0 および 91.6、いずれも)。
  • CRFは一般に高い性能を示し、LRおよびForward ANNを上回り、データサイズの増加に伴う利得は小さい。
  • LRは単純なn-gram特徴量を用いた場合、ニューラルベースラインと比較して性能が劣り、文脈モデリングの利点を強調している。
  • PubMed 200k RCTはこの課題の最大のデータセットで、195,654 要約と 2.3 million 文から構成される。
  • 著者は将来の研究の直接比較とベンチマークを可能にする明確なベースラインを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。