Skip to main content
QUICK REVIEW

[論文レビュー] A Distant Supervision Corpus for Extracting Biomedical Relationships Between Chemicals, Diseases and Genes

Dongxu Zhang, Sunil Mohan|arXiv (Cornell University)|Apr 13, 2022
Biomedical Text Mining and Ontologies被引用数 5
ひとこと要約

本論文は、化学物質、疾患、遺伝子の間の関係をラベル付けした8万件の要旨を含む大規模で、遠隔教師ありの生物医学関係抽出コーパスであるChemDisGeneを紹介する。CTDを基盤とする学習セットと手作業で整備されたテストセットを組み合わせ、実世界のシナリオをよりよく再現するためのエンティティリンクとデータ分割を改善し、評価のための3つのディープラーニングベースラインを提供することで、従来のデータセットに比べてカバレッジと品質が著しく向上している。

ABSTRACT

We introduce ChemDisGene, a new dataset for training and evaluating multi-class multi-label document-level biomedical relation extraction models. Our dataset contains 80k biomedical research abstracts labeled with mentions of chemicals, diseases, and genes, portions of which human experts labeled with 18 types of biomedical relationships between these entities (intended for evaluation), and the remainder of which (intended for training) has been distantly labeled via the CTD database with approximately 78\% accuracy. In comparison to similar preexisting datasets, ours is both substantially larger and cleaner; it also includes annotations linking mentions to their entities. We also provide three baseline deep neural network relation extraction models trained and evaluated on our new dataset.

研究の動機と目的

  • 化学物質、疾患、遺伝子のための、大規模で高品質な生物医学的関係抽出データセットの不足と低カバレッジを解消すること。
  • 出版日を基準とした時系列的分割(ランダム分割ではなく)を用いることで、モデルの汎化性能を向上させ、実世界での展開を模擬すること。
  • 化学物質、疾患、遺伝子のための最新のPubTator Centralモデルを用いて、エンティティリンクの正確性を向上させること。
  • 自動ラベル付け(学習用)と手作業でアノテートされたデータ(評価用)の両方を提供することで、モデルの評価を堅牢にするためのベンチマークを提供すること。
  • 新規コーパス上で訓練・評価された3つのディープラーニングベースラインを提供し、今後の研究のためのパフォーマンスの基準を確立すること。

提案手法

  • 比較毒性ゲノムデータベース(CTD)を活用し、化学物質、疾患、遺伝子の間で14種類の関係タイプを持つ8万件の要旨を自動的に遠隔教師ありでラベル付けした。
  • 最新のモデルを搭載したPubTator Centralを用いてエンティティ認識とリンクを改善し、化学物質で+66.3%、疾患で+3.8%、遺伝子で+8.2%のF1スコア向上を達成した。
  • 学習データを出版日に基づいて分割することで、実世界での展開を模擬し、ランダム分割よりも汎化性能が向上した。
  • CTDの複雑でネストされた関係表現から、バイナリ関係をクリーニングして抽出することで、学習データの品質を向上させた。
  • 評価のためのドメインエキスパートによる手作業アノテーションを施した523件の要旨から成る小規模なテストセットを構築し、18種類の関係タイプを含めた。
  • ChemDisGeneデータセット上で、グラフベースや自己注意メカニズムを用いた3つのディープニューラルネットワークモデルを訓練・評価し、パフォーマンスのベースラインを確立した。

実験結果

リサーチクエスチョン

  • RQ1大規模で遠隔教師ありの生物医学的関係抽出コーパスは、マルチクラス・マルチラベルドキュメントレベル関係抽出におけるディープラーニングモデルの性能と汎化能力を向上させることができるか?
  • RQ2出版日ベースのデータ分割は、ランダム分割に比べて、モデル評価の的確性と実世界への適用性においてどのように優れているか?
  • RQ3向上したエンティティリンクモデルは、遠隔教師あり学習データの品質と有用性をどの程度向上させるか?
  • RQ4大規模で弱教師ありのコーパス上で訓練され、小規模でゴールドスタンダードのテストセット上で評価された、最先端のディープラーニングモデルはどの程度効果的か?
  • RQ5新規でより大規模かつクリアなデータセットを用いて、化学物質、疾患、遺伝子間の関係抽出のためのパフォーマンスベンチマークをどのように確立できるか?

主な発見

  • ChemDisGeneコーパスは、CTDによる遠隔教師ありラベル付けを経て、約8万件の要旨を含み、推定78%の正確性を達成している。
  • 523件の要旨から成る手作業で整備されたテストセットは、モデルの汎化性能とパフォーマンスを評価する高品質なベンチマークを提供している。
  • 最新のPubTator Centralモデルを用いたエンティティリンクにより、化学物質で66.3%、疾患で3.8%、遺伝子で8.2%のF1スコア向上が達成された。
  • 出版日ベースの時系列的分割をランダム分割ではなく採用することで、実世界の展開シナリオをよりよく模擬でき、モデル評価の信頼性が向上した。
  • ChemDisGene上で訓練された3つのベースラインディープラーニングモデルは、テストセットで優れたパフォーマンスを示し、今後の研究の新しいベンチマークを確立した。
  • 特にエンティティリンクと関係表現の観点で、既存のコーパスに比べてサイズ、クリーニング度、アノテーション品質の面で顕著に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。