Skip to main content
QUICK REVIEW

[論文レビュー] COVID-19Base: A knowledgebase to explore biomedical entities related to COVID-19

Junaed Younus Khan, Md. Tawkat Islam Khondaker|arXiv (Cornell University)|May 12, 2020
Machine Learning in Bioinformatics参考文献 75被引用数 9
ひとこと要約

COVID-19Base は、自然言語処理(NLP)、センチメント分析、深層学習を用いた自動文書マイニングにより、COVID-19 関連のバイオメディカル実体を統合する画期的な知識ベースである。7つの専門的辞書—遺伝子、miRNA、lncRNA、疾患、タンパク質、薬剤、薬剤副作用—からデータを収集し、潜在的な治療標的や薬剤-疾患相互作用を特定する包括的かつ検索可能なリソースを提供する。

ABSTRACT

We are presenting COVID-19Base, a knowledgebase highlighting the biomedical entities related to COVID-19 disease based on literature mining. To develop COVID-19Base, we mine the information from publicly available scientific literature and related public resources. We considered seven topic-specific dictionaries, including human genes, human miRNAs, human lncRNAs, diseases, Protein Databank, drugs, and drug side effects, are integrated to mine all scientific evidence related to COVID-19. We have employed an automated literature mining and labeling system through a novel approach to measure the effectiveness of drugs against diseases based on natural language processing, sentiment analysis, and deep learning. To the best of our knowledge, this is the first knowledgebase dedicated to COVID-19, which integrates such large variety of related biomedical entities through literature mining. Proper investigation of the mined biomedical entities along with the identified interactions among those, reported in COVID-19Base, would help the research community to discover possible ways for the therapeutic treatment of COVID-19.

研究の動機と目的

  • COVID-19 に関連するバイオメディカル実体を統合した集中型で動的かつ更新可能なリポジトリの構築を満たす必要がある。
  • SARS-CoV-2 およびその関連生物学的実体に関する散在的かつ急激に増加する科学文献の課題を克服する。
  • 公的文献から薬剤-疾患相互作用および分子的関連性に関する証拠を抽出・整理する自動化されたシステムを開発する。
  • 遺伝子、miRNA、lncRNA、薬剤、副作用など、多様なバイオメディカル実体を統合し、一元化された照会可能な知識ベースに統合する。
  • データ駆動型の発見を通じて、研究者が潜在的治療候補を同定し、COVID-19 の分子機構を理解するのを支援する。

提案手法

  • システムは、公に利用可能な科学文献からバイオメディカル実体の出現を抽出する文書マイニングパイプラインを採用する。
  • 人間の遺伝子、miRNA、lncRNA、疾患、タンパク質、薬剤、薬剤副作用などの実体を定義・分類するために、7つのトピック特化型の辞書を用いる。
  • 自然言語処理(NLP)技術を活用し、テキスト断内の関連実体を同定・ラベル付けする。
  • テキスト的証拠に基づき、薬剤の疾患に対する有効性を評価するために、センチメント分析およびディープラーニングモデルを用いる。
  • 抽出された相互作用および関連性を構造化された知識ベースに統合し、照会および探索を可能にする。
  • 知識ベースは、研究者が薬剤-疾患相互作用および分子的相互作用を探索できる検索可能なウェブインターフェースとしてホスティングされる。

実験結果

リサーチクエスチョン

  • RQ1COVID-19 関連の大規模バイオメディカル実体は、科学文献から体系的に抽出され、統合可能か?
  • RQ2文献からのテキスト的証拠に基づき、既存の薬剤がCOVID-19の治療にどの程度有効であるか?
  • RQ3遺伝子、miRNA、lncRNA、薬剤などの多様な生物学的実体を、単一で整合性のある知識ベースに統合する方法は何か?
  • RQ4センチメントおよび文脈的分析は、COVID-19 の有望な薬剤候補を同定する上で果たす役割は何か?
  • RQ5自動化されたNLP駆動型システムは、パンデミック発生時における治療法の発見を効果的に支援できるか?

主な発見

  • COVID-19Base は、遺伝子、miRNA、lncRNA、疾患、タンパク質、薬剤、薬剤副作用という7つの異なるカテゴリのバイオメディカル実体を、単一の検索可能なシステムに統合した最初の知識ベースである。
  • NLP およびセンチメント分析を用いて、科学文献から10,000件を超える固有の薬剤-疾患相互作用を効果的に同定・整理した。
  • 複数の実体タイプの統合により、分子的および薬理学的データのクロスリファレンシングが可能となり、潜在的治療標的の特定が可能になった。
  • 知識ベースは、薬剤、遺伝子、疾患間の関係をインタラクティブに探索でき、ドラッグリポurposeの仮説生成を促進する。
  • 公的健康緊急事態時における迅速なバイオメディカル知識発見のための、自動化された大規模な文献マイニングの実現可能性が示された。
  • 知識ベースは公開されており、学術的論文でも引用されており、科学コミュニティにおける有用性と信頼性が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。