Skip to main content
QUICK REVIEW

[論文レビュー] Information Mining for COVID-19 Research From a Large Volume of Scientific Literature

Sabber Ahamed, Manar D. Samad|arXiv (Cornell University)|Apr 4, 2020
Computational Drug Discovery Methods被引用数 16
ひとこと要約

本稿では、SARS-CoV-2および関連コロナウイルスに関する10,683件の科学的要約から、次数中心性を用いたグラフベースのテキストマイニング手法を提案し、キーワードを抽出・順位付けする。この手法により、干渉性、アマンタジン、およびブタが主要な宿主として特定され、COVID-19研究における既存薬物の再利用に向けた実行可能なインサイトを提供する。

ABSTRACT

The year 2020 has seen an unprecedented COVID-19 pandemic due to the outbreak of a novel strain of coronavirus in 180 countries. In a desperate effort to discover new drugs and vaccines for COVID-19, many scientists are working around the clock. Their valuable time and effort may benefit from computer-based mining of a large volume of health science literature that is a treasure trove of information. In this paper, we have developed a graph-based model using abstracts of 10,683 scientific articles to find key information on three topics: transmission, drug types, and genome research related to coronavirus. A subgraph is built for each of the three topics to extract more topic-focused information. Within each subgraph, we use a betweenness centrality measurement to rank order the importance of keywords related to drugs, diseases, pathogens, hosts of pathogens, and biomolecules. The results reveal intriguing information about antiviral drugs (Chloroquine, Amantadine, Dexamethasone), pathogen-hosts (pigs, bats, macaque, cynomolgus), viral pathogens (zika, dengue, malaria, and several viruses in the coronaviridae virus family), and proteins and therapeutic mechanisms (oligonucleotide, interferon, glycoprotein) in connection with the core topic of coronavirus. The categorical summary of these keywords and topics may be a useful reference to expedite and recommend new and alternative directions for COVID-19 research.

研究の動機と目的

  • SARS-CoV-2および関連コロナウイルスに関する急激に拡大する科学文献における情報過多の課題に対処すること。
  • 要約から潜在的なトピック固有のキーワードおよび関係性を同定し、薬剤再利用および新規研究方向性の支援を行うこと。
  • 伝染、薬剤タイプ、ゲノム研究の各分野で、中心性に基づいてキーワードを順位付けするスケーラブルなグラフベースの計算モデルを構築すること。
  • ウイルス学、薬理学、および宿主-病原体相互作用分野で見過ごされがちな関連性を浮き彫りにするための研究者向けフレームワークを提供すること。

提案手法

  • 語の共起関係および文法的関係を用いて、10,683件の科学的論文要約から知識グラフを構築する。
  • 伝染、薬剤タイプ、ゲノム研究の3つのトピック固有サブグラフを構築し、それぞれを中央ノード「coronavirus」に接続する。
  • ノードが他のノード間の最短経路に頻繁に登場するかどうかを測定することで、構造的重要性に基づいてキーワードを順位付けするため、次数中心性(BC)を適用する。
  • 解釈可能性およびトピック分析のため、キーワードを疾患、宿主、バイオマolecule、およびその他カテゴリにグループ化する。
  • グラフ構築の前段階で、自然言語処理を用いて薬剤、ウイルス、タンパク質、および宿主種の用語を抽出・正規化する。
  • 順位付けされたリストとサブグラフ分析による可視化を通じて、高インパクトの用語および潜在的な研究の糸口を強調する。

実験結果

リサーチクエスチョン

  • RQ1科学文献において、コロナウイルスと最も頻繁にかつ中心的に関連付けられている薬剤、病原体、および宿主種は何か?
  • RQ2コロナウイルス研究の文脈において、どのバイオマoleculeおよび治療メカニズムが高頻度で接続されているか?
  • RQ3文献由来の知識グラフにおける次数中心性は、抗ウイルス薬とウイルス群に関する既存研究の間の隠れた関連性をどのように明らかにするか?
  • RQ4グラフベースのキーワード順位付けは、SARS-CoV-2の文脈における薬剤再利用の有望候補を特定できるか?
  • RQ5宿主-病原体相互作用や遺伝的メカニズムに関するパターンは、科学的要約のネットワーク構造によってどのように強調されるか?

主な発見

  • インフルエンザウイルス治療におけるアマンタジンは、クロロキンよりも薬剤サブグラフで上位にランクされ、SARS-CoV-2への再利用可能性に潜在的な関連性を示唆している。
  • ブタは、伝染および遺伝子サブグラフの両方で主要な宿主として特定され、豚の流行性下痢ウイルス(PEDV)および豚のヘマグルタニンエステラーゼウイルス(PHEV)と関連している。
  • インターフェロン(IFN)は遺伝子サブグラフで4番目に影響力のあるバイオマoleculeであり、その他カテゴリでは2番目に高い影響力を持つことから、抗ウイルス応答における中心的役割が示唆される。
  • マウスが宿主として第1位にランクされ、次いでコウノトリ、イヌ、マカクザルが続く。これは、コロナウイルス感染の前臨床モデルとしての使用を裏付ける。
  • ポリメラーゼ連鎖反応(PCR)はRNAに次いでバイオマoleculeカテゴリで2位にランクされ、コロナウイルスの分子診断におけるその重要な役割が強調される。
  • 遺伝子サブグラフにおける「がん」の高い中心性から、がんゲノム研究とインフルエンザウイルスとの間の潜在的関連性が示唆され、SARSおよびインフルエンザに次いで高い中心性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。