Skip to main content
QUICK REVIEW

[논문 리뷰] Information Mining for COVID-19 Research From a Large Volume of Scientific Literature

Sabber Ahamed, Manar D. Samad|arXiv (Cornell University)|2020. 04. 04.
Computational Drug Discovery Methods인용 수 16
한 줄 요약

이 논문은 코로나바이러스에 관한 10,683篇의 과학적 초록에서 关键 키워드를 추출하고 순위를 매기기 위해 중심성 중심성(-betweenness centrality-)을 사용하는 그래프 기반 텍스트 마이닝 접근법을 제안한다. 이 방법은 간섭성, 아만타딘, 돼지와 같은 핵심 약물, 병원체, 숙주 및 생분자들을 규명하여 기존 치료제의 재사용 가능성을 제시하며, 코로나19 연구를 가속화하는 실질적인 통찰을 제공한다.

ABSTRACT

The year 2020 has seen an unprecedented COVID-19 pandemic due to the outbreak of a novel strain of coronavirus in 180 countries. In a desperate effort to discover new drugs and vaccines for COVID-19, many scientists are working around the clock. Their valuable time and effort may benefit from computer-based mining of a large volume of health science literature that is a treasure trove of information. In this paper, we have developed a graph-based model using abstracts of 10,683 scientific articles to find key information on three topics: transmission, drug types, and genome research related to coronavirus. A subgraph is built for each of the three topics to extract more topic-focused information. Within each subgraph, we use a betweenness centrality measurement to rank order the importance of keywords related to drugs, diseases, pathogens, hosts of pathogens, and biomolecules. The results reveal intriguing information about antiviral drugs (Chloroquine, Amantadine, Dexamethasone), pathogen-hosts (pigs, bats, macaque, cynomolgus), viral pathogens (zika, dengue, malaria, and several viruses in the coronaviridae virus family), and proteins and therapeutic mechanisms (oligonucleotide, interferon, glycoprotein) in connection with the core topic of coronavirus. The categorical summary of these keywords and topics may be a useful reference to expedite and recommend new and alternative directions for COVID-19 research.

연구 동기 및 목표

  • SARS-CoV-2 및 관련 코로나바이러스에 관한 과학 문헌의 급격한 증가로 인한 정보 과부하 문제를 해결하기 위해.
  • 초록들로부터 잠재적이고 주제별 키워드 및 관계를 규명하여 약물 재사용 및 새로운 연구 방향을 지원하기 위해.
  • 전파, 약물 유형 및 게놈 연구 분야에서 가장 영향력 있는 용어를 중심성 기반으로 순위를 매기는 확장 가능한 그래프 기반 계산 모델을 개발하기 위해.
  • 비타이로지, 약리학 및 숙주-병원체 상호작용 분야에서 간과된 연결 고리를 드러내어 연구자들이 발견을 가속화할 수 있도록 기반 프레임워크를 제공하기 위해.

제안 방법

  • 단어 동시 발생 및 문법적 관계를 기반으로 10,683편의 과학 논문 초록에서 지식 그래프를 구축한다.
  • 전파, 약물 유형, 게놈 연구 세 가지 주제별 하위그래프를 생성하며, 각각 '코로나바이러스'라는 중심 노드를 기반으로 한다.
  • 노드가 다른 노드들 사이의 최단 경로에 얼마나 자주 포함되는지 측정함으로써 네트워크 내에서의 구조적 중요도를 기반으로 키워드를 순위 매기기 위해 중심성 중심성(BC)을 적용한다.
  • 해석 가능성과 주제 분석을 위해 순위가 매겨진 키워드를 질병, 숙주, 생분자 및 잡다한 카테고리로 분류한다.
  • 그래프 구축 이전에 자연어 처리를 사용하여 약물, 바이러스, 단백질 및 숙주 종 등을 추출하고 정규화한다.
  • 순위 목록과 하위그래프 분석을 통해 결과를 시각화하여 영향력 있는 용어와 잠재적 연구 기회를 부각시킨다.

실험 결과

연구 질문

  • RQ1과학 문헌에서 코로나바이러스와 가장 자주 그리고 중심적으로 연결된 약물, 병원체 및 숙주 종은 무엇인가?
  • RQ2코로나바이러스 연구의 맥락에서 어떤 생분자와 치료 메커니즘이 높은 연결성을 보이는가?
  • RQ3문헌 기반 지식 그래프에서 중심성 중심성이 기존 항바이러스제 및 바이러스 가족에 대한 연구 간 숨겨진 연결 고리를 어떻게 드러내는가?
  • RQ4그래프 기반 키워드 순위 매기기 방법이 SARS-CoV-2 맥락에서 약물 재사용 가능 후보를 식별할 수 있는가?
  • RQ5숙주-병원체 상호작용 또는 유전적 메커니즘에 대한 네트워크 구조는 과학적 초록의 구조에서 어떤 패턴을 드러내는가?

주요 결과

  • 인플루엔자 바이러스 치료를 위한 아만타딘은 항말라린보다 약물 하위그래프에서 높은 순위를 차지하여 SARS-CoV-2에 대한 재사용 가능성에 대한 잠재적 관련성을 시사한다.
  • 돼지는 전파 및 유전자 하위그래프 양쪽 모두에서 핵심 숙주로 규명되었으며, 돼지 전염성 설사 바이러스(PEDV) 및 돼지 혈구응집소에스터라제 바이러스(PHEV)와 연결되어 있다.
  • 간섭성(IFN)은 유전자 하위그래프에서 네 번째로 영향력 있는 생분자이며, 잡다한 카테고리에서는 두 번째로 높은 순위를 차지하여 항바이러스 반응에서의 중심적 역할을 나타낸다.
  • 숙주 중에서 쥐가 1위를 차지하며, 그 다음으로 박쥐, 고양이, 마카크가 이어지며, 이는 코로나바이러스 감염의 전임상 모델로의 사용을 뒷받침한다.
  • 중합효소 연쇄 반응(PCR)은 RNA 다음으로 생분자 카테고리에서 두 번째로 높은 순위를 차지하여 코로나바이러스의 분자 진단에서의 핵심적 역할을 강조한다.
  • 유전자가 높은 중심성을 보이며, SARS와 인플루엔자 바이러스 다음으로 '암'이 유전자 하위그래프에서 높은 중심성을 보이며, 암 게놈 연구와 인플루엔자 바이러스 간 잠재적 연결 고리를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.