Skip to main content
QUICK REVIEW

[논문 리뷰] COVID-19Base: A knowledgebase to explore biomedical entities related to COVID-19

Junaed Younus Khan, Md. Tawkat Islam Khondaker|arXiv (Cornell University)|2020. 05. 12.
Machine Learning in Bioinformatics참고 문헌 75인용 수 9
한 줄 요약

COVID-19Base는 자연어 처리, 정서 분석 및 딥러닝을 활용한 자동 문헌 마이닝을 통해 코로나19와 관련된 생물의학적 실체를 통합하는 혁신적인 지식기반이다. 이 기반은 유전자, miRNA, lncRNA, 질병, 단백질, 약물 및 약물 부작용 등 일곱 종류의 전문 사전에서 데이터를 취합하여, 코로나19에 대한 잠재적 치료 타겟과 약물-질병 상호작용을 식별할 수 있는 종합적이고 검색 가능한 자원을 제공한다.

ABSTRACT

We are presenting COVID-19Base, a knowledgebase highlighting the biomedical entities related to COVID-19 disease based on literature mining. To develop COVID-19Base, we mine the information from publicly available scientific literature and related public resources. We considered seven topic-specific dictionaries, including human genes, human miRNAs, human lncRNAs, diseases, Protein Databank, drugs, and drug side effects, are integrated to mine all scientific evidence related to COVID-19. We have employed an automated literature mining and labeling system through a novel approach to measure the effectiveness of drugs against diseases based on natural language processing, sentiment analysis, and deep learning. To the best of our knowledge, this is the first knowledgebase dedicated to COVID-19, which integrates such large variety of related biomedical entities through literature mining. Proper investigation of the mined biomedical entities along with the identified interactions among those, reported in COVID-19Base, would help the research community to discover possible ways for the therapeutic treatment of COVID-19.

연구 동기 및 목표

  • 코로나19와 관련된 생물의학적 실체를 통합하고 동적으로 업데이트되는 저장소가 급격히 필요한 상황를 해결하기 위해.
  • SARS-CoV-2 및 관련 생물학적 실체에 관한 분 散된, 급격히 증가하는 과학 문헌의 과제를 극복하기 위해.
  • 공개된 문헌에서 약물-질병 상호작용과 분자적 연관성에 대한 증거를 자동으로 추출하고 정리하는 시스템을 개발하기 위해.
  • 유전자, miRNA, lncRNA, 약물 및 부작용을 포함한 다양한 생물의학적 실체를 통합된, 질의 가능한 지식기반으로 통합하기 위해.
  • 데이터 기반 발견을 통해 연구자들이 코로나19의 분자 메커니즘을 이해하고 잠재적 치료 후보를 식별하는 데 지원하기 위해.

제안 방법

  • 시스템은 공개된 과학 문헌에서 생물의학적 실체의 언급을 추출하는 문헌 마이닝 파이프라인을 활용한다.
  • 인간 유전자, miRNA, lncRNA, 질병, 단백질, 약물 및 약물 부작용 등의 실체를 정의하고 분류하기 위해 일곱 종류의 주제별 전문 사전을 사용한다.
  • 자연어 처리(NLP) 기법을 적용하여 텍스트 문단 내에서 관련 실체를 식별하고 레이블을 붙인다.
  • 텍스트 증거를 바탕으로 약물의 질병에 대한 효과를 평가하기 위해 정서 분석 및 딥러닝 모델을 사용한다.
  • 추출된 상호작용과 연관성을 구조화된 지식기반으로 통합하여 질의 및 탐색을 가능하게 한다.
  • 지식기반은 연구자들이 약물-질병 상호작용과 분자적 상호작용을 탐색할 수 있도록 검색 가능한 웹 인터페이스로 호스팅되어 있다.

실험 결과

연구 질문

  • RQ1코로나19와 관련된 대규모 생물의학적 실체는 과학 문헌에서 체계적으로 어떻게 추출하고 통합할 수 있는가?
  • RQ2문헌에서의 텍스트 증거를 바탕으로 기존 약물이 코로나19 치료에 얼마나 효과적인가?
  • RQ3유전자, miRNA, lncRNA 및 약물과 같은 다양한 생물학적 실체는 어떻게 하나의 통합되고 일관된 지식기반으로 통합될 수 있는가?
  • RQ4정서와 맥락 분석은 코로나19에 대한 유망한 약물 후보를 식별하는 데 어떤 역할을 하는가?
  • RQ5자동화된 NLP 기반 시스템은 패닉 상황 동안 치료법 발견을 효과적으로 지원할 수 있는가?

주요 결과

  • COVID-19Base는 유전자, miRNA, lncRNA, 질병, 단백질, 약물 및 약물 부작용 등 일곱 가지 다른 유형의 생물의학적 실체를 통합한 최초의 지식기반으로, 하나의 검색 가능한 시스템에 통합하였다.
  • 시스템은 NLP와 정서 분석을 활용하여 과학 문헌에서 10,000개 이상의 고유한 약물-질병 상호작용을 성공적으로 식별하고 정리하였다.
  • 다양한 실체 유형의 통합은 분자적 및 약리학적 데이터 간의 상호 참조를 가능하게 하여 잠재적 치료 타겟을 드러내었다.
  • 지식기반은 약물, 유전자 및 질병 간의 관계를 상호작용적으로 탐색할 수 있도록 지원하여 약물 재편성에 대한 가설 수립을 촉진하였다.
  • 공중보건 급성 사태 동안 대규모 자동 문헌 마이닝이 생물의학 지식 발견에 실현 가능함을 입증하였다.
  • 지식기반은 공개 접근이 가능하며, 심층 검토된 연구 논문에서 인용되어 과학 공동체 내에서 실용성과 신뢰성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.