Skip to main content
QUICK REVIEW

[논문 리뷰] Coronavirus Knowledge Graph: A Case Study

Chongyan Chen, Islam Akef Ebeid|arXiv (Cornell University)|2020. 07. 04.
Advanced Graph Neural Networks참고 문헌 26인용 수 12
한 줄 요약

이 논문은 BioBERT를 사용한 명칭 엔터티 인식과 PubMed 및 CORD-19 데이터셋에서 공존 빈도 및 코사인 유사도 두 가지 방법을 활용하여 코로나19 지식 그래프(Coronavirus Knowledge Graph, CKG)를 구축한다. 주요 기여는 코로나19와 관련된 유망한 약물 후보 및 생물학적 관계를 체계적이고 확장 가능한 프레임워크로 식별하는 데 있으며, 初기 결과로 팔리피라비르, 로피나비르, 리바비르린과 같은 약물에 대해 생물학적으로 타당한 연결 고리가 확인되었다.

ABSTRACT

The emergence of the novel COVID-19 pandemic has had a significant impact on global healthcare and the economy over the past few months. The virus's rapid widespread has led to a proliferation in biomedical research addressing the pandemic and its related topics. One of the essential Knowledge Discovery tools that could help the biomedical research community understand and eventually find a cure for COVID-19 are Knowledge Graphs. The CORD-19 dataset is a collection of publicly available full-text research articles that have been recently published on COVID-19 and coronavirus topics. Here, we use several Machine Learning, Deep Learning, and Knowledge Graph construction and mining techniques to formalize and extract insights from the PubMed dataset and the CORD-19 dataset to identify COVID-19 related experts and bio-entities. Besides, we suggest possible techniques to predict related diseases, drug candidates, gene, gene mutations, and related compounds as part of a systematic effort to apply Knowledge Discovery methods to help biomedical researchers tackle the pandemic.

연구 동기 및 목표

  • 코로나19에 관한 급격히 확장되는 생물의학 문헌에서 체계적인 지식 탐색의 급박한 필요성을 해결하기 위해.
  • 비정형 텍스트에서 생물의학적 엔터티(약물, 유전자, 화학물질)를 추출하고 조직화하는 확장 가능한 방법을 개발하기 위해.
  • 하위 작업(예: 약물 재도입 및 전문가 식별)을 지원하는 동적이고 질의에 대응 가능한 지식 그래프를 구축하기 위해.
  • 공존 빈도와 코사인 유사도라는 두 가지 지식 그래프 구축 기법이 생물학적 관계를 얼마나 잘 포착하는지 평가하고 비교하기 위해.
  • 사스코로나2바이러스 연구의 맥락에서 약물, 질병, 전문가에 대한 자동 프로파일링 시스템의 기초를 마련하기 위해.

제안 방법

  • BioBERT, 즉 생물의학 NLP를 위한 미세조정된 BERT 모델을 사용하여 PubMed 및 CORD-19 데이터셋에서 명칭 엔터티 인식(Named Entity Recognition, NER)을 수행한다.
  • Word2Vec을 통해 단어 임베딩을 적용하여 유사도 계산을 위한 엔터티의 조밀한 벡터 표현을 생성한다.
  • 두 가지 다른 방법을 사용해 지식 그래프를 구축한다: (1) 슬라이딩 윈도우 내에서 엔터티의 공존 빈도, (2) 엔터티 임베딩 벡터 간의 코사인 유사도.
  • Gephi 소프트웨어를 활용해 약물 중심의 지식 그래프를 시각화하며, 노드는 엔터티를 나타내고, 엣지는 유사도 또는 공존을 나타낸다.
  • 코사인 유사도 공식을 적용한다: $ \text{cos}(\mathbf{S}, \mathbf{T}) = \frac{\sum_{i=1}^{n}{{\bf S}_{i}{\bf T}_{i}}}{\sqrt{\sum_{i=1}^{n}{({\bf S}_{i})^{2}}}\sqrt{\sum_{i=1}^{n}{({\bf T}_{i})^{2}}}} $ 엔터티 간의 관계를 정량화한다.
  • 약물별 상위 랭크된 엔터티의 질적 분 析를 통해 결과를 검증하며, 사스코로나2바이러스와의 생물학적 타당성과 관련성을 평가한다.

실험 결과

연구 질문

  • RQ1생물의학 분야에서의 급속한 바이러스 유행 상황을 고려할 때, BioBERT는 CORD-19 및 PubMed 데이터셋에서 생물의학적 엔터티를 얼마나 효과적으로 추출하는가?
  • RQ2공존 빈도와 코사인 유사도 중 어느 지식 그래프 구축 방법이 약물, 유전자, 화학물질 간의 의미 있는 생물학적 관계를 더 잘 포착하는가?
  • RQ3결과로 도출된 지식 그래프는 코로나19 치료를 위한 생물학적으로 타당하고 재도입 가능한 가능성이 있는 약물 후보를 식별할 수 있는가?
  • RQ4약물 중심 그래프에서 상위 랭크된 유전자 및 화학물질 엔터티는 사스코로나2바이러스의 알려진 생물학적 메커니즘과 어느 정도 일치하는가?
  • RQ5패닉 연구의 맥락에서 지식 그래프를 활용해 약물, 질병, 전문가에 대한 확장 가능하고 자동화된 프로파일링 시스템을 어떻게 설계할 수 있는가?

주요 결과

  • BioBERT는 CORD-19 및 PubMed 데이터셋에서 생물의학적 엔터티의 고율을 성공적으로 추출했지만, CORD-19에서는 다양한 훈련 데이터 부족으로 엔터티의 다양성이 제한되었다.
  • 코사인 유사도 기반 지식 그래프에서는 생물학적으로 타당한 관계가 드러났다: 예를 들어 팔리피라비르는 구아닌, 라이신, 프롤린과 가장 유사했으며, 이는 구조적 또는 생물학적으로 관련성이 있다.
  • 로피나비르는 신아민나아제, p53, IFITM3과 연결되었는데, 이는 바이러스 복제 및 숙주 면역 반응에 관여하는 유전자 및 단백질이다.
  • 리바비르린은 독성, p53, 염증과 강한 연관성을 보였으며, 이는 알려진 부작용과 항바이러스 메커니즘과 일치한다.
  • 리토나비르와 탐푸루는 JNK, STAT3, IFN 관련 유전자와 연결되어 사스코로나2바이러스와 관련된 면역 조절 효과가 있을 가능성이 제기된다.
  • 약물 중심 지식 그래프는 일관되고 해석 가능하며 생물학적으로 관련성이 있는 엔터티 클러스터를 생성했으며, 이는 약물 재도입 및 시스템 생물학 분석에 유용함을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.