[논문 리뷰] COVID-19 Literature Knowledge Graph Construction and Drug Repurposing Report Generation
본 논문은 COVID-KG를 소개합니다. 이는 COVID-19 문헌에서 텍스트 및 이미지 기반 생물의학 지식을 추출하여 QA를 가능하게 하고 증거와 서브그래프를 포함한 약물 재창출 보고서를 생성하는 멀티미디어 지식 그래프 프레임워크입니다.
To combat COVID-19, both clinicians and scientists need to digest vast amounts of relevant biomedical knowledge in scientific literature to understand the disease mechanism and related biological functions. We have developed a novel and comprehensive knowledge discovery framework, COVID-KG to extract fine-grained multimedia knowledge elements (entities and their visual chemical structures, relations, and events) from scientific literature. We then exploit the constructed multimedia knowledge graphs (KGs) for question answering and report generation, using drug repurposing as a case study. Our framework also provides detailed contextual sentences, subfigures, and knowledge subgraphs as evidence.
연구 동기 및 목표
- 논문과 그림으로부터 구조화된 멀티미디어 지식 그래프를 구축하여 COVID-19 문헌의 지식 병목 현상과 품질 문제를 해결합니다.
- 효과적인 질의응답과 증거에 기반한 약물 재창출 보고서를 가능하게 합니다.
- 검색 결과에 대한 증거로서 자세한 맥락 문장, 하위 그림, 그리고 지식 서브그래프를 제공합니다.
- 주요 문헌 소스의 점진적 업데이트를 지원하여 지식 발견의 규모화를 실현합니다.
제안 방법
- 네 가지 엔티티 유형(Gene, Disease, Chemical, Organism)에 대한 거친 수준의 정보 추출과 MeSH CTD 연결 및 133개의 관계 타입과 13개의 이벤트 타입.
- 75개 엔티티 타입의 미세 엔티티 추출(CORD-NER)으로, 원거리 감독 학습과 약한 감독 학습을 이용합니다.
- Figure 추출, 하위 그림 분할, OCR 및 교차 미디어 근거화로 시각 콘텐츠를 KG 엔티티에 연결하는 이미지 처리.
- 시맨틱 태그 클라우드와 히트맵을 이용한 지식 그래프 시맨틱 시각화, Kibana 기반 대시보드 위에 구축.
- KG 매칭과 분포 의미 매칭을 결합한 다중 홉 기능의 지식 기반 QA.
- BioBert 기반 표현과 EvidenceMiner를 이용한 메타 심볼 질의에 대한 문장 수준 증거 마이닝.
- 11개의 전형적 질문에 답하고 각 후보 약물에 대해 증거, 서브그래프, 이미지 분석을 모아 약물 재창출 보고서를 생성합니다.
실험 결과
연구 질문
- RQ1어떻게 텍스트와 이미지 콘텐츠를 통합하여 COVID-19 문헌으로부터 멀티미디어 지식 그래프를 구축할 수 있는가?
- RQ2구축된 KG가 정확한 증거 기반의 질의응답 및 약물 재창출 보고를 지원하는가?
- RQ3거친-정밀 엔티티 추출 및 교차 미디어 근거화가 포괄적인 지식 그래프 구축에 얼마나 효과적인가?
- RQ4문헌 증가에 따라 시스템이 얼마나 확장되며 약물 재창출에 대한 실행 가능한 통찰을 제공하는가?
주요 결과
- 2020년 6월 14일 기준 저자들은 140K편의 논문을 수집했고 KG를 구축하여 7,230개의 질병, 9,123개의 화학물질, 50,864개의 유전자를 포함했으며, 1,725,518개의 Chemical–Gene 연결, 5,556,670개의 Chemical–Disease 연결, 및 77,844,574개의 Gene–Disease 연결을 포함합니다.
- 거친 수준의 IE는 전문가 주석이 달린 186개의 문서에서 노드 추출에 대해 83.6% F-스코어, 링크 추출에 대해 78.1% F-스코어를 달성합니다.
- CORD-NER는 75개의 미세 엔티티 유형을 제공하며 F-score가 최대 93.95%에 달하고, 샘플 세트에서 SciSpacy를 능가합니다.
- 시각적 IE 서브시스템은 거의 50만 개의 하위 그림을 분할하고 시각 콘텐츠를 KG 엔티티에 근거시켜 교차 모달 지식을 풍부하게 합니다.
- QA 시스템은 다중 홉 질의를 지원하고 중요한 경로를 서브그래프로 제시하며 증거 문장과 출처를 제공합니다.
- 여러 약물(예: Benazepril, Losartan, Amodiaquine)에 대한 약물 재창출 보고서를 증거와 지식 서브그래프를 갖추어 생성하며, 전문가 검토 후 정보성이 있고 타당한 출력이 보고됩니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.