[논문 리뷰] Navigating the landscape of COVID-19 research through literature analysis: A bird's eye view
이 논문은 13,369篇의 PubMed 논문을 대상으로 명명된 실체 인식, 군집화, 주제 모델링을 활용하여 급격히 확장되고 있는 코로나19 관련 문헌을 분석하기 위한 자연어 처리 프레임워크를 제시한다. 이는 지속적이고 새로운 연구 주제를 특정하고, 핵심 생물학적 실체(예: 질병, 증상, 기관)를 매핑하며, 패an드레미크 기간 동안 과학적 발견을 가속화하기 위한 상호작용 가능하고 공개된 지식 탐색 시스템을 제공한다.
Timely access to accurate scientific literature in the battle with the ongoing COVID-19 pandemic is critical. This unprecedented public health risk has motivated research towards understanding the disease in general, identifying drugs to treat the disease, developing potential vaccines, etc. This has given rise to a rapidly growing body of literature that doubles in number of publications every 20 days as of May 2020. Providing medical professionals with means to quickly analyze the literature and discover growing areas of knowledge is necessary for addressing their question and information needs. In this study we analyze the LitCovid collection, 13,369 COVID-19 related articles found in PubMed as of May 15th, 2020 with the purpose of examining the landscape of literature and presenting it in a format that facilitates information navigation and understanding. We do that by applying state-of-the-art named entity recognition, classification, clustering and other NLP techniques. By applying NER tools, we capture relevant bioentities (such as diseases, internal body organs, etc.) and assess the strength of their relationship with COVID-19 by the extent they are discussed in the corpus. We also collect a variety of symptoms and co-morbidities discussed in reference to COVID-19. Our clustering algorithm identifies topics represented by groups of related terms, and computes clusters corresponding to documents associated with the topic terms. Among the topics we observe several that persist through the duration of multiple weeks and have numerous associated documents, as well several that appear as emerging topics with fewer documents. All the tools and data are publicly available, and this framework can be applied to any literature collection. Taken together, these analyses produce a comprehensive, synthesized view of COVID-19 research to facilitate knowledge discovery from literature.
연구 동기 및 목표
- 2020년 5월 기준 매 20일마다 두 배로 증가하고 있는 코로나19 과학 문헌의 과도한 정보에 대응하는 데 도전한다.
- 의료 전문가 및 연구자가 변화하는 연구 풍경을 효율적으로 탐색하고 이해할 수 있도록 지원하여 임상 의사결정 및 지식 발견을 지원한다.
- 모든 생물의학 문헌 컬렉션에 적용 가능한 확장 가능한, 공개된 프레임워크를 개발하여 핵심 실체와 주제를 추출하고 정리한다.
- 자동화된 군집화 및 관계 분석을 통해 코로나19 문헌에서 기존의 연구 주제와 새로운 연구 주제를 식별한다.
- 고급 텍스트 마이닝을 통해 SARS-CoV-2와 관련된 공존 질환, 증상 및 생물학적 실체를 탐색할 수 있도록 한다.
제안 방법
- 13,369편의 코로나19 관련 PubMed 논문에서 생물학적 실체(예: 질병, 기관, 유전자)를 추출하기 위해 최신 기술의 명명된 실체 인식(NER) 도구를 적용한다.
- 논문 코퍼스 내 공통 출현 빈도와 문맥적 관련성 기반으로 생물학적 실체와 코로나19 간의 관계 강도를 측정한다.
- 군집화 알고리즘을 사용하여 관련 용어를 그룹화하고, 지속적이고 새로운 연구 주제를 식별한다.
- 시간 경과에 따른 추세 분석을 통해 주제 군집의 변화를 여러 주 동안 추적하여 새로운 연구 분야를 탐지한다.
- 분류 및 정보 검색 기법을 통합하여 문헌을 체계화하고 요약하여 탐색을 향상시킨다.
- 모든 도구, 데이터, 결과물을 공개하여 향후 문헌 분석 작업의 재현성과 재사용을 지원한다.
실험 결과
연구 질문
- RQ1과학 문헌에 반영된 바에 비추어 볼 때, 코로나19 맥락에서 가장 자주 다뤄지는 증상과 공존 질환은 무엇인가?
- RQ2출판된 연구에서 SARS-CoV-2와 가장 강하게 연관된 생물학적 실체(예: 기관, 단백질)는 무엇인가?
- RQ3코로나19 관련 연구 주제 중 시간이 지나도 지속되는 것은 무엇이며, 초기 문헌 기반으로는 제한적이지만 성장 중인 새로운 주제는 무엇인가?
- RQ4대규모 생물의학 문헌에 효과적으로 NLP 기법을 적용하여 지식을 추출하고 정리하는 방법은 무엇인가?
- RQ5자동화된 문헌 분석이 코로나19 패an드레미크과 같은 글로벌 보건 위기 대응에 얼마나 효과적으로 기여할 수 있는가?
주요 결과
- 지속적인 연구 주제가 다수 식별되었으며, 높은 문서 수를 기록하여 핵심 코로나19 연구 분야에 대한 지속적인 과학적 관심을 반영한다.
- 초기 문서 수가 적은 몇몇 새로운 주제가 탐지되어 아직 초기 단계이지만 성장 중인 연구 방향을 시사한다.
- 증상과 공존 질환들이 체계적으로 추출되어 SARS-CoV-2와의 임상적 연관성을 체계적으로 개괄하였다.
- 폐, 사이토카인, ACE2 수용체와 같은 핵심 생물학적 실체가 두드러지게 다뤄져 생물학적 관련성을 반영한다.
- 프레임워크는 질병, 기관, 증상 간의 관계를 성공적으로 매핑하여 문헌의 통합적 시각을 가능하게 하였다.
- 모든 도구와 데이터는 공개되어 있어 다른 질환 맥락이나 문헌 컬렉션에 대한 재사용 및 확장이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.