Skip to main content
QUICK REVIEW

[논문 리뷰] Covidia: COVID-19 Interdisciplinary Academic Knowledge Graph

Cheng Deng, Jiaxin Ding|arXiv (Cornell University)|2023. 04. 14.
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

Covidia는 생물학, 의학, 컴퓨터 과학, 사회학 등 다양한 분야의 150만 페퍼를 통합한 대규모 다학문적 학술 지식 그래프이다. 다중 레이블 논문 분류를 위해 대조 학습을 사용하고, BERT 기반의 실체 및 관계 추출을 수행하며, 새로운 온톨로지 체계를 도입하여 다분야 지식 통합을 가능하게 하며, 다양한 분야 간 고정밀도 검색을 통한 공동체 탐지 및 링크 예측 벤치마크를 제공한다.

ABSTRACT

The pandemic of COVID-19 has inspired extensive works across different research fields. Existing literature and knowledge platforms on COVID-19 only focus on collecting papers on biology and medicine, neglecting the interdisciplinary efforts, which hurdles knowledge sharing and research collaborations between fields to address the problem. Studying interdisciplinary researches requires effective paper category classification and efficient cross-domain knowledge extraction and integration. In this work, we propose Covidia, COVID-19 interdisciplinary academic knowledge graph to bridge the gap between knowledge of COVID-19 on different domains. We design frameworks based on contrastive learning for disciplinary classification, and propose a new academic knowledge graph scheme for entity extraction, relation classification and ontology management in accordance with interdisciplinary researches. Based on Covidia, we also establish knowledge discovery benchmarks for finding COVID-19 research communities and predicting potential links.

연구 동기 및 목표

  • 생물학, 의학, 컴퓨터 과학, 사회과학 분야 간 지식의 분산 문제를 해결하기 위해 생물학, 의학, 컴퓨터 과학, 사회과학 분야의 지식을 통합한다.
  • 기존 문헌 플랫폼이 생물의학 논문에만 집중하여 전체 COVID-19 논문의 48%를 제외하는 한계를 극복한다.
  • 다양한 도메인의 실체 추출, 관계 분류, 전공 분류를 지원하는 통합 학술 지식 그래프를 개발한다.
  • 구조화되고 의미적으로 풍부한 표현을 통해 다양한 분야 간 효과적인 정보 검색 및 지식 탐색을 가능하게 한다.
  • 다학문 연구 네트워크에서 공동체 탐지 및 링크 예측을 위한 벤치마크를 수립한다.

제안 방법

  • 다중 레이블 논문 분류 모델을 대조 학습 기반으로 제안하여 논문을 여러 분야에 할당함으로써 다분야 분류 정확도를 향상시킨다.
  • 위키백과 연결을 통한 강화된 BERT 기반 실체 추출 모델을 도입하여 도메인 특화 의미를 포착하고 개방형 도메인 적응성을 향상시킨다.
  • 세그먼트 임베딩 기반 관계 추출 모델을 사용하여 다분야 맥락에서 추출된 실체 간의 관계를 식별한다.
  • 공동 참조를 통해 연결된 이중 레이어 구조의 새로운 학술 지식 그래프 스키마를 설계: 온톨로지(개념 및 관계)와 인스턴스(논문, 실체, 문헌정보 데이터)로 구성.
  • 공간 시간 정보를 표현하기 위해 지오해시(geohash)를 사용하고, OWL:sameAs 축약어를 활용해 내부 실체를 외부 지식 기반과 연결한다.
  • 문헌정보 데이터를 기반으로 공동저자, 인용, 저자-논문, 논문-저자 네트워크 등 네 가지 사회과학 네트워크를 구축하여 네트워크 과학 분석을 수행한다.

실험 결과

연구 질문

  • RQ1생물학 및 의학을 초월해 다양한 분야를 포함하는 다학문적 코로나19 연구 논문을 효과적으로 다수 분야에 분류할 수 있는 방법은 무엇인가?
  • RQ2이질적인 학술 도메인에서 정확하고 맥락 인식 가능한 실체 및 관계 추출을 가능하게 하는 기법은 무엇인가?
  • RQ3다양한 분야의 실체 및 관계를 통합하면서도 전공 의미를 유지하는 통합 지식 그래프는 어떻게 설계할 수 있는가?
  • RQ4코로나19 맥락에서 다학문 연구 네트워크의 구조적 및 통계적 특성은 무엇인가?
  • RQ5지식 그래프가 공동체 탐지 및 링크 예측과 같은 지식 탐색 작업을 얼마나 효과적으로 지원할 수 있는가?

주요 결과

  • Covidia는 150만 건의 코로나19 연구 논문을 통합하며, 그 중 48%는 비생물의학 분야에서 출간되어 다학문 지식 플랫폼의 필요성을 강조한다.
  • 대조 학습 기반 분류 모델은 다양한 분야의 논문에 대한 다중 레이블 분류 정확도를 향상시켜 정확한 전공 태깅을 가능하게 한다.
  • 위키백과 연결을 통한 강화된 BERT 기반 실체 추출 모델은 개방형 도메인에서 도메인 특화 실체를 높은 정밀도로 식별한다.
  • 지식 그래프는 표준 검색 엔진이 해석할 수 없는 복잡한 질의를 지원한다. 예를 들어, 한 단계 질의(특정 지식 포인트를 언급한 논문), 두 단계 질의(특정 도메인의 그림), 세 단계 질의(소속 기관이 연구한 장소) 등이다.
  • 네트워크 분석 결과, 공동저자, 인용, 저자-논문 네트워크에서 멱법칙(degree distribution) 분포가 관찰되었으며, α 값은 1.377에서 1.511 사이로, 스케일프리 네트워크 특성을 나타낸다.
  • 시스템은 공동체 탐지 및 링크 예측에 대한 벤치마크를 제공하며, 연구 공동체 식별 및 숨겨진 다학문적 연결을 밝혀내는 데 유용함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.