[논문 리뷰] Building a PubMed knowledge graph
이 논문은 PubMed, NIH ExPORTER, ORCID, MapAffil 등의 다양한 출처에서 생물학적 실체, 저자 이름의 동일인 식별, 자금 지원 정보, 소속 역사를 통합하여 PubMed 지식 그래프(PKG)를 구축하는 방법을 제시한다. BioBERT를 사용한 실체 추출과 고도의 동일인 식별 기법을 적용하여, 저자 이름의 동일인 식별에서 F1 스코어 98.09%를 달성하고 기존 모델들을 뛰어넘는 생물학적 실체 인식 성능을 확보하였다.
PubMed is an essential resource for the medical domain, but useful concepts are either difficult to extract or are ambiguated, which has significantly hindered knowledge discovery. To address this issue, we constructed a PubMed knowledge graph (PKG) by extracting bio-entities from 29 million PubMed abstracts, disambiguating author names, integrating funding data through the National Institutes of Health (NIH) ExPORTER, collecting affiliation history and educational background of authors from ORCID, and identifying fine-grained affiliation data from MapAffil. Through the integration of the credible multi-source data, we could create connections among the bio-entities, authors, articles, affiliations, and funding. Data validation revealed that the BioBERT deep learning method of bio-entity extraction significantly outperformed the state-of-the-art models based on the F1 score (by 0.51%), with the author name disambiguation (AND) achieving a F1 score of 98.09%. PKG can trigger broader innovations, not only enabling us to measure scholarly impact, knowledge usage, and knowledge transfer, but also assisting us in profiling authors and organizations based on their connections with bio-entities. The PKG is freely available on Figshare (https://figshare.com/s/6327a55355fc2c99f3a2, simplified version that exclude PubMed raw data) and TACC website (http://er.tacc.utexas.edu/datasets/ped, full version).
연구 동기 및 목표
- PubMed 초록에서 유용한 생물의학 개념을 추출하고 동일인 식별하는 데 도전하는 것.
- 생물학적 실체, 저자 이름, 자금 지원, 소속 정보 및 교육 배경 등의 다중 출처 데이터를 통합하여 통합 지식 그래프를 구축하는 것.
- 기존 최고 수준의 모델을 뛰어넘는 생물학적 실체 추출 및 저자 이름 동일인 식별 정확도를 향상시키는 것.
- 학술적 영향 측정, 지식 이전 분석, 저자 및 기관 프로파일링 등의 새로운 기능을 가능하게 하는 것.
- 생물의학 연구 및 지식 탐색을 위한 자유로운 접근이 가능한 포괄적인 자원을 제공하는 것.
제안 방법
- 딥 러닝 모델인 BioBERT를 사용하여 2,900만 개의 PubMed 초록에서 생물학적 실체를 추출하였다.
- 저자 이름의 모호성을 해결하기 위해 다단계 동일인 식별 파이프라인을 적용하여 높은 정밀도와 재현율을 확보하였다.
- NIH ExPORTER 데이터베이스에서 자금 지원 정보를 통합하여 기금을 논문 및 저자와 연결하였다.
- ORCID 및 MapAffil에서 수집한 저자 소속 역사 및 교육 배경을 정제하여 구조화하였다.
- 생물학적 실체, 저자, 논문, 소속, 자금 지원 간의 의미적 관계를 포함한 통합 지식 그래프를 구성하였다.
- 기존 모델과의 F1 스코어 비교 및 벤치마크 데이터셋을 활용하여 지식 그래프의 정확도를 검증하였다.
실험 결과
연구 질문
- RQ1딥 러닝 기반 생물학적 실체 추출 방법이 기존 최고 수준의 모델보다 생물의학 텍스트에서 우수한 성능을 보일 수 있는가?
- RQ2다중 출처 데이터 통합을 통해 저자 이름의 동일인 식별은 어느 정도 향상될 수 있는가?
- RQ3지식 그래프가 다양한 생물의학 데이터 출처를 어떻게 통합하여 일관되고 질의 가능한 구조로 만들 수 있는가?
- RQ4PubMed, ORCID, NIH 데이터를 결합했을 때 실체 추출 및 동일인 식별 성능 향상 정도는 어떠한가?
- RQ5최종적으로 생성된 지식 그래프가 학술적 영향 분석 및 지식 이전 연구를 어느 정도 지원할 수 있는가?
주요 결과
- BioBERT 기반 생물학적 실체 추출 방법은 기존 최고 수준의 모델보다 F1 스코어에서 0.51% 높은 성능을 보였다.
- 저자 이름 동일인 식별은 높은 F1 스코어 98.09%를 기록하여 모호한 저자 신원을 효과적으로 해결하는 데 성공하였다.
- NIH 자금 지원, ORCID 소속 정보, MapAffil 데이터를 포함한 다중 출처 데이터 통합을 통해 지식 그래프 내 풍부하고 의미적으로 연결된 관계를 구현할 수 있었다.
- PubMed 지식 그래프(PKG)는 기관 간 학술적 영향 측정, 지식 활용도 분석, 지식 이전 분석 등의 새로운 분석 기능을 가능하게 하였다.
- PKG는 Figshare에 단순화된 버전과 TACC 웹사이트에 전체 버전으로 공개되어 있어 누구나 접근할 수 있다.
- 데이터 검증을 통해 대규모 생물의학 문헌 기반 지식 그래프 구축 파이프라인의 신뢰성과 확장성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.