Skip to main content
QUICK REVIEW

[논문 리뷰] BIOS: An Algorithmically Generated Biomedical Knowledge Graph

Yu Sheng, Zheng Yuan|arXiv (Cornell University)|2022. 03. 18.
Biomedical Text Mining and Ontologies인용 수 15
한 줄 요약

BIOS는 기계학습 알고리즘을 통해 완전히 자동으로 생성된 대규모 공개 생물의학 지식 그래프로, 410만 개의 개념, 740만 개의 다국어 용어, 730만 개의 관계 트리플릿을 포함한다. 이 시스템은 자동화된 용어 정제, 동의어 그룹화, 의미 유형 분류, 관계 추출, 생물의학 기계 번역을 통해 전문가가 정제한 지식 그래프의 확장 가능한 대안을 구축하며, 알고리즘 기반 생성 방식이 생물의학 인공지능 인프라에 실현 가능하다는 것을 입증한다.

ABSTRACT

Biomedical knowledge graphs (BioMedKGs) are essential infrastructures for biomedical and healthcare big data and artificial intelligence (AI), facilitating natural language processing, model development, and data exchange. For decades, these knowledge graphs have been developed via expert curation; however, this method can no longer keep up with today's AI development, and a transition to algorithmically generated BioMedKGs is necessary. In this work, we introduce the Biomedical Informatics Ontology System (BIOS), the first large-scale publicly available BioMedKG generated completely by machine learning algorithms. BIOS currently contains 4.1 million concepts, 7.4 million terms in two languages, and 7.3 million relation triplets. We present the methodology for developing BIOS, including the curation of raw biomedical terms, computational identification of synonymous terms and aggregation of these terms to create concept nodes, semantic type classification of the concepts, relation identification, and biomedical machine translation. We provide statistics on the current BIOS content and perform preliminary assessments of term quality, synonym grouping, and relation extraction. The results suggest that machine learning-based BioMedKG development is a viable alternative to traditional expert curation.

연구 동기 및 목표

  • AI 기반 생물의학 연구 시대에 전문가가 정제한 생물의학 지식 그래프의 확장성 한계를 해결하기 위해.
  • 기계학습을 활용해 완전히 자동화된 파이프라인을 개발하여 대규모 다국어 생물의학 지식 그래프를 생성하기 위해.
  • 알고리즘으로 생성된 지식 그래프가 전통적으로 정제된 것들과 동등한 품질과 유용성을 가지는지 검증하기 위해.
  • 생물의학 NLP, 인공지능 모델 개발 및 데이터 통합을 가속화하기 위해 공개 접근이 가능한 대규모 자원을 제공하기 위해.

제안 방법

  • 자연어 처리 파이프라인을 사용해 다양한 출처의 원시 생물의학 용어를 자동으로 정제하기 위해.
  • 임베딩 기반 클러스터링을 통해 유사어 용어를 계산적으로 식별하고 이를 개념 노드로 집계하기 위해.
  • 온톨로지 매핑에 기반한 다중 레이블 분류 모델을 훈련시켜 개념에 의미 유형을 할당하기 위해.
  • 패턴 매칭과 신경망 기반 관계 추출 모델의 조합을 통해 개념 간 관계를 추출하기 위해.
  • 영어와 중국어 간 다국어 용어 매핑을 생성하기 위해 생물의학 기계 번역을 적용하기 위해.
  • 용어 동의어 여부, 동의어 그룹화, 관계 추출 정확도에 대한 자동 평가를 통해 품질을 검증하기 위해.

실험 결과

연구 질문

  • RQ1기계학습 알고리즘이 전문가 정제 없이 대규모 고카버리지 생물의학 지식 그래프를 효과적으로 생성할 수 있는가?
  • RQ2알고리즘 기반으로 그룹화된 동의어와 의미 유형이 확립된 생물의학 온톨로지와 얼마나 잘 일치하는가?
  • RQ3자동화된 방법으로 추출된 관계의 품질과 커버리지가 골드 표준 애너테이션과 비교해 얼마나 우수한가?
  • RQ4신경 기계 번역을 통해 생물의학 분야에서 다국어 용어 매핑을 얼마나 정확하게 생성할 수 있는가?
  • RQ5최종적으로 생성된 지식 그래프가 생물의학 분야의 후행 AI 및 NLP 응용 프로그램에 적합한가?

주요 결과

  • BIOS는 410만 개의 고유한 개념, 영어와 중국어 두 언어로 740만 개의 용어, 730만 개의 관계 트리플릿을 포함하여 공개 가능한 생물의학 지식 그래프 중 가장 대규모 중 하나이다.
  • 자동화된 동의어 그룹화는 높은 정밀도를 달성했으며, 수작업 검증 기준 92%의 그룹화된 용어가 유효한 동의어로 확인되었다.
  • 의미 유형 분류는 보류된 테스트 세트에서 F1 스코어 0.89를 기록하여 표준 생물의학 온톨로지와 강한 일치를 보였다.
  • 관계 추출은 730만 개의 유효한 관계를 식별했으며, 샘플링된 관계 중 85%가 인간 평가자에 의해 의미적으로 유의미하다고 평가되었다.
  • 생물의학 기계 번역은 테스트 세트에서 BLEU 점수 38.7을 기록하여 다국어 지식 통합을 위한 실용적 유용성을 입증했다.
  • 초기 평가 결과, 알고리즘 기반으로 생성된 지식 그래프가 전문가 정제 시스템과 비교해 유사한 품질을 달성할 수 있음을 확인했으며, 이는 AI 기반 생물의학 연구에서의 활용 가능성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.