[논문 리뷰] An Information Extraction and Knowledge Graph Platform for Accelerating Biochemical Discoveries
이 논문은 NLP와 그래프 분석을 활용하여 구조화된 생화학 데이터베이스와 비구조화된 과학 문헌(PDF)을 통합하는 확장 가능한 지식 그래프 플랫폼인 BCKG를 제시한다. 이 플랫폼은 10개 이상의 데이터베이스에서 정규화된 데이터를 취득하고, 클라우드 네이티브 파이프라인을 통해 텍스트와 표에서 사실을 추출함으로써 생화학적 발견을 가속화한다. 복잡한 질의를 가능하게 하여 기존에 목록에 없었던 효소 후보들, 예를 들어 기존에 목록에 없던 트레할로스-포스페이트 인산화효소인 TPP1을 밝혀내어, 체계 생물학 분야에서 뜻밖의 발견을 가능하게 한다.
Information extraction and data mining in biochemical literature is a daunting task that demands resource-intensive computation and appropriate means to scale knowledge ingestion. Being able to leverage this immense source of technical information helps to drastically reduce costs and time to solution in multiple application fields from food safety to pharmaceutics. We present a scalable document ingestion system that integrates data from databases and publications (in PDF format) in a biochemistry knowledge graph (BCKG). The BCKG is a comprehensive source of knowledge that can be queried to retrieve known biochemical facts and to generate novel insights. After describing the knowledge ingestion framework, we showcase an application of our system in the field of carbohydrate enzymes. The BCKG represents a way to scale knowledge ingestion and automatically exploit prior knowledge to accelerate discovery in biochemical sciences.
연구 동기 및 목표
- 고립된 데이터베이스와 비구조화된 문헌에 저장된 분산되고 활용도가 낮은 생화학 지식 문제를 해결하기 위해.
- 다양한 데이터 소스를 하나의 질의 가능한 지식 그래프로 통합하는 확장 가능하고 클라우드 네이티브 플랫폼을 개발하기 위해.
- 엔티티와 사실을 자동으로 대규모로 추출하기 위해 과학적 PDF에서 NLP 기법을 활용한 정보 추출을 가능하게 하기 위해.
- 트레할로스와 같은 고가치 당합성에 관여하는 효소와 같이 이전에 보고되지 않은 새로운 효소 후보를 식별함으로써 플랫폼의 유용성을 입증하기 위해.
- 그래프 기반 분석과 복잡한 질의 워크플로우를 통해 뜻밖의 통찰을 생성함으로써 생화학 분야의 발견을 가속화하기 위해.
제안 방법
- 표준화된 키를 사용한 정규화된 JSON 표현을 통해 10개 이상의 생화학 데이터베이스(예: UniProt, CAZy, KEGG, PubChem)에서 구조화된 데이터를 수신한다.
- 과학 논문, 수기 등 비구조화된 PDF(예: 과학 논문, 수기)를 Corpus Conversion Service(CCS)를 통해 처리하여 텍스트, 표, 메타데이터를 구조화된 JSON 형식으로 추출한다.
- 텍스트와 표 전반에 걸쳐 생화학 엔티티(예: 유전자, 단백질, EC 번호)를 식별하기 위해 명명된 엔티티 인식(NER)을 적용한다.
- 엔티티 간의 관계를 식별하기 위해 사실 추출(FE)을 수행한다. 예를 들어 효소-기질 또는 효소-생물체 간의 관계.
- 공동 발생과 의미 정규화를 사용하여 데이터베이스와 문헌 간의 엔티티와 사실을 연결함으로써 통합 지식 그래프를 구축한다.
- 그래프 탐색, 중심성 분석, 통찰 생성을 지원하기 위해 다이어그램 기반의 질의 엔진(DAG-based query engine)을 구현한다.
실험 결과
연구 질문
- RQ1확장 가능하고 클라우드 네이티브인 플랫폼이 이질적인 생화학 데이터베이스와 비구조화된 과학 문헌을 하나의 질의 가능한 지식 그래프로 효과적으로 통합할 수 있는가?
- RQ2NER 및 FE와 같은 NLP 기법을 스캐너된 PDF와 과학적 텍스트에서 실질적인 생화학 사실을 추출하는 데 어떻게 적용할 수 있는가?
- RQ3그래프 기반 분석이 기존에 알려지지 않은, CAZy와 같은 주요 데이터베이스에 등재되어 있지 않은 새로운 효소 후보를 얼마나 잘 밝혀낼 수 있는가?
- RQ4플랫폼이 생화학적 발견에서 '뜻밖의 통찰을 계획'할 수 있도록 다단계 복잡한 질의를 지원할 수 있는가?
- RQ5지식 그래프가 트레할로스와 같은 고가치 당합성에 관여하는 효소의 식별을 얼마나 효과적으로 가속화하는가?
주요 결과
- BCKG 플랫폼은 10개 이상의 구조화된 데이터베이스와 1,000개 이상의 과학 문서에서 데이터를 수신하여 약 600만 개의 노드와 6,100만 개의 엣지를 가진 지식 그래프를 생성하였다.
- 플랫폼은 CAZy 데이터베이스에 아직 등재되어 있지 않은, 벼에서 유래한 가능성이 있는 트레할로스-포스페이트 인산화효소인 TPP1을 성공적으로 식별하였다.
- 시스템은 마이코박터이움 투버클로시스에서 유래한 트레할로스 2-설포트라제인 stf0를 이전에 CAZy에 보고되지 않은 효소 후보로 밝혀내었다.
- 다이어그램 기반 질의 엔진은 그래프 탐색과 필터링을 조합한 복잡한 다단계 워크플로우를 가능하게 하여 희귀하거나 간과된 생화학적 관계를 식별하는 데 기여하였다.
- NER 및 FE를 통한 문헌 기반 사실 통합은 기존에 정제된 데이터베이스만으로는 확보할 수 없는 생화학 효소 기능의 커버리지 확장을 크게 증가시켰다.
- 플랫폼은 특히 당 대사 경로의 맥락에서 생화학 네트워크의 체계적 탐색을 가능하게 하여 새로운 통찰을 생성하는 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.