Skip to main content
QUICK REVIEW

[논문 리뷰] A Semantically Enriched Dataset based on Biomedical NER for the COVID19 Open Research Dataset Challenge

Hermann Kroll, Jan Pirklbauer|arXiv (Cornell University)|2020. 05. 18.
Topic Modeling참고 문헌 6인용 수 7
한 줄 요약

이 논문은 최신 NER 도구(TaggerOne 및 GNormPlus)를 사용하여 CORD-19 데이터셋에서 추출한 생물의학적 명칭(entity)—화학물질, 질병, 유전자, 종—을 포함하는 의미적 풍부한 데이터셋을 제시한다. 파이프라인은 제목, 초록, 전문문을 처리하여 전문문에서 340만 개 이상의 엔티티 언급을 생성하였으며, CC BY 4.0 라이선스 하에 오픈 소스 JSON 파일로 배포되어 코로나19 연구 도구에서의 재사용을 가능하게 한다.

ABSTRACT

Research into COVID-19 is a big challenge and highly relevant at the moment. New tools are required to assist medical experts in their research with relevant and valuable information. The COVID-19 Open Research Dataset Challenge (CORD-19) is a "call to action" for computer scientists to develop these innovative tools. Many of these applications are empowered by entity information, i. e. knowing which entities are used within a sentence. For this paper, we have developed a pipeline upon the latest Named Entity Recognition tools for Chemicals, Diseases, Genes and Species. We apply our pipeline to the COVID-19 research challenge and share the resulting entity mentions with the community.

연구 동기 및 목표

  • 생물의학적 코로나19 연구에서 정보 과부하 문제를 해결하기 위해 정확하고 엔티티 중심의 정보 검색을 가능하게 하기 위해.
  • 화학물질, 질병, 유전자, 종과 같은 핵심 생물의학적 엔티티를 자동으로 탐지하고 정규화하는 고품질의 자동화된 파이프라인을 개발하기 위해.
  • 구조화되고 기계로 읽을 수 있는 엔티티 주석을 통해 CORD-19 오픈 연구 데이터셋을 향상시키기 위해.
  • 지식 그래프 구축, 요약, 의미 기반 검색과 같은 고급 NLP 응용 프로그램 개발을 지원하기 위해.
  • 연구 공동체가 재사용할 수 있도록 정밀한 공간적 및 의미적 메타데이터를 포함한 엔티티 언급의 오픈 데이터셋을 제공하기 위해.

제안 방법

  • 화학물질과 질병에는 TaggerOne을, 유전자와 종에는 GNormPlus를 사용하여, 사전 학습된 모델을 활용해 동시 NER 및 정규화를 수행한다.
  • 엔티티 탐지는 CORD-19 데이터셋(버전 9)을 대상으로 하며, JSON 형식의 제목, 초록, 전문문 본문 문단을 처리한다.
  • 각 엔티티 언급은 위치(문단 인덱스, 시작 및 끝 문자 위치), 엔티티 문자열, 유형, MeSH, OMIM, NCBI Gene 또는 NCBI 종 분류 체계에서의 표준화된 ID를 포함하여 주석 처리된다.
  • 출력은 각 CORD-19 문서 ID를 엔티티 언급의 메타데이터가 포함된 목록으로 매핑하는 JSON 사전 형식으로 구성된다.
  • 데이터셋은 GitHub에 버전 관리되어 배포되며, 새로운 CORD-19 릴리스에 대응해 향후 업데이트가 계획되어 있다.
  • NCBI 질병, BioCreativeV, 유전자 정규화 테스트셋과 같은 벤치마크 코퍼스에서 검증된 도구에 기반하여 고품질 주석을 보장한다.

실험 결과

연구 질문

  • RQ1생물의학적 명칭 인식(NER)이 CORD-19 데이터셋 전반에 효과적으로 적용되어 구조화된 엔티티 언급을 추출할 수 있는가?
  • RQ2화학물질, 질병, 유전자, 종과 같은 핵심 생물의학적 엔티티의 크기와 분포는 CORD-19 코퍼스의 제목, 초록, 전문문에서 어떻게 분포되어 있는가?
  • RQ3TaggerOne과 GNormPlus를 통합한 단일 NER 파이프라인이 다양한 생물의학적 텍스트 유형에서 고품질이고 일관된 엔티티 주석을 생성할 수 있는가?
  • RQ4오픈이고 의미적으로 풍부한 엔티티 주석은 패닉 연구에서 지식 그래프 구축이나 의미 기반 검색과 같은 후속 응용 프로그램을 얼마나 향상시킬 수 있는가?
  • RQ5엔티티 언급은 제목, 초록, 본문 문단와 같은 텍스트 구조 내에서 어떻게 정밀하게 위치가 지정되어 있는가? 이를 통해 세밀한 정보 접근을 어떻게 지원할 수 있는가?

주요 결과

  • 파이프라인이 CORD-19 데이터셋의 제목과 초록에서 약 99,000개의 화학물질, 145,000개의 질병, 59,000개의 유전자, 165,000개의 종을 탐지하였다.
  • 전문문 문서에서는 파이프라인이 340만 개의 화학물질, 400만 개의 질병, 220만 개의 유전자, 470만 개의 종을 식별하였다.
  • 데이터셋은 창작자 표시 4.0 국제 라이선스 하에 두 개의 오픈 소스 JSON 파일로 배포되었으며, 하나는 제목과 초록용, 다른 하나는 전문문용이다.
  • 각 엔티티 언급에는 정밀한 위치 메타데이터가 포함되어 있다: 문단 인덱스, 문자 수준의 시작 및 끝 위치, 엔티티 문자열, 유형, 표준화된 ID.
  • 저자는 주석 품질이 TaggerOne 및 GNormPlus의 원래 벤치마크 수준과 유사하다고 추정한다.
  • 데이터셋은 GitHub에 호스팅되어 있으며, 새로운 CORD-19 데이터셋 릴리스에 대응해 지속적인 업데이트가 계획되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.