Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Framework to Expedite Systematic Reviews by Automatically Building Information Extraction Training Corpora

Tanmay Basu, Shraman Kumar|arXiv (Cornell University)|2016. 06. 21.
Biomedical Text Mining and Ontologies참고 문헌 16인용 수 6
한 줄 요약

이 논문은 기존의 시스템적 리뷰를 활용하여 정보 추출을 위한 훈련 코퍼스를 자동으로 구성함으로써 시스템적 리뷰의 속도를 높이는 새로운 프레임워크를 제안한다. 수동 주석 처리가 필요 없도록 하며, 참조 PDF에서 관련 문장을 추출하기 위해 수정된 재스카드 유사도를 사용하고, SVM 분류기를 훈련시켜 포함 기준을 식별할 때 93.75%의 리콜과 27.05%의 정밀도를 달성하여 평균적으로 수동 검토 대상 문장 수를 3.7개로 줄였다.

ABSTRACT

A systematic review identifies and collates various clinical studies and compares data elements and results in order to provide an evidence based answer for a particular clinical question. The process is manual and involves lot of time. A tool to automate this process is lacking. The aim of this work is to develop a framework using natural language processing and machine learning to build information extraction algorithms to identify data elements in a new primary publication, without having to go through the expensive task of manual annotation to build gold standards for each data element type. The system is developed in two stages. Initially, it uses information contained in existing systematic reviews to identify the sentences from the PDF files of the included references that contain specific data elements of interest using a modified Jaccard similarity measure. These sentences have been treated as labeled data.A Support Vector Machine (SVM) classifier is trained on this labeled data to extract data elements of interests from a new article. We conducted experiments on Cochrane Database systematic reviews related to congestive heart failure using inclusion criteria as an example data element. The empirical results show that the proposed system automatically identifies sentences containing the data element of interest with a high recall (93.75%) and reasonable precision (27.05% - which means the reviewers have to read only 3.7 sentences on average). The empirical results suggest that the tool is retrieving valuable information from the reference articles, even when it is time-consuming to identify them manually. Thus we hope that the tool will be useful for automatic data extraction from biomedical research publications. The future scope of this work is to generalize this information framework for all types of systematic reviews.

연구 동기 및 목표

  • 시스템적 리뷰에서 정보 추출을 위한 훈련 데이터를 구축할 때 수동 주석 처리의 시간과 비용을 줄이기 위해.
  • 기존의 시스템적 리뷰를 지식 소스로 활용하여 생물의학 문헌 내 임상적으로 관련성이 있는 데이터 요소를 자동으로 식별하기 위해.
  • 다양한 유형의 시스템적 리뷰와 데이터 요소에 일반화할 수 있는 확장 가능한 프레임워크를 개발하기 위해.
  • 참고 논문에서 가장 관련성이 높은 문장들만 검색하여 리뷰어의 작업 부담을 최소화하기 위해.

제안 방법

  • 기존의 시스템적 리뷰를 활용하여, 수정된 재스카드 유사도 측정법을 사용해 포함된 참조 PDF에서 목표 데이터 요소를 포함한 문장을 추출한다.
  • 식별된 문장을 약한 레이블이 부여된 훈련 데이터로 간주하여 지도 학습에 활용한다.
  • 이러한 자동으로 구성된 레이블 데이터를 기반으로 SVM 분류기를 훈련시켜, 새로운 주요 연구 논문에서 동일한 데이터 요소를 추출한다.
  • 시스템적 리뷰에 기재된 포함 기준과 참조 기사 요약 간 문장 수준의 유사도를 활용하여 관련 내용을 식별한다.
  • 기존에 발표된 시스템적 리뷰에 이미 존재하는 정보를 재사용함으로써 수동 주석 처리를 피한다.
  • 이 방법은 심부전에 중점을 둔 코크란 데이터베이스 리뷰를 대상으로 평가되었으며, 포함 기준을 목표 데이터 요소로 삼았다.

실험 결과

연구 질문

  • RQ1기존의 시스템적 리뷰를 활용하여 수동 주석 처리 없이 정보 추출을 위한 훈련 데이터를 자동으로 생성할 수 있는가?
  • RQ2수정된 재스카드 유사도 측정법이 목표 데이터 요소를 포함한 참조 기사의 관련 문장을 효과적으로 식별하는 데 얼마나 유용한가?
  • RQ3생물의학 문헌에서 데이터 추출을 위한 자동으로 구성된 훈련 코퍼스를 사용할 때 달성할 수 있는 리콜과 정밀도 수준은 어느 정도인가?
  • RQ4제안된 프레임워크가 시스템적 리뷰 리뷰어의 수동 검토 부담을 어느 정도 줄이는가?
  • RQ5이 프레임워크는 다양한 유형의 시스템적 리뷰와 데이터 요소에 일반화될 수 있는가?

주요 결과

  • 이 프레임워크는 새로운 논문에서 목표 데이터 요소(포함 기준)를 포함한 문장을 식별할 때 93.75%의 리콜을 달성하여 관련 콘텐츠를 높은 민감도로 포착하고 있음을 나타낸다.
  • 정밀도는 27.05%로, 리뷰어가 관련 정보를 찾기 위해 평균적으로 단 3.7개의 문장만 검토하면 되어 수동 작업 부담이 크게 감소하였다.
  • 수정된 재스카드 유사도 측정법을 사용함으로써 수동 레이블링이 필요 없이 참조 PDF에서 관련 문장을 효과적으로 식별할 수 있었다.
  • 자동으로 생성된 훈련 데이터를 기반으로 훈련된 SVM 분류기가 안정적으로 작동하여, 생물의학 정보 추출에서 약한 감독의 가능성을 입증하였다.
  • 결과적으로 이 프레임워크는 수동 데이터 추출 작업을 최소화함으로써 시스템적 리뷰의 속도를 크게 향상시킬 수 있음을 시사한다.
  • 이 방법은 확장 가능하고 일반화 가능하며, 다른 데이터 요소와 시스템적 리뷰 유형으로도 확장 가능할 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.