[논문 리뷰] OpenExtract: Automated Data Extraction for Systematic Reviews in Health
OpenExtract는 건강 분야의 체계적 검토를 자동으로 데이터를 추출하기 위해 대형 언어 모델을 사용하는 오픈 소스 파이프라인으로, 인간 연구자와 비교했을 때 정밀도와 재현율이 0.8 이상을 달성한다.
This study presents OpenExtract, an open-source pipeline for automated data extraction in large-scale systematic literature reviews. The pipeline queries large language models (LLMs) to predict data entries based on relevant sections of scientific articles. To test the efficacy of OpenExtract, we apply it to a systematic literature review in digital health and compare its outputs with those of human researchers. OpenExtract achieves precision and recall scores of > 0.8 in this task, indicating that it can be effective at extracting data automatically and efficiently. OpenExtract: https://github.com/JimAchterbergLUMC/OpenExtract.
연구 동기 및 목표
- 건강 체계적 검토에서 확장 가능한 데이터 추출의 필요성을 제시한다.
- LLM을 사용하여 데이터 추출을 자동화하는 오픈 소스 파이프라인을 제안한다.
- 디지털 헬스 체계적 검토에서 OpenExtract를 인간 연구자와 비교 평가한다.
제안 방법
- OpenExtract는 관련 논문 섹션에서 데이터 항목을 예측하기 위해 대형 언어 모델에 질의한다.
- 이 파이프라인은 연구원이 수행하는 데이터 추출 작업을 자동화한다.
- 디지털 헬스 체계적 검토를 사용하여 인간 연구자와의 비교 평가를 수행한다.
실험 결과
연구 질문
- RQ1자동화된 파이프라인이 LLM을 사용하여 건강 체계적 검토를 위해 사전에 정의된 데이터 항목을 정확하게 추출할 수 있는가?
- RQ2건강 문헌의 데이터 추출 작업에서 OpenExtract가 정밀도와 재현율 측면에서 인간 연구자와 어떻게 비교되는가?
- RQ3대규모 체계적 검토에 대해 오픈 소스 접근 방식이 효과적인가?
주요 결과
- OpenExtract는 디지털 헬스 체계적 검토의 데이터 항목을 추출할 때 정밀도 및 재현율 점수가 > 0.8에 도달한다.
- 이 파이프라인은 인간 연구자에 비해 데이터 추출 산출물을 생산하는 측면에서 효율성을 보여준다.
- 본 연구는 건강 분야의 대규모 체계적 검토를 위한 실행 가능한 자동 도구로 OpenExtract를 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.