[논문 리뷰] Automated Paper Screening for Clinical Reviews Using Large Language Models
이 연구는 임상 메타분석의 제목 및 초록 선별을 자동화하기 위해 OpenAI GPT API를 사용하는 새로운 워크플로우를 제안한다. 자연어 프롬프트를 적용하여 관련성을 분류함으로써, 모델은 관련 없는 논문을 배제할 때 91%의 정확도와 91%의 특이도를 기록했으며, 수작업 부담을 크게 줄이면서도 높은 일관성을 유지할 잠재력을 보여주었다. 다만, 관련 논문을 포함시키는 데 있어 민감도는 76%로 중간 수준에 머물렀다.
Objective: To assess the performance of the OpenAI GPT API in accurately and efficiently identifying relevant titles and abstracts from real-world clinical review datasets and compare its performance against ground truth labelling by two independent human reviewers. Methods: We introduce a novel workflow using the OpenAI GPT API for screening titles and abstracts in clinical reviews. A Python script was created to make calls to the GPT API with the screening criteria in natural language and a corpus of title and abstract datasets that have been filtered by a minimum of two human reviewers. We compared the performance of our model against human-reviewed papers across six review papers, screening over 24,000 titles and abstracts. Results: Our results show an accuracy of 0.91, a sensitivity of excluded papers of 0.91, and a sensitivity of included papers of 0.76. On a randomly selected subset of papers, the GPT API demonstrated the ability to provide reasoning for its decisions and corrected its initial decision upon being asked to explain its reasoning for a subset of incorrect classifications. Conclusion: The GPT API has the potential to streamline the clinical review process, save valuable time and effort for researchers, and contribute to the overall quality of clinical reviews. By prioritizing the workflow and acting as an aid rather than a replacement for researchers and reviewers, the GPT API can enhance efficiency and lead to more accurate and reliable conclusions in medical research.
연구 동기 및 목표
- 임상 메타분석의 관련 제목과 초록을 식별하는 데 있어 OpenAI GPT API의 성능을 평가하는 것.
- 두 개의 독립적인 인간 리뷰어가 제공한 기준 레이블과 비교하여 GPT API의 선별 정확도를 평가하는 것.
- 모델이 결정한 이유를 설명하고, 반성한 후 오류를 수정할 수 있는 능력을 평가하는 것.
- 대규모 언어 모델을 체계적 리뷰 과정을 간소화하기 위한 최초 단계 도구로 사용할 수 있는지 탐색하는 것.
- GPT API가 인간의 노동을 줄일 수 있는지, 동시에 임상 리뷰의 포괄성과 품질을 유지할 수 있는지 판단하는 것.
제안 방법
- 포함 및 배제 기준을 설명하는 자연어 프롬프트를 사용하여 OpenAI GPT API와 연동하는 데 전용 파이썬 스크립트를 개발했다.
- 모델은 최소 두 명의 인간 리뷰어에 의해 사전 걸러진 24,000건 이상의 제목과 초록으로 구성된 코퍼스를 처리했다.
- 스크리닝 결정은 두 명의 독립적인 인간 리뷰어가 확보한 기준 데이터셋과 비교하여 정확도, 민감도, 특이도를 측정하기 위해 사용되었다.
- GPT API는 선택된 잘못된 분류에 대해 그 이유를 설명하도록 유도되었으며, 결정을 수정할 수 있는 능력이 평가되었다.
- 성능 지표로는 모든 스크리닝 결정에 대해 정확도, 포함된 논문에 대한 민감도, 배제된 논문에 대한 특이도를 계산하였다.
- 워크플로우는 인간 리뷰어의 대체가 아니라 의사결정 보조 도구로 설계되었으며, 효율성과 일관성을 우선시하였다.
실험 결과
연구 질문
- RQ1GPT API는 자연어 프롬프트만으로 임상 메타분석의 관련 및 비관련 제목과 초록을 정확하게 분류할 수 있는가?
- RQ2정확도, 민감도, 특이도 측면에서 GPT API의 성능은 인간 리뷰어와 비교해 어떻게 되는가?
- RQ3GPT API는 자신의 스크리닝 결정에 대해 해석 가능한 이유를 제공할 수 있으며, 이러한 이유 설명이 초기 잘못된 분류를 수정하는 데 기여하는가?
- RQ4GPT API는 관련 연구의 포함을 훼손하지 않으면서 체계적 리뷰의 수작업 선별 부담을 어느 정도 줄일 수 있는가?
- RQ5특히 포함에 대한 민감도 측면에서 GPT API가 관련 논문을 식별하는 데 있어 한계는 무엇인가?
주요 결과
- GPT API는 제목과 초록을 관련 또는 비관련으로 분류하는 데 총 정확도 0.91을 기록했다.
- 모델은 관련 없는 논문을 정확히 배제하는 데 특이도 0.91을 보였으며, 비관련 연구를 걸러내는 데 강력한 성능을 보였다.
- 관련 논문을 포함시키는 데 있어 민감도는 0.76이었으며, 중요한 논문을 놓칠 가능성이 중간 수준임을 시사했다.
- 잘못 분류된 논문의 일부 집합에 대해, GPT API는 이유를 설명하도록 유도당했을 때 초반 결정을 수정할 수 있었으며, 이는 반성 능력을 지녔음을 나타냈다.
- 모델의 이유 설명은 의사결정 과정에 대한 통찰을 제공하여 스크리닝 워크플로우의 투명성과 감사 가능성을 높였다.
- GPT API는 수작업 선별 부담을 크게 줄일 수 있으며, 높은 일관성을 유지할 수 있어 체계적 리뷰에서 유용한 최초 단계 도구로 위치할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.