[논문 리뷰] Automated title and abstract screening for scoping reviews using the GPT-4 Large Language Model
이 논문은 GPT-4와 체인 오브 써포트 프롬프팅을 사용하여 범위 검토에서 제목과 초록 스크리닝을 자동화하는 R 패키지인 GPTscreenR를 소개한다. 이는 71%의 민감도, 89%의 특이도, 84%의 정확도를 기록하며, 제로샷 방법과 유사한 성능을 보이며 오류 제어가 향상되어 인간의 노고를 줄일 수 있는 사용자 友好的한 도구를 제공한다.
Scoping reviews, a type of literature review, require intensive human effort to screen large numbers of scholarly sources for their relevance to the review objectives. This manuscript introduces GPTscreenR, a package for the R statistical programming language that uses the GPT-4 Large Language Model (LLM) to automatically screen sources. The package makes use of the chain-of-thought technique with the goal of maximising performance on complex screening tasks. In validation against consensus human reviewer decisions, GPTscreenR performed similarly to an alternative zero-shot technique, with a sensitivity of 71%, specificity of 89%, and overall accuracy of 84%. Neither method achieved perfect accuracy nor human levels of intraobserver agreement. GPTscreenR demonstrates the potential for LLMs to support scholarly work and provides a user-friendly software framework that can be integrated into existing review processes.
연구 동기 및 목표
- 범위 검토에서 대량의 자료를 스크리닝하기 위해 요구되는 인적 노력의 감소.
- 기존 리뷰 워크플로우에 GPT-4를 통합하는 사용자 친화적이고 오픈소스인 R 패키지 개발.
- 제로샷 프롬프팅과 비교하여 GPT-4를 사용한 체인 오브 써포트 프롬프팅의 성능 평가.
- 인간 리뷰어 공감대에 비해 LLM 기반 스크리닝의 신뢰성과 투명성 평가.
- 심사 가능성을 유지하기 위해 추론 트레이스를 활용하는 LLM 통합 프레임워크 제공.
제안 방법
- GPTscreenR 패키지는 스크리닝 결정을 중간 추론 단계로 나누는 체인 오브 써포트 프롬프팅 전략을 구현한다.
- 각 자료는 포함 및 배제 기준에 따라 GPT-4가 단계별로 관련성을 평가하도록 지시하는 프롬프트를 통해 처리된다.
- 모델은 최종 포함 또는 배제 결정을 내리기 전에 추론 전사본을 생성한다.
- 성능 평가는 여러 범위 검토에서 GPT-4 결정을 인간 리뷰어의 공감 결정과 비교하여 평가된다.
- OpenAI API를 사용하며 GPT-4를 활용하고 토큰당 요금이 발생하며, MIT 라이선스 하에 오픈소스 R 패키지로 구현된다.
- 결정의 추론 체인을 검토할 수 있도록 해, 투명성을 확보한다.

실험 결과
연구 질문
- RQ1GPT-4를 사용한 체인 오브 써포트 프롬프팅은 제로샷 프롬프팅에 비해 자동 스크리닝의 신뢰성과 투명도를 향상시키는가?
- RQ2GPTscreenR의 성능은 민감도, 특이도, 전체 정확도 측면에서 인간 리뷰어 공감대에 비해 어떻게 비교되는가?
- RQ3체인 오브 써포트 방법은 제로샷 방법에 비해 유형 I 오류(거짓 양성)를 얼마나 줄이는가?
- RQ4비용, 시간, 데이터 품질 의존성 등의 측면에서 GPT-4를 사용한 스크리닝의 실용적 한계는 무엇인가?
- RQ5GPT-4가 생성한 추론 트레이스가 인간 리뷰어가 갈등을 해결하거나 결정 일관성을 향상시키는 데 기여할 수 있는가?
주요 결과
- GPTscreenR는 인간 공감 결정과 비교해 민감도 71%, 특이도 89%, 전체 정확도 84%를 기록했다.
- 체인 오브 써포트 방법은 제로샷 방법(84%)에 비해 더 높은 특이도(89%)를 보였지만 민감도는 낮았으며(71% 대 78%), 거짓 양성 감소를 위한 트레이드오프를 보였다.
- 검토 검증 과정에서의 데이터 품질 문제(누락되거나 손상된 초록, 일관되지 않은 스크리닝 기록)로 인해 성능이 제한되었다.
- 체인 오브 써포트 방법은 각 LLM 결정의 추론 배경을 검토할 수 있게 해 투명성과 심사 가능성 향상에 기여했다.
- 제로샷 방법과 유사한 성능를 보였음에도 불구하고, GPTscreenR는 인간 리뷰어 간의 일致도에 도달하지 못해 향상 여지가 있음을 시사했다.
- 더 긴 추론 시퀀스로 인해 제로샷 프롬프팅보다 토큰 사용량과 비용이 더 높아져 대규모 스크리닝 작업의 확장성에 영향을 미쳤다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.