[논문 리뷰] Zero-shot Generative Large Language Models for Systematic Review Screening Automation
이 논문은 목표 재현율 수준을 달성하기 위해 지침에 맞춰 튜닝된 모델과 새로운 校정 기법을 사용하는 제로샷 생성형 LLM 접근법을 제안하여 체계적 리뷰 문서 선별을 자동화한다. 보다 높은 성능을 보이는 제로샷 LLM의 캘리브레이션된 앙상블가 상태의 최신 맞춤형 모델인 Bio-SIEVE를 능가하며, 고비용의 레이블링이나 희석을 제거하여 수동 선별 노력을 크게 줄인다.
Systematic reviews are crucial for evidence-based medicine as they comprehensively analyse published research findings on specific questions. Conducting such reviews is often resource- and time-intensive, especially in the screening phase, where abstracts of publications are assessed for inclusion in a review. This study investigates the effectiveness of using zero-shot large language models~(LLMs) for automatic screening. We evaluate the effectiveness of eight different LLMs and investigate a calibration technique that uses a predefined recall threshold to determine whether a publication should be included in a systematic review. Our comprehensive evaluation using five standard test collections shows that instruction fine-tuning plays an important role in screening, that calibration renders LLMs practical for achieving a targeted recall, and that combining both with an ensemble of zero-shot models saves significant screening time compared to state-of-the-art approaches.
연구 동기 및 목표
- 작업 전용 희석 또는 레이블링 없이 제로샷 생성형 LLM을 사용하여 체계적 리뷰 문서 선별을 자동화하기.
- LLM 아키텍처, 지침 기반 희석, 캘리브레이션의 영향이 선별 효과성에 미치는 영향 평가하기.
- 여러 개의 LLM과 BERT 기반 베이스라인을 조합한 앙상블 방법이 기존 최고 수준의 접근법을 능가하는지 평가하기.
- 제로샷 LLM이 임상 체계적 리뷰에서 요구하는 목표 재현율 수준을 신뢰성 있게 달성할 수 있는지 확인하기.
제안 방법
- 검토 주제에서 유도된 지침 지시문을 기반으로 제로샷 생성형 LLM을 사용해 문서를 '포함' 또는 '제외'로 분류하기.
- 다음 예측 토큰('예' 또는 '아니요')의 확률을 사용해 분류 결정을 내리며, 재현율을 제어하기 위해 캘리브레이션된 임계값 θ를 사용하기.
- 시드 문서 또는 이전 리뷰에서 유도된 정해진 재현율 목표를 기반으로 결정 경계 θ를 캘리브레이션하여 정밀도와 재현율의 균형을 맞추기.
- 다양한 최고 성능을 보이는 LLM들(예: LlaMa2-7b-ins, LlaMa2-13b-ins)과 BioBERT 기반 베이스라인의 예측을 조합하여 앙상블를 구성해 정교함과 성능을 향상시키기.
- 비교 평가를 위해 캘리브레이션 기법을 제로샷 모델과 희석된 Bio-SIEVE 기반 베이스라인 양쪽에 적용하기.
- 표준 지표인 B-AC, WSS, 정밀도, F3, 재현율을 사용해 다섯 개의 표준 테스트 컬렉션(예: CLEF-TAR)에서 모든 방법 평가하기.
실험 결과
연구 질문
- RQ1RQ1: LLM의 아키텍처와 크기가 선별 효과성에 어떤 영향을 미치는가?
- RQ2RQ2: 지침 기반 희석은 기본 모델 대비 성능에 어떤 영향을 미치는가?
- RQ3RQ3: 임계값 θ를 사용한 출력 캘리브레이션은 재현율과 전체 효과성에 어떤 영향을 미치는가?
- RQ4RQ4: 여러 개의 LLM과 신경망 기반 베이스라인을 조합한 앙상블 방법은 개별 모델 대비 성능에 어떤 영향을 미치는가?
주요 결과
- LlaMa2-7b-ins가 더 큰 LlaMa2-13b-ins를 능가하여, 이 작업에 있어 모델 크기만으로는 더 나은 성능을 보장하지 못함을 시사한다.
- 지침 기반 희석은 기본 모델 대비 일관되게 성능 향상을 이끌어내어, 효과적인 제로샷 적용에 있어 중요성을 입증한다.
- 임계값 θ를 사용한 캘리브레이션은 재현율과 정밀도를 크게 향상시켜 목표 재현율 수준을 안정적으로 달성할 수 있도록 한다.
- LlaMa2-7b-ins, LlaMa2-13b-ins, BioBERT의 캘리브레이션된 앙상블는 개별 모델, 포함해 희석된 Bio-SIEVE보다 더 높은 WSS, 정밀도, F3 성능을 기록했다.
- Bio-SIEVE가 동일한 데이터셋에서 희석된 바에도 불구하고, 동일한 캘리브레이션 조건 하에서 앙상블 방법이 B-AC와 WSS 모두에서 Bio-SIEVE를 능가했다.
- 캘리브레이션된 제로샷 접근법은 다양한 주제에서 높은 재현율을 달성하여 실제 체계적 리뷰 워크플로우에서의 실용성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.