Skip to main content
QUICK REVIEW

[论文解读] Zero-shot Generative Large Language Models for Systematic Review Screening Automation

Shuai Wang, Harrisen Scells|arXiv (Cornell University)|Jan 12, 2024
Topic Modeling被引用 4
一句话总结

本文提出一种零样本生成式大语言模型方法,用于自动化系统综述的文献筛选,通过指令微调模型和一种新颖的校准技术,实现目标召回率。结果表明,经过校准的零样本大语言模型集成方法优于最先进的微调模型(如Bio-SIEVE),同时无需昂贵的标注或微调过程,显著减少了人工筛选的工作量。

ABSTRACT

Systematic reviews are crucial for evidence-based medicine as they comprehensively analyse published research findings on specific questions. Conducting such reviews is often resource- and time-intensive, especially in the screening phase, where abstracts of publications are assessed for inclusion in a review. This study investigates the effectiveness of using zero-shot large language models~(LLMs) for automatic screening. We evaluate the effectiveness of eight different LLMs and investigate a calibration technique that uses a predefined recall threshold to determine whether a publication should be included in a systematic review. Our comprehensive evaluation using five standard test collections shows that instruction fine-tuning plays an important role in screening, that calibration renders LLMs practical for achieving a targeted recall, and that combining both with an ensemble of zero-shot models saves significant screening time compared to state-of-the-art approaches.

研究动机与目标

  • 使用无需任务特定微调或标注的零样本生成式大语言模型,自动化系统综述的文献筛选。
  • 评估大语言模型架构、指令微调以及校准对筛选效果的影响。
  • 评估结合多个大语言模型与BERT基线的集成方法是否能超越现有最先进方法。
  • 确定零样本大语言模型是否能可靠地达到临床系统综述所需的靶向召回率。

提出的方法

  • 使用零样本生成式大语言模型,基于从综述主题中提取的提示指令,将文献分类为“纳入”或“排除”。
  • 利用下一个预测标记的概率('是'或'否')做出分类决策,并使用校准后的阈值θ控制召回率。
  • 通过预设的召回率目标(源自种子文献或先前综述)校准决策边界θ,以平衡精确率与召回率。
  • 通过组合多个表现最佳的大语言模型(如LlaMa2-7b-ins、LlaMa2-13b-ins)和一个BioBERT基线,构建集成模型以提升鲁棒性与性能。
  • 对零样本模型和微调后的Bio-SIEVE基线均应用该校准技术,以进行对比评估。
  • 在五个标准测试集(如CLEF-TAR)上使用标准指标(B-AC、WSS、精确率、F3和召回率)评估所有方法。

实验结果

研究问题

  • RQ1RQ1:大语言模型的架构与规模如何影响筛选效果?
  • RQ2RQ2:与基础模型相比,基于指令的微调对性能有何影响?
  • RQ3RQ3:使用阈值θ进行输出校准如何提升召回率与整体有效性?
  • RQ4RQ4:与单个模型相比,集成多个大语言模型与神经网络基线对性能有何影响?

主要发现

  • LlaMa2-7b-ins的表现优于更大的LlaMa2-13b-ins,表明模型规模本身并不能保证该任务的更好性能。
  • 与基础模型相比,指令微调始终能提升性能,证明其在有效应用零样本方法中的重要性。
  • 使用阈值θ进行校准显著提升了召回率与精确率,使可靠达到目标召回率成为可能。
  • 经过校准的LlaMa2-7b-ins、LlaMa2-13b-ins与BioBERT集成模型在WSS、精确率与F3上均优于任何单一模型,包括微调后的Bio-SIEVE。
  • 在相同校准条件下,该集成方法在B-AC与WSS上均优于Bio-SIEVE,尽管Bio-SIEVE在相同数据集上进行了微调。
  • 经过校准的零样本方法在多种主题下均实现了高召回率,表明其在真实世界系统综述工作流程中具有实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。