[論文レビュー] Zero-shot Generative Large Language Models for Systematic Review Screening Automation
本論文は、タスク固有の微調整やラベル付けを必要とせず、指示微調整されたモデルと新規のキャリブレーション技術を用いて、ターゲットリCALLレベルを満たすゼロショット生成型LLMアプローチを提案する。実験により、微調整済みモデル(例:Bio-SIEVE)を凌駕するゼロショットLLMのアンサンブルが、高コストなラベル付けや微調整を排除することで、人的スクリーニング作業を顕著に削減できることを示している。
Systematic reviews are crucial for evidence-based medicine as they comprehensively analyse published research findings on specific questions. Conducting such reviews is often resource- and time-intensive, especially in the screening phase, where abstracts of publications are assessed for inclusion in a review. This study investigates the effectiveness of using zero-shot large language models~(LLMs) for automatic screening. We evaluate the effectiveness of eight different LLMs and investigate a calibration technique that uses a predefined recall threshold to determine whether a publication should be included in a systematic review. Our comprehensive evaluation using five standard test collections shows that instruction fine-tuning plays an important role in screening, that calibration renders LLMs practical for achieving a targeted recall, and that combining both with an ensemble of zero-shot models saves significant screening time compared to state-of-the-art approaches.
研究の動機と目的
- タスク固有の微調整やラベル付けを一切行わず、ゼロショット生成型LLMを用いてシステマティックレビューの文書スクリーニングを自動化すること。
- LLMアーキテクチャ、インstructベースの微調整、キャリブレーションのスクリーニング効果への影響を評価すること。
- 複数のLLMとBERTベースラインを組み合わせたアンサンブル手法が、既存の最先端手法を上回るかを評価すること。
- ゼロショットLLMが、臨床的システマティックレビューで求められるターゲットリCALLレベルを信頼性を持って達成できるかを検証すること。
提案手法
- レビューのトピックから導出されたプロンプト指示に基づき、ゼロショット生成型LLMを用いて文書を「含める」または「除外する」に分類する。
- 次に予測されるトークン(「はい」または「いいえ」)の確率を用いて分類意思決定を行い、リCALLを制御するためのキャリブレーションされたしきい値θを設定する。
- シードドキュメントや過去のレビューから得られる事前定義されたリCALLターゲットを用いて、しきい値θをキャリブレーションし、精度とリCALLのバランスをとる。
- 複数の優れた性能を示すLLM(例:LlaMa2-7b-ins, LlaMa2-13b-ins)とBioBERTベースラインの予測を統合することでアンサンブルを構築し、耐性と性能を向上させる。
- 比較評価のため、キャリブレーション技術をゼロショットモデルと微調整済みのBio-SIEVEベースラインの両方へ適用する。
- 標準指標(B-AC, WSS, 精度, F3, リCALL)を用いて、5つの標準テストコレクション(例:CLEF-TAR)上で全手法を評価する。
実験結果
リサーチクエスチョン
- RQ1RQ1: LLMのアーキテクチャおよびサイズがスクリーニング効果に与える影響は何か?
- RQ2RQ2: インstructベースの微調整は、ベースモデルと比較して性能にどのように影響するか?
- RQ3RQ3: しきい値θを用いた出力キャリブレーションは、リCALLおよび全体的な効果にどのように寄与するか?
- RQ4RQ4: 複数のLLMとニューラルベースラインをアンサンブル化することで、個々のモデルと比較して性能にどのような影響を与えるか?
主な発見
- LlaMa2-7b-insが、より大きなLlaMa2-13b-insを上回る性能を示し、モデルサイズそのものがこのタスクでより良い性能を保証するわけではないことを示している。
- インstructベースの微調整は、ベースモデルと比較して一貫して性能を向上させ、効果的なゼロショット応用においてその重要性を裏付けている。
- しきい値θによるキャリブレーションは、リCALLと精度を顕著に向上させ、ターゲットリCALLレベルの信頼性ある達成を可能にした。
- LlaMa2-7b-ins、LlaMa2-13b-ins、およびBioBERTのキャリブレーション済みアンサンブルは、個々のモデル(包括的微調整済みのBio-SIEVEを含む)を上回るWSS、精度、F3を達成した。
- 同じキャリブレーション条件のもとで、アンサンブル手法は、同じデータセットで微調整済みのBio-SIEVEをB-ACおよびWSSの両面で上回った。
- キャリブレーション済みゼロショットアプローチは、多様なトピックにわたり高いリCALLを達成したため、実世界のシステマティックレビューワークフローにおける実用的妥当性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。