Skip to main content
QUICK REVIEW

[論文レビュー] Automated Paper Screening for Clinical Reviews Using Large Language Models

Eddie Guo, Mehul Gupta|arXiv (Cornell University)|May 1, 2023
Artificial Intelligence in Healthcare and Education被引用数 6
ひとこと要約

本研究では、臨床システマティックレビューにおけるタイトルおよびアブストラクトスクリーニングの自動化を目的として、OpenAI GPT APIを用いた新規ワークフローを提案する。自然言語プロンプトを適用して関連性を分類することで、モデルは不適切な論文を除外する際、91%の正確性と91%の特異性を達成した。これは、人的作業負荷を大幅に削減しつつも高い一貫性を維持する強力な潜在的効果を示しているが、関連する論文を含める感度は76%にとどまり、中程度の水準であった。

ABSTRACT

Objective: To assess the performance of the OpenAI GPT API in accurately and efficiently identifying relevant titles and abstracts from real-world clinical review datasets and compare its performance against ground truth labelling by two independent human reviewers. Methods: We introduce a novel workflow using the OpenAI GPT API for screening titles and abstracts in clinical reviews. A Python script was created to make calls to the GPT API with the screening criteria in natural language and a corpus of title and abstract datasets that have been filtered by a minimum of two human reviewers. We compared the performance of our model against human-reviewed papers across six review papers, screening over 24,000 titles and abstracts. Results: Our results show an accuracy of 0.91, a sensitivity of excluded papers of 0.91, and a sensitivity of included papers of 0.76. On a randomly selected subset of papers, the GPT API demonstrated the ability to provide reasoning for its decisions and corrected its initial decision upon being asked to explain its reasoning for a subset of incorrect classifications. Conclusion: The GPT API has the potential to streamline the clinical review process, save valuable time and effort for researchers, and contribute to the overall quality of clinical reviews. By prioritizing the workflow and acting as an aid rather than a replacement for researchers and reviewers, the GPT API can enhance efficiency and lead to more accurate and reliable conclusions in medical research.

研究の動機と目的

  • 臨床システマティックレビューにおける関連するタイトルおよびアブストラクトを特定するためのOpenAI GPT APIのパフォーマンスを評価すること。
  • 2名の独立した人間レビュアーが作成した基準ラベルと比較して、GPT APIのスクリーニング正確性を評価すること。
  • モデルがその意思決定の根拠を提示でき、自己の判断を吟味し修正できる能力を評価すること。
  • 大規模言語モデルをシステマティックレビューのプロセスを簡素化するための最初のスクリーニングツールとして使用可能かどうかを検討すること。
  • GPT APIが人的作業負荷を削減しつつも、臨床レビューの包括性および品質を保持できるかどうかを特定すること。

提案手法

  • 自然言語プロンプトを用いて、含む・除外する基準を記述し、OpenAI GPT APIと連携するカスタムPythonスクリプトを開発した。
  • モデルは、6つの実世界の臨床レビュー・データセットから得た24,000件以上のタイトルおよびアブストラクトのコロナを処理した。これらの論文は、少なくとも2名の人的レビュアーによる事前スクリーニングを経ていた。
  • スクリーニング意思決定は、2名の独立した人間レビュアーが作成した基準データセットと照合され、正確性、感度、特異性を測定した。
  • GPT APIは、誤分類された特定の事例について、その意思決定の根拠を説明するようプロンプトされ、その判断の是正能力が評価された。
  • パフォーマンス指標には、正確性、含める論文の感度、除外する論文の特異性が含まれ、すべてのスクリーニング意思決定に対して計算された。
  • このワークフローは、人間レビュアーの代替ではなく、意思決定支援として設計されており、効率性と一貫性を最優先にした。

実験結果

リサーチクエスチョン

  • RQ1自然言語プロンプトのみを用いて、GPT APIは臨床システマティックレビューにおける関連・非関連のタイトルおよびアブストラクトを正確に分類できるか?
  • RQ2GPT APIのパフォーマンスは、正確性、感度、特異性の観点から人間レビュアーと比較してどうなるか?
  • RQ3GPT APIはそのスクリーニング意思決定に対して説明可能な根拠を提示でき、その根拠によって初期の誤分類を是正できるか?
  • RQ4GPT APIは、関連論文の含む率に影響を与えることなく、システマティックレビューにおける人的スクリーニング負荷をどの程度軽減できるか?
  • RQ5特に含める論文の感度という観点から、GPT APIが関連論文を特定する際に抱える制限は何か?

主な発見

  • GPT APIは、タイトルおよびアブストラクトの関連・非関連分類において、全体として0.91の正確性を達成した。
  • モデルは、非関連論文を正しく除外するという点で0.91の特異性を示し、非関連研究を効果的にフィルタリングする強力な性能を示した。
  • 関連論文を含める感度は0.76であったため、重要な研究を見逃すリスクが中程度に存在するとされた。
  • 誤分類された論文のサブセットにおいて、GPT APIはその意思決定の根拠を説明するようプロンプトされた際に、初期の判断を是正することができた。これは、自己反省能力を有していることを示唆した。
  • モデルが提供する根拠の説明は、意思決定プロセスの理解を深め、スクリーニングワークフローにおける透明性と監査可能性を高める支援となった。
  • GPT APIは人的スクリーニングの作業負荷を顕著に削減しつつも、高い一貫性を維持できるため、システマティックレビューにおける価値ある最初のスクリーニングツールとして位置づけられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。