Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Ability of ChatGPT to Screen Articles for Systematic Reviews

Eugene Syriani, István Dávid|arXiv (Cornell University)|Jul 12, 2023
Scientific Computing and Data Management被引用数 17
ひとこと要約

本論文は、系統的レビューにおける記事のスクリーニングにおける ChatGPT の一貫性、分類性能、一般化能力を評価し、従来の分類器と比較し、統合に関する検討事項について論じる。

ABSTRACT

By organizing knowledge within a research field, Systematic Reviews (SR) provide valuable leads to steer research. Evidence suggests that SRs have become first-class artifacts in software engineering. However, the tedious manual effort associated with the screening phase of SRs renders these studies a costly and error-prone endeavor. While screening has traditionally been considered not amenable to automation, the advent of generative AI-driven chatbots, backed with large language models is set to disrupt the field. In this report, we propose an approach to leverage these novel technological developments for automating the screening of SRs. We assess the consistency, classification performance, and generalizability of ChatGPT in screening articles for SRs and compare these figures with those of traditional classifiers used in SR automation. Our results indicate that ChatGPT is a viable option to automate the SR processes, but requires careful considerations from developers when integrating ChatGPT into their SR tools.

研究の動機と目的

  • ソフトウェア工学における系統的レビューのスクリーニング段階を自動化する必要性を動機づける。
  • スクリーニングタスクにおける ChatGPT の一貫性、性能、および一般化能力を評価する。
  • SR 自動化に用いられる従来の機械学習ベースラインと ChatGPT を比較する。
  • 実証的な知見に基づいて ChatGPT を SR ツールへ統合する指針を提供する。

提案手法

  • ReLiS に基づく SR コーパスをスクリーニング決定の地真実として用いる。
  • 記事タイトル/要約に Word2Vec 特徴を用いて訓練した従来の分類器(LR、RF、CNB、SVC)でベースラインを確立する。
  • ChatGPT のプロンプトを設計し、地真実に対するスクリーニング判断を評価する。
  • 不均衡データの性能指標(例:MCC、F2、バランス精度)を用いて ChatGPT の結果をベースラインと比較する。
  • 複数回にわたる実行で Fleiss’ Kappa による一貫性を評価し、ChatGPT の判断の安定性を測定する。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 特定の記事に対する ChatGPT のスクリーニング判断は、複数回の実行でどれだけ一貫していますか?
  • RQ2RQ2: ChatGPT の分類性能は、従来の SR 自動化分類器と比較してどうですか?
  • RQ3RQ3: ChatGPT のスクリーニング判断は、異なるソフトウェア工学の SR データセット間でどれだけ一般化可能ですか?

主な発見

  • ChatGPT は、追加トレーニングなしで SR スクリーニングにおいて従来の機械学習手法と同等の性能を発揮できる。
  • LLMs like ChatGPT は SR 自動化を革新する可能性を示しているが、ツール開発者には慎重な統合上の考慮が必要である。
  • 多様な SR データセットを用いて一般化可能性を検証し、堅牢なプロンプト設計の必要性を浮き彫りにした。
  • 本研究は ReLiS プロジェクトの地真実データを使用し、包含/除外判断の信頼できる評価を保証する。
  • プロンプトとハイパーパラメータ(temperature、トークン制限)は、一貫した最小限の返答結果(Include/Exclude)を得る上で重要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。