Skip to main content
QUICK REVIEW

[論文レビュー] GPT-4 to GPT-3.5: 'Hold My Scalpel' -- A Look at the Competency of OpenAI's GPT on the Plastic Surgery In-Service Training Exam

Jonathan D. Freedman, Ian A. Nappier|arXiv (Cornell University)|Apr 4, 2023
Artificial Intelligence in Healthcare and Education被引用数 7
ひとこと要約

本研究では、高水準の臨床ベンチマークである Plastic Surgery In-Service Training Exam (PSITE) において、GPT-4 と GPT-3.5 の性能を評価した。本物の選択肢式問題と現実世界の臨床的状況を提示した問題を用い、著者らは GPT-4 が 2022 年度および 2021 年度の試験でそれぞれ 88 と 99 パーセンタイルに達したのに対し、GPT-3.5 は 8 と 3 パーセンタイルにとどまり、医療的推論能力に顕著な飛躍が見られたことを示した。

ABSTRACT

The Plastic Surgery In-Service Training Exam (PSITE) is an important indicator of resident proficiency and serves as a useful benchmark for evaluating OpenAI's GPT. Unlike many of the simulated tests or practice questions shown in the GPT-4 Technical Paper, the multiple-choice questions evaluated here are authentic PSITE questions. These questions offer realistic clinical vignettes that a plastic surgeon commonly encounters in practice and scores highly correlate with passing the written boards required to become a Board Certified Plastic Surgeon. Our evaluation shows dramatic improvement of GPT-4 (without vision) over GPT-3.5 with both the 2022 and 2021 exams respectively increasing the score from 8th to 88th percentile and 3rd to 99th percentile. The final results of the 2023 PSITE are set to be released on April 11, 2023, and this is an exciting moment to continue our research with a fresh exam. Our evaluation pipeline is ready for the moment that the exam is released so long as we have access via OpenAI to the GPT-4 API. With multimodal input, we may achieve superhuman performance on the 2023.

研究の動機と目的

  • GPT-4 と GPT-3.5 が本物の臨床的状況を反映した高水準の医学的試験で示す臨床的推論能力を評価すること。
  • GPT モデルが形成外科学の In-Service Training Exam (PSITE) において、人間のレジidency と同等の成績を達成できるかどうかを評価すること。
  • ボード資格取得の成績と相関する、本物の臨床的関連性を持つ選択肢式問題を用いたベンチマークを提供すること。
  • GPT-4 と GPT-3.5 の間の性能格差が、複雑で分野特化型の医学的試験においてどのように現れるかを調査すること。
  • 2023 年度 PSITE 試験が公開された段階ですぐに GPT-4 の評価を実施できるよう準備すること。

提案手法

  • 本研究では、2022 年度および 2021 年度の PSITE 選択肢式問題を評価データセットとして使用した。
  • GPT-4 と GPT-3.5 は、各問題に対してプロンプトを与えられ、提示された選択肢の中から最も適切な答えを選択するよう求められた。
  • 性能は、同じ試験で実施された人間のレジidency の成績と比較してのパーセンタイル順位によって測定された。
  • 評価パイプラインは、2023 年度 PSITE 試験が公開された段階ですぐに使用可能となるように設計された。
  • 本評価ではマルチモーダル入力を使用していないが、著者らは視覚機能の統合により将来的に超人的な性能を達成できる可能性を指摘している。
  • モデルの成績は、歴史的なレジidency の成績パーセンタイルと比較して、モデルの成績を文脈づけて評価した。

実験結果

リサーチクエスチョン

  • RQ1GPT-4 は、人間の形成外科学レジidency と同等またはそれ以上の成績を PSITE で達成できるか?
  • RQ2GPT-4 の成績は、同じ臨床的推論試験において GPT-3.5 と比べてどの程度優れているか?
  • RQ3GPT モデルは、複雑な臨床的状況を含む本物の高水準医学的試験問題にどの程度一般化できるか?
  • RQ4GPT-4 と GPT-3.5 の間の成績格差は、単なる統計的ノイズではなく、医療的推論能力の本質的な向上を示しているのか?
  • RQ5今後、2023 年度 PSITE 試験に対する GPT-4 の評価が、LLM が外科学専門分野においてどのように進化しているかをさらに解明できるか?

主な発見

  • GPT-4 は 2022 年度 PSITE 試験で 88 パーセンタイルに達し、人間のレジidency と比較して優れた成績を示した。
  • GPT-4 は 2021 年度 PSITE 試験で 99 パーセンタイルに達し、ほぼエキスパートレベルの熟練度を示した。
  • GPT-3.5 は 2022 年度試験でしか 8 パーセンタイルにとどまり、2021 年度試験では 3 パーセンタイルにとどまり、著しく低い成績を示した。
  • GPT-4 と GPT-3.5 の間の成績格差は顕著で、両試験において 80 パーセンタイルポイント以上も差が開いた。
  • これらの結果から、GPT-4 は形成外科学分野の訓練を受けた人間のレジidency の臨床的推論能力に近いか、それ以上に達している可能性がある。
  • 評価パイプラインは、OpenAI API を介して 2023 年度 PSITE 試験が公開された段階ですぐに GPT-4 の評価が可能となるよう準備が整っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。