Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Large Language Models in Ophthalmology

Jason Holmes, Shuyuan Ye|arXiv (Cornell University)|Nov 7, 2023
Artificial Intelligence in Healthcare and Education被引用数 6
ひとこと要約

本研究では、100問の多肢選択式テストを大規模言語モデルと3つの人間の専門職グループ(学部生、修士課程学生、専門医)に実施することで、眼科分野におけるGPT-3.5、GPT-4、PaLM2の性能を評価した。GPT-4は全人間グループを上回り、専門医と同等の性能を示したが、より高い安定性と自信を示した。これは、LLMが医学教育および臨床意思決定支援分野において強力な潜在能力を有することを示している。

ABSTRACT

Purpose: The performance of three different large language models (LLMS) (GPT-3.5, GPT-4, and PaLM2) in answering ophthalmology professional questions was evaluated and compared with that of three different professional populations (medical undergraduates, medical masters, and attending physicians). Methods: A 100-item ophthalmology single-choice test was administered to three different LLMs (GPT-3.5, GPT-4, and PaLM2) and three different professional levels (medical undergraduates, medical masters, and attending physicians), respectively. The performance of LLM was comprehensively evaluated and compared with the human group in terms of average score, stability, and confidence. Results: Each LLM outperformed undergraduates in general, with GPT-3.5 and PaLM2 being slightly below the master's level, while GPT-4 showed a level comparable to that of attending physicians. In addition, GPT-4 showed significantly higher answer stability and confidence than GPT-3.5 and PaLM2. Conclusion: Our study shows that LLM represented by GPT-4 performs better in the field of ophthalmology. With further improvements, LLM will bring unexpected benefits in medical education and clinical decision making in the near future.

研究の動機と目的

  • 大規模言語モデル(LLM)の眼科分野における人間の医療専門職との相対的性能を評価すること。
  • GPT-3.5、GPT-4、PaLM2の標準化された眼科分野の問題に対して、正確性、安定性、自信の比較を行うこと。
  • LLMが医学部学生および専門医の診断的推論を模倣または上回ることができるかを評価すること。
  • LLMが医学教育および臨床意思決定支援アプリケーションにおける潜在的応用を検討すること。

提案手法

  • 臨床知識を含む眼科分野の主要分野をカバーする100問の多肢選択式眼科テストを構築した。
  • テストは、プロンプトベースの推論を用いて、3つのLLM(GPT-3.5、GPT-4、PaLM2)に実施した。
  • 3つの人間グループ(学部生、修士課程学生、専門医)が、制御された条件下で同じテストを受験した。
  • 性能は平均得点、回答の安定性(繰り返し試行における一貫性)、自己評価スコアで測定した。
  • LLMと人間グループとの相対的性能を比較する統計的分析を実施した。
  • 各LLMの予測に対する自信スコアを収集し、キャリブレーションおよび自己評価の信頼性を評価した。

実験結果

リサーチクエスチョン

  • RQ1GPT-3.5、GPT-4、PaLM2は、人間の専門職と比較して、標準化された眼科知識テストでどの程度の成績を示すか?
  • RQ2GPT-4は、眼科分野において専門医と同等のパフォーマンスを示すか?
  • RQ3LLMは、回答の安定性および自己評価の観点から、人間グループと比較してどの程度の差があるか?
  • RQ4LLMは、異なる訓練レベルの医学部学生よりも高い正確性と一貫性を達成できるか?

主な発見

  • GPT-4は専門医と同等の平均得点を達成し、学部生および修士課程学生を上回った。
  • GPT-3.5およびPaLM2は、修士課程学生の水準をわずかに下回っており、中程度の性能を示したが、優れた性能とは言えなかった。
  • GPT-4は、GPT-3.5およびPaLM2よりも顕著に高い回答の安定性を示し、より一貫した推論が可能であることを示した。
  • GPT-4は、GPT-3.5およびPaLM2よりも高い自己評価スコアを示し、実際のパフォーマンスとのキャリブレーションが良好であった。
  • すべてのLLMが、全体的な正確性において医学部生を上回った。これは、基礎医学教育分野におけるLLMの潜在的価値を示している。
  • 結果から、GPT-4は、眼科分野の知識において経験を積んだ臨床医と同等の水準に達しており、信頼性と自信の指標においても優れた性能を示していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。