Skip to main content
QUICK REVIEW

[論文レビュー] Medical Misinformation in AI-Assisted Self-Diagnosis: Development of a Method (EvalPrompt) for Analyzing Large Language Models

Zada, Troy, Tam, Natalie|arXiv (Cornell University)|Jul 10, 2023
Misinformation and Its ImpactsSocial Sciences被引用数 3
ひとこと要約

この論文は、正解選択肢のない開かれた形の医療質問をテストすることで、ChatGPTのような大規模言語モデル(LLM)の現実的自己診断シナリオにおける評価を可能にする新手法EvalPromptを紹介する。LLMは従来の想定よりも著しく性能が低いことが判明し、誤った助言に対して過信を示し、免責条項を記載しないか、不確実性を示さない。これは、実世界での医療誤情報拡散リスクを高める。

ABSTRACT

Rapid integration of large language models (LLMs) in health care is sparking global discussion about their potential to revolutionize health care quality and accessibility. At a time when improving health care quality and access remains a critical concern for countries worldwide, the ability of these models to pass medical examinations is often cited as a reason to use them for medical training and diagnosis. However, the impact of their inevitable use as a self-diagnostic tool and their role in spreading healthcare misinformation has not been evaluated. This study aims to assess the effectiveness of LLMs, particularly ChatGPT, from the perspective of an individual self-diagnosing to better understand the clarity, correctness, and robustness of the models. We propose the comprehensive testing methodology evaluation of LLM prompts (EvalPrompt). This evaluation methodology uses multiple-choice medical licensing examination questions to evaluate LLM responses. We use open-ended questions to mimic real-world self-diagnosis use cases, and perform sentence dropout to mimic realistic self-diagnosis with missing information. Human evaluators then assess the responses returned by ChatGPT for both experiments for clarity, correctness, and robustness. The results highlight the modest capabilities of LLMs, as their responses are often unclear and inaccurate. As a result, medical advice by LLMs should be cautiously approached. However, evidence suggests that LLMs are steadily improving and could potentially play a role in healthcare systems in the future. To address the issue of medical misinformation, there is a pressing need for the development of a comprehensive self-diagnosis dataset. This dataset could enhance the reliability of LLMs in medical applications by featuring more realistic prompt styles with minimal information across a broader range of medical fields.

研究の動機と目的

  • 複数選択問題の試験ベンチマークにとどまらず、実世界におけるChatGPTのようなLLMの自己診断における実態性能を検証すること。
  • 非専門家が開かれた症状クエリに対してLLMを利用した場合、医療誤情報がどのように拡散されるかを調査すること。
  • 単純な正誤判定を超えた、応答品質の微細な側面を捉える、繰り返し可能で人間の評価者を活用する評価フレームワークを構築すること。
  • 特に高リスクの医療文脈において、LLMが不確実性を認識したり、自身の応答を検証できるかどうかを検討すること。
  • 試験成績ではなく実世界での使いやすさを重視する、医療分野へのLLM応用を評価するための方法論的ブループrintを提供すること。

提案手法

  • 単一正解のUSMLE Step 1問題のサブセットを、実際のユーザーによる自己診断を模倣する開かれた形のプロンプトに変換する。
  • 非専門家の人間の評価者を用いて、応答を細かくスケーリングして評価:正解、部分的に正解、誤り、曖昧。
  • 文のドロップアウト(アブレーション)を用いた感度分析により、LLMの応答が情報欠落に対してどれほど頑健であるかをテストする。
  • ChatGPTに自身の回答を自己評価させることで、誤りや不確実性を検出できる能力を評価する。
  • 集約された人間の評価を用いて、LLM出力における性能低下や行動的異常を定量化する。
  • 開かれた形の医療推論タスクにおけるLLMの評価に適した、繰り返し可能でコーダー信頼性を考慮した方法論を確立する。

実験結果

リサーチクエスチョン

  • RQ1正解選択肢が提供されない状況で、ChatGPTのようなLLMの自己診断タスクにおける性能は、複数選択問題の設定と比べてどのように変化するか?
  • RQ2誤った応答であっても、LLMが免責条項を記載したり不確実性を示したりする割合はどの程度低いのか?
  • RQ3重要な臨床的詳細の欠落(ドロップアウト)が、LLMが生成する医療助言の「正しく見える」度にどのような影響を与えるか?
  • RQ4LLMは、誤った応答や過信の強い応答を識別できる正確な自己評価が可能か?
  • RQ5医療推論タスクにおいて、過信や不必要な慎重さといった行動的パターンは、どのように顕在化するか?

主な発見

  • 正解選択肢が提供されない状況ではLLMの性能が著しく低下しており、複数選択問題のベンチマークが実世界の診断能力を誇張していることが示唆される。
  • ChatGPTは、誤ったまたは危険な医療行動を推奨している場合でも、しばしば免責条項を記載せず、不確実性を示さない。
  • 誤った助言に対して過信を示す傾向があるため、自己診断の文脈で医療誤情報が拡散されるリスクが高まる。
  • 医療的に正しい回答であっても、追加の不要なが臨床的に適切な助言を含むと、ChatGPTはしばしば「部分的に正解」と分類する。これは臨床的直感の欠如を示している。
  • 自己評価を依頼された際、ChatGPTは自身の誤りに対する認識が著しく低いことが判明し、信頼できる事実確認ツールとしての役割を果たせないことが示された。
  • たとえわずかな情報欠落(例:1文の臨床的文の削除)であっても、応答の「正しく見える」度に顕著な影響を与えることが判明し、現実世界のデータ変動に対する推論の脆さが浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。