[論文レビュー] Putting ChatGPT's Medical Advice to the (Turing) Test
本研究では、ChatGPTが患者との対話において医療提供者をいかに的確に模倣できるかを評価する。具体的には、一般の人々がAIが生成した応答と実際の医師の応答を区別できるかをテストした。参加者は平均して65.5%の正確さで応答の出どころを特定できた。これは、ChatGPTの医療的助言が人間の応答と弱く区別できる状態にあることを示しており、低複雑性の健康関連質問に対してはチャットボットに対する中程度の信頼が存在する。
Objective: Assess the feasibility of using ChatGPT or a similar AI-based chatbot for patient-provider communication. Participants: A US representative sample of 430 study participants aged 18 and above. 53.2% of respondents analyzed were women; their average age was 47.1. Exposure: Ten representative non-administrative patient-provider interactions were extracted from the EHR. Patients' questions were placed in ChatGPT with a request for the chatbot to respond using approximately the same word count as the human provider's response. In the survey, each patient's question was followed by a provider- or ChatGPT-generated response. Participants were informed that five responses were provider-generated and five were chatbot-generated. Participants were asked, and incentivized financially, to correctly identify the response source. Participants were also asked about their trust in chatbots' functions in patient-provider communication, using a Likert scale of 1-5. Results: The correct classification of responses ranged between 49.0% to 85.7% for different questions. On average, chatbot responses were correctly identified 65.5% of the time, and provider responses were correctly distinguished 65.1% of the time. On average, responses toward patients' trust in chatbots' functions were weakly positive (mean Likert score: 3.4), with lower trust as the health-related complexity of the task in questions increased. Conclusions: ChatGPT responses to patient questions were weakly distinguishable from provider responses. Laypeople appear to trust the use of chatbots to answer lower risk health questions.
研究の動機と目的
- ChatGPTのようなAIチャットボットを患者-医療提供者間の対話に使用する可能性を評価すること。
- 一般の人々がChatGPTが生成した応答と人間が生成した医療的応答を区別できるかどうかを評価すること。
- チャットボットが健康関連の質問に答える際にユーザーが示す信頼の度合いを調査すること。
- 健康関連の複雑さがAI医療助言の信頼性に与える影響を検討すること。
提案手法
- 電子的健康記録(EHR)から非管理的臨床対話に該当する10件の実際の患者質問を抽出した。
- ChatGPTに、元の医師の応答とほぼ同じ語数になるように応答を生成するようプロンプトを提示した。
- 参加者には、5件の医師の応答と5件のChatGPTの応答をペアで提示し、出どころを特定するよう依頼した。
- 各応答の出どころを正しく分類した参加者に対して、報酬が支払われた。
- チャットボットの機能に対する信頼度を測定するために、5段階リッカート尺度が用いられた。
- 米国代表的な430名の18歳以上の成人が調査に参加し、女性は53.2%、平均年齢は47.1歳であった。
実験結果
リサーチクエスチョン
- RQ1一般の人々は、患者-医療提供者対話におけるChatGPTが生成した応答と人間が生成した医療的応答を信頼性を持って区別できるか?
- RQ2健康関連のタスクの複雑さに応じて、ユーザーのチャットボットに対する信頼度はどのように変化するか?
- RQ3AIと人間の忾答の類似度が、ユーザーが医療コミュニケーションにおけるAIの信頼性に与える影響はどの程度か?
- RQ4臨床的複雑さの異なるレベルにおいて、応答の分類正確さに差異が生じるか?
主な発見
- ChatGPTの応答は、全体で65.5%の割合でAI生成であると正しく識別された。これは、AIの応答が人間の応答と弱く区別できる状態にあることを示している。
- 医師の応答も、平均して65.1%の正確さで正しく分類された。これは、AIの応答と人間の応答が類似した外見を持つことを示している。
- 参加者の平均信頼度は5段階リッカート尺度で3.4であった。これは、弱く肯定的ではあるが慎重な信頼を示している。
- 健康関連の質問の複雑さが増すにつれて、チャットボットに対する信頼度は有意に低下した。
- 分類正確さは質問ごとに大きく変動し、49.0%から85.7%の範囲にまで達した。これは、文脈依存的な検出可能性を示している。
- 結果から、低リスク・低複雑性の健康関連質問に関しては、ユーザーがチャットボットの応答を信頼できると受け入れる可能性がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。