[論文レビュー] Assessing the Usability of GutGPT: A Simulation Study of an AI Clinical Decision Support System for Gastrointestinal Bleeding Risk
本研究は、消化管出血リスクのためのLLM駆動型臨床意思決定支援システムであるGutGPTを、医師および学生を対象としたシミュレーション試験を通じて評価した。GutGPTは、コンテンツ習得度と使用のしやすさの向上を示したが、信頼性や受容性への影響は混合的であり、臨床現場における最適化された人間-AI連携の必要性を浮き彫りにした。
Applications of large language models (LLMs) like ChatGPT have potential to enhance clinical decision support through conversational interfaces. However, challenges of human-algorithmic interaction and clinician trust are poorly understood. GutGPT, a LLM for gastrointestinal (GI) bleeding risk prediction and management guidance, was deployed in clinical simulation scenarios alongside the electronic health record (EHR) with emergency medicine physicians, internal medicine physicians, and medical students to evaluate its effect on physician acceptance and trust in AI clinical decision support systems (AI-CDSS). GutGPT provides risk predictions from a validated machine learning model and evidence-based answers by querying extracted clinical guidelines. Participants were randomized to GutGPT and an interactive dashboard, or the interactive dashboard and a search engine. Surveys and educational assessments taken before and after measured technology acceptance and content mastery. Preliminary results showed mixed effects on acceptance after using GutGPT compared to the dashboard or search engine but appeared to improve content mastery based on simulation performance. Overall, this study demonstrates LLMs like GutGPT could enhance effective AI-CDSS if implemented optimally and paired with interactive interfaces.
研究の動機と目的
- GutGPT、消化管出血リスクのためのLLMベースの臨床意思決定支援システム(CDSS)の臨床医の信頼性、受容性、使いやすさを評価すること。
- GutGPTの臨床意思決定および知識習得への影響を、従来のインタラクティブダッシュボードおよびインターネット検索と比較すること。
- 会話型AIインターフェースが、シミュレートされた臨床シナリオにおける臨床医の認識、作業効率の期待、AI-CDSSの使用意図に与える影響を調査すること。
- GutGPTの教育的価値が、上行性消化管出血管理ガイドラインの習得度を向上させるかを評価すること。
提案手法
- 救急医学・内科学の医師および医学部学生を対象とした55名の参加者を対象に、シミュレーションベースの研究を実施した。
- 参加者を3つのグループに無作為割り当て:GutGPT+EHRダッシュボード、インタラクティブダッシュボードのみ、インターネット検索+EHRダッシュボード。
- UTAUTモデルに基づく事前および事後のアンケートを用いて、信頼性、受容性、作業効率の期待、使用意図を測定した。
- 画面および動画記録の収集と分析に加え、定性的なデブriefフィードバックを用いて、インターフェースの使いやすさを評価した。
- GutGPTは、消化管出血リスク予測のための妥当性が確認された機械学習モデルと、根拠に基づく臨床ガイドラインに準拠した管理推奨事項と統合された。
- 教育的評価を事前および事後に実施し、学習成果を測定することで、コンテンツ習得度を測定した。

実験結果
リサーチクエスチョン
- RQ1GutGPTに暴露された臨床医は、従来のダッシュボードや検索エンジンと比較して、AIベースの臨床意思決定支援システムに対する信頼性をどのように変化させるか?
- RQ2GutGPTは、代替の情報源と比較して、上行性消化管出血管理におけるコンテンツ習得度をどの程度向上させるか?
- RQ3GutGPTは、シミュレートされた臨床環境における臨床医の使用のしやすさ(作業効率の期待)および使用意図にどのような影響を与えるか?
- RQ4臨床医は、LLMベースのシステムが、意思決定における社会的・感情的・身体的要因といった臨床的ニュアンスをどのように捉えられていないと認識しているか?
- RQ5シミュレーション研究は、実世界への導入前に、LLMベースのCDSSの使いやすさおよび教育的影響を効果的に評価できるか?
主な発見
- GutGPTを使用した参加者では、作業効率の期待が顕著に向上し、ダッシュボードまたは検索グループと比較して、使用のしやすさに対する認識が改善されたことが示された。
- GutGPT群およびダッシュボード群の両方が、教育的評価後の正答率の割合が上昇し、コンテンツ習得度が向上した。
- シミュレーション後、GutGPT群およびダッシュボード群の両方でAI-CDSSへの信頼性が向上したが、GutGPT群での上昇が統計的に顕著に強いとは認められなかった。
- アンケートの内部妥当性は高く、UTAUT指標の多くについてCronbach’s alpha値が0.8を超えていた。
- 両グループの臨床医全員が、AIシステムが臨床意思決定における社会的・感情的・身体的ニュアンスを十分に反映していないと懸念を示した。
- 本研究は継続中であり、現在までに55名の参加者が登録されており、小規模なサンプルサイズおよび未完了の参加者数のため、正式な統計的検定は実施されなかった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。