[논문 리뷰] Assessing the Usability of GutGPT: A Simulation Study of an AI Clinical Decision Support System for Gastrointestinal Bleeding Risk
이 연구는 내시경의학자와 학생들을 대상으로 한 시뮬레이션 기반 시험을 통해 LLM 기반 임상의사 지원 시스템인 GutGPT의 위장관 출혈 위험 평가 능력을 평가한다. GutGPT는 내용 숙지도와 사용 편의성 향상에 기여하는 것으로 나타났지만, 신뢰도 및 수용도에 대한 영향은 혼합된 것으로 나타나, 임상 현장에서 인간-AI 상호작용을 최적화할 필요성이 있음을 시사한다.
Applications of large language models (LLMs) like ChatGPT have potential to enhance clinical decision support through conversational interfaces. However, challenges of human-algorithmic interaction and clinician trust are poorly understood. GutGPT, a LLM for gastrointestinal (GI) bleeding risk prediction and management guidance, was deployed in clinical simulation scenarios alongside the electronic health record (EHR) with emergency medicine physicians, internal medicine physicians, and medical students to evaluate its effect on physician acceptance and trust in AI clinical decision support systems (AI-CDSS). GutGPT provides risk predictions from a validated machine learning model and evidence-based answers by querying extracted clinical guidelines. Participants were randomized to GutGPT and an interactive dashboard, or the interactive dashboard and a search engine. Surveys and educational assessments taken before and after measured technology acceptance and content mastery. Preliminary results showed mixed effects on acceptance after using GutGPT compared to the dashboard or search engine but appeared to improve content mastery based on simulation performance. Overall, this study demonstrates LLMs like GutGPT could enhance effective AI-CDSS if implemented optimally and paired with interactive interfaces.
연구 동기 및 목표
- LLM 기반 임상의사 지원 시스템(GutGPT)의 임상의사 신뢰도, 수용도 및 사용성 평가
- 기존 인터랙티브 대시보드 및 인터넷 검색과 비교하여 GutGPT가 임상의사 결정 및 지식 습득에 미치는 영향 평가
- 대화형 AI 인터페이스가 시뮬레이션된 임상 상황에서 임상의사의 인식, 노력 예상도, AI-CDSS 사용 의지에 미치는 영향 조사
- GutGPT의 교육적 가치 평가: 상부 위장관 출혈 관리 지침에 대한 숙지도 향상 여부 분석
제안 방법
- 응급의학, 내과의학 전문의 및 의학생 총 55명을 대상으로 시뮬레이션 기반 연구 수행
- 참가자를 세 그룹으로 무작위 배정: EHR 대시보드와 함께 GutGPT 사용, 단일 인터랙티브 대시보드 사용, EHR 대시보드와 함께 인터넷 검색 사용
- UTAUT 모델 기반 사전 및 사후 설문지를 활용해 신뢰도, 수용도, 노력 예상도, 사용 의지 측정
- 화면 및 영상 녹화 기록과 함께 정성적 피드백을 수집·분석하여 인터페이스 사용성 평가
- 위장관 출혈 위험 예측을 위한 검증된 기계학습 모델과 임상 지침 기반 관리 권고를 GutGPT에 통합
- 교육 평가를 사전 및 사후에 실시해 학습 결과 측정을 통해 내용 숙지도 측정

실험 결과
연구 질문
- RQ1GutGPT 노출이 기존 대시보드나 검색 엔진 대비 AI 기반 임상의사 지원 시스템에 대한 임상의사의 신뢰도에 어떤 영향을 미치는가?
- RQ2기타 정보 소스와 비교했을 때 GutGPT가 상부 위장관 출혈 관리에 대한 내용 숙지도 향상에 얼마나 기여하는가?
- RQ3시뮬레이션된 임상 환경에서 임상의사의 인식된 사용 편의성(노력 예상도) 및 AI-CDSS 사용 의지에 GutGPT가 미치는 영향은 어떠한가?
- RQ4임상의사들은 LLM 기반 시스템이 의사결정 과정에서 사회적, 정서적, 신체적 요소를 반영하지 못하는 한계를 어떻게 인식하는가?
- RQ5실제 적용 이전에 LLM 기반 CDSS의 사용성 및 교육적 영향을 효과적으로 평가하기 위해 시뮬레이션 연구가 유용한가?
주요 결과
- GutGPT를 사용한 참가자들은 기존 대시보드나 검색 그룹 대비 사용 편의성에 대한 노력 예상도가 뚜렷이 향상된 것으로 평가되었다.
- GutGPT 그룹과 대시보드 그룹 모두 교육 평가에서 사후에 더 높은 정답률을 기록하여 내용 숙지도 향상이 확인되었다.
- 시뮬레이션 후 양 그룹 모두 AI-CDSS에 대한 신뢰도가 증가했지만, GutGPT 그룹에서의 효과가 유의미하게 높지는 않았다.
- 설문지 도구는 대부분의 UTAUT 지표에서 높은 내적 신뢰도를 보였으며, Cronbach’s alpha 값이 0.8를 초과하였다.
- 두 그룹의 임상의사 모두 AI 시스템이 임상의사 결정 과정에서 사회적, 정서적, 신체적 요소를 반영하지 못한다는 점을 우려로 제기하였다.
- 연구는 현재 진행 중이며, 현재까지 총 55명의 참가자가 참여했으며, 표본 수가 작고 모집이 완료되지 않아 공식적인 통계 검정은 수행되지 않았다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.