Skip to main content
QUICK REVIEW

[논문 리뷰] Putting ChatGPT's Medical Advice to the (Turing) Test

Oded Nov, Nina Singh|arXiv (Cornell University)|2023. 01. 24.
Digital Mental Health Interventions인용 수 4
한 줄 요약

이 연구는 ChatGPT가 환자 소통에서 인간 의료 제공자처럼 자연스럽게 행동할 수 있는지 평가하기 위해, 일반인이 AI가 생성한 응답과 실제 의료진의 응답을 구별할 수 있는지 테스트한다. 참가자들은 평균 65.5%의 정확도로 응답 출처를 올바르게 식별했으며, 이는 ChatGPT의 의료 조언이 인간 응답과 약간 구별되지만 비교적 유사하다는 것을 시사한다. 이는 저도의 복잡도를 가진 건강 관련 질의에 대해 챗봇에 대해 중간 정도의 신뢰를 가진다는 것을 의미한다.

ABSTRACT

Objective: Assess the feasibility of using ChatGPT or a similar AI-based chatbot for patient-provider communication. Participants: A US representative sample of 430 study participants aged 18 and above. 53.2% of respondents analyzed were women; their average age was 47.1. Exposure: Ten representative non-administrative patient-provider interactions were extracted from the EHR. Patients' questions were placed in ChatGPT with a request for the chatbot to respond using approximately the same word count as the human provider's response. In the survey, each patient's question was followed by a provider- or ChatGPT-generated response. Participants were informed that five responses were provider-generated and five were chatbot-generated. Participants were asked, and incentivized financially, to correctly identify the response source. Participants were also asked about their trust in chatbots' functions in patient-provider communication, using a Likert scale of 1-5. Results: The correct classification of responses ranged between 49.0% to 85.7% for different questions. On average, chatbot responses were correctly identified 65.5% of the time, and provider responses were correctly distinguished 65.1% of the time. On average, responses toward patients' trust in chatbots' functions were weakly positive (mean Likert score: 3.4), with lower trust as the health-related complexity of the task in questions increased. Conclusions: ChatGPT responses to patient questions were weakly distinguishable from provider responses. Laypeople appear to trust the use of chatbots to answer lower risk health questions.

연구 동기 및 목표

  • ChatGPT와 같은 AI 챗봇이 환자-의료진 소통에 활용 가능한지의 타당성을 평가하기 위해.
  • 일반인이 ChatGPT가 생성한 응답과 인간이 생성한 의료 응답을 구별할 수 있는지 평가하기 위해.
  • 환자가 건강 관련 질의를 처리하는 데 있어 챗봇에 대한 신뢰도를 검토하기 위해.
  • 건강 관련 복잡도가 AI 의료 조언의 신뢰성 인식에 어떻게 영향을 미치는지 탐색하기 위해.

제안 방법

  • 비관리적 임상 상호작용을 반영하기 위해 전자건강기록(EHR)에서 10개의 실제 환자 질문을 추출하였다.
  • ChatGPT는 원래 의료진 응답과 유사한 단어 수를 갖도록 프롬프트가 주어졌다.
  • 참가자들은 5개의 의료진 응답과 5개의 ChatGPT 응답을 짝지어 보여주었으며, 응답 출처를 식별하도록 요청받았다.
  • 각 응답 출처를 정확히 분류하는 데에 참가자들이 재정적 인centive를 받았다.
  • 의료소통에서 챗봇의 기능에 대한 신뢰도를 측정하기 위해 5점 리커트 척도를 사용하였다.
  • 미국 대표 표본으로 18세 이상의 성인 430명을 대상으로 설문조사를 실시하였으며, 여성 비율은 53.2%이며 평균 연령은 47.1세였다.

실험 결과

연구 질문

  • RQ1일반인이 환자-의료진 상호작용에서 ChatGPT가 생성한 응답과 인간이 생성한 의료 응답을 신뢰성 있게 구별할 수 있는가?
  • RQ2건강 관련 작업의 복잡도에 따라 사용자들이 챗봇에 대한 신뢰도가 어떻게 달라지는가?
  • RQ3AI와 인간 응답 간의 인식된 유사성이 환자가 의료소통에서 AI에 대한 자신감에 얼마나 영향을 미치는가?
  • RQ4임상 복잡도 수준에 따라 응답 분류 정확도에 차이가 있는가?

주요 결과

  • ChatGPT 응답은 전체의 65.5%에서 AI로 생성된 것으로 정확히 식별되었으며, 이는 인간 응답과 약간 구별되지만 비교적 유사하다는 것을 의미한다.
  • 의료진 응답은 평균 65.1%의 정확도로 올바르게 분류되었으며, 이는 AI 응답과 유사한 인지적 유사성을 보여준다.
  • 참가자들은 평균적으로 챗봇의 의료 기능에 대해 5점 척도에서 3.4점(약간 긍정적이나 신중한 태도)을 평가하여, 약간 긍정적이지만 경계하는 신뢰도를 보였다.
  • 질의의 건강 관련 복잡도가 증가함에 따라 챗봇에 대한 신뢰도가 유의미하게 감소했다.
  • 분류 정확도는 질문에 따라 다양하게 변동하여 49.0%에서 85.7%까지 변동하였으며, 이는 검출 가능성의 맥락 의존성을 시사한다.
  • 결과적으로 저위험, 저복잡도의 건강 관련 질의에 대해서는 사용자들이 챗봇 응답을 신뢰성 있고 신뢰할 수 있다고 받아들이는 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.