Skip to main content
QUICK REVIEW

[논문 리뷰] LLM-empowered Chatbots for Psychiatrist and Patient Simulation: Application and Evaluation

Siyuan Chen, Mengyue Wu|arXiv (Cornell University)|2023. 05. 23.
Digital Mental Health Interventions인용 수 38
한 줄 요약

이 논문은 반복적인 프롬프트 설계와 정신과 의사 및 환자로 구성된 인간+자동 평가를 사용하여 ChatGPT 기반 의사와 환자 챗봇의 정신과 진단 대화를 평가한다.

ABSTRACT

Empowering chatbots in the field of mental health is receiving increasing amount of attention, while there still lacks exploration in developing and evaluating chatbots in psychiatric outpatient scenarios. In this work, we focus on exploring the potential of ChatGPT in powering chatbots for psychiatrist and patient simulation. We collaborate with psychiatrists to identify objectives and iteratively develop the dialogue system to closely align with real-world scenarios. In the evaluation experiments, we recruit real psychiatrists and patients to engage in diagnostic conversations with the chatbots, collecting their ratings for assessment. Our findings demonstrate the feasibility of using ChatGPT-powered chatbots in psychiatric scenarios and explore the impact of prompt designs on chatbot behavior and user experience.

연구 동기 및 목표

  • 정신과 외래 진단을 위한 의사 및 환자 챗봇의 과업을 형식화한다.
  • 정신과 전문의와 함께 프롬프트를 공동 설계하여 챗봇의 동작을 실제 진단과 일치시키다.
  • 사용자 연구와 자동 지표를 결합한 인간 중심 평가 프레임워크를 개발하고 적용한다.
  • 프롬프트 설계가 챗봇의 공감, 심도 있는 질문, 사용자 경험에 미치는 영향을 입증한다.

제안 방법

  • 협업하는 정신과 의사들의 지도로 의사 및 환자 챗봇을 설계하는 반복적 프롬프트 설계.
  • 세 단계 개발: 목표 식별(1단계), 프롬프트 설계 및 평가 프레임워크(2단계), 그리고 정신과 의사 및 환자와의 실제 사용자 평가(3단계).
  • 다중 프롬프트 변형(D1–D4 의사용; P1–P2 환자용)을 실증 비교.
  • 인간 평가 지표(의사용 유창성, 공감, 전문성, 참여도; 환자용 유사성/합리성)와 자동 지표(진단 정확도, 증상 회상, 심도 있는 비율, Distinct-1 등)를 결합.
  • 의사 프롬프트에 공감과 심도 있는 질문의 통합; 환자 프롬프트에는 명시적 정직성 및 구어체/생활 맥락 언어를 적용.
Figure 1: The overview of the psychiatrist-guided three-phase study.
Figure 1: The overview of the psychiatrist-guided three-phase study.

실험 결과

연구 질문

  • RQ1ChatGPT-기반 의사 및 환자 챗봇이 실제 정신과 진단 대화를 근접하게 재현할 수 있는가?
  • RQ2다른 프롬프트 설계가 챗봇의 공감, 심도 있는 질문, 사용자 경험에 어떤 영향을 미치는가?
  • RQ3사람 임상의와 같은 행동과 자동 지표 사이의 관계는 무엇인가?
  • RQ4표상된 환자(simulated patients)가 표현된 증상과 상호작용 스타일 측면에서 실제 환자와 어떻게 비교되는가?
  • RQ5정신과 진단 대화의 질을 가장 잘 포착하는 평가 프레임워크는 무엇인가?

주요 결과

  • 공감을 가능하게 하는 의사 프롬프트는 공감 점수를 높이지만 지나치게 반복적인 공감은 사용자 경험에 해를 줄 수 있다.
  • 명시적 증상 측면 프롬프트(D3)가 연구에서 의사 챗봇 중 최고 진단 정확도(55.56%)를 달성했고, 다른 지표는 프롬프트에 따라 차이가 있었다.
  • 프롬프트 변형은 질문의 깊이와 증상 회상에 모두 영향을 주며, D3는 더 깊은 심층적 질문과 더 높은 증상 정밀도를 보였지만 증상 회상은 낮았다.
  • 저항과 구어체를 포함한 환자 프롬프트(P2)가 더 높은 현실성 점수와 정신과 의사의 표현 스타일 향상을 가져왔으나 때로는 언급되지 않은 증상의 비율에 비용이 들었다.
  • 현실 의사들은 챗봇보다 더 균형적이고 포괄적인 증상 커버리지를 보여주었으며, 다중 질환 선별 및 선별 전략의 남아 있는 격차를 강조했다.
  • 자동 지표는 환자 챗봇의 언어 스타일(Distinct-1)과 증상 보고 정확도 사이의 트레이드오프를 드러냈다.
Figure 2: The iterative development process of the prompt of doctor chatbots. Psychiatrists will identify the limitations of the current version, and we will address these issues in the subsequent version.
Figure 2: The iterative development process of the prompt of doctor chatbots. Psychiatrists will identify the limitations of the current version, and we will address these issues in the subsequent version.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.