Skip to main content
QUICK REVIEW

[논문 리뷰] AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator

Zhihao Fan, Jialong Tang|arXiv (Cornell University)|2024. 02. 15.
Artificial Intelligence in Healthcare and Education인용 수 5
한 줄 요약

AI Hospital은 멀티에이전트 LLM 기반의 인턴 의사들, 환자들, 심사관들, 의료 이사들로 구성된 실시간 상호작용 의료 진단 환경과 진단 정확도를 높이기 위한 Multi-View Medical Evaluation benchmark 및 분쟁 해결 협업 메커니즘을 제공합니다.

ABSTRACT

Artificial intelligence has significantly advanced healthcare, particularly through large language models (LLMs) that excel in medical question answering benchmarks. However, their real-world clinical application remains limited due to the complexities of doctor-patient interactions. To address this, we introduce extbf{AI Hospital}, a multi-agent framework simulating dynamic medical interactions between \emph{Doctor} as player and NPCs including \emph{Patient}, \emph{Examiner}, \emph{Chief Physician}. This setup allows for realistic assessments of LLMs in clinical scenarios. We develop the Multi-View Medical Evaluation (MVME) benchmark, utilizing high-quality Chinese medical records and NPCs to evaluate LLMs' performance in symptom collection, examination recommendations, and diagnoses. Additionally, a dispute resolution collaborative mechanism is proposed to enhance diagnostic accuracy through iterative discussions. Despite improvements, current LLMs exhibit significant performance gaps in multi-turn interactions compared to one-step approaches. Our findings highlight the need for further research to bridge these gaps and improve LLMs' clinical diagnostic capabilities. Our data, code, and experimental results are all open-sourced at \url{https://github.com/LibertFan/AI_Hospital}.

연구 동기 및 목표

  • 실시간 임상 진단에 LLM의 통합을 인터랙티브한 다중 에이전트 시뮬레이션을 통해 촉진합니다.
  • 환자, 심사관, 인턴 의사, 의료 이사 역할이 있는 실제 환경을 제공하여 LLM을 평가합니다.
  • 인터랙티브 설정에서 증상 식별, 검사 포괄성, 진단 품질을 평가하는 MVME 벤치마크를 소개합니다.
  • 의료 이사가 감독하는 분쟁 해결 협업 메커니즘을 보여 주어 진단 정확도를 향상시킵니다.

제안 방법

  • 고품질의 중국 의학 기록을 사용하여 네 가지 역할(인턴 의사, 환자, 심사관, 의료 이사)을 가진 AI Hospital을 구축합니다.
  • 세 에이전트 상호작용 워크플로우 정의: 환자가 증상을 설명하고, 인턴이 질의하고, 심사관이 검사를 수행하며, 이사가 평가를 감독합니다.
  • 인터랙티브 설정에서 증상 숙달, 검사 포괄성, 진단 보고 품질을 평가하는 MVME 벤치마크를 만듭니다.
  • 의료 이사의 지도 하에 여러 인턴이 반복적으로 토론하여 합의에 도달하는 분쟁 해결 협업을 구현합니다.
  • 평가 엔진으로 GPT-4를 사용하고 진단 결과를 평가하기 위해 연결 기반 ICD-10 용어 매핑을 적용합니다.
  • 한 단계 진단(비인터랙티브)과 여러 LLM에 걸친 상호작용적 협력 설정을 비교하여 상호작용의 영향과 협업 이득을 정량화합니다.

실험 결과

연구 질문

  • RQ1LLMs가 실제 상담을 모방한 다중 에이전트 설정에서 실시간으로 상호작용하는 임상 진단을 수행할 수 있는가?
  • RQ2의료 이사가 지도하는 분쟁 해결 협업이 비협력적 접근보다 진단 정확도를 향상시키는가?
  • RQ3AI Hospital에서 다양한 LLM은 증상 수집, 검사 선택, 진단 보고에서 어떤 성능을 보이는가?
  • RQ4협력 진단에서 인턴 수를 늘리는 것이 진단 성능에 어떤 영향을 미치는가?

주요 결과

  • 인터랙티브 협업은 단일 모델의 원샷 베이스라인보다 진단 정확도를 향상시킵니다.
  • 세 명의 인턴과의 협업이 두 명의 인턴보다 더 높은 진단 지표를 보여 팀워크의 이점을 강조합니다.
  • 의료 이사의 지도 하에 분쟁 해결은 합의에 이르는 속도를 높이고 평가 결과를 향상시킵니다.
  • GPT-4 기반의 한 단계 진단은 상한을 설정합니다; 여러 모델과의 인터랙티브 협업은 특정 지표에서 GPT-4만으로는 능가할 수 있습니다.
  • 인간 평가에서 여러 모델에 걸친 환자-심사관 상호작용에서 신뢰도가 98%를 넘는 높은 일관성을 보여 인터랙티브 설정의 강건성을 시사합니다.
  • 분쟁 해결 메커니즘은 합의에 도달하는 라운드 수를 줄입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.